24–30 AGOSTO 2026 · #01Imprescindible
MobilePA-Bench: Evaluating Mobile Personal Agents in Real-World Tasks
Yi Zhu, Xiongwei Wu, Qiyi Wang et al.; MAI Team · 24 agosto 2026; versión v2 25 agosto 2026.
IDEA CENTRALBenchmark de 1.705 tareas en 13 dominios y 212 herramientas que separa uso básico, colaboración de subagentes, memoria y skills.
POR QUÉ IMPORTAAporta una línea base más cercana al agente móvil de producto y permite fijar gates por capacidad.
Ver problema que intenta resolver
Un único score de éxito oculta si el agente falla por herramienta, memoria, colaboración o skill.
agentes móviles, tool use, memoria, evaluación.copilotos móvilesevaluación de agentes
24–30 AGOSTO 2026 · #02Imprescindible
OODA-Tool: Specialized OODA Loops for Tool-Using Agents
Rongfeng Guo, Yinxuan Huang, Yusen Wu et al. · 25 agosto 2026; versión v2 27 agosto 2026.
IDEA CENTRALEspecializa observar, orientar, decidir y actuar para mejorar el uso de herramientas en Qwen3 de 0,6B a 14B.
POR QUÉ IMPORTAConecta la arquitectura de decisión con una métrica explícita de latencia secuencial.
Ver problema que intenta resolver
Una política única mezcla fases y oculta dónde se pierde exactitud y cuánto cuesta cada llamada.
agentes, tool use, latencia.agentes con APIsorquestación multi-herramienta
24–30 AGOSTO 2026 · #03Imprescindible
AnTrap: A Comprehensive Benchmark for Anomaly Traps in GUI Agents
Guo Gan, Yilun Zhao, Cong Chen et al. · 25 agosto 2026; versión v1.
IDEA CENTRALEvalúa 236 tareas con anomalías de estado, pensamiento, acción y ronda en 16 modelos GUI.
POR QUÉ IMPORTAConvierte la degradación ante anomalías en un gate separado del éxito nominal.
Ver problema que intenta resolver
El éxito en una interfaz limpia no muestra cómo responde el agente a un cambio de estado o una instrucción engañosa.
agentes GUI, seguridad, robustez.testing de agentes GUIred teaming
24–30 AGOSTO 2026 · #04Imprescindible
MetaRAG: Meta-Reinforcement Learning for Adaptive Retrieval-Augmented Generation
Qiuyi Qi, Tian Liang, Jiamu Wang et al. · 25 agosto 2026; versión v1.
IDEA CENTRALAprende cuándo recuperar y verificar mediante una política adaptativa con Verify-first Action Generation e Internal Belief Probing.
POR QUÉ IMPORTAHace evaluables conjuntamente la calidad de respuesta y el número de búsquedas.
Ver problema que intenta resolver
Buscar siempre o nunca no respeta la incertidumbre ni el presupuesto de cada pregunta.
RAG, retrieval, decisión.QA documentalbúsqueda empresarial
24–30 AGOSTO 2026 · #05Imprescindible
The RAT: A Bayesian Model of Retrieval, Abstention, and Task Success
Pius von Däniken, Felix Matthias Saaro, Mark Cieliebak y Jan Milan Deriu · 25 agosto 2026; versión v1.
IDEA CENTRALSepara éxito de recuperación, abstención, tarea y generación en 27 configuraciones con 10.000 consultas por condición.
POR QUÉ IMPORTAAporta una estructura de diagnóstico para políticas de evidencia y jueces.
Ver problema que intenta resolver
El score final no indica si el sistema no encontró, no supo responder o respondió cuando debía abstenerse.
RAG, abstención, evaluación.evaluación de RAGpolíticas de abstención
24–30 AGOSTO 2026 · #06Imprescindible
SPA: Secure Planning Agents with Information-Flow Control
Dylan Girrens y Guangjing Wang · 27 agosto 2026; versión v1.
IDEA CENTRALUn DSL declarativo y un control de flujo de información de doble retícula restringen los artefactos que pueden llegar a una acción.
POR QUÉ IMPORTAMide explícitamente el intercambio entre utilidad y seguridad en vez de esconderlo tras task success.
Ver problema que intenta resolver
Un agente puede completar una tarea mientras filtra información sensible.
seguridad, planificación, information-flow control.agentes segurosdatos sensibles
24–30 AGOSTO 2026 · #07Imprescindible
ClueWeaver: Evidence-Guided Multi-Hop Question Answering with Self-Calibration
Jihao Zhu, Zhiwei Yang, Wenxiao Zhang et al. · 27 agosto 2026; versión v2.
IDEA CENTRALSepara selección de pistas e interpretación y conserva citas por identificador de párrafo.
POR QUÉ IMPORTAConecta precisión multi-hop con una trayectoria de evidencia auditable.
Ver problema que intenta resolver
Una cita válida puede ser decorativa si no sostiene cada salto del razonamiento.
RAG, evidencia, trazabilidad.investigación asistidadue diligence
24–30 AGOSTO 2026 · #08Interesante
TOPAS: Topology-Aware Scheduling for LLM Agent Workflows
Hongqiu Ni, Han Tian, Chi Zhang, Guopeng Li y Haisheng Tan · 26 agosto 2026; versión v1.
IDEA CENTRALUsa la topología del workflow para programar solicitudes y reducir el tiempo de finalización del job.
POR QUÉ IMPORTALleva la optimización del agente al scheduler y al grafo de ejecución.
Ver problema que intenta resolver
Servir llamadas como peticiones aisladas ignora dependencias y oportunidades de scheduling.
serving, workflows DAG, latencia.serving de agentesorquestadores LLM
24–30 AGOSTO 2026 · #09Interesante
ReWorld: An Interactive World Model with Long-Horizon Memory
Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre memoria de horizonte largo en un mundo interactivo.
POR QUÉ IMPORTAPuede ampliar el radar de memoria ejecutable, pero aún no hay extracción primaria.
Ver problema que intenta resolver
Las tareas largas exigen conservar estado y volver a consultar el mundo.
memoria, world models.agentes personalessimulación
24–30 AGOSTO 2026 · #10Interesante
SWE Refactor Bench
Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre evaluación de refactors de software por agentes.
POR QUÉ IMPORTAPodría aportar una prueba más exigente de trabajo de ingeniería, pendiente de verificar.
Ver problema que intenta resolver
Los tests que pasan no siempre demuestran que una refactorización preserve arquitectura y comportamiento.
coding, evaluación.coding agentsrevisión de código
24–30 AGOSTO 2026 · #11Vigilar
On the Threat Model of Weird Generalization and Emergent Misalignment
Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre generalización extraña y desalineamiento emergente.
POR QUÉ IMPORTAEs una posible pieza de threat modeling, pero no se publica como evidencia hasta leerla.
Ver problema que intenta resolver
La evaluación nominal puede no cubrir comportamientos que aparecen fuera de la distribución entrenada.
seguridad, alineamiento.red teamingevaluación de alineamiento
24–30 AGOSTO 2026 · #12Interesante
CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.
POR QUÉ IMPORTAPuede conectar feedback y evolución de retrieval, pendiente de verificar método y resultados.
Ver problema que intenta resolver
Una señal de recompensa fija puede dejar de representar la calidad cuando cambia la política de búsqueda.
RAG, feedback, agentes.search agentsRAG
24–30 AGOSTO 2026 · #13Interesante
Evidence Blindness in Search Agents: AtlasNav
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre ceguera a la evidencia en agentes de búsqueda.
POR QUÉ IMPORTAPodría reforzar el eje de trazabilidad, pendiente de lectura y localizadores exactos.
Ver problema que intenta resolver
Navegar por documentos no garantiza que el agente haya identificado el pasaje que justifica su respuesta.
RAG, evidencia, navegación.búsqueda asistidaQA documental
24–30 AGOSTO 2026 · #14Interesante
StepGuard
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre compuertas de seguridad a nivel de paso.
POR QUÉ IMPORTAPuede complementar el control de trayectoria, pendiente de confirmar alcance y coste.
Ver problema que intenta resolver
Una revisión al final del workflow puede llegar demasiado tarde para bloquear una acción peligrosa.
seguridad, verificación.guardrailsagentes con herramientas
24–30 AGOSTO 2026 · #15Vigilar
RACE
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.
POR QUÉ IMPORTASe conserva para no perder la señal, sin atribuirle claims no leídos.
Ver problema que intenta resolver
La etiqueta scout no permite todavía distinguir benchmark, método o protocolo.
agentes, evaluación.evaluación de agentesorquestación
24–30 AGOSTO 2026 · #16Interesante
Right Diagnoses, Decorative Reasoning
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.
POR QUÉ IMPORTAPuede reforzar la separación entre resultado y trayectoria, pendiente de evidencia primaria.
Ver problema que intenta resolver
Una explicación plausible puede no ser la causa real de una decisión correcta.
evaluación, razonamiento.evaluación de razonamientoauditoría
24–30 AGOSTO 2026 · #17Vigilar
AsymSpec
Autores pendientes de lectura primaria · 26 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre AsymSpec y una posible arquitectura asimétrica.
POR QUÉ IMPORTASe mantiene como vigilancia hasta completar la lectura primaria.
Ver problema que intenta resolver
El nombre y el abstract scout no bastan para conocer tarea, baseline o resultado.
modelos, especulación.model servingeficiencia
24–30 AGOSTO 2026 · #18Interesante
When Tool Outputs Become Commands
Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.
POR QUÉ IMPORTAEs una señal de seguridad relevante para interfaces de herramientas, pendiente de método y resultados.
Ver problema que intenta resolver
Los datos devueltos por una herramienta pueden cruzar una frontera de autoridad si el agente los interpreta como comandos.
seguridad, tool use.tool securityprompt injection
24–30 AGOSTO 2026 · #19Interesante
WikiSkill
Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre skills derivadas de conocimiento estructurado o wikis.
POR QUÉ IMPORTAPuede enlazar el radar de skills con evidencia y estado persistente, pendiente de verificación.
Ver problema que intenta resolver
Un skill reutilizable necesita procedencia, límites y una interfaz ejecutable, no sólo texto recuperado.
skills, agentes.skill librariesagentes de conocimiento
24–30 AGOSTO 2026 · #20Vigilar
AgentFold
Autores pendientes de lectura primaria · 27 agosto 2026; versión v2 28 agosto 2026.
IDEA CENTRALSeñal del scout sobre composición o compactación de agentes.
POR QUÉ IMPORTASe conserva para la próxima lectura sin elevarla a evidencia.
Ver problema que intenta resolver
La señal inicial no permite aún saber si el aporte es de entrenamiento, serving o coordinación.
agentes, orquestación.orquestaciónmulti-agent systems