Recuperar no es todavía saber.
MetaRAG, The RAT y ClueWeaver separan buscar, verificar, citar, responder y abstenerse. La evidencia tiene que quedar anclada a la trayectoria.
Ocho lecturas primarias y doce señales nuevas apuntan a una misma exigencia: evaluar la trayectoria completa —recuperación, herramienta, memoria, seguridad, scheduler y cita— y conservar una salida explícita cuando la evidencia no basta.
¿Qué cambia cuando un agente debe demostrar qué recuperó, qué acción ejecutó, qué riesgo aceptó y cuánto costó antes de ser promovido?
MetaRAG, The RAT y ClueWeaver separan buscar, verificar, citar, responder y abstenerse. La evidencia tiene que quedar anclada a la trayectoria.
MobilePA-Bench y OODA-Tool muestran que memoria, colaboración y especialización cambian el resultado antes de que el modelo llegue a la respuesta final.
AnTrap y SPA prueban dos fronteras distintas: anomalías contextuales y flujo de información. Un agente útil necesita medir robustez y seguridad junto con utilidad.
OODA-Tool paga llamadas secuenciales y TOPAS optimiza el DAG de serving. La decisión correcta debe conservar calidad, p95, coste y fallos de recovery.
La lista ya no repite un resumen y un catálogo separados. Abre los claims sólo cuando quieras comprobar el localizador exacto.
Descompone el rendimiento de un agente móvil en tool use, colaboración, memoria y skills.
1.705 tareas, 13 dominios y 212 herramientas; mejor global 75,52% y basic tool use 83,85%.
Sandbox y checkers preasignados. No hay métrica explícita de abstención.
MobilePA-Bench contiene 1.705 tareas en 13 dominios y 212 herramientas.
1.705 · 13 · 212 · baseline: Descripción del benchmark · MobilePA-BenchEl mejor resultado global reportado es 75,52% y basic tool use alcanza 83,85%.
75,52% · 83,85% · baseline: Comparativa del benchmark · Resultados principalesEspecializa el ciclo observar–orientar–decidir–actuar para usar herramientas.
Task Success mejora entre 4,48 y 6,99 pp; la variante de 1,7B registra 2,36× de latencia normalizada.
Las llamadas secuenciales pueden multiplicar latencia. Falta validación con herramientas remotas y fallos reales.
Specialized OODA mejora Task Success entre 4,48 y 6,99 puntos porcentuales frente a Direct-LoRA.
+4,48 a +6,99 pp · baseline: Direct-LoRA · Qwen3 0,6B–14BLa variante de 1,7B registra 2,36× de latencia normalizada.
2,36× · baseline: Latencia normalizada · Ciclo especializadoMide la degradación de agentes GUI cuando aparecen anomalías en estado, pensamiento, acción o ronda.
Claude Sonnet 4.6 cae de 74,2% limpio a 66,5% con anomalías.
Trampas construidas por el benchmark. La prevalencia en producción no está estimada.
AnTrap amplía 116 escenarios originales hasta 236 tareas.
236 tareas · baseline: 116 escenarios · Cuatro capas de anomalíaClaude Sonnet 4.6 baja de 74,2% limpio a 66,5% con traps.
−7,7 pp · baseline: 74,2% limpio · Evaluación GUIAprende cuándo recuperar y cuándo verificar en vez de fijar la misma política para toda pregunta.
Qwen2.5-3B alcanza 41,7% con 1,60 búsquedas y 7B 45,4% con 1,74.
Siete benchmarks QA. La búsqueda no equivale a abstención correcta.
Qwen2.5-3B alcanza 41,7% con 1,60 búsquedas y 7B 45,4% con 1,74.
41,7%/1,60 · 45,4%/1,74 · baseline: Comparativas del estudio · Siete benchmarks QAVerify-first Action Generation e Internal Belief Probing separan verificación y señal de entrenamiento.
Componentes del método · baseline: Política fija de retrieval · MetaRAGDescompone retrieval, abstención, tarea y generación para diagnosticar políticas de evidencia.
Separa retrieval, abstención, tarea y generación en 27 configuraciones de evaluación.
Depende de calibración y juez. El snapshot KILT no garantiza transferencia.
El protocolo cubre 27 configuraciones y 10.000 consultas por configuración.
27 × 10.000 · baseline: Diseño factorial · KILTThe RAT separa retrieval success, abstention, task success y generator success.
P(R, A, T, G) · baseline: Task success agregado · Modelo bayesianoPlanifica con un DSL y comprueba el flujo de información antes de ejecutar acciones.
El IFC estricto reduce ASR, con una pérdida visible de utilidad en AgentDojo y AgentDojo-MQ.
La política puede bloquear planes útiles. Evaluación centrada en AgentDojo y AgentDojo-MQ.
En el ejemplo AgentDojo, la utilidad/ASR pasa de 53%/0,4 sin IFC a 29%/0 con IFC concreto.
53%/0,4 → 29%/0 · baseline: Sin IFC · AgentDojoEn AgentDojo-MQ, la comparación anotada pasa de 65,9%/0,6 a 35,3%/0,2.
65,9%/0,6 → 35,3%/0,2 · baseline: Sin IFC + Values · AgentDojo-MQSelecciona pistas antes de interpretar y exige identificadores de párrafo para las citas.
59,0% global; 275/310 respuestas con citas y 685/690 IDs válidos.
Añade latencia. No incluye abstención explícita I do not know.
ClueWeaver obtiene 59,0% frente a 52,6% IRCoT y 44,5% respuesta directa.
59,0% vs 52,6% vs 44,5% · baseline: IRCoT y directo · 310 preguntasProduce citas en 275/310 respuestas y valida 685/690 IDs.
275/310 · 685/690 · baseline: Control de trazabilidad · Citas por párrafoUsa la topología del DAG para programar workflows LLM con menor tiempo de finalización.
Hasta −39,8% mean y −49,4% p99 JCT en DAG sintéticos; overhead 1,9 ms.
Una GPU y un servidor. Topologías y cargas controladas.
TOPAS reduce mean/p99 JCT hasta 39,8%/49,4% en DAG sintéticos.
−39,8% mean · −49,4% p99 · baseline: Scheduler comparado · Tres DAG sintéticosEn MetaGPT-TL reporta −22,0% mean y −26,6% p99, con 1,9 ms de overhead de decisión.
−22,0%/−26,6% · 1,9 ms · baseline: Scheduler comparado · MetaGPT-TLEl scout las encontró y dejó su fuente primaria. Todavía no se usan como evidencia: falta leer método, resultados y límites.
Una relación sólo entra si comparte un eje verificable. Los nombres enlazan con la ficha cuando existe.
La descomposición por dimensiones de MobilePA-Bench ofrece un marco para medir dónde aporta valor la especialización OODA.
MobilePA-Bench mide capacidad funcional; AnTrap recuerda que el resultado debe repetirse cuando el estado de la interfaz deja de ser cooperativo.
MetaRAG entrena una política que decide buscar y verificar; The RAT aporta la descomposición para evaluar recuperación, abstención y respuesta por separado.
La política de retrieval debe respetar el flujo de información: buscar o verificar también son acciones con permisos y datos.
Las pistas y citas de ClueWeaver aportan observables que complementan la descomposición de recuperación y abstención de The RAT.
OODA cambia la política de llamadas; TOPAS muestra que el scheduler del DAG también puede cambiar la latencia de esa misma política.
No se registró contradicción directa entre MetaRAG y The RAT: optimizan y diagnostican capas distintas de la política de recuperación.
No se registró contradicción directa entre SPA y AnTrap: uno restringe flujo de información y el otro evalúa anomalías GUI; la caída de utilidad no es evidencia de incompatibilidad.
No se trató la mejora de OODA-Tool ni TOPAS como causalmente transferible a MobilePA-Bench: cambian modelo, tarea y sistema de serving.
Las extensiones y tensiones quedan distinguidas de lo que todavía necesita otro corte.
La unidad verificable del agente incluye acciones, herramientas, evidencia seleccionada, restricciones y resultado, no sólo la respuesta final.
Apoyo: MobilePA-Bench, The RAT, SPA, ClueWeaver y AnTrap añaden dimensiones observables antes de aceptar el score final.Falta: Faltan dos cortes con un protocolo común de trazas y una métrica de soporte semántico de claim.La autoridad debe cerrarse a lo largo del ciclo: planificar, recuperar, llamar, persistir, reintentar y publicar.
Apoyo: SPA, OODA-Tool, The RAT y TOPAS muestran fronteras de acción, coste y scheduling que el prompt por sí solo no cubre.Falta: Queda medir identidad, permisos y recuperación entre procesos en un mismo runKey.Los agentes fiables asignan más pasos a los casos inciertos y menos a los fáciles, con una salida de abstención cuando la evidencia no se cierra.
Apoyo: MetaRAG, The RAT, ClueWeaver y OODA-Tool combinan decisión adaptativa, verificación o especialización.Falta: Faltan costes calibrados por riesgo y una prueba fuera de benchmarks académicos.El estado útil debe ser direccionable y ejecutable, pero cada memoria o artefacto añade riesgo, coste y posibles restricciones de flujo.
Apoyo: MobilePA-Bench mide memoria; SPA restringe artefactos; TOPAS y OODA-Tool exponen el coste de mantener una trayectoria operativa.Falta: No hay todavía una comparación longitudinal de memoria beneficiosa frente a memoria distractora en este corte.Candidato: recuperar, citar, planificar, actuar y servir deben compartir una representación de evidencia y presupuesto.
Apoyo: The RAT, MetaRAG, ClueWeaver, SPA y TOPAS sugieren la conexión, pero ninguno prueba el ciclo completo en el mismo sistema.Falta: Necesita dos semanas adicionales, un ledger común y una métrica conjunta de precisión, abstención, latencia y coste.Dossier editorial provisional. Ocho papers fueron abiertos y leídos en sus HTML primarios versionados, con claims y localizadores exactos. Doce señales adicionales proceden del scout y se publican sólo como descubrimientos enlazados: no se usan como evidencia ni como reported-results. La persistencia canónica y el replay operativo del run quedan pendientes de la sesión MCP autenticada.
Medir: Exactitud de claim, precisión de localizador, abstención correcta, cobertura de evidencia, duplicados, recuperación, p95, coste y pérdida de estado.
Parar si: No promover una reparación ni una nueva regla si el replay cambia IDs/conteos/hashes, si una cita no resuelve, si el coste es desconocido sin marcarlo o si el aumento de cobertura incrementa respuestas sin evidencia.
Abrir bundle para agentes ↗