NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 35 · AGO 2026
24—30 AGO 20268 LECTURAS PRIMARIAS12 EN COLA16 CLAIMS

El agente fiable aprende a enlazar evidencia, acción y coste.

Ocho lecturas primarias y doce señales nuevas apuntan a una misma exigencia: evaluar la trayectoria completa —recuperación, herramienta, memoria, seguridad, scheduler y cita— y conservar una salida explícita cuando la evidencia no basta.

ESTADO EDITORIAL8 fuentes primarias abiertas · 12 señales scout sin claims
EN UNA FRASE

La mejora no viene de una única técnica. MobilePA-Bench y AnTrap hacen visibles los fallos del entorno; MetaRAG, The RAT y ClueWeaver separan recuperación, evidencia y abstención; OODA-Tool, SPA y TOPAS muestran que la arquitectura y el serving también son parte de la política.

PREGUNTA QUE GUÍA EL CORTE

¿Qué cambia cuando un agente debe demostrar qué recuperó, qué acción ejecutó, qué riesgo aceptó y cuánto costó antes de ser promovido?

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / EVIDENCIA Y ABSTENCIÓN

Recuperar no es todavía saber.

MetaRAG, The RAT y ClueWeaver separan buscar, verificar, citar, responder y abstenerse. La evidencia tiene que quedar anclada a la trayectoria.

02 / ARQUITECTURA DEL AGENTE

La arquitectura también decide.

MobilePA-Bench y OODA-Tool muestran que memoria, colaboración y especialización cambian el resultado antes de que el modelo llegue a la respuesta final.

03 / SEGURIDAD E INTERFAZ

La interfaz puede dejar de cooperar.

AnTrap y SPA prueban dos fronteras distintas: anomalías contextuales y flujo de información. Un agente útil necesita medir robustez y seguridad junto con utilidad.

04 / COSTE DE EJECUCIÓN

El grafo completo entra en la cuenta.

OODA-Tool paga llamadas secuenciales y TOPAS optimiza el DAG de serving. La decisión correcta debe conservar calidad, p95, coste y fallos de recovery.

02LEDGER DE FUENTES / QUÉ SOSTIENE LA TESIS

Cada paper aparece una vez: papel, hallazgo y frontera.

La lista ya no repite un resumen y un catálogo separados. Abre los claims sólo cuando quieras comprobar el localizador exacto.

  1. 01 / AGENTES / MÓVIL24 AGO 2026 · arXiv v2

    MobilePA-Bench

    Descompone el rendimiento de un agente móvil en tool use, colaboración, memoria y skills.

    HALLAZGO OBSERVADO

    1.705 tareas, 13 dominios y 212 herramientas; mejor global 75,52% y basic tool use 83,85%.

    FRONTERA

    Sandbox y checkers preasignados. No hay métrica explícita de abstención.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§1 · alcance

      MobilePA-Bench contiene 1.705 tareas en 13 dominios y 212 herramientas.

      1.705 · 13 · 212 · baseline: Descripción del benchmark · MobilePA-Bench
    2. reported-result§4 · resultados

      El mejor resultado global reportado es 75,52% y basic tool use alcanza 83,85%.

      75,52% · 83,85% · baseline: Comparativa del benchmark · Resultados principales
  2. 02 / AGENTES / TOOL USE25 AGO 2026 · arXiv v2

    OODA-Tool

    Especializa el ciclo observar–orientar–decidir–actuar para usar herramientas.

    HALLAZGO OBSERVADO

    Task Success mejora entre 4,48 y 6,99 pp; la variante de 1,7B registra 2,36× de latencia normalizada.

    FRONTERA

    Las llamadas secuenciales pueden multiplicar latencia. Falta validación con herramientas remotas y fallos reales.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. Specialized OODA mejora Task Success entre 4,48 y 6,99 puntos porcentuales frente a Direct-LoRA.

      +4,48 a +6,99 pp · baseline: Direct-LoRA · Qwen3 0,6B–14B
    2. La variante de 1,7B registra 2,36× de latencia normalizada.

      2,36× · baseline: Latencia normalizada · Ciclo especializado
  3. 03 / AGENTES / GUI / SEGURIDAD25 AGO 2026 · arXiv v1

    AnTrap

    Mide la degradación de agentes GUI cuando aparecen anomalías en estado, pensamiento, acción o ronda.

    HALLAZGO OBSERVADO

    Claude Sonnet 4.6 cae de 74,2% limpio a 66,5% con anomalías.

    FRONTERA

    Trampas construidas por el benchmark. La prevalencia en producción no está estimada.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§3 · benchmark

      AnTrap amplía 116 escenarios originales hasta 236 tareas.

      236 tareas · baseline: 116 escenarios · Cuatro capas de anomalía
    2. Claude Sonnet 4.6 baja de 74,2% limpio a 66,5% con traps.

      −7,7 pp · baseline: 74,2% limpio · Evaluación GUI
  4. 04 / RAG / DECISIÓN25 AGO 2026 · arXiv v1

    MetaRAG

    Aprende cuándo recuperar y cuándo verificar en vez de fijar la misma política para toda pregunta.

    HALLAZGO OBSERVADO

    Qwen2.5-3B alcanza 41,7% con 1,60 búsquedas y 7B 45,4% con 1,74.

    FRONTERA

    Siete benchmarks QA. La búsqueda no equivale a abstención correcta.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. Qwen2.5-3B alcanza 41,7% con 1,60 búsquedas y 7B 45,4% con 1,74.

      41,7%/1,60 · 45,4%/1,74 · baseline: Comparativas del estudio · Siete benchmarks QA
    2. Verify-first Action Generation e Internal Belief Probing separan verificación y señal de entrenamiento.

      Componentes del método · baseline: Política fija de retrieval · MetaRAG
  5. 05 / RAG / ABSTENCIÓN25 AGO 2026 · arXiv v1

    The RAT

    Descompone retrieval, abstención, tarea y generación para diagnosticar políticas de evidencia.

    HALLAZGO OBSERVADO

    Separa retrieval, abstención, tarea y generación en 27 configuraciones de evaluación.

    FRONTERA

    Depende de calibración y juez. El snapshot KILT no garantiza transferencia.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. El protocolo cubre 27 configuraciones y 10.000 consultas por configuración.

      27 × 10.000 · baseline: Diseño factorial · KILT
    2. source-claim§3 · modelo

      The RAT separa retrieval success, abstention, task success y generator success.

      P(R, A, T, G) · baseline: Task success agregado · Modelo bayesiano
  6. 06 / SEGURIDAD / PLANIFICACIÓN27 AGO 2026 · arXiv v1

    SPA

    Planifica con un DSL y comprueba el flujo de información antes de ejecutar acciones.

    HALLAZGO OBSERVADO

    El IFC estricto reduce ASR, con una pérdida visible de utilidad en AgentDojo y AgentDojo-MQ.

    FRONTERA

    La política puede bloquear planes útiles. Evaluación centrada en AgentDojo y AgentDojo-MQ.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. En el ejemplo AgentDojo, la utilidad/ASR pasa de 53%/0,4 sin IFC a 29%/0 con IFC concreto.

      53%/0,4 → 29%/0 · baseline: Sin IFC · AgentDojo
    2. En AgentDojo-MQ, la comparación anotada pasa de 65,9%/0,6 a 35,3%/0,2.

      65,9%/0,6 → 35,3%/0,2 · baseline: Sin IFC + Values · AgentDojo-MQ
  7. 07 / RAG / TRAZABILIDAD27 AGO 2026 · arXiv v2

    ClueWeaver

    Selecciona pistas antes de interpretar y exige identificadores de párrafo para las citas.

    HALLAZGO OBSERVADO

    59,0% global; 275/310 respuestas con citas y 685/690 IDs válidos.

    FRONTERA

    Añade latencia. No incluye abstención explícita I do not know.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. ClueWeaver obtiene 59,0% frente a 52,6% IRCoT y 44,5% respuesta directa.

      59,0% vs 52,6% vs 44,5% · baseline: IRCoT y directo · 310 preguntas
    2. Produce citas en 275/310 respuestas y valida 685/690 IDs.

      275/310 · 685/690 · baseline: Control de trazabilidad · Citas por párrafo
  8. 08 / SERVING / WORKFLOWS26 AGO 2026 · arXiv v1

    TOPAS

    Usa la topología del DAG para programar workflows LLM con menor tiempo de finalización.

    HALLAZGO OBSERVADO

    Hasta −39,8% mean y −49,4% p99 JCT en DAG sintéticos; overhead 1,9 ms.

    FRONTERA

    Una GPU y un servidor. Topologías y cargas controladas.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. TOPAS reduce mean/p99 JCT hasta 39,8%/49,4% en DAG sintéticos.

      −39,8% mean · −49,4% p99 · baseline: Scheduler comparado · Tres DAG sintéticos
    2. En MetaGPT-TL reporta −22,0% mean y −26,6% p99, con 1,9 ms de overhead de decisión.

      −22,0%/−26,6% · 1,9 ms · baseline: Scheduler comparado · MetaGPT-TL
04PRÓXIMAS LECTURAS

12 señales para abrir después.

El scout las encontró y dejó su fuente primaria. Todavía no se usan como evidencia: falta leer método, resultados y límites.

ABRIR COLA DE LECTURA12 fuentes enlazadas +
  1. 01
    MEMORIA · WORLD MODELS · 24 AGO 2026 · v1

    ReWorld: An Interactive World Model with Long-Horizon Memory

    Fuente ↗
  2. 02
    CODING · EVALUACIÓN · 24 AGO 2026 · v1

    SWE Refactor Bench

    Fuente ↗
  3. 03
    SEGURIDAD · ALINEAMIENTO · 24 AGO 2026 · v1

    On the Threat Model of Weird Generalization and Emergent Misalignment

    Fuente ↗
  4. 04
    RAG · FEEDBACK · 25 AGO 2026 · v1

    CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

    Fuente ↗
  5. 05
    RAG · EVIDENCIA · 25 AGO 2026 · v1

    Evidence Blindness in Search Agents: AtlasNav

    Fuente ↗
  6. 06
    SEGURIDAD · VERIFICACIÓN · 25 AGO 2026 · v1

    StepGuard

    Fuente ↗
  7. 07
    AGENTES · EVALUACIÓN · 25 AGO 2026 · v1

    RACE

    Fuente ↗
  8. 08
    EVALUACIÓN · RAZONAMIENTO · 25 AGO 2026 · v1

    Right Diagnoses, Decorative Reasoning

    Fuente ↗
  9. 09
    MODELOS · ESPECULACIÓN · 26 AGO 2026 · v1

    AsymSpec

    Fuente ↗
  10. 10
    SEGURIDAD · TOOL USE · 27 AGO 2026 · v1

    When Tool Outputs Become Commands

    Fuente ↗
  11. 11
    SKILLS · AGENTES · 27 AGO 2026 · v1

    WikiSkill

    Fuente ↗
  12. 12
    AGENTES · ORQUESTACIÓN · 27 AGO 2026 · v2

    AgentFold

    Fuente ↗
05CONEXIONES / QUÉ SE PUEDE LEER JUNTOS

El mapa dice cómo leerlos juntos.

Una relación sólo entra si comparte un eje verificable. Los nombres enlazan con la ficha cuando existe.

evaluación de tool use · confianza alta

La descomposición por dimensiones de MobilePA-Bench ofrece un marco para medir dónde aporta valor la especialización OODA.

entorno móvil y anomalías · confianza alta

MobilePA-Bench mide capacidad funcional; AnTrap recuerda que el resultado debe repetirse cuando el estado de la interfaz deja de ser cooperativo.

política de recuperación · confianza alta

MetaRAG entrena una política que decide buscar y verificar; The RAT aporta la descomposición para evaluar recuperación, abstención y respuesta por separado.

SPAqualifiesMetaRAG
frontera de acción · confianza media

La política de retrieval debe respetar el flujo de información: buscar o verificar también son acciones con permisos y datos.

evidencia y trazabilidad · confianza alta

Las pistas y citas de ClueWeaver aportan observables que complementan la descomposición de recuperación y abstención de The RAT.

coste de ejecución · confianza media

OODA cambia la política de llamadas; TOPAS muestra que el scheduler del DAG también puede cambiar la latencia de esa misma política.

COMPARACIONES DESCARTADAS3 límites de interpretación +

No se registró contradicción directa entre MetaRAG y The RAT: optimizan y diagnostican capas distintas de la política de recuperación.

No se registró contradicción directa entre SPA y AnTrap: uno restringe flujo de información y el otro evalúa anomalías GUI; la caída de utilidad no es evidencia de incompatibilidad.

No se trató la mejora de OODA-Tool ni TOPAS como causalmente transferible a MobilePA-Bench: cambian modelo, tarea y sistema de serving.

05BCONCEPTOS VIVOS

5 ideas, con el candidato separado.

Las extensiones y tensiones quedan distinguidas de lo que todavía necesita otro corte.

EXTENSIÓN5 PAPERS

Evidence as trajectory unit

La unidad verificable del agente incluye acciones, herramientas, evidencia seleccionada, restricciones y resultado, no sólo la respuesta final.

Apoyo: MobilePA-Bench, The RAT, SPA, ClueWeaver y AnTrap añaden dimensiones observables antes de aceptar el score final.Falta: Faltan dos cortes con un protocolo común de trazas y una métrica de soporte semántico de claim.
EXTENSIÓN4 PAPERS

Lifecycle authority closure

La autoridad debe cerrarse a lo largo del ciclo: planificar, recuperar, llamar, persistir, reintentar y publicar.

Apoyo: SPA, OODA-Tool, The RAT y TOPAS muestran fronteras de acción, coste y scheduling que el prompt por sí solo no cubre.Falta: Queda medir identidad, permisos y recuperación entre procesos en un mismo runKey.
EXTENSIÓN4 PAPERS

Adaptive trajectory inference

Los agentes fiables asignan más pasos a los casos inciertos y menos a los fáciles, con una salida de abstención cuando la evidencia no se cierra.

Apoyo: MetaRAG, The RAT, ClueWeaver y OODA-Tool combinan decisión adaptativa, verificación o especialización.Falta: Faltan costes calibrados por riesgo y una prueba fuera de benchmarks académicos.
EXTENSIÓN3 PAPERS

Persistent executable agent state

El estado útil debe ser direccionable y ejecutable, pero cada memoria o artefacto añade riesgo, coste y posibles restricciones de flujo.

Apoyo: MobilePA-Bench mide memoria; SPA restringe artefactos; TOPAS y OODA-Tool exponen el coste de mantener una trayectoria operativa.Falta: No hay todavía una comparación longitudinal de memoria beneficiosa frente a memoria distractora en este corte.
CANDIDATO5 PAPERS

Evidence-aligned execution

Candidato: recuperar, citar, planificar, actuar y servir deben compartir una representación de evidencia y presupuesto.

Apoyo: The RAT, MetaRAG, ClueWeaver, SPA y TOPAS sugieren la conexión, pero ninguno prueba el ciclo completo en el mismo sistema.Falta: Necesita dos semanas adicionales, un ledger común y una métrica conjunta de precisión, abstención, latencia y coste.
FRONTERA DE CONFIANZA

El corte orienta una prueba; no demuestra una adopción.

Dossier editorial provisional. Ocho papers fueron abiertos y leídos en sus HTML primarios versionados, con claims y localizadores exactos. Doce señales adicionales proceden del scout y se publican sólo como descubrimientos enlazados: no se usan como evidencia ni como reported-results. La persistencia canónica y el replay operativo del run quedan pendientes de la sesión MCP autenticada.

SIGUIENTE PRUEBA

Construir un replay mínimo de evidencia antes de adoptar más técnicas

Medir: Exactitud de claim, precisión de localizador, abstención correcta, cobertura de evidencia, duplicados, recuperación, p95, coste y pérdida de estado.

Parar si: No promover una reparación ni una nueva regla si el replay cambia IDs/conteos/hashes, si una cita no resuelve, si el coste es desconocido sin marcarlo o si el aumento de cobertura incrementa respuestas sin evidencia.

Abrir bundle para agentes