NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
20 señales encontradas · mostrando 20 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
24–30 AGOSTO 2026 · #01Imprescindible

MobilePA-Bench: Evaluating Mobile Personal Agents in Real-World Tasks

Yi Zhu, Xiongwei Wu, Qiyi Wang et al.; MAI Team · 24 agosto 2026; versión v2 25 agosto 2026.

IDEA CENTRAL

Benchmark de 1.705 tareas en 13 dominios y 212 herramientas que separa uso básico, colaboración de subagentes, memoria y skills.

POR QUÉ IMPORTA

Aporta una línea base más cercana al agente móvil de producto y permite fijar gates por capacidad.

Ver problema que intenta resolver

Un único score de éxito oculta si el agente falla por herramienta, memoria, colaboración o skill.

agentes móviles, tool use, memoria, evaluación.copilotos móvilesevaluación de agentes
24–30 AGOSTO 2026 · #02Imprescindible

OODA-Tool: Specialized OODA Loops for Tool-Using Agents

Rongfeng Guo, Yinxuan Huang, Yusen Wu et al. · 25 agosto 2026; versión v2 27 agosto 2026.

IDEA CENTRAL

Especializa observar, orientar, decidir y actuar para mejorar el uso de herramientas en Qwen3 de 0,6B a 14B.

POR QUÉ IMPORTA

Conecta la arquitectura de decisión con una métrica explícita de latencia secuencial.

Ver problema que intenta resolver

Una política única mezcla fases y oculta dónde se pierde exactitud y cuánto cuesta cada llamada.

agentes, tool use, latencia.agentes con APIsorquestación multi-herramienta
24–30 AGOSTO 2026 · #03Imprescindible

AnTrap: A Comprehensive Benchmark for Anomaly Traps in GUI Agents

Guo Gan, Yilun Zhao, Cong Chen et al. · 25 agosto 2026; versión v1.

IDEA CENTRAL

Evalúa 236 tareas con anomalías de estado, pensamiento, acción y ronda en 16 modelos GUI.

POR QUÉ IMPORTA

Convierte la degradación ante anomalías en un gate separado del éxito nominal.

Ver problema que intenta resolver

El éxito en una interfaz limpia no muestra cómo responde el agente a un cambio de estado o una instrucción engañosa.

agentes GUI, seguridad, robustez.testing de agentes GUIred teaming
24–30 AGOSTO 2026 · #04Imprescindible

MetaRAG: Meta-Reinforcement Learning for Adaptive Retrieval-Augmented Generation

Qiuyi Qi, Tian Liang, Jiamu Wang et al. · 25 agosto 2026; versión v1.

IDEA CENTRAL

Aprende cuándo recuperar y verificar mediante una política adaptativa con Verify-first Action Generation e Internal Belief Probing.

POR QUÉ IMPORTA

Hace evaluables conjuntamente la calidad de respuesta y el número de búsquedas.

Ver problema que intenta resolver

Buscar siempre o nunca no respeta la incertidumbre ni el presupuesto de cada pregunta.

RAG, retrieval, decisión.QA documentalbúsqueda empresarial
24–30 AGOSTO 2026 · #05Imprescindible

The RAT: A Bayesian Model of Retrieval, Abstention, and Task Success

Pius von Däniken, Felix Matthias Saaro, Mark Cieliebak y Jan Milan Deriu · 25 agosto 2026; versión v1.

IDEA CENTRAL

Separa éxito de recuperación, abstención, tarea y generación en 27 configuraciones con 10.000 consultas por condición.

POR QUÉ IMPORTA

Aporta una estructura de diagnóstico para políticas de evidencia y jueces.

Ver problema que intenta resolver

El score final no indica si el sistema no encontró, no supo responder o respondió cuando debía abstenerse.

RAG, abstención, evaluación.evaluación de RAGpolíticas de abstención
24–30 AGOSTO 2026 · #06Imprescindible

SPA: Secure Planning Agents with Information-Flow Control

Dylan Girrens y Guangjing Wang · 27 agosto 2026; versión v1.

IDEA CENTRAL

Un DSL declarativo y un control de flujo de información de doble retícula restringen los artefactos que pueden llegar a una acción.

POR QUÉ IMPORTA

Mide explícitamente el intercambio entre utilidad y seguridad en vez de esconderlo tras task success.

Ver problema que intenta resolver

Un agente puede completar una tarea mientras filtra información sensible.

seguridad, planificación, information-flow control.agentes segurosdatos sensibles
24–30 AGOSTO 2026 · #07Imprescindible

ClueWeaver: Evidence-Guided Multi-Hop Question Answering with Self-Calibration

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang et al. · 27 agosto 2026; versión v2.

IDEA CENTRAL

Separa selección de pistas e interpretación y conserva citas por identificador de párrafo.

POR QUÉ IMPORTA

Conecta precisión multi-hop con una trayectoria de evidencia auditable.

Ver problema que intenta resolver

Una cita válida puede ser decorativa si no sostiene cada salto del razonamiento.

RAG, evidencia, trazabilidad.investigación asistidadue diligence
24–30 AGOSTO 2026 · #08Interesante

TOPAS: Topology-Aware Scheduling for LLM Agent Workflows

Hongqiu Ni, Han Tian, Chi Zhang, Guopeng Li y Haisheng Tan · 26 agosto 2026; versión v1.

IDEA CENTRAL

Usa la topología del workflow para programar solicitudes y reducir el tiempo de finalización del job.

POR QUÉ IMPORTA

Lleva la optimización del agente al scheduler y al grafo de ejecución.

Ver problema que intenta resolver

Servir llamadas como peticiones aisladas ignora dependencias y oportunidades de scheduling.

serving, workflows DAG, latencia.serving de agentesorquestadores LLM
24–30 AGOSTO 2026 · #09Interesante

ReWorld: An Interactive World Model with Long-Horizon Memory

Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre memoria de horizonte largo en un mundo interactivo.

POR QUÉ IMPORTA

Puede ampliar el radar de memoria ejecutable, pero aún no hay extracción primaria.

Ver problema que intenta resolver

Las tareas largas exigen conservar estado y volver a consultar el mundo.

memoria, world models.agentes personalessimulación
24–30 AGOSTO 2026 · #10Interesante

SWE Refactor Bench

Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre evaluación de refactors de software por agentes.

POR QUÉ IMPORTA

Podría aportar una prueba más exigente de trabajo de ingeniería, pendiente de verificar.

Ver problema que intenta resolver

Los tests que pasan no siempre demuestran que una refactorización preserve arquitectura y comportamiento.

coding, evaluación.coding agentsrevisión de código
24–30 AGOSTO 2026 · #11Vigilar

On the Threat Model of Weird Generalization and Emergent Misalignment

Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre generalización extraña y desalineamiento emergente.

POR QUÉ IMPORTA

Es una posible pieza de threat modeling, pero no se publica como evidencia hasta leerla.

Ver problema que intenta resolver

La evaluación nominal puede no cubrir comportamientos que aparecen fuera de la distribución entrenada.

seguridad, alineamiento.red teamingevaluación de alineamiento
24–30 AGOSTO 2026 · #12Interesante

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.

POR QUÉ IMPORTA

Puede conectar feedback y evolución de retrieval, pendiente de verificar método y resultados.

Ver problema que intenta resolver

Una señal de recompensa fija puede dejar de representar la calidad cuando cambia la política de búsqueda.

RAG, feedback, agentes.search agentsRAG
24–30 AGOSTO 2026 · #13Interesante

Evidence Blindness in Search Agents: AtlasNav

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre ceguera a la evidencia en agentes de búsqueda.

POR QUÉ IMPORTA

Podría reforzar el eje de trazabilidad, pendiente de lectura y localizadores exactos.

Ver problema que intenta resolver

Navegar por documentos no garantiza que el agente haya identificado el pasaje que justifica su respuesta.

RAG, evidencia, navegación.búsqueda asistidaQA documental
24–30 AGOSTO 2026 · #14Interesante

StepGuard

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre compuertas de seguridad a nivel de paso.

POR QUÉ IMPORTA

Puede complementar el control de trayectoria, pendiente de confirmar alcance y coste.

Ver problema que intenta resolver

Una revisión al final del workflow puede llegar demasiado tarde para bloquear una acción peligrosa.

seguridad, verificación.guardrailsagentes con herramientas
24–30 AGOSTO 2026 · #15Vigilar

RACE

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.

POR QUÉ IMPORTA

Se conserva para no perder la señal, sin atribuirle claims no leídos.

Ver problema que intenta resolver

La etiqueta scout no permite todavía distinguir benchmark, método o protocolo.

agentes, evaluación.evaluación de agentesorquestación
24–30 AGOSTO 2026 · #16Interesante

Right Diagnoses, Decorative Reasoning

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.

POR QUÉ IMPORTA

Puede reforzar la separación entre resultado y trayectoria, pendiente de evidencia primaria.

Ver problema que intenta resolver

Una explicación plausible puede no ser la causa real de una decisión correcta.

evaluación, razonamiento.evaluación de razonamientoauditoría
24–30 AGOSTO 2026 · #17Vigilar

AsymSpec

Autores pendientes de lectura primaria · 26 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.

POR QUÉ IMPORTA

Se mantiene como vigilancia hasta completar la lectura primaria.

Ver problema que intenta resolver

El nombre y el abstract scout no bastan para conocer tarea, baseline o resultado.

modelos, especulación.model servingeficiencia
24–30 AGOSTO 2026 · #18Interesante

When Tool Outputs Become Commands

Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.

POR QUÉ IMPORTA

Es una señal de seguridad relevante para interfaces de herramientas, pendiente de método y resultados.

Ver problema que intenta resolver

Los datos devueltos por una herramienta pueden cruzar una frontera de autoridad si el agente los interpreta como comandos.

seguridad, tool use.tool securityprompt injection
24–30 AGOSTO 2026 · #19Interesante

WikiSkill

Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre skills derivadas de conocimiento estructurado o wikis.

POR QUÉ IMPORTA

Puede enlazar el radar de skills con evidencia y estado persistente, pendiente de verificación.

Ver problema que intenta resolver

Un skill reutilizable necesita procedencia, límites y una interfaz ejecutable, no sólo texto recuperado.

skills, agentes.skill librariesagentes de conocimiento
24–30 AGOSTO 2026 · #20Vigilar

AgentFold

Autores pendientes de lectura primaria · 27 agosto 2026; versión v2 28 agosto 2026.

IDEA CENTRAL

Señal del scout sobre composición o compactación de agentes.

POR QUÉ IMPORTA

Se conserva para la próxima lectura sin elevarla a evidencia.

Ver problema que intenta resolver

La señal inicial no permite aún saber si el aporte es de entrenamiento, serving o coordinación.

agentes, orquestación.orquestaciónmulti-agent systems