NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
13–19 JULIO 2026 · #01Imprescindible

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan et al.; trabajo asociado a Ant Group y colaboradores. · 16 julio 2026.

IDEA CENTRAL

Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.

POR QUÉ IMPORTA

Para mí es el paper estratégico de la semana. La siguiente generación de Deep Research no será simplemente «más búsquedas», sino gestión explícita de cobertura, evidencia, fallos y procedencia. Esto tiene implicaciones directas para cómo una empresa consigue ser descubierta y citada por asistentes: la información debe poder convertirse en evidencia estructurada y trazable.

Ver problema que intenta resolver

Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.

ÁREA NO INDICADAdeep researchinteligencia competitiva
13–19 JULIO 2026 · #02Imprescindible

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen y Jianhua Tao. · 16 julio 2026.

IDEA CENTRAL

Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token.

POR QUÉ IMPORTA

Es una dirección muy potente para agentes autoevolutivos: ejecutar → analizar experiencia → extraer skill → incorporar comportamiento → volver a ejecutar, sin depender exclusivamente de datasets humanos estáticos.

Ver problema que intenta resolver

El RL basado únicamente en éxito o fracaso final ofrece muy poca información sobre qué decisiones intermedias fueron buenas.

ÁREA NO INDICADAagentes webcoding agents
13–19 JULIO 2026 · #03Imprescindible

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan et al.; inclusionAI y colaboradores. · 14 julio 2026.

IDEA CENTRAL

Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa.

POR QUÉ IMPORTA

Si los resultados se reproducen, fortalece la tesis de que determinadas capacidades de razonamiento emergen al combinar escala y señales verificables, reduciendo la necesidad de diseñar manualmente heurísticas de pensamiento.

Ver problema que intenta resolver

Buena parte de lo que sabemos sobre «Zero RL» proviene de modelos considerablemente más pequeños.

ÁREA NO INDICADAmatemáticasrazonamiento verificable
13–19 JULIO 2026 · #04Imprescindible

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

Kai Chen, Zichen Ding, Jiaye Ge, Shufan Jiang y otros 19 autores. · 15 julio 2026.

IDEA CENTRAL

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

POR QUÉ IMPORTA

Si este tipo de abstracción se consolida, podríamos empezar a evaluar independientemente modelo vs. harness vs. entorno, algo fundamental para saber por qué un agente funciona realmente.

Ver problema que intenta resolver

Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.

ÁREA NO INDICADAmodel selectionregresión continua
13–19 JULIO 2026 · #05Imprescindible

PalmClaw: A Native On-Device Agent Framework for Mobile Phones

Hongru Cai, Yongqi Li, Ran Wei y Wenjie Li. · 14 julio 2026.

IDEA CENTRAL

En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.

POR QUÉ IMPORTA

El teléfono es probablemente el entorno agentic con mayor acceso a contexto personal, sensores y aplicaciones. PalmClaw reporta una mejora relativa del 11,5% en éxito y una reducción del 94,9% en tiempo de finalización frente al mejor baseline evaluado.

Ver problema que intenta resolver

Los mobile agents GUI son lentos, frágiles y dependientes del diseño visual de cada aplicación.

ÁREA NO INDICADAasistentes personalesautomatización móvil
13–19 JULIO 2026 · #06Imprescindible

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie y Wenhu Chen; TIGER-Lab y colaboradores. · 14 julio 2026.

IDEA CENTRAL

Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.

POR QUÉ IMPORTA

En vez de enseñar tool-use solo con costosas trayectorias agentic, propone aprovechar la estructura natural del código como señal de pre/mid-training.

Ver problema que intenta resolver

Los modelos de código aprenden principalmente generación izquierda-a-derecha, pero un coding agent debe integrar continuamente observaciones producidas externamente.

ÁREA NO INDICADAcoding agentsIDEs
13–19 JULIO 2026 · #07Imprescindible

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao et al. · 16 julio 2026.

IDEA CENTRAL

Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.

POR QUÉ IMPORTA

El long-context de agentes podría pasar de ser simplemente «memoria disponible» a una capacidad entrenada explícitamente.

Ver problema que intenta resolver

Un agente puede acumular millones de tokens entre documentos, observaciones y tools, pero nunca haber sido realmente entrenado para comportarse en ese régimen.

ÁREA NO INDICADAcoding agents de repositorio completoexpedientes
13–19 JULIO 2026 · #08Interesante

Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu et al.; Tencent Hunyuan y colaboradores. · 14 julio 2026.

IDEA CENTRAL

Trata el harness agentic como un objeto de ingeniería de primera clase. El comportamiento de prompts, estado, tools y coordinación suele estar distribuido por grandes repositorios; el trabajo busca hacerlo navegable y editable según comportamientos, no simplemente según archivos.

POR QUÉ IMPORTA

Continúa una tendencia muy marcada en las últimas semanas: el modelo deja de ser el único producto; el harness se convierte en software crítico que también necesitará arquitectura, observabilidad y mantenimiento automatizado.

Ver problema que intenta resolver

Cambiar «cómo actúa el agente» exige localizar código disperso entre múltiples componentes.

ÁREA NO INDICADAdesarrollo de plataformas agenticmantenimiento automático de agentes
13–19 JULIO 2026 · #09Imprescindible

OvisOCR2 Technical Report

Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji et al. · 15 julio 2026.

IDEA CENTRAL

Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.

POR QUÉ IMPORTA

Excelente ejemplo de SLM especializado que compite con pipelines complejos. Reporta 96,58 en OmniDocBench v1.6 y el mejor Avg3 en PureDocBench entre los comparados.

Ver problema que intenta resolver

Los pipelines de parsing documental suelen combinar numerosos módulos especializados.

ÁREA NO INDICADARAG documentalextracción de facturas
13–19 JULIO 2026 · #10Imprescindible

AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

Aritra Mazumder y Nusrat Jahan Lia. · 13 julio 2026.

IDEA CENTRAL

Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.

POR QUÉ IMPORTA

Su patrón reproducir → intervenir → mitigar → confirmar se parece mucho más a chaos engineering para agentes que a benchmarking tradicional. Los experimentos muestran importantes diferencias entre cinco agentes y que los datos obsoletos son especialmente difíciles de mitigar.

Ver problema que intenta resolver

Probamos agentes suponiendo que sus herramientas funcionan correctamente, cuando en producción los fallos más peligrosos pueden ser respuestas erróneas aceptadas silenciosamente.

ÁREA NO INDICADAQA de agentes MCPtesting adversarial
13–19 JULIO 2026 · #11Imprescindible

Self-Improving AI Coding Agents Through Accumulated Behavioral Rules

Aditya Aggarwal y Nahid Farhady Ghalaty. · 13 julio 2026.

IDEA CENTRAL

Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.

POR QUÉ IMPORTA

Es sorprendentemente simple y muy aplicable. El paper reporta 0% de recurrencia en las clases de errores cubiertas por reglas en las sesiones estudiadas, aunque el tamaño experimental es pequeño y no debe generalizarse demasiado.

Ver problema que intenta resolver

Los coding agents pueden recibir la misma corrección humana repetidamente y volver a cometer el mismo error en sesiones posteriores.

ÁREA NO INDICADACodex/Claude Code-like workflowsnormas internas
13–19 JULIO 2026 · #12Interesante

Tracing Agentic Failure from the Flow of Success

Samuel Yeh, Yiwen Zhu, Shaleen Deep y Sharon Li. · 14 julio 2026.

IDEA CENTRAL

Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso. El modelo aprende exclusivamente de trayectorias exitosas y utiliza ese conocimiento para señalar pasos anómalos dentro de ejecuciones fallidas.

POR QUÉ IMPORTA

La observabilidad agentic necesitará algo equivalente a un stack trace semántico: no basta saber que la tarea falló; hay que identificar dónde comenzó a desviarse.

Ver problema que intenta resolver

Diagnosticar agentes manualmente a partir de largas trazas es caro y difícil de escalar.

ÁREA NO INDICADAdebugging agenticanálisis automático de sesiones
13–19 JULIO 2026 · #13Interesante

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang y Ming Li. · 13 julio 2026.

IDEA CENTRAL

AgentFootprint mide cuánto almacenamiento persistente deja realmente un agente: logs, snapshots, conversaciones, checkpoints y trazas. Ejecutar una misma trayectoria en siete frameworks produjo una diferencia de 6,7×, y configuraciones con el mismo 100% de accuracy difirieron hasta 15,7× en bytes retenidos.

POR QUÉ IMPORTA

A medida que agentes y memorias sean persistentes, el almacenamiento afectará coste, privacidad, seguridad y derecho al borrado. La deduplicación content-addressed redujo la retención entre 4,8× y 32,7× preservando las métricas de reconstrucción estudiadas.

Ver problema que intenta resolver

Medimos tokens y GPU, pero ignoramos el coste y riesgo de todos los datos que los agentes acumulan.

ÁREA NO INDICADAarquitectura de memoriacompliance
13–19 JULIO 2026 · #14Interesante

Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi y Di Niu. · 15 julio 2026.

IDEA CENTRAL

Añade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.

POR QUÉ IMPORTA

Podría convertir parte de la orquestación de agentes en señales internas baratas producidas por el propio modelo, reduciendo llamadas y latencia.

Ver problema que intenta resolver

Hoy estas decisiones suelen resolverse con prompts adicionales, routers externos y reglas manuales.

ÁREA NO INDICADAmodel routinghuman-in-the-loop
13–19 JULIO 2026 · #15Vigilar

BadWAM: When World-Action Models Dream Right but Act Wrong

Qi Li, Xingyi Yang y Xinchao Wang. · 16 julio 2026.

IDEA CENTRAL

Cuestiona la idea de que un World-Action Model es seguro porque podemos inspeccionar el futuro que imagina. Introduce ataques que, mediante pequeñas perturbaciones visuales, desacoplan la predicción del mundo futuro de la acción que finalmente ejecuta el robot.

POR QUÉ IMPORTA

Es un fallo de seguridad conceptualmente importante para world models y robótica agentic: la supervisión visual de una predicción futura puede crear una falsa sensación de seguridad.

Ver problema que intenta resolver

«El modelo imagina un futuro razonable» no garantiza «el robot hará algo coherente con ese futuro».

ÁREA NO INDICADAred-teaming robóticovalidación de WAM/VLA