13–19 JULIO 2026 · #01Imprescindible
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan et al.; trabajo asociado a Ant Group y colaboradores. · 16 julio 2026.
IDEA CENTRALConvierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.
POR QUÉ IMPORTAPara mí es el paper estratégico de la semana. La siguiente generación de Deep Research no será simplemente «más búsquedas», sino gestión explícita de cobertura, evidencia, fallos y procedencia. Esto tiene implicaciones directas para cómo una empresa consigue ser descubierta y citada por asistentes: la información debe poder convertirse en evidencia estructurada y trazable.
Ver problema que intenta resolver
Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.
ÁREA NO INDICADAdeep researchinteligencia competitiva
13–19 JULIO 2026 · #02Imprescindible
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen y Jianhua Tao. · 16 julio 2026.
IDEA CENTRALConvierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token.
POR QUÉ IMPORTAEs una dirección muy potente para agentes autoevolutivos: ejecutar → analizar experiencia → extraer skill → incorporar comportamiento → volver a ejecutar, sin depender exclusivamente de datasets humanos estáticos.
Ver problema que intenta resolver
El RL basado únicamente en éxito o fracaso final ofrece muy poca información sobre qué decisiones intermedias fueron buenas.
ÁREA NO INDICADAagentes webcoding agents
13–19 JULIO 2026 · #03Imprescindible
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan et al.; inclusionAI y colaboradores. · 14 julio 2026.
IDEA CENTRALLleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa.
POR QUÉ IMPORTASi los resultados se reproducen, fortalece la tesis de que determinadas capacidades de razonamiento emergen al combinar escala y señales verificables, reduciendo la necesidad de diseñar manualmente heurísticas de pensamiento.
Ver problema que intenta resolver
Buena parte de lo que sabemos sobre «Zero RL» proviene de modelos considerablemente más pequeños.
ÁREA NO INDICADAmatemáticasrazonamiento verificable
13–19 JULIO 2026 · #04Imprescindible
AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
Kai Chen, Zichen Ding, Jiaye Ge, Shufan Jiang y otros 19 autores. · 15 julio 2026.
IDEA CENTRALInfraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
POR QUÉ IMPORTASi este tipo de abstracción se consolida, podríamos empezar a evaluar independientemente modelo vs. harness vs. entorno, algo fundamental para saber por qué un agente funciona realmente.
Ver problema que intenta resolver
Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.
ÁREA NO INDICADAmodel selectionregresión continua
13–19 JULIO 2026 · #05Imprescindible
PalmClaw: A Native On-Device Agent Framework for Mobile Phones
Hongru Cai, Yongqi Li, Ran Wei y Wenjie Li. · 14 julio 2026.
IDEA CENTRALEn lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.
POR QUÉ IMPORTAEl teléfono es probablemente el entorno agentic con mayor acceso a contexto personal, sensores y aplicaciones. PalmClaw reporta una mejora relativa del 11,5% en éxito y una reducción del 94,9% en tiempo de finalización frente al mejor baseline evaluado.
Ver problema que intenta resolver
Los mobile agents GUI son lentos, frágiles y dependientes del diseño visual de cada aplicación.
ÁREA NO INDICADAasistentes personalesautomatización móvil
13–19 JULIO 2026 · #06Imprescindible
Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie y Wenhu Chen; TIGER-Lab y colaboradores. · 14 julio 2026.
IDEA CENTRALObserva que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.
POR QUÉ IMPORTAEn vez de enseñar tool-use solo con costosas trayectorias agentic, propone aprovechar la estructura natural del código como señal de pre/mid-training.
Ver problema que intenta resolver
Los modelos de código aprenden principalmente generación izquierda-a-derecha, pero un coding agent debe integrar continuamente observaciones producidas externamente.
ÁREA NO INDICADAcoding agentsIDEs
13–19 JULIO 2026 · #07Imprescindible
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao et al. · 16 julio 2026.
IDEA CENTRALAborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.
POR QUÉ IMPORTAEl long-context de agentes podría pasar de ser simplemente «memoria disponible» a una capacidad entrenada explícitamente.
Ver problema que intenta resolver
Un agente puede acumular millones de tokens entre documentos, observaciones y tools, pero nunca haber sido realmente entrenado para comportarse en ese régimen.
ÁREA NO INDICADAcoding agents de repositorio completoexpedientes
13–19 JULIO 2026 · #08Interesante
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu et al.; Tencent Hunyuan y colaboradores. · 14 julio 2026.
IDEA CENTRALTrata el harness agentic como un objeto de ingeniería de primera clase. El comportamiento de prompts, estado, tools y coordinación suele estar distribuido por grandes repositorios; el trabajo busca hacerlo navegable y editable según comportamientos, no simplemente según archivos.
POR QUÉ IMPORTAContinúa una tendencia muy marcada en las últimas semanas: el modelo deja de ser el único producto; el harness se convierte en software crítico que también necesitará arquitectura, observabilidad y mantenimiento automatizado.
Ver problema que intenta resolver
Cambiar «cómo actúa el agente» exige localizar código disperso entre múltiples componentes.
ÁREA NO INDICADAdesarrollo de plataformas agenticmantenimiento automático de agentes
13–19 JULIO 2026 · #09Imprescindible
OvisOCR2 Technical Report
Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji et al. · 15 julio 2026.
IDEA CENTRALModelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.
POR QUÉ IMPORTAExcelente ejemplo de SLM especializado que compite con pipelines complejos. Reporta 96,58 en OmniDocBench v1.6 y el mejor Avg3 en PureDocBench entre los comparados.
Ver problema que intenta resolver
Los pipelines de parsing documental suelen combinar numerosos módulos especializados.
ÁREA NO INDICADARAG documentalextracción de facturas
13–19 JULIO 2026 · #10Imprescindible
AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
Aritra Mazumder y Nusrat Jahan Lia. · 13 julio 2026.
IDEA CENTRALWorkbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.
POR QUÉ IMPORTASu patrón reproducir → intervenir → mitigar → confirmar se parece mucho más a chaos engineering para agentes que a benchmarking tradicional. Los experimentos muestran importantes diferencias entre cinco agentes y que los datos obsoletos son especialmente difíciles de mitigar.
Ver problema que intenta resolver
Probamos agentes suponiendo que sus herramientas funcionan correctamente, cuando en producción los fallos más peligrosos pueden ser respuestas erróneas aceptadas silenciosamente.
ÁREA NO INDICADAQA de agentes MCPtesting adversarial
13–19 JULIO 2026 · #11Imprescindible
Self-Improving AI Coding Agents Through Accumulated Behavioral Rules
Aditya Aggarwal y Nahid Farhady Ghalaty. · 13 julio 2026.
IDEA CENTRALCada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.
POR QUÉ IMPORTAEs sorprendentemente simple y muy aplicable. El paper reporta 0% de recurrencia en las clases de errores cubiertas por reglas en las sesiones estudiadas, aunque el tamaño experimental es pequeño y no debe generalizarse demasiado.
Ver problema que intenta resolver
Los coding agents pueden recibir la misma corrección humana repetidamente y volver a cometer el mismo error en sesiones posteriores.
ÁREA NO INDICADACodex/Claude Code-like workflowsnormas internas
13–19 JULIO 2026 · #12Interesante
Tracing Agentic Failure from the Flow of Success
Samuel Yeh, Yiwen Zhu, Shaleen Deep y Sharon Li. · 14 julio 2026.
IDEA CENTRALIntenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso. El modelo aprende exclusivamente de trayectorias exitosas y utiliza ese conocimiento para señalar pasos anómalos dentro de ejecuciones fallidas.
POR QUÉ IMPORTALa observabilidad agentic necesitará algo equivalente a un stack trace semántico: no basta saber que la tarea falló; hay que identificar dónde comenzó a desviarse.
Ver problema que intenta resolver
Diagnosticar agentes manualmente a partir de largas trazas es caro y difícil de escalar.
ÁREA NO INDICADAdebugging agenticanálisis automático de sesiones
13–19 JULIO 2026 · #14Interesante
Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi y Di Niu. · 15 julio 2026.
IDEA CENTRALAñade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.
POR QUÉ IMPORTAPodría convertir parte de la orquestación de agentes en señales internas baratas producidas por el propio modelo, reduciendo llamadas y latencia.
Ver problema que intenta resolver
Hoy estas decisiones suelen resolverse con prompts adicionales, routers externos y reglas manuales.
ÁREA NO INDICADAmodel routinghuman-in-the-loop
13–19 JULIO 2026 · #15Vigilar
BadWAM: When World-Action Models Dream Right but Act Wrong
Qi Li, Xingyi Yang y Xinchao Wang. · 16 julio 2026.
IDEA CENTRALCuestiona la idea de que un World-Action Model es seguro porque podemos inspeccionar el futuro que imagina. Introduce ataques que, mediante pequeñas perturbaciones visuales, desacoplan la predicción del mundo futuro de la acción que finalmente ejecuta el robot.
POR QUÉ IMPORTAEs un fallo de seguridad conceptualmente importante para world models y robótica agentic: la supervisión visual de una predicción futura puede crear una falsa sensación de seguridad.
Ver problema que intenta resolver
«El modelo imagina un futuro razonable» no garantiza «el robot hará algo coherente con ese futuro».
ÁREA NO INDICADAred-teaming robóticovalidación de WAM/VLA