6–12 JULIO 2026 · #01Imprescindible
Agent Data Injection Attacks are Realistic Threats to AI Agents
Woohyuk Choi, Juhee Kim, Taehyun Kang, Jihyeon Jeong, Luyi Xing y Byoungyoung Lee. · 6 julio 2026.
IDEA CENTRALIntroduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables. Los autores demuestran ataques contra agentes web y de programación, incluyendo clics arbitrarios, ejecución remota de código y ataques de cadena de suministro.
POR QUÉ IMPORTAEs probablemente el hallazgo de seguridad de agentes más accionable de la semana. Afecta directamente a Claude Code, Codex, Gemini CLI, extensiones de navegador y cualquier agente que consuma herramientas o documentos externos.
Ver problema que intenta resolver
Las defensas actuales se concentran en distinguir instrucciones fiables y no fiables, pero apenas separan datos fiables de datos controlados por terceros.
ÁREA NO INDICADAthreat modelingvalidación de tool outputs
6–12 JULIO 2026 · #02Imprescindible
Eluna: An Agentic LLM System for Automating Warehouse Operations
Ning Liu y colaboradores. · 9 julio 2026.
IDEA CENTRALSistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño.
POR QUÉ IMPORTAEs una de las pocas señales recientes de agentes empresariales con despliegue productivo, evaluación de tareas reales y optimización explícita de latencia y coste. Reporta un 94% de acuerdo con expertos en una aplicación de gestión de tickets.
Ver problema que intenta resolver
Los SOP completos saturan el contexto y los LLM genéricos no garantizan cumplimiento procedimental.
ÁREA NO INDICADAoperaciones de almacéngestión de incidencias
6–12 JULIO 2026 · #03Imprescindible
TTHE: Test-Time Harness Evolution
Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian y Bo Han. · 9 julio 2026.
IDEA CENTRALPropone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.
POR QUÉ IMPORTARefuerza una tendencia importante: el rendimiento de un agente depende tanto del harness como del modelo. Puede desplazar parte de la innovación desde el entrenamiento de modelos hacia la evolución dinámica del software que los rodea.
Ver problema que intenta resolver
Los agentes actuales suelen desplegarse con un workflow fijo, aunque cambien la distribución de tareas, las herramientas o los errores encontrados.
ÁREA NO INDICADAcoding agentsresearch agents
6–12 JULIO 2026 · #04Imprescindible
Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
Oliver Makins, Orazio Angelini, Zohreh Shams y Mary Phuong. · 8 julio 2026.
IDEA CENTRALEstudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas. Introduce FakeLab, un entorno con nueve servicios, 86 tareas benignas y cuatro objetivos de ataque. El resultado principal es el “efecto de fragmentación”: al aumentar el número de atacantes, disminuye la probabilidad de que un monitor por instancia detecte alguno.
POR QUÉ IMPORTAEn despliegues reales habrá decenas o cientos de agentes compartiendo repositorios, datos y herramientas. El paper muestra que un planificador coordinador puede multiplicar hasta por siete la tasa de éxito de algunos ataques.
Ver problema que intenta resolver
La mayoría de los sistemas de control evalúan cada agente y cada trayectoria de forma aislada.
ÁREA NO INDICADAmonitorización colectivaseguridad de enjambres de agentes
6–12 JULIO 2026 · #05Imprescindible
SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review
Ruoyu Wang, Jierun Chen, Shaowei Wang y colaboradores. · 7 julio 2026.
IDEA CENTRALAñade una etapa de revisión agentic al flujo de resolución de issues. Un agente explora el repositorio, determina si el PR debería aceptarse y emite feedback estructurado para que otro agente revise el parche. Introduce SWE-Review-Bench y SWE-Review-Traj.
POR QUÉ IMPORTAEl patrón generar → revisar → corregir se parece mucho más al desarrollo profesional que el one-shot actual. El trabajo reporta mejoras en decisión de aceptación y tasa de resolución después de la revisión.
Ver problema que intenta resolver
La mayoría de los coding agents generan un único parche y terminan, sin un ciclo sistemático de revisión y corrección.
ÁREA NO INDICADArevisión automática de PRscontrol de calidad
6–12 JULIO 2026 · #06Imprescindible
WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
Xiaoshuai Song, Liancheng Zhang, Kangzhi Zhao y colaboradores. · 9 julio 2026.
IDEA CENTRALSistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.
POR QUÉ IMPORTAEs relevante para la transición de los buscadores hacia sistemas que construyen respuestas, informes y mapas completos de información. También afecta a cómo marcas y contenidos serán descubiertos y citados dentro de asistentes.
Ver problema que intenta resolver
Los search agents suelen sacrificar profundidad para ganar cobertura, o cobertura para mantener profundidad.
ÁREA NO INDICADAdeep researchdue diligence
6–12 JULIO 2026 · #07Imprescindible
From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents
Joongho Ahn y Moonsoo Kim. · 9 julio 2026.
IDEA CENTRALTraslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.
POR QUÉ IMPORTAEs un diseño especialmente apropiado para empresa: menos “magia del prompt” y más contratos comprobables. El caso experimental utiliza datos de 25 empresas pertenecientes a cinco grupos corporativos coreanos.
Ver problema que intenta resolver
Los prompts monolíticos mezclan lógica de negocio, recuperación, reglas, formato y razonamiento, dificultando auditoría y mantenimiento.
ÁREA NO INDICADAagentes auditablescompliance
6–12 JULIO 2026 · #08Interesante
DynaKRAG: Learnable Evidence Control in Multi-Hop RAG
Yaqi Wu, Xiaolei Guo, Chenyu Zhou y colaboradores. · 7 julio 2026.
IDEA CENTRALUnifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.
POR QUÉ IMPORTAEl retrieval empieza a convertirse en un problema de control secuencial, no en una simple consulta vectorial. Esto puede reducir pasos innecesarios y mejorar consultas composicionales.
Ver problema que intenta resolver
Muchos sistemas RAG complejos tienen pipelines rígidos, diseñados manualmente y poco adaptables a cada consulta.
ÁREA NO INDICADAinvestigación documentalgraph-RAG
6–12 JULIO 2026 · #09Interesante
MILES: Modular Instruction Memory with Learnable Selection
Ruilin Tong y Dong Gong. · 8 julio 2026.
IDEA CENTRALMemoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.
POR QUÉ IMPORTAIntroduce una forma de aprendizaje continuo en tiempo de uso sin tener que modificar todos los pesos del modelo. Es especialmente prometedor para agentes que repiten familias de tareas similares.
Ver problema que intenta resolver
Guardar soluciones completas genera plantillas rígidas; guardar pasos sin una política aprendida produce recuperación poco fiable.
ÁREA NO INDICADArazonamiento matemáticoagentes de operaciones
6–12 JULIO 2026 · #10Interesante
SMetric: Session-Centric Scheduling for Serving Agents
Jiahao Wang, Kaizhan Lin, Kaixi Zhang y colaboradores. · 9 julio 2026.
IDEA CENTRALRediseña el balanceo de inferencia alrededor de sesiones completas, no de solicitudes individuales. La primera petición se distribuye según carga y las siguientes se enrutan teniendo en cuenta la reutilización de caché.
POR QUÉ IMPORTAEl coste de los agentes está fuertemente influido por el KV cache y la reutilización de contexto. Una infraestructura consciente de sesiones puede reducir latencia y presión sobre almacenamiento global.
Ver problema que intenta resolver
Los schedulers tradicionales están optimizados para peticiones independientes, mientras que los agentes generan largas secuencias de llamadas relacionadas.
ÁREA NO INDICADAserving multiagentecoding agents
6–12 JULIO 2026 · #11Interesante
InternVLA-A1.5: Understanding, Latent Foresight and Action
Haoxiang Ma y colaboradores; Intern Robotics. · 6 julio 2026.
IDEA CENTRALModelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto. Aprende dinámicas desde un modelo de generación de vídeo congelado, pero elimina esa rama durante inferencia para conservar control en tiempo real.
POR QUÉ IMPORTAEntrenado con 1,2 millones de episodios robóticos y tres millones de ejemplos multimodales, logra los mejores resultados globales en seis benchmarks simulados y mejora la generalización composicional real.
Ver problema que intenta resolver
Los robots necesitan anticipar consecuencias sin pagar el coste de generar vídeos o estados futuros completos.
ÁREA NO INDICADAmanipulaciónrobótica industrial
6–12 JULIO 2026 · #12Interesante
MORES: Mobile Reasoning-as-a-Service
Guanchen Liu, Hongyang Du y Kaibin Huang. · 9 julio 2026.
IDEA CENTRALDivide el razonamiento latente entre dispositivos móviles y servidores. Un controlador ajusta dinámicamente cuántas iteraciones de razonamiento ejecutar y cuánta información transmitir según la calidad de la red y la dificultad de la tarea.
POR QUÉ IMPORTAAnticipa una arquitectura en la que el razonamiento se ofrece como servicio distribuido, mientras parte del procesamiento y los datos permanecen en el dispositivo.
Ver problema que intenta resolver
El razonamiento de test-time consume demasiada memoria y cómputo para ejecutarse completamente en dispositivos edge.
ÁREA NO INDICADAasistentes móvilesrobots
6–12 JULIO 2026 · #13Interesante
Pluralis v0.1: Multicultural, Multimodal and Multilingual AI Risk Benchmark
Alicia Parrish, Rajat Shinde y más de 50 colaboradores. · 7 julio 2026.
IDEA CENTRALBenchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas. Evalúa casos donde texto e imagen parecen inocuos por separado, pero su combinación genera riesgos legales o culturales locales.
POR QUÉ IMPORTALa seguridad de un producto internacional no puede depender únicamente de datasets occidentales traducidos. Pluralis incorpora 6.448 prompts y separa daño universal de adecuación cultural.
Ver problema que intenta resolver
Los benchmarks globales promedian culturas, idiomas y jurisdicciones, ocultando fallos regionales.
ÁREA NO INDICADAevaluación de VLMsmoderación regional
6–12 JULIO 2026 · #14Vigilar
LongMedBench: Medical Agents for Long-Horizon Clinical Decision-Making
Yanzhen Chen, Zihan Xu, Xiaocheng Zhang y colaboradores. · 10 julio 2026.
IDEA CENTRALBenchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.
POR QUÉ IMPORTALos resultados muestran que RAG y memoria ayudan a recuperar información, pero las decisiones clínicas siguen dependiendo en gran medida del contexto inmediato. Eso limita el uso seguro de agentes como gestores longitudinales del paciente.
Ver problema que intenta resolver
Los benchmarks médicos suelen reducir la asistencia clínica a preguntas cortas o episodios aislados.
ÁREA NO INDICADAsoporte clínicoresumen de historiales
6–12 JULIO 2026 · #15Vigilar
Evaluating and Understanding Model Editing for Medical VLMs
Guli Zhu, Chenwei Wu y Liyue Shen. · 6 julio 2026; aceptado en ECCV 2026.
IDEA CENTRALM3Bench evalúa si una corrección introducida en un modelo médico multimodal permanece precisa bajo variaciones de texto, imágenes, modalidades, protocolos y evolución temporal. Contiene 16.276 preguntas y soporta ediciones únicas y secuenciales.
POR QUÉ IMPORTANingún método evaluado domina todos los criterios: los métodos basados en gradientes generalizan más, pero dañan conocimientos locales; los basados en memoria conservan mejor el resto del modelo, pero componen peor.
Ver problema que intenta resolver
Corregir un error concreto en un VLM puede alterar conocimientos no relacionados o dejar de funcionar al cambiar la imagen.
ÁREA NO INDICADAactualización de modelos médicoscorrección posdespliegue y validación regulatoria.