Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Agent Data Injection Attacks are Realistic Threats to AI Agents.
NOTA DE EDICIÓN
Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE
Agent Data Injection Attacks are Realistic Threats to AI Agents
Introduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables. Los autores demuestran ataques contra agentes web y de programación, incluyendo clics arbitrarios, ejecución remota de código y ataques de cadena de suministro. La pregunta de producto que queda abierta es: Las defensas actuales se concentran en distinguir instrucciones fiables y no fiables, pero apenas separan datos fiables de datos controlados por terceros.
Eluna: An Agentic LLM System for Automating Warehouse Operations
Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño. La pregunta de producto que queda abierta es: Los SOP completos saturan el contexto y los LLM genéricos no garantizan cumplimiento procedimental.
Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba. La pregunta de producto que queda abierta es: Los agentes actuales suelen desplegarse con un workflow fijo, aunque cambien la distribución de tareas, las herramientas o los errores encontrados.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
01
AGENTES · CODING
Agent Data Injection Attacks are Realistic Threats to AI Agents
Introduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables.
La sección Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.05120#S6.
Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08960#S5.
Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08124#S5.
Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas.
La sección 3 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.07368#S3.
Añade una etapa de revisión agentic al flujo de resolución de issues.
La sección 4 Learning from Agentic Review Trajectories informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06065#S4.
Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación.
La sección Experiment informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08662#Sx4.
Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables.
La sección 5 System Validation Results informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08028#S5.
Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06507#Sx4.
Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06974#S4.
Rediseña el balanceo de inferencia alrededor de sesiones completas, no de solicitudes individuales.
La sección Performance evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08565#S5.
Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.04988#S5.
Divide el razonamiento latente entre dispositivos móviles y servidores.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08116#S5.
Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas.
La sección 6 Preliminary Insights informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06196#S6.
Benchmark clínico longitudinal construido con historiales de MIMIC-IV.
La sección 3 Experiments and Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.09322#S3.
Evaluating and Understanding Model Editing for Medical VLMs
M3Bench evalúa si una corrección introducida en un modelo médico multimodal permanece precisa bajo variaciones de texto, imágenes, modalidades, protocolos y evolución temporal.
La sección 5 Analysis informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.05310#S5.
Abrir Agent Data Injection Attacks are Realistic Threats to AI Agents y localizar su resultado principal en la fuente primaria.
Contrastar Eluna: An Agentic LLM System for Automating Warehouse Operations con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR
La señal también tiene sombra.
Una ficha abierta no equivale a una recomendación de adopción.
Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.