NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 05 · 6–12 Julio 2026
6–12 JULIO 202615 PAPERS · 3 SEÑALESREVISIÓN EDITORIAL / 97/100

15 fichas abiertas: qué cambió en este corte.

El archivo reúne 15 señales de 6–12 julio 2026; 15 tienen lectura editorial enlazada y 0 conservan sólo su rastro de descubrimiento.

TESIS DEL CORTE

Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Agent Data Injection Attacks are Realistic Threats to AI Agents.

NOTA DE EDICIÓN

Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE

Agent Data Injection Attacks are Realistic Threats to AI Agents

Introduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables. Los autores demuestran ataques contra agentes web y de programación, incluyendo clics arbitrarios, ejecución remota de código y ataques de cadena de suministro. La pregunta de producto que queda abierta es: Las defensas actuales se concentran en distinguir instrucciones fiables y no fiables, pero apenas separan datos fiables de datos controlados por terceros.

02 / IMPRESCINDIBLE

Eluna: An Agentic LLM System for Automating Warehouse Operations

Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño. La pregunta de producto que queda abierta es: Los SOP completos saturan el contexto y los LLM genéricos no garantizan cumplimiento procedimental.

03 / IMPRESCINDIBLE

TTHE: Test-Time Harness Evolution

Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba. La pregunta de producto que queda abierta es: Los agentes actuales suelen desplegarse con un workflow fijo, aunque cambien la distribución de tareas, las herramientas o los errores encontrados.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    AGENTES · CODING

    Agent Data Injection Attacks are Realistic Threats to AI Agents

    Introduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables.

    La sección Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.05120#S6.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    AGENTES

    Eluna

    Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08960#S5.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    AGENTES · CODING

    TTHE

    Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08124#S5.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    AGENTES · RAG

    Multi-Agent AI Control

    Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas.

    La sección 3 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.07368#S3.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    AGENTES · EVALUACIÓN · MULTIMODAL

    SWE-Review

    Añade una etapa de revisión agentic al flujo de resolución de issues.

    La sección 4 Learning from Agentic Review Trajectories informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06065#S4.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    AGENTES · RAG

    WebSwarm

    Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación.

    La sección Experiment informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08662#Sx4.
    Imprescindibleneeds-reviewLeer ficha
  7. 07
    AGENTES

    From Prompts to Contracts

    Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables.

    La sección 5 System Validation Results informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08028#S5.
    Imprescindibleneeds-reviewLeer ficha
  8. 08
    RAG

    DynaKRAG

    Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06507#Sx4.
    Interesanteneeds-reviewLeer ficha
  9. 09
    MEMORIA

    MILES

    Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06974#S4.
    Interesanteneeds-reviewLeer ficha
  10. 10
    AGENTES · EVALUACIÓN

    SMetric

    Rediseña el balanceo de inferencia alrededor de sesiones completas, no de solicitudes individuales.

    La sección Performance evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08565#S5.
    Interesanteneeds-reviewLeer ficha
  11. 11
    MULTIMODAL · MODELOS PEQUEÑOS

    InternVLA-A1.5

    Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.04988#S5.
    Interesanteneeds-reviewLeer ficha
  12. 12
    MEMORIA · MODELOS PEQUEÑOS

    MORES

    Divide el razonamiento latente entre dispositivos móviles y servidores.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08116#S5.
    Interesanteneeds-reviewLeer ficha
  13. 13
    EVALUACIÓN · SEGURIDAD · MULTIMODAL

    Pluralis v0.1

    Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas.

    La sección 6 Preliminary Insights informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06196#S6.
    Interesanteneeds-reviewLeer ficha
  14. 14
    AGENTES · EVALUACIÓN

    LongMedBench

    Benchmark clínico longitudinal construido con historiales de MIMIC-IV.

    La sección 3 Experiments and Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.09322#S3.
    Vigilarneeds-reviewLeer ficha
  15. 15
    EVALUACIÓN · MULTIMODAL

    Evaluating and Understanding Model Editing for Medical VLMs

    M3Bench evalúa si una corrección introducida en un modelo médico multimodal permanece precisa bajo variaciones de texto, imágenes, modalidades, protocolos y evolución temporal.

    La sección 5 Analysis informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.05310#S5.
    Vigilarneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Abrir Agent Data Injection Attacks are Realistic Threats to AI Agents y localizar su resultado principal en la fuente primaria.
  2. Contrastar Eluna: An Agentic LLM System for Automating Warehouse Operations con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
  3. Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • Una ficha abierta no equivale a una recomendación de adopción.
  • Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
  • Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.
Guardar una nota en Second Brain