NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
6–12 JULIO 2026 · #01Imprescindible

Agent Data Injection Attacks are Realistic Threats to AI Agents

Woohyuk Choi, Juhee Kim, Taehyun Kang, Jihyeon Jeong, Luyi Xing y Byoungyoung Lee. · 6 julio 2026.

IDEA CENTRAL

Introduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables. Los autores demuestran ataques contra agentes web y de programación, incluyendo clics arbitrarios, ejecución remota de código y ataques de cadena de suministro.

POR QUÉ IMPORTA

Es probablemente el hallazgo de seguridad de agentes más accionable de la semana. Afecta directamente a Claude Code, Codex, Gemini CLI, extensiones de navegador y cualquier agente que consuma herramientas o documentos externos.

Ver problema que intenta resolver

Las defensas actuales se concentran en distinguir instrucciones fiables y no fiables, pero apenas separan datos fiables de datos controlados por terceros.

ÁREA NO INDICADAthreat modelingvalidación de tool outputs
6–12 JULIO 2026 · #02Imprescindible

Eluna: An Agentic LLM System for Automating Warehouse Operations

Ning Liu y colaboradores. · 9 julio 2026.

IDEA CENTRAL

Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño.

POR QUÉ IMPORTA

Es una de las pocas señales recientes de agentes empresariales con despliegue productivo, evaluación de tareas reales y optimización explícita de latencia y coste. Reporta un 94% de acuerdo con expertos en una aplicación de gestión de tickets.

Ver problema que intenta resolver

Los SOP completos saturan el contexto y los LLM genéricos no garantizan cumplimiento procedimental.

ÁREA NO INDICADAoperaciones de almacéngestión de incidencias
6–12 JULIO 2026 · #03Imprescindible

TTHE: Test-Time Harness Evolution

Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian y Bo Han. · 9 julio 2026.

IDEA CENTRAL

Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.

POR QUÉ IMPORTA

Refuerza una tendencia importante: el rendimiento de un agente depende tanto del harness como del modelo. Puede desplazar parte de la innovación desde el entrenamiento de modelos hacia la evolución dinámica del software que los rodea.

Ver problema que intenta resolver

Los agentes actuales suelen desplegarse con un workflow fijo, aunque cambien la distribución de tareas, las herramientas o los errores encontrados.

ÁREA NO INDICADAcoding agentsresearch agents
6–12 JULIO 2026 · #04Imprescindible

Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors

Oliver Makins, Orazio Angelini, Zohreh Shams y Mary Phuong. · 8 julio 2026.

IDEA CENTRAL

Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas. Introduce FakeLab, un entorno con nueve servicios, 86 tareas benignas y cuatro objetivos de ataque. El resultado principal es el “efecto de fragmentación”: al aumentar el número de atacantes, disminuye la probabilidad de que un monitor por instancia detecte alguno.

POR QUÉ IMPORTA

En despliegues reales habrá decenas o cientos de agentes compartiendo repositorios, datos y herramientas. El paper muestra que un planificador coordinador puede multiplicar hasta por siete la tasa de éxito de algunos ataques.

Ver problema que intenta resolver

La mayoría de los sistemas de control evalúan cada agente y cada trayectoria de forma aislada.

ÁREA NO INDICADAmonitorización colectivaseguridad de enjambres de agentes
6–12 JULIO 2026 · #05Imprescindible

SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review

Ruoyu Wang, Jierun Chen, Shaowei Wang y colaboradores. · 7 julio 2026.

IDEA CENTRAL

Añade una etapa de revisión agentic al flujo de resolución de issues. Un agente explora el repositorio, determina si el PR debería aceptarse y emite feedback estructurado para que otro agente revise el parche. Introduce SWE-Review-Bench y SWE-Review-Traj.

POR QUÉ IMPORTA

El patrón generar → revisar → corregir se parece mucho más al desarrollo profesional que el one-shot actual. El trabajo reporta mejoras en decisión de aceptación y tasa de resolución después de la revisión.

Ver problema que intenta resolver

La mayoría de los coding agents generan un único parche y terminan, sin un ciclo sistemático de revisión y corrección.

ÁREA NO INDICADArevisión automática de PRscontrol de calidad
6–12 JULIO 2026 · #06Imprescindible

WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search

Xiaoshuai Song, Liancheng Zhang, Kangzhi Zhao y colaboradores. · 9 julio 2026.

IDEA CENTRAL

Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.

POR QUÉ IMPORTA

Es relevante para la transición de los buscadores hacia sistemas que construyen respuestas, informes y mapas completos de información. También afecta a cómo marcas y contenidos serán descubiertos y citados dentro de asistentes.

Ver problema que intenta resolver

Los search agents suelen sacrificar profundidad para ganar cobertura, o cobertura para mantener profundidad.

ÁREA NO INDICADAdeep researchdue diligence
6–12 JULIO 2026 · #07Imprescindible

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

Joongho Ahn y Moonsoo Kim. · 9 julio 2026.

IDEA CENTRAL

Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.

POR QUÉ IMPORTA

Es un diseño especialmente apropiado para empresa: menos “magia del prompt” y más contratos comprobables. El caso experimental utiliza datos de 25 empresas pertenecientes a cinco grupos corporativos coreanos.

Ver problema que intenta resolver

Los prompts monolíticos mezclan lógica de negocio, recuperación, reglas, formato y razonamiento, dificultando auditoría y mantenimiento.

ÁREA NO INDICADAagentes auditablescompliance
6–12 JULIO 2026 · #08Interesante

DynaKRAG: Learnable Evidence Control in Multi-Hop RAG

Yaqi Wu, Xiaolei Guo, Chenyu Zhou y colaboradores. · 7 julio 2026.

IDEA CENTRAL

Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.

POR QUÉ IMPORTA

El retrieval empieza a convertirse en un problema de control secuencial, no en una simple consulta vectorial. Esto puede reducir pasos innecesarios y mejorar consultas composicionales.

Ver problema que intenta resolver

Muchos sistemas RAG complejos tienen pipelines rígidos, diseñados manualmente y poco adaptables a cada consulta.

ÁREA NO INDICADAinvestigación documentalgraph-RAG
6–12 JULIO 2026 · #09Interesante

MILES: Modular Instruction Memory with Learnable Selection

Ruilin Tong y Dong Gong. · 8 julio 2026.

IDEA CENTRAL

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.

POR QUÉ IMPORTA

Introduce una forma de aprendizaje continuo en tiempo de uso sin tener que modificar todos los pesos del modelo. Es especialmente prometedor para agentes que repiten familias de tareas similares.

Ver problema que intenta resolver

Guardar soluciones completas genera plantillas rígidas; guardar pasos sin una política aprendida produce recuperación poco fiable.

ÁREA NO INDICADArazonamiento matemáticoagentes de operaciones
6–12 JULIO 2026 · #10Interesante

SMetric: Session-Centric Scheduling for Serving Agents

Jiahao Wang, Kaizhan Lin, Kaixi Zhang y colaboradores. · 9 julio 2026.

IDEA CENTRAL

Rediseña el balanceo de inferencia alrededor de sesiones completas, no de solicitudes individuales. La primera petición se distribuye según carga y las siguientes se enrutan teniendo en cuenta la reutilización de caché.

POR QUÉ IMPORTA

El coste de los agentes está fuertemente influido por el KV cache y la reutilización de contexto. Una infraestructura consciente de sesiones puede reducir latencia y presión sobre almacenamiento global.

Ver problema que intenta resolver

Los schedulers tradicionales están optimizados para peticiones independientes, mientras que los agentes generan largas secuencias de llamadas relacionadas.

ÁREA NO INDICADAserving multiagentecoding agents
6–12 JULIO 2026 · #11Interesante

InternVLA-A1.5: Understanding, Latent Foresight and Action

Haoxiang Ma y colaboradores; Intern Robotics. · 6 julio 2026.

IDEA CENTRAL

Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto. Aprende dinámicas desde un modelo de generación de vídeo congelado, pero elimina esa rama durante inferencia para conservar control en tiempo real.

POR QUÉ IMPORTA

Entrenado con 1,2 millones de episodios robóticos y tres millones de ejemplos multimodales, logra los mejores resultados globales en seis benchmarks simulados y mejora la generalización composicional real.

Ver problema que intenta resolver

Los robots necesitan anticipar consecuencias sin pagar el coste de generar vídeos o estados futuros completos.

ÁREA NO INDICADAmanipulaciónrobótica industrial
6–12 JULIO 2026 · #12Interesante

MORES: Mobile Reasoning-as-a-Service

Guanchen Liu, Hongyang Du y Kaibin Huang. · 9 julio 2026.

IDEA CENTRAL

Divide el razonamiento latente entre dispositivos móviles y servidores. Un controlador ajusta dinámicamente cuántas iteraciones de razonamiento ejecutar y cuánta información transmitir según la calidad de la red y la dificultad de la tarea.

POR QUÉ IMPORTA

Anticipa una arquitectura en la que el razonamiento se ofrece como servicio distribuido, mientras parte del procesamiento y los datos permanecen en el dispositivo.

Ver problema que intenta resolver

El razonamiento de test-time consume demasiada memoria y cómputo para ejecutarse completamente en dispositivos edge.

ÁREA NO INDICADAasistentes móvilesrobots
6–12 JULIO 2026 · #13Interesante

Pluralis v0.1: Multicultural, Multimodal and Multilingual AI Risk Benchmark

Alicia Parrish, Rajat Shinde y más de 50 colaboradores. · 7 julio 2026.

IDEA CENTRAL

Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas. Evalúa casos donde texto e imagen parecen inocuos por separado, pero su combinación genera riesgos legales o culturales locales.

POR QUÉ IMPORTA

La seguridad de un producto internacional no puede depender únicamente de datasets occidentales traducidos. Pluralis incorpora 6.448 prompts y separa daño universal de adecuación cultural.

Ver problema que intenta resolver

Los benchmarks globales promedian culturas, idiomas y jurisdicciones, ocultando fallos regionales.

ÁREA NO INDICADAevaluación de VLMsmoderación regional
6–12 JULIO 2026 · #14Vigilar

LongMedBench: Medical Agents for Long-Horizon Clinical Decision-Making

Yanzhen Chen, Zihan Xu, Xiaocheng Zhang y colaboradores. · 10 julio 2026.

IDEA CENTRAL

Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.

POR QUÉ IMPORTA

Los resultados muestran que RAG y memoria ayudan a recuperar información, pero las decisiones clínicas siguen dependiendo en gran medida del contexto inmediato. Eso limita el uso seguro de agentes como gestores longitudinales del paciente.

Ver problema que intenta resolver

Los benchmarks médicos suelen reducir la asistencia clínica a preguntas cortas o episodios aislados.

ÁREA NO INDICADAsoporte clínicoresumen de historiales
6–12 JULIO 2026 · #15Vigilar

Evaluating and Understanding Model Editing for Medical VLMs

Guli Zhu, Chenwei Wu y Liyue Shen. · 6 julio 2026; aceptado en ECCV 2026.

IDEA CENTRAL

M3Bench evalúa si una corrección introducida en un modelo médico multimodal permanece precisa bajo variaciones de texto, imágenes, modalidades, protocolos y evolución temporal. Contiene 16.276 preguntas y soporta ediciones únicas y secuenciales.

POR QUÉ IMPORTA

Ningún método evaluado domina todos los criterios: los métodos basados en gradientes generalizan más, pero dañan conocimientos locales; los basados en memoria conservan mejor el resto del modelo, pero componen peor.

Ver problema que intenta resolver

Corregir un error concreto en un VLM puede alterar conocimientos no relacionados o dejar de funcionar al cambiar la imagen.

ÁREA NO INDICADAactualización de modelos médicoscorrección posdespliegue y validación regulatoria.