NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
27 JULIO–2 AGOSTO 2026 · #01Imprescindible

TransMem: Transforming Hidden States into Memory for Large Language Models

Haodong Lei et al. · 31 julio 2026.

IDEA CENTRAL

TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los agentes con historiales largos pagan repetidamente por releer texto y pueden perder información importante al resumirlo. Por qué puede ser importante: Señala que la memoria futura podría residir parcialmente en el espacio latente, no solo en bases vectoriales o documentos. Mejora entre 11,58 y 29,25 puntos F1 en LoCoMo, entre 10,20 y 13,03 en HotpotQA, y eleva MemoryAgentBench de 29,54% a 40%.

memoria, long-context, agentes.asistentes personalesexpedientes extensos
27 JULIO–2 AGOSTO 2026 · #02Imprescindible

Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case Studies

Peter Kirgis, Sayash Kapoor, Andrew Schwartz, Rishi Bommasani, Arvind Narayanan et al. · 29 julio 2026.

IDEA CENTRAL

Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante. Los agentes recibieron seis días y miles de dólares de cómputo. Completaron la ingeniería experimental, pero no produjeron avances científicos sustanciales.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los benchmarks verificables miden tareas estrechas, mientras que enviar papers generados a revisión académica introduce mucho ruido. Por qué puede ser importante: Es una corrección necesaria frente a predicciones de automatización total de la ciencia. Identifica fallos recurrentes en criterio científico, creatividad, backtracking, uso de recursos y mantenimiento del objetivo.

agentes científicos, evaluación, automatización de I+D.evaluación de AI scientistsdiseño de agentes de investigación
27 JULIO–2 AGOSTO 2026 · #03Imprescindible

Aries: Rethinking AI Cloud Infrastructure for Agentic Serving Systems

Leonid Kondrashov, Hongrui Liu, JooYoung Park et al. · 31 julio 2026.

IDEA CENTRAL

Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones. Combina experimentos reproducibles con trazas de una plataforma comercial.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

La infraestructura LLM actual optimiza tokens y batches, pero los agentes alternan razonamiento, llamadas externas, esperas y ráfagas cortas de ejecución. Por qué puede ser importante: Muestra que las métricas token-centric ocultan cuellos de botella relevantes; que añadir más contexto produce rendimientos decrecientes; y que los sandboxes permanecen ociosos durante largos intervalos, aunque suspenderlos resulte caro.

infraestructura agentic, serving, cloud.cloud agenticoptimización de costes
27 JULIO–2 AGOSTO 2026 · #04Imprescindible

SkillGate: Cost-Efficient Runtime Malicious Skill File Detection in Coding Agents

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua. · 28 julio 2026.

IDEA CENTRAL

SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los archivos SKILL.md y paquetes equivalentes se están convirtiendo en código ejecutable semántico, pero se descargan con controles considerablemente menores que una dependencia tradicional. Por qué puede ser importante: Define una superficie de ataque emergente muy cercana a npm/pip, aunque las cargas útiles se expresen en lenguaje natural y comportamiento agentic.

seguridad, coding agents, supply chain.escáneres de skillsregistries seguros
27 JULIO–2 AGOSTO 2026 · #05Imprescindible

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang. · 28 julio 2026.

IDEA CENTRAL

Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los benchmarks suelen medir recuperación una vez elegida la fuente correcta, pero en empresa el primer reto es decidir dónde debe buscarse cada respuesta. Por qué puede ser importante: Acerca la evaluación a Google Workspace, Microsoft 365, Drive, CRM, ERP y entornos donde la información se reparte entre formatos muy distintos. Las respuestas son auditables mediante SQL ejecutado, spans documentales y rutas de grafo verificadas.

agentes empresariales, RAG, evaluación.copilotos empresarialesbúsqueda interna
27 JULIO–2 AGOSTO 2026 · #06Imprescindible

Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections Against Multimodal LLM Agents

Mingxiao Liu, Yitong Li, Haoren Zhao et al. · 30 julio 2026.

IDEA CENTRAL

Estudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria. Presenta AudioAgentSecurity, con ocho escenarios reales y diez patrones de ataque, evaluado sobre once agentes multimodales.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los agentes de audio no pueden asumir que todo sonido captado pertenece al usuario autorizado. Por qué puede ser importante: Los ataques alcanzan un ASR medio del 69,1% frente a Gemini 3 Pro. La defensa CADV separa fuentes acústicas y comprueba consistencia entre modalidades, superando el 90% de detección en las pruebas reportadas.

multimodalidad, seguridad, agentes de voz.asistentes móvilesvehículos
27 JULIO–2 AGOSTO 2026 · #07Imprescindible

DenseOn with the LateOn: Fully Open Models for Multilingual, Long-Context and Code Search

Raphaël Sourty, Antoine Chaffin, Paulo Roberto Moura Junior, Amélie Chatelain. · 29 julio 2026.

IDEA CENTRAL

Publica una receta end-to-end para entrenar retrievers densos y de interacción tardía. Reconstruye 665 millones de pares públicos de pretraining, crea 1,88 millones de pares supervisados y extiende el entrenamiento a ocho idiomas.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los mejores retrievers dependen cada vez más de datasets privados, dificultando reproducibilidad y adaptación empresarial. Por qué puede ser importante: Los modelos de 149M alcanzan nuevos resultados de referencia para su tamaño en BEIR. La variante late-interaction generaliza mejor a lenguas y alfabetos no incluidos directamente en translate-train.

retrieval, RAG, modelos pequeños, búsqueda multilingüe.RAG multilingüebúsqueda de código
27 JULIO–2 AGOSTO 2026 · #08Interesante

GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation

Maya Arseven, Anette Frank, Beni Egressy, Johann Higl, Moritz Plenz. · 30 julio 2026.

IDEA CENTRAL

Compara retrievers basados en Graph Language Models, GNNs y búsqueda vectorial. Los GLM combinan semántica textual y estructura del grafo para recuperar subgrafos relevantes.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los vectores funcionan bien para hechos locales, pero pierden relaciones; los GNN capturan estructura, aunque pueden generalizar peor fuera del dominio entrenado. Por qué puede ser importante: Los retrievers GLM logran SOTA en dos benchmarks multi-hop fuera de dominio. El paper muestra además que no existe un retriever universal: vector search domina single-hop, GNN aporta cobertura y GLM destaca en transferencia estructurada.

GraphRAG, retrieval, razonamiento multi-hop.knowledge graphsinvestigación científica
27 JULIO–2 AGOSTO 2026 · #09Interesante

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal RAG

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li. · 30 julio 2026; aceptado en ACM Multimedia 2026.

IDEA CENTRAL

Separa dos escalas de recuperación. Un macro-grafo decide la ruta global entre documentos y modalidades; un micro-grafo verifica evidencia visual o textual fina. El retrieval se formula como propagación de mensajes guiada por la consulta.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Un grafo multimodal muy detallado explota en tamaño y ruido; uno muy resumido pierde señales visuales pequeñas pero decisivas. Por qué puede ser importante: Produce rutas explícitas de razonamiento desde el propio GNN y supera los baselines en recall de evidencia y QA complejo.

RAG multimodal, grafos, reasoning.PDFscatálogos técnicos
27 JULIO–2 AGOSTO 2026 · #10Interesante

NeSyFS: Neuro-Symbolic Fast–Slow Thinking for LLM Agents Under Partial Observability

Duo Xu, Faramarz Fekri. · 31 julio 2026.

IDEA CENTRAL

Representa el estado de creencias del agente mediante un knowledge graph. Un módulo rápido actúa reactivamente; otro lento planifica bajo incertidumbre. La reflexión detecta fallos repetidos y decide cuándo escalar del modo rápido al lento.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los historiales completos o resumidos contienen observaciones irrelevantes y no representan bien qué cree actualmente el agente sobre un entorno parcialmente observable. Por qué puede ser importante: Combina routing de cómputo, memoria estructurada y planificación probabilística. Reporta mejoras en ALFWorld, WebShop y ScienceWorld.

agentes, reasoning, neuro-simbólico.agentes webrobots
27 JULIO–2 AGOSTO 2026 · #11Interesante

RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao et al. · 31 julio 2026.

IDEA CENTRAL

Un bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Pedir al LLM que explore libremente todas las posibles modificaciones produce búsquedas caras, erráticas y repetitivas. Por qué puede ser importante: Separa la decisión estratégica —qué familia de cambios explorar— de la generación táctica de código. Es un patrón aplicable más allá de recomendadores.

recomendación, agentes, optimización automática.optimización de rankingAutoML
27 JULIO–2 AGOSTO 2026 · #12Interesante

Explanation-Bound Tool Execution for AI Agents

Genliang Zhu, Chu Wang et al.; Accentrust, Georgia Tech y UIUC. · 28 julio 2026; revisión 29 julio.

IDEA CENTRAL

Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor. La autorización no depende de que la explicación del modelo “suene razonable”, sino de claims verificables sobre objetivo, parámetros y contexto.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Las cadenas de pensamiento y racionales del modelo no son una base segura para autorizar transferencias, cambios de configuración o acceso a datos. Por qué puede ser importante: Se alinea con una arquitectura zero-trust: el modelo propone y el servidor valida evidencia concreta antes de ejecutar.

seguridad de herramientas, gobernanza agentic.pagosadministración cloud
27 JULIO–2 AGOSTO 2026 · #13Interesante

TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning

Rwaida Alssadi, Muntaser Syed, Balaji Kasula et al. · 28 julio 2026.

IDEA CENTRAL

Conserva el historial de cada fragmento de código: benchmark que provocó el cambio, ronda, error, explicación del modelo y versión. Añade identificadores estables para seguir snippets aunque las líneas circundantes cambien.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

Los coding agents reparan código iterativamente, pero el razonamiento y la procedencia de cada modificación suelen desaparecer. Por qué puede ser importante: En software regulado, la trazabilidad de por qué apareció una línea puede llegar a ser tan importante como que los tests pasen.

código, auditoría, trazabilidad.auditoría de PRscompliance
27 JULIO–2 AGOSTO 2026 · #14Vigilar

EasyBCI Agent: Universal Neural Data Preprocessing with LLM Agents

autores del equipo EasyBCI. · 31 julio 2026.

IDEA CENTRAL

Un agente de planificación convierte cada registro neurofisiológico en una huella textual que no revela los datos crudos. Después, un agente ejecutor genera y corrige el pipeline de preprocesamiento hasta superar controles de calidad.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

EEG y otras señales tienen pipelines dependientes del sensor, ruido, frecuencia, artefactos y objetivo experimental. Por qué puede ser importante: Une planificación, ejecución de código, privacidad y memoria de estrategias validadas. Es un buen patrón para agentes científicos verticales.

agentes científicos, privacidad, aplicaciones empresariales.EEGBCI
27 JULIO–2 AGOSTO 2026 · #15Vigilar

Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks

Bart Custers, Koorosh Aslansefat. · 28 julio 2026.

IDEA CENTRAL

Utiliza redes bayesianas para acumular señales de incertidumbre procedentes de varios agentes y componentes durante la ejecución, no solo al final.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

En un sistema multiagente, pequeños errores o dudas pueden propagarse entre roles y aparecer después como una decisión aparentemente segura. Por qué puede ser importante: Introduce una capa explícita de incertidumbre sistémica, útil para decidir cuándo detener, verificar o escalar a una persona.

seguridad, incertidumbre, multiagente.aprobación humanaagentes regulados