27 JULIO–2 AGOSTO 2026 · #01Imprescindible
TransMem: Transforming Hidden States into Memory for Large Language Models
Haodong Lei et al. · 31 julio 2026.
IDEA CENTRALTransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los agentes con historiales largos pagan repetidamente por releer texto y pueden perder información importante al resumirlo. Por qué puede ser importante: Señala que la memoria futura podría residir parcialmente en el espacio latente, no solo en bases vectoriales o documentos. Mejora entre 11,58 y 29,25 puntos F1 en LoCoMo, entre 10,20 y 13,03 en HotpotQA, y eleva MemoryAgentBench de 29,54% a 40%.
memoria, long-context, agentes.asistentes personalesexpedientes extensos
27 JULIO–2 AGOSTO 2026 · #02Imprescindible
Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case Studies
Peter Kirgis, Sayash Kapoor, Andrew Schwartz, Rishi Bommasani, Arvind Narayanan et al. · 29 julio 2026.
IDEA CENTRALIntroduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante. Los agentes recibieron seis días y miles de dólares de cómputo. Completaron la ingeniería experimental, pero no produjeron avances científicos sustanciales.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los benchmarks verificables miden tareas estrechas, mientras que enviar papers generados a revisión académica introduce mucho ruido. Por qué puede ser importante: Es una corrección necesaria frente a predicciones de automatización total de la ciencia. Identifica fallos recurrentes en criterio científico, creatividad, backtracking, uso de recursos y mantenimiento del objetivo.
agentes científicos, evaluación, automatización de I+D.evaluación de AI scientistsdiseño de agentes de investigación
27 JULIO–2 AGOSTO 2026 · #03Imprescindible
Aries: Rethinking AI Cloud Infrastructure for Agentic Serving Systems
Leonid Kondrashov, Hongrui Liu, JooYoung Park et al. · 31 julio 2026.
IDEA CENTRALAries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones. Combina experimentos reproducibles con trazas de una plataforma comercial.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
La infraestructura LLM actual optimiza tokens y batches, pero los agentes alternan razonamiento, llamadas externas, esperas y ráfagas cortas de ejecución. Por qué puede ser importante: Muestra que las métricas token-centric ocultan cuellos de botella relevantes; que añadir más contexto produce rendimientos decrecientes; y que los sandboxes permanecen ociosos durante largos intervalos, aunque suspenderlos resulte caro.
infraestructura agentic, serving, cloud.cloud agenticoptimización de costes
27 JULIO–2 AGOSTO 2026 · #04Imprescindible
SkillGate: Cost-Efficient Runtime Malicious Skill File Detection in Coding Agents
Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua. · 28 julio 2026.
IDEA CENTRALSkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los archivos SKILL.md y paquetes equivalentes se están convirtiendo en código ejecutable semántico, pero se descargan con controles considerablemente menores que una dependencia tradicional. Por qué puede ser importante: Define una superficie de ataque emergente muy cercana a npm/pip, aunque las cargas útiles se expresen en lenguaje natural y comportamiento agentic.
seguridad, coding agents, supply chain.escáneres de skillsregistries seguros
27 JULIO–2 AGOSTO 2026 · #05Imprescindible
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang. · 28 julio 2026.
IDEA CENTRALEvalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los benchmarks suelen medir recuperación una vez elegida la fuente correcta, pero en empresa el primer reto es decidir dónde debe buscarse cada respuesta. Por qué puede ser importante: Acerca la evaluación a Google Workspace, Microsoft 365, Drive, CRM, ERP y entornos donde la información se reparte entre formatos muy distintos. Las respuestas son auditables mediante SQL ejecutado, spans documentales y rutas de grafo verificadas.
agentes empresariales, RAG, evaluación.copilotos empresarialesbúsqueda interna
27 JULIO–2 AGOSTO 2026 · #06Imprescindible
Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections Against Multimodal LLM Agents
Mingxiao Liu, Yitong Li, Haoren Zhao et al. · 30 julio 2026.
IDEA CENTRALEstudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria. Presenta AudioAgentSecurity, con ocho escenarios reales y diez patrones de ataque, evaluado sobre once agentes multimodales.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los agentes de audio no pueden asumir que todo sonido captado pertenece al usuario autorizado. Por qué puede ser importante: Los ataques alcanzan un ASR medio del 69,1% frente a Gemini 3 Pro. La defensa CADV separa fuentes acústicas y comprueba consistencia entre modalidades, superando el 90% de detección en las pruebas reportadas.
multimodalidad, seguridad, agentes de voz.asistentes móvilesvehículos
27 JULIO–2 AGOSTO 2026 · #07Imprescindible
DenseOn with the LateOn: Fully Open Models for Multilingual, Long-Context and Code Search
Raphaël Sourty, Antoine Chaffin, Paulo Roberto Moura Junior, Amélie Chatelain. · 29 julio 2026.
IDEA CENTRALPublica una receta end-to-end para entrenar retrievers densos y de interacción tardía. Reconstruye 665 millones de pares públicos de pretraining, crea 1,88 millones de pares supervisados y extiende el entrenamiento a ocho idiomas.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los mejores retrievers dependen cada vez más de datasets privados, dificultando reproducibilidad y adaptación empresarial. Por qué puede ser importante: Los modelos de 149M alcanzan nuevos resultados de referencia para su tamaño en BEIR. La variante late-interaction generaliza mejor a lenguas y alfabetos no incluidos directamente en translate-train.
retrieval, RAG, modelos pequeños, búsqueda multilingüe.RAG multilingüebúsqueda de código
27 JULIO–2 AGOSTO 2026 · #08Interesante
GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation
Maya Arseven, Anette Frank, Beni Egressy, Johann Higl, Moritz Plenz. · 30 julio 2026.
IDEA CENTRALCompara retrievers basados en Graph Language Models, GNNs y búsqueda vectorial. Los GLM combinan semántica textual y estructura del grafo para recuperar subgrafos relevantes.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los vectores funcionan bien para hechos locales, pero pierden relaciones; los GNN capturan estructura, aunque pueden generalizar peor fuera del dominio entrenado. Por qué puede ser importante: Los retrievers GLM logran SOTA en dos benchmarks multi-hop fuera de dominio. El paper muestra además que no existe un retriever universal: vector search domina single-hop, GNN aporta cobertura y GLM destaca en transferencia estructurada.
GraphRAG, retrieval, razonamiento multi-hop.knowledge graphsinvestigación científica
27 JULIO–2 AGOSTO 2026 · #09Interesante
DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal RAG
Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li. · 30 julio 2026; aceptado en ACM Multimedia 2026.
IDEA CENTRALSepara dos escalas de recuperación. Un macro-grafo decide la ruta global entre documentos y modalidades; un micro-grafo verifica evidencia visual o textual fina. El retrieval se formula como propagación de mensajes guiada por la consulta.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Un grafo multimodal muy detallado explota en tamaño y ruido; uno muy resumido pierde señales visuales pequeñas pero decisivas. Por qué puede ser importante: Produce rutas explícitas de razonamiento desde el propio GNN y supera los baselines en recall de evidencia y QA complejo.
RAG multimodal, grafos, reasoning.PDFscatálogos técnicos
27 JULIO–2 AGOSTO 2026 · #10Interesante
NeSyFS: Neuro-Symbolic Fast–Slow Thinking for LLM Agents Under Partial Observability
Duo Xu, Faramarz Fekri. · 31 julio 2026.
IDEA CENTRALRepresenta el estado de creencias del agente mediante un knowledge graph. Un módulo rápido actúa reactivamente; otro lento planifica bajo incertidumbre. La reflexión detecta fallos repetidos y decide cuándo escalar del modo rápido al lento.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los historiales completos o resumidos contienen observaciones irrelevantes y no representan bien qué cree actualmente el agente sobre un entorno parcialmente observable. Por qué puede ser importante: Combina routing de cómputo, memoria estructurada y planificación probabilística. Reporta mejoras en ALFWorld, WebShop y ScienceWorld.
agentes, reasoning, neuro-simbólico.agentes webrobots
27 JULIO–2 AGOSTO 2026 · #11Interesante
RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems
Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao et al. · 31 julio 2026.
IDEA CENTRALUn bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Pedir al LLM que explore libremente todas las posibles modificaciones produce búsquedas caras, erráticas y repetitivas. Por qué puede ser importante: Separa la decisión estratégica —qué familia de cambios explorar— de la generación táctica de código. Es un patrón aplicable más allá de recomendadores.
recomendación, agentes, optimización automática.optimización de rankingAutoML
27 JULIO–2 AGOSTO 2026 · #12Interesante
Explanation-Bound Tool Execution for AI Agents
Genliang Zhu, Chu Wang et al.; Accentrust, Georgia Tech y UIUC. · 28 julio 2026; revisión 29 julio.
IDEA CENTRALPropone ligar cada acción de herramienta a afirmaciones comprobables por el servidor. La autorización no depende de que la explicación del modelo “suene razonable”, sino de claims verificables sobre objetivo, parámetros y contexto.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Las cadenas de pensamiento y racionales del modelo no son una base segura para autorizar transferencias, cambios de configuración o acceso a datos. Por qué puede ser importante: Se alinea con una arquitectura zero-trust: el modelo propone y el servidor valida evidencia concreta antes de ejecutar.
seguridad de herramientas, gobernanza agentic.pagosadministración cloud
27 JULIO–2 AGOSTO 2026 · #13Interesante
TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning
Rwaida Alssadi, Muntaser Syed, Balaji Kasula et al. · 28 julio 2026.
IDEA CENTRALConserva el historial de cada fragmento de código: benchmark que provocó el cambio, ronda, error, explicación del modelo y versión. Añade identificadores estables para seguir snippets aunque las líneas circundantes cambien.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
Los coding agents reparan código iterativamente, pero el razonamiento y la procedencia de cada modificación suelen desaparecer. Por qué puede ser importante: En software regulado, la trazabilidad de por qué apareció una línea puede llegar a ser tan importante como que los tests pasen.
código, auditoría, trazabilidad.auditoría de PRscompliance
27 JULIO–2 AGOSTO 2026 · #14Vigilar
EasyBCI Agent: Universal Neural Data Preprocessing with LLM Agents
autores del equipo EasyBCI. · 31 julio 2026.
IDEA CENTRALUn agente de planificación convierte cada registro neurofisiológico en una huella textual que no revela los datos crudos. Después, un agente ejecutor genera y corrige el pipeline de preprocesamiento hasta superar controles de calidad.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
EEG y otras señales tienen pipelines dependientes del sensor, ruido, frecuencia, artefactos y objetivo experimental. Por qué puede ser importante: Une planificación, ejecución de código, privacidad y memoria de estrategias validadas. Es un buen patrón para agentes científicos verticales.
agentes científicos, privacidad, aplicaciones empresariales.EEGBCI
27 JULIO–2 AGOSTO 2026 · #15Vigilar
Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks
Bart Custers, Koorosh Aslansefat. · 28 julio 2026.
IDEA CENTRALUtiliza redes bayesianas para acumular señales de incertidumbre procedentes de varios agentes y componentes durante la ejecución, no solo al final.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
En un sistema multiagente, pequeños errores o dudas pueden propagarse entre roles y aparecer después como una decisión aparentemente segura. Por qué puede ser importante: Introduce una capa explícita de incertidumbre sistémica, útil para decidir cuándo detener, verificar o escalar a una persona.
seguridad, incertidumbre, multiagente.aprobación humanaagentes regulados