3–9 AGOSTO 2026 · #01Imprescindible
CoEvo-Mem — Co-Evolving Retrieval Policy and Memory Bank for LLM Agents
Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li. · 3 agosto 2026.
IDEA CENTRALrompe una separación habitual: por un lado optimizamos cómo buscamos recuerdos y por otro cómo los almacenamos. CoEvo-Mem hace que retrieval y memoria evolucionen conjuntamente. Los resultados de las tareas actualizan tanto la política de routing como valores y relaciones del grafo de memoria; esos cambios modifican después qué recuerdos se recuperarán.
POR QUÉ IMPORTAes probablemente la dirección conceptualmente más potente de la semana. Una memoria agentic madura no debería ser una base vectorial estática: debería aprender simultáneamente qué conservar, cómo relacionarlo, cuándo buscarlo y cuánto confiar en ello. Reporta SOTA en siete benchmarks.
Ver problema que intenta resolver
una memoria que cambia vuelve obsoleta la política de retrieval que fue diseñada para consultarla.
memoria, agentes, RAG.asistentes personales persistentesCRM
3–9 AGOSTO 2026 · #02Imprescindible
Agent Memory Distillation — Empowering Small LLM Agents with Hierarchical Teacher Memory
Taeil Kim, Kangsan Kim, Sung Ju Hwang. · 7 agosto 2026.
IDEA CENTRALun agente grande ejecuta correctamente tareas y convierte sus experiencias en tres tipos de memoria: Workflow, Subtask y Function. Un modelo pequeño de 4B–8B recibe estas memorias sin modificar sus pesos. La memoria de workflow se carga al comenzar; las instrucciones específicas de herramientas aparecen cuando se producen errores.
POR QUÉ IMPORTAel resultado es especialmente atractivo económicamente. Usando GPT-5-mini como profesor, los pequeños mejoran de media +27,2 puntos porcentuales en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox. Los modelos de 4B son los que más se benefician.
Ver problema que intenta resolver
los SLM generan pocas trayectorias exitosas y, por tanto, tienen dificultades para construir por sí mismos una buena experiencia operacional.
SLM, memoria, agentes, tool-use.agentes locales baratoscopilotos especializados
3–9 AGOSTO 2026 · #03Imprescindible
CodeGrep — An RL-Trained Retrieval Agent for LLM Coding Agents
Wuya Chen, Yihao Yang, Yang Cao, Yue Lin. · 6 agosto 2026.
IDEA CENTRALobserva que Claude Code/OpenHands-like agents gastan una parte enorme del presupuesto buscando dónde tocar el código. Entrenan un modelo de 14B específicamente para hacer grep, glob y lectura multi-turn del repositorio y entregar al coding agent solo los archivos candidatos.
POR QUÉ IMPORTACodeGrep mantiene/mejora ligeramente resolución —27,0% frente a 25,8%— mientras reduce 15% las rondas y 19% los tokens en issues resueltas. También identifica algo muy útil: retrieval solo ayuda cuando supera cierto umbral de precisión; retrieval mediocre empeora al agente.
Ver problema que intenta resolver
en SWE-Bench Verified, su baseline de 30B consume unas 23 rondas y 631K tokens por issue resuelta; mucha actividad es simple exploración del repo.
coding agents, retrieval, RL.Codex/Claude Code-like agentsmantenimiento de repositorios
3–9 AGOSTO 2026 · #04Imprescindible
RAG-Stack — Co-Optimizing RAG Serving Performance and Quality
Haiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang, Wenqi Jiang. · 4 agosto 2026.
IDEA CENTRALtrata el diseño de RAG como una optimización conjunta de calidad y sistema. Cambiar índice, modelo, estrategia de retrieval, hardware o serving produce combinaciones distintas de coste, latencia y precisión. RAG-Stack busca automáticamente la frontera Pareto sin desplegar y medir exhaustivamente cada configuración.
POR QUÉ IMPORTAen los experimentos encuentra fronteras Pareto que cubren entre 52,5% y 153,2% más espacio calidad-rendimiento que otros métodos de búsqueda de configuración.
Ver problema que intenta resolver
la pregunta empresarial no es “¿qué RAG tiene mayor accuracy?”, sino “¿qué configuración da la calidad requerida al coste y latencia aceptables?”.
RAG, infraestructura, eficiencia.diseño de RAG corporativoselección de modelos
3–9 AGOSTO 2026 · #05Imprescindible
Before Reasoning Can Fail — Pre-Evidence Procedural Failures in Agentic RAG
Daeyoung Roh, Donghee Han. · 3 agosto; revisado 4 agosto 2026.
IDEA CENTRALdescubre un fallo casi cómico pero importante: un search agent puede encontrar la evidencia correcta y responder sin haberla leído. Analiza 12.000 trayectorias en HotpotQA, 2WikiMultiHopQA y MuSiQue y separa errores de razonamiento de errores procedimentales previos.
POR QUÉ IMPORTAañadir una sola regla —Read-Gate: después de buscar hay que leer antes de responder— mejora la precisión entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura. Dar más presupuesto de pensamiento no soluciona necesariamente el problema.
Ver problema que intenta resolver
solemos culpar al razonamiento del LLM cuando el verdadero fallo fue que el harness permitió search → final answer sin read.
RAG, reasoning, agentes, evaluación.Deep Researchagentes web
3–9 AGOSTO 2026 · #06Imprescindible
ReASearch — The Optimizer Is the Agent
Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao. · 7 agosto 2026.
IDEA CENTRALelimina gran parte del algoritmo externo que normalmente controla una optimización. El agente decide por sí mismo qué probar, cómo interpretar resultados, qué cambiar, cuándo verificar, cuándo volver atrás y cuándo abandonar una rama. El mismo scaffold optimiza prompts, programas y workflows ML. Utiliza ejecución Python y memoria persistente para analizar experimentalmente su propio historial.
POR QUÉ IMPORTAen 14 tareas iguala o supera mayoritariamente optimizadores especializados, con mejoras del 2–40%; en algunos casos encuentra resultados superiores a mejores soluciones humanas conocidas. También emergen conductas como reverificación, rollback y reutilización de fallos anteriores sin estar programadas explícitamente.
Ver problema que intenta resolver
los LLMs en sistemas AutoML/AlphaEvolve-like suelen ser generadores de propuestas dentro de un algoritmo de búsqueda diseñado por humanos.
agentes, reasoning, AutoML, self-improvement.optimización de promptscódigo
3–9 AGOSTO 2026 · #07Imprescindible
LiveMem — Maintaining Memory State Continuity in Long-Running LLM Inference
Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Yang Xu. · 3 agosto; versión actual 7 agosto 2026.
IDEA CENTRALpropone distinguir contexto activo de estado vital persistente. LiveMem mantiene un estado de memoria de capacidad fija incluso después de eliminar los tokens originales del KV/context window.
POR QUÉ IMPORTALongMemEval demuestra que el modelo puede responder utilizando memoria sobre evidencia que ya no está presente en el contexto actual. Es una arquitectura complementaria a RAG, no simplemente otro retriever.
Ver problema que intenta resolver
resumir o recuperar historia conserva referencias al pasado, pero no mantiene necesariamente continuidad computacional del estado interno a lo largo de toda la vida del agente.
memoria intrínseca, long-context, LLMs.asistentes siempre activosagentes personales
3–9 AGOSTO 2026 · #08Imprescindible
NiyamAI — Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs
Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid. · 7 agosto 2026.
IDEA CENTRALal comenzar la sesión se crea un Intent Contract que fija herramientas y restricciones. Cada acción es juzgada en un componente aislado y, si es válida, genera una prueba zk-SNARK. La herramienta únicamente se ejecuta después de verificar criptográficamente esa prueba.
POR QUÉ IMPORTAen Agent-SafetyBench reporta F1 del 88,5% y 1,1% de falsos positivos. La pega práctica es considerable: generar la prueba añade aproximadamente 2,26 segundos por acción, aunque verificarla tarda \~53 ms.
Ver problema que intenta resolver
system prompts y guardrails normales funcionan en el mismo entorno que queremos proteger y no proporcionan prueba verificable de que una política se aplicó.
alignment, agent safety, criptografía.pagos agenticoperaciones cloud
3–9 AGOSTO 2026 · #09Imprescindible
Shape Your Feed — An LLM-based Agentic System for Conversational Recommendation
Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song et al. · 6 agosto 2026.
IDEA CENTRALcambia recomendación pasiva basada en clics por co-curación conversacional. El usuario expresa deseos mediante texto, voz o interfaz; un agente mantiene un Semantic Profile persistente y rerankea/prunea candidatos en tiempo real. Un tercer loop aprende mediante DPO y un ensemble LLM-as-a-Judge.
POR QUÉ IMPORTAes además una señal real de mercado: los autores reportan A/B tests en tráfico de producción, no solo benchmark offline, con mejoras de relevancia y sentimiento del usuario.
Ver problema que intenta resolver
algoritmos de recomendación infieren preferencias de comportamiento pasado aunque el usuario pueda expresar explícitamente qué quiere ahora.
recomendación, discovery, agentes, multimodalidad.feedsmarketplaces
3–9 AGOSTO 2026 · #10Interesante
MemWM — Memory-Augmented Text-Based World Model
Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye et al. · 7 agosto 2026.
IDEA CENTRALlos world models textuales pueden producir estados futuros muy plausibles pero olvidar atributos cruciales o inventar reglas de transición. MemWM añade una memoria explícita con reglas del mundo, state caches y hechos difíciles de predecir.
POR QUÉ IMPORTAmemory-augmented training mejora hasta 206,3% la métrica Structured State Fidelity; en planificación downstream reporta hasta 65,4% de mejora relativa sobre el agente basado en world model SFT.
Ver problema que intenta resolver
planificar sobre un mundo imaginado incorrectamente conduce inevitablemente a malas acciones.
reasoning, world models, memoria, agentes.planificaciónsimulación
3–9 AGOSTO 2026 · #11Interesante
RepoOMP — Repository-Aware Hotspot OpenMP Parallelization
Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li. · 6 agosto 2026.
IDEA CENTRALantes de pedir al agente que paralelice código, construye un grafo de dependencias y genera un contexto estructurado que contiene únicamente evidencia relevante para decidir si una transformación OpenMP es legal y rentable.
POR QUÉ IMPORTAen 951 hotspots reales/sintéticos acepta 372 transformaciones válidas. Frente a Claude Code sin contexto estructurado reduce 47–68% el coste de tokens y mejora speedup 18–28% en el subconjunto comparativo; la mediana de aceleración de 330 hotspots reales aceptados es 2,25×.
Ver problema que intenta resolver
el contexto local puede ser insuficiente; meter todo el repositorio añade ruido y tokens.
code generation, agentes, ingeniería.modernización de códigoHPC
3–9 AGOSTO 2026 · #12Interesante
MNC — Minimum-Necessary Communication for Private LLM-Agent Communication
Jinghan Xu, Longze Fan, Zeyuan Wang, Xinjin Li, Hankai Liu. · 3 agosto 2026.
IDEA CENTRALun agente informado puede necesitar decirle algo a otro agente sin tener permiso para entregarle todo lo que sabe. MNC define disclosures mínimos asociados a destinatario, propósito, reenvío, lifetime, logging y memory scope.
POR QUÉ IMPORTAes un modelo de privacidad mucho más apropiado para organizaciones multiagente que simple RBAC. El permiso acompaña semánticamente a la información durante su vida posterior.
Ver problema que intenta resolver
borrar campos sensibles del mensaje no impide que ese conocimiento termine después reenviado, logueado o incorporado permanentemente a memoria.
privacidad, multiagente, memoria.agentes corporativosdatos médicos
3–9 AGOSTO 2026 · #13Interesante
Cross-Domain Hybrid OPD — Generalizable Search Agents
Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu et al. · 3 agosto 2026.
IDEA CENTRALdescribe el entrenamiento del Yuanbao search agent sobre Hunyuan3. El problema que ataca es especialmente interesante: entrenar mucho para buscar puede crear un alignment tax que deteriora las capacidades generales del LLM. Combina RL especializado en búsqueda con On-Policy Distillation desde expertos de otros dominios, recuperando capacidades generales sin renunciar a search.
POR QUÉ IMPORTAanticipa arquitecturas donde especialización agentic y general intelligence se entrenan conjuntamente, en vez de elegir entre ambas.
Ver problema que intenta resolver
convertir un buen LLM en search agent puede volverlo peor como asistente general.
search agents, RL, distillation.buscadores generativosresearch agents
3–9 AGOSTO 2026 · #14Interesante
KnowHal — Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation
Ruihan Li, Yuntao Du et al. · 4 agosto 2026.
IDEA CENTRALamplía hallucination testing multimodal más allá de detectar objetos o relaciones inexistentes. Evalúa cuatro dimensiones: entidad, atributo, relación y conocimiento, usando preguntas positivas y negativas sobre las mismas imágenes.
POR QUÉ IMPORTA1.800 muestras, 10 dominios, 50 categorías y 14 MLLMs muestran que knowledge hallucination es generalmente la dimensión más difícil, y que los modelos se degradan notablemente ante preguntas con premisas falsas.
Ver problema que intenta resolver
un VLM puede ver correctamente una imagen y después combinarla con conocimiento externo incorrecto o aceptar una premisa falsa.
multimodalidad, evaluación, hallucinations.QA multimodalinspección
3–9 AGOSTO 2026 · #15Interesante
Teaching Nemotron Greek — Mining a Corpus, Adapting Retrieval, and Grounding Generation
Ayoub Kirouane, Christos Petrocheilos. · 5 agosto 2026.
IDEA CENTRALconstruye de extremo a extremo un RAG especializado para griego moderno: corpus, synthetic supervision, embedding model, reranker, reader y benchmark HERA. Lo interesante es que BM25 inicialmente supera a varios dense retrievers multilingües, pero adaptar un Nemotron embedder de 1B eleva nDCG\@10 de 0,362 a 0,835. El reader Nemotron 30B-A3B LoRA pasa de 29,4% a 66,9% de corrección juzgada, mejorando además grounding y citas.
POR QUÉ IMPORTAofrece una receta muy reutilizable para crear RAG realmente competente en idiomas y dominios corporativos específicos.
Ver problema que intenta resolver
“multilingual” suele ocultar grandes diferencias de calidad en idiomas fuera del inglés.
RAG, modelos eficientes, multilingual enterprise AI.RAG legalenergía