NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
3–9 AGOSTO 2026 · #01Imprescindible

CoEvo-Mem — Co-Evolving Retrieval Policy and Memory Bank for LLM Agents

Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li. · 3 agosto 2026.

IDEA CENTRAL

rompe una separación habitual: por un lado optimizamos cómo buscamos recuerdos y por otro cómo los almacenamos. CoEvo-Mem hace que retrieval y memoria evolucionen conjuntamente. Los resultados de las tareas actualizan tanto la política de routing como valores y relaciones del grafo de memoria; esos cambios modifican después qué recuerdos se recuperarán.

POR QUÉ IMPORTA

es probablemente la dirección conceptualmente más potente de la semana. Una memoria agentic madura no debería ser una base vectorial estática: debería aprender simultáneamente qué conservar, cómo relacionarlo, cuándo buscarlo y cuánto confiar en ello. Reporta SOTA en siete benchmarks.

Ver problema que intenta resolver

una memoria que cambia vuelve obsoleta la política de retrieval que fue diseñada para consultarla.

memoria, agentes, RAG.asistentes personales persistentesCRM
3–9 AGOSTO 2026 · #02Imprescindible

Agent Memory Distillation — Empowering Small LLM Agents with Hierarchical Teacher Memory

Taeil Kim, Kangsan Kim, Sung Ju Hwang. · 7 agosto 2026.

IDEA CENTRAL

un agente grande ejecuta correctamente tareas y convierte sus experiencias en tres tipos de memoria: Workflow, Subtask y Function. Un modelo pequeño de 4B–8B recibe estas memorias sin modificar sus pesos. La memoria de workflow se carga al comenzar; las instrucciones específicas de herramientas aparecen cuando se producen errores.

POR QUÉ IMPORTA

el resultado es especialmente atractivo económicamente. Usando GPT-5-mini como profesor, los pequeños mejoran de media +27,2 puntos porcentuales en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox. Los modelos de 4B son los que más se benefician.

Ver problema que intenta resolver

los SLM generan pocas trayectorias exitosas y, por tanto, tienen dificultades para construir por sí mismos una buena experiencia operacional.

SLM, memoria, agentes, tool-use.agentes locales baratoscopilotos especializados
3–9 AGOSTO 2026 · #03Imprescindible

CodeGrep — An RL-Trained Retrieval Agent for LLM Coding Agents

Wuya Chen, Yihao Yang, Yang Cao, Yue Lin. · 6 agosto 2026.

IDEA CENTRAL

observa que Claude Code/OpenHands-like agents gastan una parte enorme del presupuesto buscando dónde tocar el código. Entrenan un modelo de 14B específicamente para hacer grep, glob y lectura multi-turn del repositorio y entregar al coding agent solo los archivos candidatos.

POR QUÉ IMPORTA

CodeGrep mantiene/mejora ligeramente resolución —27,0% frente a 25,8%— mientras reduce 15% las rondas y 19% los tokens en issues resueltas. También identifica algo muy útil: retrieval solo ayuda cuando supera cierto umbral de precisión; retrieval mediocre empeora al agente.

Ver problema que intenta resolver

en SWE-Bench Verified, su baseline de 30B consume unas 23 rondas y 631K tokens por issue resuelta; mucha actividad es simple exploración del repo.

coding agents, retrieval, RL.Codex/Claude Code-like agentsmantenimiento de repositorios
3–9 AGOSTO 2026 · #04Imprescindible

RAG-Stack — Co-Optimizing RAG Serving Performance and Quality

Haiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang, Wenqi Jiang. · 4 agosto 2026.

IDEA CENTRAL

trata el diseño de RAG como una optimización conjunta de calidad y sistema. Cambiar índice, modelo, estrategia de retrieval, hardware o serving produce combinaciones distintas de coste, latencia y precisión. RAG-Stack busca automáticamente la frontera Pareto sin desplegar y medir exhaustivamente cada configuración.

POR QUÉ IMPORTA

en los experimentos encuentra fronteras Pareto que cubren entre 52,5% y 153,2% más espacio calidad-rendimiento que otros métodos de búsqueda de configuración.

Ver problema que intenta resolver

la pregunta empresarial no es “¿qué RAG tiene mayor accuracy?”, sino “¿qué configuración da la calidad requerida al coste y latencia aceptables?”.

RAG, infraestructura, eficiencia.diseño de RAG corporativoselección de modelos
3–9 AGOSTO 2026 · #05Imprescindible

Before Reasoning Can Fail — Pre-Evidence Procedural Failures in Agentic RAG

Daeyoung Roh, Donghee Han. · 3 agosto; revisado 4 agosto 2026.

IDEA CENTRAL

descubre un fallo casi cómico pero importante: un search agent puede encontrar la evidencia correcta y responder sin haberla leído. Analiza 12.000 trayectorias en HotpotQA, 2WikiMultiHopQA y MuSiQue y separa errores de razonamiento de errores procedimentales previos.

POR QUÉ IMPORTA

añadir una sola regla —Read-Gate: después de buscar hay que leer antes de responder— mejora la precisión entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura. Dar más presupuesto de pensamiento no soluciona necesariamente el problema.

Ver problema que intenta resolver

solemos culpar al razonamiento del LLM cuando el verdadero fallo fue que el harness permitió search → final answer sin read.

RAG, reasoning, agentes, evaluación.Deep Researchagentes web
3–9 AGOSTO 2026 · #06Imprescindible

ReASearch — The Optimizer Is the Agent

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao. · 7 agosto 2026.

IDEA CENTRAL

elimina gran parte del algoritmo externo que normalmente controla una optimización. El agente decide por sí mismo qué probar, cómo interpretar resultados, qué cambiar, cuándo verificar, cuándo volver atrás y cuándo abandonar una rama. El mismo scaffold optimiza prompts, programas y workflows ML. Utiliza ejecución Python y memoria persistente para analizar experimentalmente su propio historial.

POR QUÉ IMPORTA

en 14 tareas iguala o supera mayoritariamente optimizadores especializados, con mejoras del 2–40%; en algunos casos encuentra resultados superiores a mejores soluciones humanas conocidas. También emergen conductas como reverificación, rollback y reutilización de fallos anteriores sin estar programadas explícitamente.

Ver problema que intenta resolver

los LLMs en sistemas AutoML/AlphaEvolve-like suelen ser generadores de propuestas dentro de un algoritmo de búsqueda diseñado por humanos.

agentes, reasoning, AutoML, self-improvement.optimización de promptscódigo
3–9 AGOSTO 2026 · #07Imprescindible

LiveMem — Maintaining Memory State Continuity in Long-Running LLM Inference

Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Yang Xu. · 3 agosto; versión actual 7 agosto 2026.

IDEA CENTRAL

propone distinguir contexto activo de estado vital persistente. LiveMem mantiene un estado de memoria de capacidad fija incluso después de eliminar los tokens originales del KV/context window.

POR QUÉ IMPORTA

LongMemEval demuestra que el modelo puede responder utilizando memoria sobre evidencia que ya no está presente en el contexto actual. Es una arquitectura complementaria a RAG, no simplemente otro retriever.

Ver problema que intenta resolver

resumir o recuperar historia conserva referencias al pasado, pero no mantiene necesariamente continuidad computacional del estado interno a lo largo de toda la vida del agente.

memoria intrínseca, long-context, LLMs.asistentes siempre activosagentes personales
3–9 AGOSTO 2026 · #08Imprescindible

NiyamAI — Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid. · 7 agosto 2026.

IDEA CENTRAL

al comenzar la sesión se crea un Intent Contract que fija herramientas y restricciones. Cada acción es juzgada en un componente aislado y, si es válida, genera una prueba zk-SNARK. La herramienta únicamente se ejecuta después de verificar criptográficamente esa prueba.

POR QUÉ IMPORTA

en Agent-SafetyBench reporta F1 del 88,5% y 1,1% de falsos positivos. La pega práctica es considerable: generar la prueba añade aproximadamente 2,26 segundos por acción, aunque verificarla tarda \~53 ms.

Ver problema que intenta resolver

system prompts y guardrails normales funcionan en el mismo entorno que queremos proteger y no proporcionan prueba verificable de que una política se aplicó.

alignment, agent safety, criptografía.pagos agenticoperaciones cloud
3–9 AGOSTO 2026 · #09Imprescindible

Shape Your Feed — An LLM-based Agentic System for Conversational Recommendation

Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song et al. · 6 agosto 2026.

IDEA CENTRAL

cambia recomendación pasiva basada en clics por co-curación conversacional. El usuario expresa deseos mediante texto, voz o interfaz; un agente mantiene un Semantic Profile persistente y rerankea/prunea candidatos en tiempo real. Un tercer loop aprende mediante DPO y un ensemble LLM-as-a-Judge.

POR QUÉ IMPORTA

es además una señal real de mercado: los autores reportan A/B tests en tráfico de producción, no solo benchmark offline, con mejoras de relevancia y sentimiento del usuario.

Ver problema que intenta resolver

algoritmos de recomendación infieren preferencias de comportamiento pasado aunque el usuario pueda expresar explícitamente qué quiere ahora.

recomendación, discovery, agentes, multimodalidad.feedsmarketplaces
3–9 AGOSTO 2026 · #10Interesante

MemWM — Memory-Augmented Text-Based World Model

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye et al. · 7 agosto 2026.

IDEA CENTRAL

los world models textuales pueden producir estados futuros muy plausibles pero olvidar atributos cruciales o inventar reglas de transición. MemWM añade una memoria explícita con reglas del mundo, state caches y hechos difíciles de predecir.

POR QUÉ IMPORTA

memory-augmented training mejora hasta 206,3% la métrica Structured State Fidelity; en planificación downstream reporta hasta 65,4% de mejora relativa sobre el agente basado en world model SFT.

Ver problema que intenta resolver

planificar sobre un mundo imaginado incorrectamente conduce inevitablemente a malas acciones.

reasoning, world models, memoria, agentes.planificaciónsimulación
3–9 AGOSTO 2026 · #11Interesante

RepoOMP — Repository-Aware Hotspot OpenMP Parallelization

Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li. · 6 agosto 2026.

IDEA CENTRAL

antes de pedir al agente que paralelice código, construye un grafo de dependencias y genera un contexto estructurado que contiene únicamente evidencia relevante para decidir si una transformación OpenMP es legal y rentable.

POR QUÉ IMPORTA

en 951 hotspots reales/sintéticos acepta 372 transformaciones válidas. Frente a Claude Code sin contexto estructurado reduce 47–68% el coste de tokens y mejora speedup 18–28% en el subconjunto comparativo; la mediana de aceleración de 330 hotspots reales aceptados es 2,25×.

Ver problema que intenta resolver

el contexto local puede ser insuficiente; meter todo el repositorio añade ruido y tokens.

code generation, agentes, ingeniería.modernización de códigoHPC
3–9 AGOSTO 2026 · #12Interesante

MNC — Minimum-Necessary Communication for Private LLM-Agent Communication

Jinghan Xu, Longze Fan, Zeyuan Wang, Xinjin Li, Hankai Liu. · 3 agosto 2026.

IDEA CENTRAL

un agente informado puede necesitar decirle algo a otro agente sin tener permiso para entregarle todo lo que sabe. MNC define disclosures mínimos asociados a destinatario, propósito, reenvío, lifetime, logging y memory scope.

POR QUÉ IMPORTA

es un modelo de privacidad mucho más apropiado para organizaciones multiagente que simple RBAC. El permiso acompaña semánticamente a la información durante su vida posterior.

Ver problema que intenta resolver

borrar campos sensibles del mensaje no impide que ese conocimiento termine después reenviado, logueado o incorporado permanentemente a memoria.

privacidad, multiagente, memoria.agentes corporativosdatos médicos
3–9 AGOSTO 2026 · #13Interesante

Cross-Domain Hybrid OPD — Generalizable Search Agents

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu et al. · 3 agosto 2026.

IDEA CENTRAL

describe el entrenamiento del Yuanbao search agent sobre Hunyuan3. El problema que ataca es especialmente interesante: entrenar mucho para buscar puede crear un alignment tax que deteriora las capacidades generales del LLM. Combina RL especializado en búsqueda con On-Policy Distillation desde expertos de otros dominios, recuperando capacidades generales sin renunciar a search.

POR QUÉ IMPORTA

anticipa arquitecturas donde especialización agentic y general intelligence se entrenan conjuntamente, en vez de elegir entre ambas.

Ver problema que intenta resolver

convertir un buen LLM en search agent puede volverlo peor como asistente general.

search agents, RL, distillation.buscadores generativosresearch agents
3–9 AGOSTO 2026 · #14Interesante

KnowHal — Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

Ruihan Li, Yuntao Du et al. · 4 agosto 2026.

IDEA CENTRAL

amplía hallucination testing multimodal más allá de detectar objetos o relaciones inexistentes. Evalúa cuatro dimensiones: entidad, atributo, relación y conocimiento, usando preguntas positivas y negativas sobre las mismas imágenes.

POR QUÉ IMPORTA

1.800 muestras, 10 dominios, 50 categorías y 14 MLLMs muestran que knowledge hallucination es generalmente la dimensión más difícil, y que los modelos se degradan notablemente ante preguntas con premisas falsas.

Ver problema que intenta resolver

un VLM puede ver correctamente una imagen y después combinarla con conocimiento externo incorrecto o aceptar una premisa falsa.

multimodalidad, evaluación, hallucinations.QA multimodalinspección
3–9 AGOSTO 2026 · #15Interesante

Teaching Nemotron Greek — Mining a Corpus, Adapting Retrieval, and Grounding Generation

Ayoub Kirouane, Christos Petrocheilos. · 5 agosto 2026.

IDEA CENTRAL

construye de extremo a extremo un RAG especializado para griego moderno: corpus, synthetic supervision, embedding model, reranker, reader y benchmark HERA. Lo interesante es que BM25 inicialmente supera a varios dense retrievers multilingües, pero adaptar un Nemotron embedder de 1B eleva nDCG\@10 de 0,362 a 0,835. El reader Nemotron 30B-A3B LoRA pasa de 29,4% a 66,9% de corrección juzgada, mejorando además grounding y citas.

POR QUÉ IMPORTA

ofrece una receta muy reutilizable para crear RAG realmente competente en idiomas y dominios corporativos específicos.

Ver problema que intenta resolver

“multilingual” suele ocultar grandes diferencias de calidad en idiomas fuera del inglés.

RAG, modelos eficientes, multilingual enterprise AI.RAG legalenergía