NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 01

MEMORIA · AGENTES · RETRIEVAL

CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents

ImprescindibleLectura primaria completa

La memoria de un agente no debería evolucionar separada de la política que decide qué recuerdos consultar.

AUTHORS / LABBowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma y Wenzhao Li
FECHA03 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

CoEvo-Mem cierra el bucle entre retrieval y memoria: los resultados de las tareas actualizan tanto el routing como los valores y relaciones del grafo de memoria, y esos cambios modifican las recuperaciones futuras.

EVIDENCIA DISPONIBLE

El paper reporta mejoras de hasta 7,50 puntos sobre el baseline más fuerte en siete benchmarks.

Resultado con localizador exacto · 3 localizadores disponibles.
LÍMITE

El resultado depende de un ciclo de entrenamiento alternado y de evaluadores específicos de tarea; SOTA en siete benchmarks no demuestra todavía estabilidad en memorias de producción que cambian continuamente.

SIGUIENTE PRUEBA

Éxito, ganancia fuera de distribución, errores por memoria stale, tokens y número de actualizaciones.

EN UNA FRASE

CoEvo-Mem cierra el bucle entre retrieval y memoria: los resultados de las tareas actualizan tanto el routing como los valores y relaciones del grafo de memoria, y esos cambios modifican las recuperaciones futuras.

SEÑALMemoria · Retrieval · Agentes
EVIDENCIAResultado con localizador exacto
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay localizadores exactos registrados.
RESULTADO REPORTADO

El paper reporta mejoras de hasta 7,50 puntos sobre el baseline más fuerte en siete benchmarks.

hasta +7,50 puntos · baseline: baseline más fuerte · contexto: 7 benchmarks de memoria conversacional, razonamiento científico y multimodal, código, interacción con sistemas operativos y tool-use

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

CoEvo-Mem parte de una tensión que suele esconderse en los diagramas de memoria: recuperar un recuerdo y mantener una memoria útil son procesos distintos, pero cada uno cambia las condiciones del otro. La recuperación decide qué experiencias se exponen y reciben feedback; la evolución de la memoria cambia qué será recuperable mañana.

El sistema usa un LLM congelado para producir reformulaciones de consulta y una prioridad inicial entre rutas dense y sparse. Un router residual ligero corrige esa prioridad online. El conjunto recuperado sirve a la vez como contexto de respuesta y como interfaz de crédito: el resultado de la tarea informa sobre las decisiones de routing y sobre los valores y relaciones de los recuerdos expuestos.

La propuesta alterna fases: en una se adapta el router con la memoria fija y en otra evoluciona la memoria con el router fijo, tratando de reducir la no estacionariedad del bucle. El paper evalúa siete benchmarks y reporta estado del arte en todos los escenarios, con mejoras de hasta 7,50 puntos sobre el baseline más fuerte y ablaciones que separan routing, evolución relacional y schedule.

Mi lectura es que el paper convierte la memoria en una política de aprendizaje y no solo en un almacén. El límite es importante: la evolución se entrena con protocolos controlados y no prueba por sí sola que un sistema abierto sepa olvidar, corregir o contener contaminación de memoria. La siguiente prueba debería medir utilidad, coste y estabilidad de cada actualización por separado.

DECISIÓN RÁPIDASeparar en un agente de prueba la calidad del retriever, la utilidad de los recuerdos y la evolución de relaciones, y registrar qué parte del sistema recibe crédito después de cada tarea.
NO LO SOBREINTERPRETES

El resultado depende de un ciclo de entrenamiento alternado y de evaluadores específicos de tarea; SOTA en siete benchmarks no demuestra todavía estabilidad en memorias de producción que cambian continuamente.

PROBLEMA
Las memorias crecen y cambian, pero muchos sistemas optimizan la recuperación o la organización como si la otra parte permaneciera fija.
MÉTODO
Mantiene congelado el LLM que responde, pero aprende un router residual que mezcla retrieval denso y disperso y evoluciona un grafo de memoria relacional con valores, relaciones semánticas, léxicas y temporales.
TIPO DE EVIDENCIA
Experimentos en siete benchmarks de memoria conversacional, razonamiento científico y multimodal, código, interacción con sistemas operativos y tool-use; el paper reporta mejoras de hasta 7,50 puntos sobre el baseline más fuerte.
LÍMITE
El resultado depende de un ciclo de entrenamiento alternado y de evaluadores específicos de tarea; SOTA en siete benchmarks no demuestra todavía estabilidad en memorias de producción que cambian continuamente.
FIGURA DE LECTURA / MEMORIA ADAPTATIVAConsulta → memoria → resultado → nueva consulta
Abrir paper original ↗

Retrieval y memoria se actualizan dentro del mismo bucle de feedback.

RUTAElegir cómo buscar
EXPONERUsar recuerdos
EVOLUCIONARActualizar valor y relaciones
PARA RECORDAR

Lo que el agente recupera decide también qué memoria recibe crédito.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / Experimentos en siete benchmarks de memoria conversacional, razonamiento científico y multimodal, código, interacción con sistemas operativos y tool-use; el paper reporta mejoras de hasta 7,50 puntos sobre el baseline más fuerte.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Mantiene congelado el LLM que responde, pero aprende un router residual que mezcla retrieval denso y disperso y evoluciona un grafo de memoria relacional con valores, relaciones semánticas, léxicas y temporales.

QUÉ APORTA

La memoria agentic empieza a parecerse a un sistema que aprende qué conservar, cómo relacionarlo, cuándo recuperarlo y cuánto confiar en ello, no a una base vectorial estática.

QUÉ NO PRUEBA

El resultado depende de un ciclo de entrenamiento alternado y de evaluadores específicos de tarea; SOTA en siete benchmarks no demuestra todavía estabilidad en memorias de producción que cambian continuamente.

Cómo lo llevaría a un proyecto

Separar en un agente de prueba la calidad del retriever, la utilidad de los recuerdos y la evolución de relaciones, y registrar qué parte del sistema recibe crédito después de cada tarea.

Asistentes persistentesCRM y proyectosCoding agentsSoporte técnicoConocimiento corporativo

Preguntas que conviene probar

  • ¿Qué señales deberían subir o bajar el valor de un recuerdo?
  • ¿Cuándo una relación nueva mejora retrieval y cuándo solo añade ruido?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADATareas held out de tres dominios y dos modelos, comparando memoria estática, coevolucionada y sin memoria durante 100 episodios.
PREGUNTA¿La memoria coevolucionada mantiene la ganancia en modelos y tareas no vistas sin aumentar recuerdos obsoletos?
MÉTRICAÉxito, ganancia fuera de distribución, errores por memoria stale, tokens y número de actualizaciones.
PARADAParar si la ganancia held out es menor de 3 puntos o si los errores por memoria obsoleta aumentan 5 puntos.

Mi lectura

La memoria se convierte en una política de aprendizaje continuo: lo que recuperas también decide qué aprende el sistema.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.