Separar memoria de consulta, tarea y sistema en un workflow repetido y medir utilidad, correcciones y olvidos solicitados.
Dónde puede ayudar a una empresa
Ayudaría a agentes recurrentes que ya guardan conversaciones, pero no pueden demostrar qué recuerdos siguen siendo útiles o autorizados.
Qué artefacto merece desarrollar
Un historial de decisiones de memoria, correcciones y resultados que permita estudiar una política de continuidad.
Qué sigue abierto
¿Qué debe recordar un agente para mejorar y qué debe dejar caducar para no conservar errores o permisos obsoletos?
Qué aporta cada paper
Este mapa es una síntesis editorial: asigna a cada fuente un papel en la idea, conserva un localizador primario y deja explícito qué no permite concluir.
- APORTA
- Aporta el patrón de actualizar routing, valores y relaciones de memoria con el resultado de las tareas.
- LÍMITE
- Los benchmarks cubren dominios variados, pero la mejora máxima no representa todos los workflows ni autoriza transferir el mecanismo sin replay.
- APORTA
- Aporta separar memoria de workflow, subtask y función, con recuperación distinta según el tipo de fallo.
- LÍMITE
- La evaluación usa un teacher, cuatro estudiantes y tres benchmarks de tool-use; no cubre memoria de largo plazo o cambios de política.
- APORTA
- Aporta un estado de memoria de capacidad fija cuya vida no depende de mantener todos los tokens activos.
- LÍMITE
- Una respuesta tras retirar evidencia puede ser recuperación fiel o inferencia plausible; ambas deben medirse por separado.
- APORTA
- Aporta reglas de transición, cachés de estado y hechos difíciles de predecir para conectar memoria e imaginación en la planificación.
- LÍMITE
- Los resultados se concentran en ALFWorld, WebShop y ScienceWorld; mejorar el proxy de fidelidad no garantiza control del agente.
Contrato de primera prueba
La propuesta se puede ejecutar y detener con una decisión observable; no es un resultado ya obtenido.
- ENTRADA
- 30 tareas repetidas de un workflow agentic, separando memoria de consulta, tarea y sistema, con una variante sin memoria y otra con recuperación ingenua.
- BASELINE / CONTROL
- La misma tarea con contexto de sesión explícito pero sin memoria persistente, manteniendo modelo, herramientas, presupuesto y seeds.
- MÉTRICA
- Éxito de tarea, correcciones humanas, precisión de recuperación, errores por memoria obsoleta, latencia, tokens y solicitudes de olvido respetadas.
- TIMEBOX
- 2 semanas
Regla de parada: No avanzar si la memoria no mejora el éxito o las correcciones sin aumentar los errores por recuerdos obsoletos o más de 25% el coste total.