NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 02

SLM · MEMORIA · TOOL-USE

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

ImprescindibleLectura primaria completa

Un modelo pequeño puede heredar experiencia operacional de uno grande sin recibir sus pesos: basta con transferir memoria estructurada y utilizable.

AUTHORS / LABTaeil Kim, Kangsan Kim y Sung Ju Hwang
FECHA07 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

AMD construye memorias de Workflow, Subtask y Function a partir de trayectorias exitosas de un agente profesor; las dos primeras se inyectan al comenzar y la tercera aparece cuando falla una llamada a herramienta.

EVIDENCIA DISPONIBLE

Las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.

Resultado reportado con fuente enlazada · 3 localizadores disponibles.
LÍMITE

La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.

SIGUIENTE PRUEBA

Éxito de tarea, fidelidad factual, recuperación de restricciones, fuga de datos y tokens de contexto.

EN UNA FRASE

AMD construye memorias de Workflow, Subtask y Function a partir de trayectorias exitosas de un agente profesor; las dos primeras se inyectan al comenzar y la tercera aparece cuando falla una llamada a herramienta.

SEÑALMemoria · SLM · Tool-use
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.

+27,2 AppWorld; +11,2 BFCL V3; +3,4 ToolSandbox · contexto: Cuatro modelos estudiantes de 4B–8B, GPT-5-mini como teacher y tres benchmarks de tool-use

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

Agent Memory Distillation ataca una limitación económica de los agentes pequeños. Un modelo de 4B–8B puede ser barato y suficiente para tareas recurrentes, pero no suele producir por sí solo las suficientes trayectorias correctas como para construir una memoria operacional de calidad.

La solución no modifica los pesos del estudiante. Un agente teacher ejecuta tareas y sus experiencias se convierten en tres memorias jerárquicas: Workflow resume estrategias de nivel tarea, Subtask aporta ejemplos de conducta y Function registra cómo llamar herramientas y qué errores evitar. Workflow y Subtask se inyectan al inicio; Function se recupera reactivamente cuando aparece un error de tool-use.

Con GPT-5-mini como teacher, el estudio prueba cuatro estudiantes en AppWorld, BFCL V3 y ToolSandbox. Reporta mejoras medias de 27,2, 11,2 y 3,4 puntos porcentuales respectivamente, y observa que Subtask suele aportar la mayor ganancia y que los modelos de 4B se benefician especialmente.

El resultado sugiere una economía de dos velocidades: un modelo caro aprende procedimientos y modelos pequeños los ejecutan muchas veces. La cautela es que una memoria de teacher puede quedarse obsoleta o ser incompatible con otra herramienta. En un producto real la memoria necesitaría versión, procedencia, pruebas de regresión y una política explícita de invalidación.

DECISIÓN RÁPIDACapturar trayectorias exitosas de un proceso repetido y compararlas con una versión SLM que reciba memoria de workflow, subtask y función por separado.
NO LO SOBREINTERPRETES

La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.

PROBLEMA
Los modelos pequeños generan pocas trayectorias exitosas por sí mismos y tienen dificultades para construir una experiencia de tool-use suficientemente rica.
MÉTODO
Genera tres niveles de memoria a partir de trayectorias exitosas de un teacher: Workflow para estrategia de tarea, Subtask para ejemplos intermedios y Function para convenciones y fallos de llamadas.
TIPO DE EVIDENCIA
Evaluación con cuatro modelos estudiantes de 4B–8B, GPT-5-mini como teacher y tres benchmarks de tool-use; las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.
LÍMITE
La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.
FIGURA DE LECTURA / TRANSFERENCIATeacher → memoria jerárquica → student
Abrir paper original ↗

La experiencia operacional se transfiere en tres escalas de procedimiento.

WORKFLOWEstrategia de tarea
SUBTASKEjemplos intermedios
FUNCTIONTool-use y fallos
PARA RECORDAR

La memoria que ayuda a un modelo pequeño tiene que ser legible y accionable para él.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / Evaluación con cuatro modelos estudiantes de 4B–8B, GPT-5-mini como teacher y tres benchmarks de tool-use; las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Genera tres niveles de memoria a partir de trayectorias exitosas de un teacher: Workflow para estrategia de tarea, Subtask para ejemplos intermedios y Function para convenciones y fallos de llamadas.

QUÉ APORTA

La experiencia puede convertirse en un activo transferible: un agente frontier aprende procedimientos y una flota de modelos de 4B–8B los ejecuta a menor coste.

QUÉ NO PRUEBA

La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.

Cómo lo llevaría a un proyecto

Capturar trayectorias exitosas de un proceso repetido y compararlas con una versión SLM que reciba memoria de workflow, subtask y función por separado.

Agentes localesCopilotos especializadosAutomatización recurrenteEdge AITool-use

Preguntas que conviene probar

  • ¿Qué granularidad de memoria explica la mejora en cada tarea?
  • ¿Cómo detectar que la memoria transferida ya no coincide con una herramienta modificada?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA200 episodios normales y sensibles, estudiante con memoria destilada frente a historial bruto y sin memoria.
PREGUNTA¿La memoria destilada mejora tool-use y mantiene fidelidad y privacidad cuando las tareas incluyen información sensible o contradictoria?
MÉTRICAÉxito de tarea, fidelidad factual, recuperación de restricciones, fuga de datos y tokens de contexto.
PARADAParar si aparece cualquier fuga de dato sensible o si la ganancia de tarea es menor de 5 puntos.

Mi lectura

Para muchas empresas, destilar experiencia de trabajo puede tener más retorno que entrenar otro modelo desde cero.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.