Lo esencial antes de invertir más tiempo.
AMD construye memorias de Workflow, Subtask y Function a partir de trayectorias exitosas de un agente profesor; las dos primeras se inyectan al comenzar y la tercera aparece cuando falla una llamada a herramienta.
Las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.
Resultado reportado con fuente enlazada · 3 localizadores disponibles.La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.
Éxito de tarea, fidelidad factual, recuperación de restricciones, fuga de datos y tokens de contexto.
AMD construye memorias de Workflow, Subtask y Function a partir de trayectorias exitosas de un agente profesor; las dos primeras se inyectan al comenzar y la tercera aparece cuando falla una llamada a herramienta.
Qué está reportado y qué conviene comprobar.
Las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.
+27,2 AppWorld; +11,2 BFCL V3; +3,4 ToolSandbox · contexto: Cuatro modelos estudiantes de 4B–8B, GPT-5-mini como teacher y tres benchmarks de tool-use
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.Agent Memory Distillation ataca una limitación económica de los agentes pequeños. Un modelo de 4B–8B puede ser barato y suficiente para tareas recurrentes, pero no suele producir por sí solo las suficientes trayectorias correctas como para construir una memoria operacional de calidad.
La solución no modifica los pesos del estudiante. Un agente teacher ejecuta tareas y sus experiencias se convierten en tres memorias jerárquicas: Workflow resume estrategias de nivel tarea, Subtask aporta ejemplos de conducta y Function registra cómo llamar herramientas y qué errores evitar. Workflow y Subtask se inyectan al inicio; Function se recupera reactivamente cuando aparece un error de tool-use.
Con GPT-5-mini como teacher, el estudio prueba cuatro estudiantes en AppWorld, BFCL V3 y ToolSandbox. Reporta mejoras medias de 27,2, 11,2 y 3,4 puntos porcentuales respectivamente, y observa que Subtask suele aportar la mayor ganancia y que los modelos de 4B se benefician especialmente.
El resultado sugiere una economía de dos velocidades: un modelo caro aprende procedimientos y modelos pequeños los ejecutan muchas veces. La cautela es que una memoria de teacher puede quedarse obsoleta o ser incompatible con otra herramienta. En un producto real la memoria necesitaría versión, procedencia, pruebas de regresión y una política explícita de invalidación.
La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.
- PROBLEMA
- Los modelos pequeños generan pocas trayectorias exitosas por sí mismos y tienen dificultades para construir una experiencia de tool-use suficientemente rica.
- MÉTODO
- Genera tres niveles de memoria a partir de trayectorias exitosas de un teacher: Workflow para estrategia de tarea, Subtask para ejemplos intermedios y Function para convenciones y fallos de llamadas.
- TIPO DE EVIDENCIA
- Evaluación con cuatro modelos estudiantes de 4B–8B, GPT-5-mini como teacher y tres benchmarks de tool-use; las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.
- LÍMITE
- La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.
La experiencia operacional se transfiere en tres escalas de procedimiento.
La memoria que ayuda a un modelo pequeño tiene que ser legible y accionable para él.
No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.
Abrir fuente primaria ↗La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
Genera tres niveles de memoria a partir de trayectorias exitosas de un teacher: Workflow para estrategia de tarea, Subtask para ejemplos intermedios y Function para convenciones y fallos de llamadas.
La experiencia puede convertirse en un activo transferible: un agente frontier aprende procedimientos y una flota de modelos de 4B–8B los ejecuta a menor coste.
La transferencia es training-free, pero no es gratuita: depende de que el teacher produzca experiencias representativas y de que la memoria sea compatible con el estudiante y sus herramientas.
Cómo lo llevaría a un proyecto
Capturar trayectorias exitosas de un proceso repetido y compararlas con una versión SLM que reciba memoria de workflow, subtask y función por separado.
Preguntas que conviene probar
- ¿Qué granularidad de memoria explica la mejora en cada tarea?
- ¿Cómo detectar que la memoria transferida ya no coincide con una herramienta modificada?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
Para muchas empresas, destilar experiencia de trabajo puede tener más retorno que entrenar otro modelo desde cero.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.