NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 09

MEMORIA

MILES: Modular Instruction Memory with Learnable Selection

InteresanteLectura primaria completa

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables.

AUTHORS / LABRuilin Tong, Dong Gong
FECHA8 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.

EVIDENCIA DISPONIBLE

We compare MILES against test-time memory methods, including Buffer-of-Thoughts (BoT) [ 47 ] and Dynamic CheatSheet (DC) [ 35 ] , as well as two standard baselines: zero-shot Chain-of-Thought (ZS-CoT) [ 18 ] and Self-Consistency (SC) [ 40 ] .

Resultado reportado con fuente enlazada · 6 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.

SEÑALSaaS · educación
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

We compare MILES against test-time memory methods, including Buffer-of-Thoughts (BoT) [ 47 ] and Dynamic CheatSheet (DC) [ 35 ] , as well as two standard baselines: zero-shot Chain-of-Thought (ZS-CoT) [ 18 ] and Self-Consistency (SC) [ 40 ] .

baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments

RESULTADO REPORTADO

Table 1 shows that MILES matches or outperforms baseline works across all six benchmarks and four backbones, with consistent gains on both math (MATH-500, AIME 2024–2025) and academic (GPQA-Diamond, MMLU-Pro Physics/Engineering) datasets.

baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments

RESULTADO REPORTADO

The improvements are especially pronounced on smaller open-weight backbones (GPT-OSS-20B and Qwen3-30B-Instruct), where the sample-level memory baselines BoT [ 47 ] and DC [ 35 ] fail to outperform zero-shot CoT due to overly complex prompt.

20B · baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments

RESULTADO REPORTADO

We probe how accuracy scales with test-time compute by plotting accuracy against response-token cost on AIME 2024 and AIME 2025 with GPT-4.1-mini, comparing MILES to representative memoryless test-time scaling methods: Self-Consistency [ 40 ] , Tree-of-Thoughts [ 48 ] , rStar [ 28 ] , and DORA [ 39 ] .

contexto: 4 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Guardar soluciones completas genera plantillas rígidas; guardar pasos sin una política aprendida produce recuperación poco fiable.

MÉTODO / La lectura de 3 The Proposed Method: MILES describe la intervención y su construcción: Test-time LLM reasoning. In many practical settings, problems arrive sequentially. We consider a pretrained large language model (LLM) that solves a question q by generating a reasoning trajectory e_{1},e_{2},\ldots,e_{T} followed by a final answer y . We define the reasoning state after t steps as x_{t}=(q,e_{1},\ldots,e_{t}) with x_{0}=q , and denote the step-level generation distribution by p(e\mid x) . Let y^{*} denote the ground-truth answer and r\in\{0,1\} the correctness indicator, where r=1 if y=y^{*} . Test-time improvement via external memory. In a stream of test questions, accumulating reusable… [Fuente: https://arxiv.org/html/2607.06974#S3]

RESULTADO / La sección 4 Experiments informa: We compare MILES against test-time memory methods, including Buffer-of-Thoughts (BoT) [ 47 ] and Dynamic CheatSheet (DC) [ 35 ] , as well as two standard baselines: zero-shot Chain-of-Thought (ZS-CoT) [ 18 ] and Self-Consistency (SC) [ 40 ] . Table 1 shows that MILES matches or outperforms baseline works across all six benchmarks and four backbones, with consistent gains on both math (MATH-500, AIME 2024–2025) and academic (GPQA-Diamond, MMLU-Pro Physics/Engineering) datasets. The improvements are especially pronounced on smaller open-weight backbones (GPT-OSS-20B and Qwen3-30B-Instruct), where the sample-level memory baselines BoT [ 47 ] and DC [ 35 ] fail to outperform zero-shot CoT due to overly complex prompt. [Fuente: https://arxiv.org/html/2607.06974#S4]

LÍMITE / El cierre de la fuente señala: Identify contextual conditions. This prompt extracts the contextual conditions for a reasoning step from the question and preceding responses. The extracted conditions are used to build a codebook that identifies the most relevant context for applying the corresponding sub-instruction. La transferencia a razonamiento matemático requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.06974#S5].

DECISIÓN RÁPIDAProbar la propuesta en razonamiento matemático reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

PROBLEMA
Guardar soluciones completas genera plantillas rígidas; guardar pasos sin una política aprendida produce recuperación poco fiable.
MÉTODO
La lectura de 3 The Proposed Method: MILES describe la intervención y su construcción: Test-time LLM reasoning. In many practical settings, problems arrive sequentially. We consider a pretrained large language model (LLM) that solves a question q by generating a reasoning trajectory e_{1},e_{2},\ldots,e_{T} followed by a final answer y . We define the reasoning state after t steps as x_{t}=(q,e_{1},\ldots,e_{t}) with x_{0}=q , and denote the step-level generation distribution by p(e\mid x) . Let y^{*} denote the ground-truth answer and r\in\{0,1\} the correctness indicator, where r=1 if y=y^{*} . Test-time improvement via external memory. In a stream of test questions, accumulating reusable…
TIPO DE EVIDENCIA
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06974#S4.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 3 The Proposed Method: MILES describe la intervención y su construcción: Test-time LLM reasoning. In many practical settings, problems arrive sequentially. We consider a pretrained large language model (LLM) that solves a question q by generating a reasoning trajectory e_{1},e_{2},\ldots,e_{T} followed by a final answer y . We define the reasoning state after t steps as x_{t}=(q,e_{1},\ldots,e_{t}) with x_{0}=q , and denote the step-level generation distribution by p(e\mid x) . Let y^{*} denote the ground-truth answer and r\in\{0,1\} the correctness indicator, where r=1 if y=y^{*} . Test-time improvement via external memory. In a stream of test questions, accumulating reusable…

QUÉ APORTA

Introduce una forma de aprendizaje continuo en tiempo de uso sin tener que modificar todos los pesos del modelo. Es especialmente prometedor para agentes que repiten familias de tareas similares.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en razonamiento matemático reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

razonamiento matemáticoagentes de operacionesworkflows repetidos y asistentes especializados.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando razonamiento matemático cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADArazonamiento matemático con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora razonamiento matemático frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si razonamiento matemático puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.