Lo esencial antes de invertir más tiempo.
Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.
We compare MILES against test-time memory methods, including Buffer-of-Thoughts (BoT) [ 47 ] and Dynamic CheatSheet (DC) [ 35 ] , as well as two standard baselines: zero-shot Chain-of-Thought (ZS-CoT) [ 18 ] and Self-Consistency (SC) [ 40 ] .
Resultado reportado con fuente enlazada · 6 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.
Qué está reportado y qué conviene comprobar.
We compare MILES against test-time memory methods, including Buffer-of-Thoughts (BoT) [ 47 ] and Dynamic CheatSheet (DC) [ 35 ] , as well as two standard baselines: zero-shot Chain-of-Thought (ZS-CoT) [ 18 ] and Self-Consistency (SC) [ 40 ] .
baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments
Table 1 shows that MILES matches or outperforms baseline works across all six benchmarks and four backbones, with consistent gains on both math (MATH-500, AIME 2024–2025) and academic (GPQA-Diamond, MMLU-Pro Physics/Engineering) datasets.
baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments
The improvements are especially pronounced on smaller open-weight backbones (GPT-OSS-20B and Qwen3-30B-Instruct), where the sample-level memory baselines BoT [ 47 ] and DC [ 35 ] fail to outperform zero-shot CoT due to overly complex prompt.
20B · baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments
We probe how accuracy scales with test-time compute by plotting accuracy against response-token cost on AIME 2024 and AIME 2025 with GPT-4.1-mini, comparing MILES to representative memoryless test-time scaling methods: Self-Consistency [ 40 ] , Tree-of-Thoughts [ 48 ] , rStar [ 28 ] , and DORA [ 39 ] .
contexto: 4 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque Guardar soluciones completas genera plantillas rígidas; guardar pasos sin una política aprendida produce recuperación poco fiable.
MÉTODO / La lectura de 3 The Proposed Method: MILES describe la intervención y su construcción: Test-time LLM reasoning. In many practical settings, problems arrive sequentially. We consider a pretrained large language model (LLM) that solves a question q by generating a reasoning trajectory e_{1},e_{2},\ldots,e_{T} followed by a final answer y . We define the reasoning state after t steps as x_{t}=(q,e_{1},\ldots,e_{t}) with x_{0}=q , and denote the step-level generation distribution by p(e\mid x) . Let y^{*} denote the ground-truth answer and r\in\{0,1\} the correctness indicator, where r=1 if y=y^{*} . Test-time improvement via external memory. In a stream of test questions, accumulating reusable… [Fuente: https://arxiv.org/html/2607.06974#S3]
RESULTADO / La sección 4 Experiments informa: We compare MILES against test-time memory methods, including Buffer-of-Thoughts (BoT) [ 47 ] and Dynamic CheatSheet (DC) [ 35 ] , as well as two standard baselines: zero-shot Chain-of-Thought (ZS-CoT) [ 18 ] and Self-Consistency (SC) [ 40 ] . Table 1 shows that MILES matches or outperforms baseline works across all six benchmarks and four backbones, with consistent gains on both math (MATH-500, AIME 2024–2025) and academic (GPQA-Diamond, MMLU-Pro Physics/Engineering) datasets. The improvements are especially pronounced on smaller open-weight backbones (GPT-OSS-20B and Qwen3-30B-Instruct), where the sample-level memory baselines BoT [ 47 ] and DC [ 35 ] fail to outperform zero-shot CoT due to overly complex prompt. [Fuente: https://arxiv.org/html/2607.06974#S4]
LÍMITE / El cierre de la fuente señala: Identify contextual conditions. This prompt extracts the contextual conditions for a reasoning step from the question and preceding responses. The extracted conditions are used to build a codebook that identifies the most relevant context for applying the corresponding sub-instruction. La transferencia a razonamiento matemático requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.06974#S5].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- PROBLEMA
- Guardar soluciones completas genera plantillas rígidas; guardar pasos sin una política aprendida produce recuperación poco fiable.
- MÉTODO
- La lectura de 3 The Proposed Method: MILES describe la intervención y su construcción: Test-time LLM reasoning. In many practical settings, problems arrive sequentially. We consider a pretrained large language model (LLM) that solves a question q by generating a reasoning trajectory e_{1},e_{2},\ldots,e_{T} followed by a final answer y . We define the reasoning state after t steps as x_{t}=(q,e_{1},\ldots,e_{t}) with x_{0}=q , and denote the step-level generation distribution by p(e\mid x) . Let y^{*} denote the ground-truth answer and r\in\{0,1\} the correctness indicator, where r=1 if y=y^{*} . Test-time improvement via external memory. In a stream of test questions, accumulating reusable…
- TIPO DE EVIDENCIA
- La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.06974#S4.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 3 The Proposed Method: MILES describe la intervención y su construcción: Test-time LLM reasoning. In many practical settings, problems arrive sequentially. We consider a pretrained large language model (LLM) that solves a question q by generating a reasoning trajectory e_{1},e_{2},\ldots,e_{T} followed by a final answer y . We define the reasoning state after t steps as x_{t}=(q,e_{1},\ldots,e_{t}) with x_{0}=q , and denote the step-level generation distribution by p(e\mid x) . Let y^{*} denote the ground-truth answer and r\in\{0,1\} the correctness indicator, where r=1 if y=y^{*} . Test-time improvement via external memory. In a stream of test questions, accumulating reusable…
Introduce una forma de aprendizaje continuo en tiempo de uso sin tener que modificar todos los pesos del modelo. Es especialmente prometedor para agentes que repiten familias de tareas similares.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en razonamiento matemático reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando razonamiento matemático cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si razonamiento matemático puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.