Lo esencial antes de invertir más tiempo.
Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.
Because all AA-LCR instances exceed 32k tokens, this benchmark appears only in the 128k column.
Resultado reportado con fuente enlazada · 5 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.
Qué está reportado y qué conviene comprobar.
Because all AA-LCR instances exceed 32k tokens, this benchmark appears only in the 128k column.
32k · contexto: 5 Experiments
GEAR yields consistent gains across benchmarks and model scales.
contexto: 5 Experiments
GSPO + GEAR achieves the highest average score in all six model–context combinations.
contexto: 5 Experiments
At 32k context, GEAR improves over accuracy-only GSPO by +2.8 (9B), +2.1 (35B-A3B), and +1.5 (27B) points on average.
32k · contexto: 5 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque más tokens de reasoning no significan necesariamente mejor razonamiento.
MÉTODO / La lectura de 2 Related Work describe la intervención y su construcción: Reinforcement learning for reasoning. The success of DeepSeek-R1 ( 9 ) demonstrated that strong reasoning capabilities can emerge from RL training with verifiable rewards alone, without supervised fine-tuning. This reinforcement learning with verifiable rewards (RLVR) paradigm has since been refined along several axes. GRPO ( 18 ) replaces the critic network with group-relative advantage estimation, reducing memory overhead. DAPO ( 28 ) introduces asymmetric clipping and dynamic sampling for more stable long-CoT training. GSPO ( 30 ) shifts from token-level to sequence-level importance ratios, addressing… [Fuente: https://arxiv.org/html/2607.19345#S2]
RESULTADO / La sección 5 Experiments informa: Because all AA-LCR instances exceed 32k tokens, this benchmark appears only in the 128k column. GEAR yields consistent gains across benchmarks and model scales. GSPO + GEAR achieves the highest average score in all six model–context combinations. [Fuente: https://arxiv.org/html/2607.19345#S5]
LÍMITE / El cierre de la fuente señala: Table 5 reports accuracy within each overlap bin for each difficulty level. Across all difficulty levels, accuracy drops sharply once the overlap rate exceeds 0.4, and falls to 0% beyond 0.6. This pattern is consistent regardless of problem difficulty, confirming that the relationship between repetitive copying and degraded performance is not merely a confound of task complexity. La transferencia a long-context requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.19345#S6].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- PROBLEMA
- Más tokens de reasoning no significan necesariamente mejor razonamiento.
- MÉTODO
- La lectura de 2 Related Work describe la intervención y su construcción: Reinforcement learning for reasoning. The success of DeepSeek-R1 ( 9 ) demonstrated that strong reasoning capabilities can emerge from RL training with verifiable rewards alone, without supervised fine-tuning. This reinforcement learning with verifiable rewards (RLVR) paradigm has since been refined along several axes. GRPO ( 18 ) replaces the critic network with group-relative advantage estimation, reducing memory overhead. DAPO ( 28 ) introduces asymmetric clipping and dynamic sampling for more stable long-CoT training. GSPO ( 30 ) shifts from token-level to sequence-level importance ratios, addressing…
- TIPO DE EVIDENCIA
- La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.19345#S5.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 2 Related Work describe la intervención y su construcción: Reinforcement learning for reasoning. The success of DeepSeek-R1 ( 9 ) demonstrated that strong reasoning capabilities can emerge from RL training with verifiable rewards alone, without supervised fine-tuning. This reinforcement learning with verifiable rewards (RLVR) paradigm has since been refined along several axes. GRPO ( 18 ) replaces the critic network with group-relative advantage estimation, reducing memory overhead. DAPO ( 28 ) introduces asymmetric clipping and dynamic sampling for more stable long-CoT training. GSPO ( 30 ) shifts from token-level to sequence-level importance ratios, addressing…
Cuestiona otra vez la idea de que “pensar más” sea suficiente; importa sobre qué evidencia se piensa.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en long-context reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando long-context cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si long-context puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.