NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 10

RAG

Copy Less, Ground More

InteresanteLectura primaria completa

Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos.

AUTHORS / LABLizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang
FECHA21 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.

EVIDENCIA DISPONIBLE

Because all AA-LCR instances exceed 32k tokens, this benchmark appears only in the 128k column.

Resultado reportado con fuente enlazada · 5 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.

SEÑALreasoning, long-context. · legal · ciencia
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Because all AA-LCR instances exceed 32k tokens, this benchmark appears only in the 128k column.

32k · contexto: 5 Experiments

RESULTADO REPORTADO

GSPO + GEAR achieves the highest average score in all six model–context combinations.

contexto: 5 Experiments

RESULTADO REPORTADO

At 32k context, GEAR improves over accuracy-only GSPO by +2.8 (9B), +2.1 (35B-A3B), and +1.5 (27B) points on average.

32k · contexto: 5 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque más tokens de reasoning no significan necesariamente mejor razonamiento.

MÉTODO / La lectura de 2 Related Work describe la intervención y su construcción: Reinforcement learning for reasoning. The success of DeepSeek-R1 ( 9 ) demonstrated that strong reasoning capabilities can emerge from RL training with verifiable rewards alone, without supervised fine-tuning. This reinforcement learning with verifiable rewards (RLVR) paradigm has since been refined along several axes. GRPO ( 18 ) replaces the critic network with group-relative advantage estimation, reducing memory overhead. DAPO ( 28 ) introduces asymmetric clipping and dynamic sampling for more stable long-CoT training. GSPO ( 30 ) shifts from token-level to sequence-level importance ratios, addressing… [Fuente: https://arxiv.org/html/2607.19345#S2]

RESULTADO / La sección 5 Experiments informa: Because all AA-LCR instances exceed 32k tokens, this benchmark appears only in the 128k column. GEAR yields consistent gains across benchmarks and model scales. GSPO + GEAR achieves the highest average score in all six model–context combinations. [Fuente: https://arxiv.org/html/2607.19345#S5]

LÍMITE / El cierre de la fuente señala: Table 5 reports accuracy within each overlap bin for each difficulty level. Across all difficulty levels, accuracy drops sharply once the overlap rate exceeds 0.4, and falls to 0% beyond 0.6. This pattern is consistent regardless of problem difficulty, confirming that the relationship between repetitive copying and degraded performance is not merely a confound of task complexity. La transferencia a long-context requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.19345#S6].

DECISIÓN RÁPIDAProbar la propuesta en long-context reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

PROBLEMA
Más tokens de reasoning no significan necesariamente mejor razonamiento.
MÉTODO
La lectura de 2 Related Work describe la intervención y su construcción: Reinforcement learning for reasoning. The success of DeepSeek-R1 ( 9 ) demonstrated that strong reasoning capabilities can emerge from RL training with verifiable rewards alone, without supervised fine-tuning. This reinforcement learning with verifiable rewards (RLVR) paradigm has since been refined along several axes. GRPO ( 18 ) replaces the critic network with group-relative advantage estimation, reducing memory overhead. DAPO ( 28 ) introduces asymmetric clipping and dynamic sampling for more stable long-CoT training. GSPO ( 30 ) shifts from token-level to sequence-level importance ratios, addressing…
TIPO DE EVIDENCIA
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.19345#S5.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 2 Related Work describe la intervención y su construcción: Reinforcement learning for reasoning. The success of DeepSeek-R1 ( 9 ) demonstrated that strong reasoning capabilities can emerge from RL training with verifiable rewards alone, without supervised fine-tuning. This reinforcement learning with verifiable rewards (RLVR) paradigm has since been refined along several axes. GRPO ( 18 ) replaces the critic network with group-relative advantage estimation, reducing memory overhead. DAPO ( 28 ) introduces asymmetric clipping and dynamic sampling for more stable long-CoT training. GSPO ( 30 ) shifts from token-level to sequence-level importance ratios, addressing…

QUÉ APORTA

Cuestiona otra vez la idea de que “pensar más” sea suficiente; importa sobre qué evidencia se piensa.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en long-context reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

long-contextagentes documentaleslegal QAinvestigación.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando long-context cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAlong-context con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora long-context frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si long-context puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.