NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 07

AGENTES

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

ImprescindibleLectura primaria completa

Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores.

AUTHORS / LABChanghai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin
FECHA16 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.

EVIDENCIA DISPONIBLE

Qwen’s response-only receipt composes the full-attention forward over all CP8 page partitions and all-reduces dQ .

Resultado reportado con fuente enlazada · 5 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 12 Evaluation Scope.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.

SEÑALlegal · software
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Qwen’s response-only receipt composes the full-attention forward over all CP8 page partitions and all-reduces dQ .

contexto: 12 Evaluation Scope

RESULTADO REPORTADO

Read vertically, the prefix-only and conditional-response points establish different execution scopes; their lower memory does not imply that a prompt-adapted training graph fits.

contexto: 12 Evaluation Scope

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Un agente puede acumular millones de tokens entre documentos, observaciones y tools, pero nunca haber sido realmente entrenado para comportarse en ese régimen.

MÉTODO / La lectura de 3 Architecture Anatomy and Bottleneck Sources describe la intervención y su construcción: The two models differ along two independent axes. The feed-forward axis is dense versus MoE. It determines parameter residency, token routing, and the shape of activation buffers. The token-mixing axis is GDN/full attention versus MLA/DSA; it determines retained prompt state and response-time collectives. Model-level labels such as “dense”, “MoE”, or “sparse” hide this separation. Figure 3 opens both decoder stacks at the level needed by the training runtime. The diagram shows counts and ownership rather than implying that the two models share one layer template. [Fuente: https://arxiv.org/html/2607.14952#S3]

RESULTADO / La sección 12 Evaluation Scope informa: Qwen’s response-only receipt composes the full-attention forward over all CP8 page partitions and all-reduces dQ . The distributed attention backward all-reduces dQ and returns page-owner dK/dV . The probe creates one AdamW instance per rank without DDP or a parameter-gradient reducer. [Fuente: https://arxiv.org/html/2607.14952#S12]

LÍMITE / El cierre de la fuente señala: Together, these results establish a training-ready path beyond two million tokens under a fixed GPU budget. The next evaluation scales this working transaction across repeated updates and task metrics, while the independent Qwen CP8 replica-finalization check strengthens the companion dense-hybrid path. La transferencia a coding agents de repositorio completo requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.14952#S11].

DECISIÓN RÁPIDAProbar la propuesta en coding agents de repositorio completo reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 12 Evaluation Scope.

PROBLEMA
Un agente puede acumular millones de tokens entre documentos, observaciones y tools, pero nunca haber sido realmente entrenado para comportarse en ese régimen.
MÉTODO
La lectura de 3 Architecture Anatomy and Bottleneck Sources describe la intervención y su construcción: The two models differ along two independent axes. The feed-forward axis is dense versus MoE. It determines parameter residency, token routing, and the shape of activation buffers. The token-mixing axis is GDN/full attention versus MLA/DSA; it determines retained prompt state and response-time collectives. Model-level labels such as “dense”, “MoE”, or “sparse” hide this separation. Figure 3 opens both decoder stacks at the level needed by the training runtime. The diagram shows counts and ownership rather than implying that the two models share one layer template.
TIPO DE EVIDENCIA
La sección 12 Evaluation Scope informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.14952#S12.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 12 Evaluation Scope.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 3 Architecture Anatomy and Bottleneck Sources describe la intervención y su construcción: The two models differ along two independent axes. The feed-forward axis is dense versus MoE. It determines parameter residency, token routing, and the shape of activation buffers. The token-mixing axis is GDN/full attention versus MLA/DSA; it determines retained prompt state and response-time collectives. Model-level labels such as “dense”, “MoE”, or “sparse” hide this separation. Figure 3 opens both decoder stacks at the level needed by the training runtime. The diagram shows counts and ownership rather than implying that the two models share one layer template.

QUÉ APORTA

El long-context de agentes podría pasar de ser simplemente «memoria disponible» a una capacidad entrenada explícitamente.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 12 Evaluation Scope.

Cómo lo llevaría a un proyecto

Probar la propuesta en coding agents de repositorio completo reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

coding agents de repositorio completoexpedientesinvestigación profundaagentes long-horizon.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando coding agents de repositorio completo cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAcoding agents de repositorio completo con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora coding agents de repositorio completo frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si coding agents de repositorio completo puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.