Lo esencial antes de invertir más tiempo.
Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.
Consistent gains on the Qwen2.5-Coder-Instruct series.
Resultado reportado con fuente enlazada · 6 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.
Qué está reportado y qué conviene comprobar.
Consistent gains on the Qwen2.5-Coder-Instruct series.
contexto: 3 Experiments
Holding the post-training pipeline fixed at R2E-Gym, FIM mid-training improves SWE-Bench-Verified by +2.80 on 7B-Instruct and +3.00 on 14B-Instruct, with matching directional gains on SWE-Bench-Lite ( +3.67/+4.00 ).
7B · contexto: 3 Experiments
Replacing R2E-Gym with SWE-Smith on the same 7B base yields +5.30 points on Verified, larger than the +2.80 under R2E-Gym; on Lite the SWE-Smith pairing gains only +0.50 , smaller than +3.67 for the R2E-Gym pairing.
7B · contexto: 3 Experiments
Switching to Qwen3-8B paired with SWE-Lego, mid-training improves Verified by +3.20 and Lite by +5.40 , comparable to the Qwen2.5-Coder-Instruct gains.
8B · contexto: 3 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque Los modelos de código aprenden principalmente generación izquierda-a-derecha, pero un coding agent debe integrar continuamente observaciones producidas externamente.
MÉTODO / La lectura de 2 Method describe la intervención y su construcción: A coding agent at step t samples a_{t}\sim\pi(a_{t}\mid h_{t}) , observes o_{t+1}\sim p(o_{t+1}\mid h_{t},a_{t}) , and continues. Function calls mirror this loop (Figure 1 , left): pre-call context, call, return, and downstream usage align with history, action, observation, and continuation. This isomorphism motivates a fill-in-the-middle (FIM) objective drawn from code. Random-span FIM ( 20 ; 14 ; 24 ) captures it only incidentally; our function-aware variant selects masking targets by program structure and contextual predictability. We curate a corpus of 968 Python repositories from GitHub. Starting from… [Fuente: https://arxiv.org/html/2607.12463#S2]
RESULTADO / La sección 3 Experiments informa: Consistent gains on the Qwen2.5-Coder-Instruct series. Holding the post-training pipeline fixed at R2E-Gym, FIM mid-training improves SWE-Bench-Verified by +2.80 on 7B-Instruct and +3.00 on 14B-Instruct, with matching directional gains on SWE-Bench-Lite ( +3.67/+4.00 ). Replacing R2E-Gym with SWE-Smith on the same 7B base yields +5.30 points on Verified, larger than the +2.80 under R2E-Gym; on Lite the SWE-Smith pairing gains only +0.50 , smaller than +3.67 for the R2E-Gym pairing. [Fuente: https://arxiv.org/html/2607.12463#S3]
LÍMITE / El cierre de la fuente señala: We close by stating four limitations that scope our claims. (i) Python-only corpus and evaluation. The mid-training corpus and the in-domain agent benchmarks are exclusively Python; cross-language evidence comes only indirectly through FullStackBench-EN (Section 3.3 ), and transfer to Java, C++, or Rust is left to future work. (ii) Teacher dependency for CoT. The default recipe relies on Gemini-3-Flash; the CoT-source ablation (Section 3.4 ) shows… La transferencia a coding agents requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.12463#S6].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.
- PROBLEMA
- Los modelos de código aprenden principalmente generación izquierda-a-derecha, pero un coding agent debe integrar continuamente observaciones producidas externamente.
- MÉTODO
- La lectura de 2 Method describe la intervención y su construcción: A coding agent at step t samples a_{t}\sim\pi(a_{t}\mid h_{t}) , observes o_{t+1}\sim p(o_{t+1}\mid h_{t},a_{t}) , and continues. Function calls mirror this loop (Figure 1 , left): pre-call context, call, return, and downstream usage align with history, action, observation, and continuation. This isomorphism motivates a fill-in-the-middle (FIM) objective drawn from code. Random-span FIM ( 20 ; 14 ; 24 ) captures it only incidentally; our function-aware variant selects masking targets by program structure and contextual predictability. We curate a corpus of 968 Python repositories from GitHub. Starting from…
- TIPO DE EVIDENCIA
- La sección 3 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12463#S3.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 2 Method describe la intervención y su construcción: A coding agent at step t samples a_{t}\sim\pi(a_{t}\mid h_{t}) , observes o_{t+1}\sim p(o_{t+1}\mid h_{t},a_{t}) , and continues. Function calls mirror this loop (Figure 1 , left): pre-call context, call, return, and downstream usage align with history, action, observation, and continuation. This isomorphism motivates a fill-in-the-middle (FIM) objective drawn from code. Random-span FIM ( 20 ; 14 ; 24 ) captures it only incidentally; our function-aware variant selects masking targets by program structure and contextual predictability. We curate a corpus of 968 Python repositories from GitHub. Starting from…
En vez de enseñar tool-use solo con costosas trayectorias agentic, propone aprovechar la estructura natural del código como señal de pre/mid-training.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en coding agents reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando coding agents cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si coding agents puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.