NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 06

AGENTES · CODING

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

ImprescindibleLectura primaria completa

Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse.

AUTHORS / LABYubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen
FECHA14 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.

EVIDENCIA DISPONIBLE

Consistent gains on the Qwen2.5-Coder-Instruct series.

Resultado reportado con fuente enlazada · 6 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.

SEÑALsoftware · devtools
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Holding the post-training pipeline fixed at R2E-Gym, FIM mid-training improves SWE-Bench-Verified by +2.80 on 7B-Instruct and +3.00 on 14B-Instruct, with matching directional gains on SWE-Bench-Lite ( +3.67/+4.00 ).

7B · contexto: 3 Experiments

RESULTADO REPORTADO

Replacing R2E-Gym with SWE-Smith on the same 7B base yields +5.30 points on Verified, larger than the +2.80 under R2E-Gym; on Lite the SWE-Smith pairing gains only +0.50 , smaller than +3.67 for the R2E-Gym pairing.

7B · contexto: 3 Experiments

RESULTADO REPORTADO

Switching to Qwen3-8B paired with SWE-Lego, mid-training improves Verified by +3.20 and Lite by +5.40 , comparable to the Qwen2.5-Coder-Instruct gains.

8B · contexto: 3 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Los modelos de código aprenden principalmente generación izquierda-a-derecha, pero un coding agent debe integrar continuamente observaciones producidas externamente.

MÉTODO / La lectura de 2 Method describe la intervención y su construcción: A coding agent at step t samples a_{t}\sim\pi(a_{t}\mid h_{t}) , observes o_{t+1}\sim p(o_{t+1}\mid h_{t},a_{t}) , and continues. Function calls mirror this loop (Figure 1 , left): pre-call context, call, return, and downstream usage align with history, action, observation, and continuation. This isomorphism motivates a fill-in-the-middle (FIM) objective drawn from code. Random-span FIM ( 20 ; 14 ; 24 ) captures it only incidentally; our function-aware variant selects masking targets by program structure and contextual predictability. We curate a corpus of 968 Python repositories from GitHub. Starting from… [Fuente: https://arxiv.org/html/2607.12463#S2]

RESULTADO / La sección 3 Experiments informa: Consistent gains on the Qwen2.5-Coder-Instruct series. Holding the post-training pipeline fixed at R2E-Gym, FIM mid-training improves SWE-Bench-Verified by +2.80 on 7B-Instruct and +3.00 on 14B-Instruct, with matching directional gains on SWE-Bench-Lite ( +3.67/+4.00 ). Replacing R2E-Gym with SWE-Smith on the same 7B base yields +5.30 points on Verified, larger than the +2.80 under R2E-Gym; on Lite the SWE-Smith pairing gains only +0.50 , smaller than +3.67 for the R2E-Gym pairing. [Fuente: https://arxiv.org/html/2607.12463#S3]

LÍMITE / El cierre de la fuente señala: We close by stating four limitations that scope our claims. (i) Python-only corpus and evaluation. The mid-training corpus and the in-domain agent benchmarks are exclusively Python; cross-language evidence comes only indirectly through FullStackBench-EN (Section 3.3 ), and transfer to Java, C++, or Rust is left to future work. (ii) Teacher dependency for CoT. The default recipe relies on Gemini-3-Flash; the CoT-source ablation (Section 3.4 ) shows… La transferencia a coding agents requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.12463#S6].

DECISIÓN RÁPIDAProbar la propuesta en coding agents reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.

PROBLEMA
Los modelos de código aprenden principalmente generación izquierda-a-derecha, pero un coding agent debe integrar continuamente observaciones producidas externamente.
MÉTODO
La lectura de 2 Method describe la intervención y su construcción: A coding agent at step t samples a_{t}\sim\pi(a_{t}\mid h_{t}) , observes o_{t+1}\sim p(o_{t+1}\mid h_{t},a_{t}) , and continues. Function calls mirror this loop (Figure 1 , left): pre-call context, call, return, and downstream usage align with history, action, observation, and continuation. This isomorphism motivates a fill-in-the-middle (FIM) objective drawn from code. Random-span FIM ( 20 ; 14 ; 24 ) captures it only incidentally; our function-aware variant selects masking targets by program structure and contextual predictability. We curate a corpus of 968 Python repositories from GitHub. Starting from…
TIPO DE EVIDENCIA
La sección 3 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12463#S3.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 2 Method describe la intervención y su construcción: A coding agent at step t samples a_{t}\sim\pi(a_{t}\mid h_{t}) , observes o_{t+1}\sim p(o_{t+1}\mid h_{t},a_{t}) , and continues. Function calls mirror this loop (Figure 1 , left): pre-call context, call, return, and downstream usage align with history, action, observation, and continuation. This isomorphism motivates a fill-in-the-middle (FIM) objective drawn from code. Random-span FIM ( 20 ; 14 ; 24 ) captures it only incidentally; our function-aware variant selects masking targets by program structure and contextual predictability. We curate a corpus of 968 Python repositories from GitHub. Starting from…

QUÉ APORTA

En vez de enseñar tool-use solo con costosas trayectorias agentic, propone aprovechar la estructura natural del código como señal de pre/mid-training.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en coding agents reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

coding agentsIDEsreparación automáticaagentes de CI.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando coding agents cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAcoding agents con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora coding agents frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si coding agents puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.