# CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/codegrep
- Fuente primaria: https://arxiv.org/abs/2608.05886
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Wuya Chen, Yihao Yang, Yang Cao y Yue Lin
- Fecha del corte: 06 AGO 2026
- Área: CODING AGENTS · RETRIEVAL · RL

## Tesis y contexto

CodeGrep es un agente de retrieval de 14B que coordina grep, glob y lectura multi-turn para devolver candidatos a un agente de código congelado.

- Problema: En SWE-Bench Verified, una parte importante de las rondas y tokens se va en explorar el repositorio antes de escribir el parche.
- Por qué importa: Un retriever no ayuda por existir: debe superar un umbral de precisión. Cuando lo hace, puede mantener o mejorar la resolución reduciendo rondas y tokens.

## Evidencia reportada

- **reported-result**: CodeGrep resuelve 27,0% de SWE-Bench Verified frente a 25,8% sin retrieval, con 15% menos rondas y 19% menos tokens en los issues resueltos. [localizador](https://arxiv.org/html/2608.05886v1#S1)

## Lectura y límite

- Método: Entrena con GRPO un retriever de 14B que hace grep, glob y lecturas paralelas multi-turn y entrega archivos candidatos a un agente de código posterior que permanece congelado.
- Límite: La ganancia depende de la precisión del retriever y del entorno de worktree; un retrieval mediocre puede empeorar el agente, y la eficiencia observada no garantiza el mismo resultado en repositorios fuera de la distribución.
- Confianza editorial: Alta
- Limitación: SWE-Bench Verified y un umbral de precisión no representan todos los repositorios, lenguajes o fallos de integración; el retrieval puede beneficiarse de metadatos específicos del benchmark.
- Limitación: El ahorro de tokens y rondas se reporta sobre issues resueltos; no equivale necesariamente a menor coste por issue intentado ni a menos regresiones.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.05886): tipo abstract
- [Resultados y umbral · HTML](https://arxiv.org/html/2608.05886v1#S1): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.05886): tipo abstract

## Próxima prueba

- ¿Un gate de retrieval preciso mejora la resolución global de issues nuevos sin llenar el contexto de resultados irrelevantes?
- Métrica: Resolución total, precisión del contexto recuperado, rondas, tokens, tests y regresiones introducidas.
- Regla de parada: Parar si la resolución no aumenta 3 puntos o si más de 10% de los retrievals añade contexto irrelevante.

## Recursos reproducibles
- [HTML · fuente navegable](https://arxiv.org/html/2608.05886v1)

## Enlaces relacionados

- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)
- [RepoOMP](https://luiseduardodemiguel.com/research-ia/markdown/papers/repoomp)
- [SAG](https://luiseduardodemiguel.com/research-ia/markdown/papers/sag)