# Un agente fiable necesita un orden de lectura, no solo más capacidad
> Hipótesis editorial multi-paper. Resultado del test: supported-by-corpus.

- Página: https://luiseduardodemiguel.com/research-ia/hypotheses/evidence-gated-research-loop
- Test: research-hypotheses:corpus-triangulation:v1
- Fecha de comprobación: 2026-08-19
- Combinación: Before Reasoning Can Fail + CodeGrep + RAG-Stack + ReContext

## Hipótesis

Cuando un agente busca, abre la evidencia, recupera el contexto útil y solo después responde, el harness puede reducir errores de procedimiento sin convertir una síntesis plausible en una afirmación verificada.

Pregunta: ¿Qué parte de la fiabilidad viene del orden del proceso y qué parte de la capacidad del modelo?

## Problema y contexto

El fallo puede ocurrir antes de que empiece el razonamiento: un agente puede encontrar fragmentos plausibles y finalizar sin inspeccionarlos. En una tarea de investigación eso deja una respuesta con apariencia de evidencia, pero sin una traza que demuestre qué se leyó y qué se usó.

La pregunta de esta ficha no es si cuatro técnicas forman una plataforma ya validada. Es más concreta: ¿qué controles del flujo —leer, recuperar, organizar y decidir con un presupuesto— pueden medirse por separado para no atribuir a la capacidad del modelo un fallo de procedimiento?

## Qué aporta cada paper

### Before Reasoning Can Fail — Fija el primer control del loop: no finalizar sin una lectura registrada.

- Problema que aborda: Distingue el salto de evidencia previo al razonamiento de los errores posteriores a la lectura.
- Qué aporta: Introduce Read-Gate, un invariante de runtime que exige leer después de buscar y antes de finalizar; hace observable una disciplina que normalmente queda mezclada con la calidad de la respuesta.
- Resultado reportado por la fuente: En 12.000 trayectorias emparejadas de HotpotQA, 2WikiMultiHopQA y MuSiQue, la lectura forzada mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.
- Qué no permite concluir: El gate obliga a leer, no garantiza que se lea el fragmento correcto ni que el razonamiento posterior sea verdadero; es una garantía procedimental.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/before-reasoning-can-fail
- Fuente primaria (v2): https://arxiv.org/html/2608.02011v2#S5

### CodeGrep — Convierte ‘buscar’ en una política medible: la recuperación sólo ayuda cuando supera un umbral de precisión.

- Problema que aborda: Los coding agents gastan gran parte del presupuesto buscando qué archivo tocar, de modo que recuperar contexto también es un problema de eficiencia.
- Qué aporta: CodeGrep separa la recuperación especializada del agente que ejecuta la tarea y coordina llamadas de grep, glob y lectura para entregar candidatos al agente congelado.
- Resultado reportado por la fuente: En los 500 casos de SWE-Bench Verified, el trabajo reporta 27,0% frente a 25,8% sin retrieval, con 15% menos rondas y 19% menos tokens en los issues resueltos.
- Qué no permite concluir: La mejora depende de la precisión del retriever y del entorno de worktree; el propio resultado identifica un umbral de utilidad y no garantiza transferencia fuera de esa distribución.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/codegrep
- Fuente primaria (v1): https://arxiv.org/abs/2608.05886

### RAG-Stack — Añade el presupuesto al gate: una lectura más rigurosa no vale automáticamente si vuelve inviable la respuesta.

- Problema que aborda: Un sistema RAG no elige sólo una respuesta mejor: debe equilibrar calidad, latencia, hardware y coste de serving entre muchas configuraciones.
- Qué aporta: RAG-Stack explora conjuntamente el espacio algoritmo-sistema con una representación intermedia, un modelo de rendimiento y una búsqueda de configuraciones Pareto.
- Resultado reportado por la fuente: Con el mismo número de iteraciones, las fronteras encontradas cubren entre 52,5% y 153,2% más del espacio normalizado de calidad-rendimiento que los métodos comparados.
- Qué no permite concluir: La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no sustituye validar con tráfico y datos representativos.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/rag-stack
- Fuente primaria (v1): https://arxiv.org/abs/2608.03487

### ReContext — Completa el loop entre leer y responder: organizar evidencia puede ser una intervención explícita, no una esperanza puesta en el contexto largo.

- Problema que aborda: Una ventana de contexto larga permite contener la evidencia, pero no garantiza que el modelo la utilice durante la generación.
- Qué aporta: ReContext usa señales internas de relevancia para construir un pool de evidencia condicionado por la pregunta y reproducirlo antes de responder, manteniendo accesible el contexto original.
- Resultado reportado por la fuente: En ocho datasets de contexto 128K y tres backbones, reporta la mejor posición media; la media de accuracy pasa de 0,24 con Vanilla a 0,30, una ganancia relativa del 24,6%.
- Qué no permite concluir: Es un wrapper de inferencia probado bajo sus datasets, modelos y configuración; no demuestra por sí mismo una política de herramientas, abstención o transferencia a un agente de investigación.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/recontext-recursive-evidence-replay-as-llm-harness-for-long-context-reas
- Fuente primaria (v1): https://arxiv.org/html/2607.02509#S4

## Puente de síntesis

La conexión no es que los cuatro papers hayan evaluado el mismo agente. Es una cadena de controles: Before Reasoning Can Fail hace medible el requisito de leer; CodeGrep muestra que recuperar contexto tiene un umbral de precisión y coste; RAG-Stack obliga a elegir una configuración en una frontera calidad-rendimiento; ReContext ofrece una forma de ordenar evidencia relevante sin borrar el contexto original. La síntesis editorial es que un harness de investigación debería registrar y evaluar la secuencia buscar → leer → organizar → responder, manteniendo separadas la calidad de la evidencia y la economía del sistema.

## Implicaciones si la dirección es correcta

- Registrar la evidencia no como un booleano, sino como spans leídos, fuente, relación con la pregunta y decisión de continuar o abstenerse.
- Medir la utilidad del retriever contra un umbral propio: más resultados o más contexto no son una mejora si aumentan lecturas irrelevantes.
- Comparar variantes en una frontera conjunta de precisión de citas, abstenciones correctas, latencia y coste; no declarar éxito por una sola métrica.

## Resultado y límites

La triangulación del corpus apoya la dirección: los cuatro trabajos aportan evidencia sobre lectura, recuperación, optimización o diagnóstico. El resultado es convergencia arquitectónica, no una prueba conjunta de causalidad.

Que todos los papers tienen lectura primaria, resultado reportado, localizador exacto y una conexión explícita con el orden de investigación.

Límite: Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
No demuestra: No demuestra que combinar los cuatro componentes mejore un agente real ni fija el coste de la instrumentación.

## Próxima prueba

- Entrada: Un workflow de investigación con 30 preguntas, fuentes cambiantes y una respuesta que deba citar evidencia.
- Baseline: Agente actual sin gate obligatorio de lectura ni registro de recuperación.
- Métrica: Precisión de citas, abstenciones correctas, lecturas irrelevantes, latencia y coste por respuesta.
- Regla de parada: Parar si el gate no reduce respuestas sin evidencia o si la latencia/coste aumenta más que la mejora de precisión.
- Timebox: 2 semanas

## Papers

- [Before Reasoning Can Fail](https://luiseduardodemiguel.com/research-ia/markdown/papers/before-reasoning-can-fail): https://arxiv.org/abs/2608.02011
- [CodeGrep](https://luiseduardodemiguel.com/research-ia/markdown/papers/codegrep): https://arxiv.org/abs/2608.05886
- [RAG-Stack](https://luiseduardodemiguel.com/research-ia/markdown/papers/rag-stack): https://arxiv.org/abs/2608.03487
- [ReContext](https://luiseduardodemiguel.com/research-ia/markdown/papers/recontext-recursive-evidence-replay-as-llm-harness-for-long-context-reas): https://arxiv.org/abs/2607.02509