¿Qué parte de la fiabilidad viene del orden del proceso y qué parte de la capacidad del modelo?
La fiabilidad puede fallar antes del razonamiento.
El fallo puede ocurrir antes de que empiece el razonamiento: un agente puede encontrar fragmentos plausibles y finalizar sin inspeccionarlos. En una tarea de investigación eso deja una respuesta con apariencia de evidencia, pero sin una traza que demuestre qué se leyó y qué se usó.
La pregunta de esta ficha no es si cuatro técnicas forman una plataforma ya validada. Es más concreta: ¿qué controles del flujo —leer, recuperar, organizar y decidir con un presupuesto— pueden medirse por separado para no atribuir a la capacidad del modelo un fallo de procedimiento?
Qué aporta cada paper
Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.
- Before Reasoning Can FailFija el primer control del loop: no finalizar sin una lectura registrada.
- CodeGrepConvierte ‘buscar’ en una política medible: la recuperación sólo ayuda cuando supera un umbral de precisión.
- RAG-StackAñade el presupuesto al gate: una lectura más rigurosa no vale automáticamente si vuelve inviable la respuesta.
- ReContextCompleta el loop entre leer y responder: organizar evidencia puede ser una intervención explícita, no una esperanza puesta en el contexto largo.
- Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
- 01Before Reasoning Can Fail2026-08-03 · v2Fuente primaria ↗
Fija el primer control del loop: no finalizar sin una lectura registrada.
Problema que aborda. Distingue el salto de evidencia previo al razonamiento de los errores posteriores a la lectura.
Qué aporta. Introduce Read-Gate, un invariante de runtime que exige leer después de buscar y antes de finalizar; hace observable una disciplina que normalmente queda mezclada con la calidad de la respuesta.
Resultado reportado por la fuente. En 12.000 trayectorias emparejadas de HotpotQA, 2WikiMultiHopQA y MuSiQue, la lectura forzada mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.
Qué no permite concluir. El gate obliga a leer, no garantiza que se lea el fragmento correcto ni que el razonamiento posterior sea verdadero; es una garantía procedimental.
- 02CodeGrep2026-08-06 · v1Fuente primaria ↗
Convierte ‘buscar’ en una política medible: la recuperación sólo ayuda cuando supera un umbral de precisión.
Problema que aborda. Los coding agents gastan gran parte del presupuesto buscando qué archivo tocar, de modo que recuperar contexto también es un problema de eficiencia.
Qué aporta. CodeGrep separa la recuperación especializada del agente que ejecuta la tarea y coordina llamadas de grep, glob y lectura para entregar candidatos al agente congelado.
Resultado reportado por la fuente. En los 500 casos de SWE-Bench Verified, el trabajo reporta 27,0% frente a 25,8% sin retrieval, con 15% menos rondas y 19% menos tokens en los issues resueltos.
Qué no permite concluir. La mejora depende de la precisión del retriever y del entorno de worktree; el propio resultado identifica un umbral de utilidad y no garantiza transferencia fuera de esa distribución.
- 03RAG-Stack2026-08-04 · v1Fuente primaria ↗
Añade el presupuesto al gate: una lectura más rigurosa no vale automáticamente si vuelve inviable la respuesta.
Problema que aborda. Un sistema RAG no elige sólo una respuesta mejor: debe equilibrar calidad, latencia, hardware y coste de serving entre muchas configuraciones.
Qué aporta. RAG-Stack explora conjuntamente el espacio algoritmo-sistema con una representación intermedia, un modelo de rendimiento y una búsqueda de configuraciones Pareto.
Resultado reportado por la fuente. Con el mismo número de iteraciones, las fronteras encontradas cubren entre 52,5% y 153,2% más del espacio normalizado de calidad-rendimiento que los métodos comparados.
Qué no permite concluir. La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no sustituye validar con tráfico y datos representativos.
- 04ReContext2026-06-29 · v1Fuente primaria ↗
Completa el loop entre leer y responder: organizar evidencia puede ser una intervención explícita, no una esperanza puesta en el contexto largo.
Problema que aborda. Una ventana de contexto larga permite contener la evidencia, pero no garantiza que el modelo la utilice durante la generación.
Qué aporta. ReContext usa señales internas de relevancia para construir un pool de evidencia condicionado por la pregunta y reproducirlo antes de responder, manteniendo accesible el contexto original.
Resultado reportado por la fuente. En ocho datasets de contexto 128K y tres backbones, reporta la mejor posición media; la media de accuracy pasa de 0,24 con Vanilla a 0,30, una ganancia relativa del 24,6%.
Qué no permite concluir. Es un wrapper de inferencia probado bajo sus datasets, modelos y configuración; no demuestra por sí mismo una política de herramientas, abstención o transferencia a un agente de investigación.
El puente es un orden de controles, no una suma de papers.
La conexión no es que los cuatro papers hayan evaluado el mismo agente. Es una cadena de controles: Before Reasoning Can Fail hace medible el requisito de leer; CodeGrep muestra que recuperar contexto tiene un umbral de precisión y coste; RAG-Stack obliga a elegir una configuración en una frontera calidad-rendimiento; ReContext ofrece una forma de ordenar evidencia relevante sin borrar el contexto original. La síntesis editorial es que un harness de investigación debería registrar y evaluar la secuencia buscar → leer → organizar → responder, manteniendo separadas la calidad de la evidencia y la economía del sistema.
Qué cambia si la dirección es correcta
- Registrar la evidencia no como un booleano, sino como spans leídos, fuente, relación con la pregunta y decisión de continuar o abstenerse.
- Medir la utilidad del retriever contra un umbral propio: más resultados o más contexto no son una mejora si aumentan lecturas irrelevantes.
- Comparar variantes en una frontera conjunta de precisión de citas, abstenciones correctas, latencia y coste; no declarar éxito por una sola métrica.
La triangulación del corpus apoya la dirección: los cuatro trabajos aportan evidencia sobre lectura, recuperación, optimización o diagnóstico. El resultado es convergencia arquitectónica, no una prueba conjunta de causalidad.
Que todos los papers tienen lectura primaria, resultado reportado, localizador exacto y una conexión explícita con el orden de investigación.
Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
Qué comprobé
Cómo intentaría confirmarla o hacerla caer.
Timebox: 2 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.
Lo que hice bien
Separé la hipótesis del resultado de cada paper y dejé un siguiente experimento con baseline y parada.
Lo que hice mal o dejé corto
La prueba todavía es de triangulación documental; no ejecuta un agente ni compara una variante con y sin gate.
No demuestra que combinar los cuatro componentes mejore un agente real ni fija el coste de la instrumentación.