NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
HIPÓTESIS/PUBLICACIÓN 01

EVIDENCIA / RECUPERACIÓN / DECISIÓN

Un agente fiable necesita un orden de lectura, no solo más capacidad

Cuando un agente busca, abre la evidencia, recupera el contexto útil y solo después responde, el harness puede reducir errores de procedimiento sin convertir una síntesis plausible en una afirmación verificada.

COMBINACIÓNBefore Reasoning Can Fail + CodeGrep + RAG-Stack + ReContext
TESTtriangulación documental reproducible
ESTADOsupported by corpus
PREGUNTA DE INVESTIGACIÓN

¿Qué parte de la fiabilidad viene del orden del proceso y qué parte de la capacidad del modelo?

PROBLEMA Y CONTEXTO

La fiabilidad puede fallar antes del razonamiento.

El fallo puede ocurrir antes de que empiece el razonamiento: un agente puede encontrar fragmentos plausibles y finalizar sin inspeccionarlos. En una tarea de investigación eso deja una respuesta con apariencia de evidencia, pero sin una traza que demuestre qué se leyó y qué se usó.

La pregunta de esta ficha no es si cuatro técnicas forman una plataforma ya validada. Es más concreta: ¿qué controles del flujo —leer, recuperar, organizar y decidir con un presupuesto— pueden medirse por separado para no atribuir a la capacidad del modelo un fallo de procedimiento?

EVIDENCE MAP / RESULTADOS DE LAS FUENTES

Qué aporta cada paper

Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.

FIGURA / MAPA DE EVIDENCIA4 fuentes, un puente que todavía hay que probar.
SVG estático · sin runtime de gráficos
Mapa de evidencia de la hipótesis4 papers aportan controles distintos que convergen en un orden de lectura, recuperación, organización de evidencia y respuesta bajo presupuesto.FUENTE 01Before Reasoning Can FailFUENTE 02CodeGrepFUENTE 03RAG-StackFUENTE 04ReContextPUENTE EDITORIALbuscar → leerorganizar → respondersin prometer causalidad aúnAFIRMACIÓN A PROBARel orden de lecturamejora la fiabilidadpuente editorial, no resultado conjunto
La figura muestra una síntesis editorial: las flechas no significan que los autores hayan evaluado juntos este workflow.
  1. Before Reasoning Can FailFija el primer control del loop: no finalizar sin una lectura registrada.
  2. CodeGrepConvierte ‘buscar’ en una política medible: la recuperación sólo ayuda cuando supera un umbral de precisión.
  3. RAG-StackAñade el presupuesto al gate: una lectura más rigurosa no vale automáticamente si vuelve inviable la respuesta.
  4. ReContextCompleta el loop entre leer y responder: organizar evidencia puede ser una intervención explícita, no una esperanza puesta en el contexto largo.
  5. Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
  1. 01

    Fija el primer control del loop: no finalizar sin una lectura registrada.

    Problema que aborda. Distingue el salto de evidencia previo al razonamiento de los errores posteriores a la lectura.

    Qué aporta. Introduce Read-Gate, un invariante de runtime que exige leer después de buscar y antes de finalizar; hace observable una disciplina que normalmente queda mezclada con la calidad de la respuesta.

    Resultado reportado por la fuente. En 12.000 trayectorias emparejadas de HotpotQA, 2WikiMultiHopQA y MuSiQue, la lectura forzada mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.

    Qué no permite concluir. El gate obliga a leer, no garantiza que se lea el fragmento correcto ni que el razonamiento posterior sea verdadero; es una garantía procedimental.

  2. 02

    Convierte ‘buscar’ en una política medible: la recuperación sólo ayuda cuando supera un umbral de precisión.

    Problema que aborda. Los coding agents gastan gran parte del presupuesto buscando qué archivo tocar, de modo que recuperar contexto también es un problema de eficiencia.

    Qué aporta. CodeGrep separa la recuperación especializada del agente que ejecuta la tarea y coordina llamadas de grep, glob y lectura para entregar candidatos al agente congelado.

    Resultado reportado por la fuente. En los 500 casos de SWE-Bench Verified, el trabajo reporta 27,0% frente a 25,8% sin retrieval, con 15% menos rondas y 19% menos tokens en los issues resueltos.

    Qué no permite concluir. La mejora depende de la precisión del retriever y del entorno de worktree; el propio resultado identifica un umbral de utilidad y no garantiza transferencia fuera de esa distribución.

  3. 03

    Añade el presupuesto al gate: una lectura más rigurosa no vale automáticamente si vuelve inviable la respuesta.

    Problema que aborda. Un sistema RAG no elige sólo una respuesta mejor: debe equilibrar calidad, latencia, hardware y coste de serving entre muchas configuraciones.

    Qué aporta. RAG-Stack explora conjuntamente el espacio algoritmo-sistema con una representación intermedia, un modelo de rendimiento y una búsqueda de configuraciones Pareto.

    Resultado reportado por la fuente. Con el mismo número de iteraciones, las fronteras encontradas cubren entre 52,5% y 153,2% más del espacio normalizado de calidad-rendimiento que los métodos comparados.

    Qué no permite concluir. La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no sustituye validar con tráfico y datos representativos.

  4. 04

    Completa el loop entre leer y responder: organizar evidencia puede ser una intervención explícita, no una esperanza puesta en el contexto largo.

    Problema que aborda. Una ventana de contexto larga permite contener la evidencia, pero no garantiza que el modelo la utilice durante la generación.

    Qué aporta. ReContext usa señales internas de relevancia para construir un pool de evidencia condicionado por la pregunta y reproducirlo antes de responder, manteniendo accesible el contexto original.

    Resultado reportado por la fuente. En ocho datasets de contexto 128K y tres backbones, reporta la mejor posición media; la media de accuracy pasa de 0,24 con Vanilla a 0,30, una ganancia relativa del 24,6%.

    Qué no permite concluir. Es un wrapper de inferencia probado bajo sus datasets, modelos y configuración; no demuestra por sí mismo una política de herramientas, abstención o transferencia a un agente de investigación.

SÍNTESIS EDITORIAL / INFERENCIA DEL AUTOR

El puente es un orden de controles, no una suma de papers.

La conexión no es que los cuatro papers hayan evaluado el mismo agente. Es una cadena de controles: Before Reasoning Can Fail hace medible el requisito de leer; CodeGrep muestra que recuperar contexto tiene un umbral de precisión y coste; RAG-Stack obliga a elegir una configuración en una frontera calidad-rendimiento; ReContext ofrece una forma de ordenar evidencia relevante sin borrar el contexto original. La síntesis editorial es que un harness de investigación debería registrar y evaluar la secuencia buscar → leer → organizar → responder, manteniendo separadas la calidad de la evidencia y la economía del sistema.

Qué cambia si la dirección es correcta

  • Registrar la evidencia no como un booleano, sino como spans leídos, fuente, relación con la pregunta y decisión de continuar o abstenerse.
  • Medir la utilidad del retriever contra un umbral propio: más resultados o más contexto no son una mejora si aumentan lecturas irrelevantes.
  • Comparar variantes en una frontera conjunta de precisión de citas, abstenciones correctas, latencia y coste; no declarar éxito por una sola métrica.
RESULTADO DEL TEST / 2026-08-19

La triangulación del corpus apoya la dirección: los cuatro trabajos aportan evidencia sobre lectura, recuperación, optimización o diagnóstico. El resultado es convergencia arquitectónica, no una prueba conjunta de causalidad.

Que todos los papers tienen lectura primaria, resultado reportado, localizador exacto y una conexión explícita con el orden de investigación.

Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.

supported by corpus5/5 checks pasados

Qué comprobé

PASSPapers públicos encontrados4/4
PASSLecturas primarias completas4/4
PASSCortes o fechas cubiertos4
PASSLocalizadores disponibles15
PASSReferencias de resultado resueltas3/3
PRÓXIMA PRUEBA / TODAVÍA NO EJECUTADA

Cómo intentaría confirmarla o hacerla caer.

ENTRADAUn workflow de investigación con 30 preguntas, fuentes cambiantes y una respuesta que deba citar evidencia.
BASELINEAgente actual sin gate obligatorio de lectura ni registro de recuperación.
MÉTRICAPrecisión de citas, abstenciones correctas, lecturas irrelevantes, latencia y coste por respuesta.
PARADAParar si el gate no reduce respuestas sin evidencia o si la latencia/coste aumenta más que la mejora de precisión.

Timebox: 2 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.

AUTOCRÍTICA / REVISIÓN DEL AUTOR

Lo que hice bien

Separé la hipótesis del resultado de cada paper y dejé un siguiente experimento con baseline y parada.

Lo que hice mal o dejé corto

La prueba todavía es de triangulación documental; no ejecuta un agente ni compara una variante con y sin gate.

No demuestra que combinar los cuatro componentes mejore un agente real ni fija el coste de la instrumentación.