NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 05

AGENTIC RAG · EVALUACIÓN · PROCEDIMIENTO

Before Reasoning Can Fail: Pre-Evidence Procedural Failures in Agentic RAG

ImprescindibleLectura primaria completa

Un agente puede encontrar la evidencia correcta y aun así responder sin haberla leído: el fallo ocurre antes del razonamiento.

AUTHORS / LABDaeyoung Roh y Donghee Han
FECHA03 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

El paper separa los fallos procedimentales previos a la evidencia de los errores posteriores de lectura y razonamiento, y evalúa Read-Gate como una invariante mínima que obliga a leer antes de finalizar.

EVIDENCIA DISPONIBLE

Read-Gate mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.

Resultado con localizador exacto · 3 localizadores disponibles.
LÍMITE

Read-Gate obliga a que ocurra una lectura, no a que se lea el chunk correcto ni a que el razonamiento posterior sea válido; la garantía es procedimental, no una prueba de verdad.

SIGUIENTE PRUEBA

Exactitud, precisión de citas, tokens, latencia, omisiones de evidencia y falsas abstenciones.

EN UNA FRASE

El paper separa los fallos procedimentales previos a la evidencia de los errores posteriores de lectura y razonamiento, y evalúa Read-Gate como una invariante mínima que obliga a leer antes de finalizar.

SEÑALAgentic RAG · Evaluación · Read-Gate
EVIDENCIAResultado con localizador exacto
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay localizadores exactos registrados.
RESULTADO REPORTADO

Read-Gate mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.

+14,9 a +19,9 puntos · contexto: 12.000 trayectorias emparejadas en HotpotQA, 2WikiMultiHopQA y MuSiQue

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

Before Reasoning Can Fail identifica un error que puede parecer un fallo de razonamiento, pero sucede antes: el agente encuentra evidencia, recibe snippets o documentos y decide responder sin abrirlos. La trayectoria final parece una mala respuesta, aunque la causa sea que el harness permitió saltarse la lectura.

El paper separa los fallos de disciplina previos a la evidencia de los fallos posteriores a una lectura válida. Su intervención es Read-Gate, una invariante mínima que exige un evento de lectura antes de permitir la finalización, sin cambiar modelo, retriever, juez ni presupuesto de razonamiento.

El estudio analiza 12.000 trayectorias en HotpotQA, 2WikiMultiHopQA y MuSiQue y reporta mejoras de 14,9 a 19,9 puntos en los casos que se habrían saltado la lectura. La propia discusión aclara que el gate garantiza que se lea algo, no que se lea el chunk correcto; la mejora debe atribuirse a disciplina, no a una recuperación superior.

Esta es una pieza pequeña pero muy fértil para nuestro harness: separar buscar, leer, verificar y responder como estados observables. Más tokens de pensamiento no corrigen necesariamente una transición prohibida. La siguiente prueba es instrumentar el gate y medir si reduce respuestas sin evidencia sin aumentar lecturas irrelevantes o latencia inútil.

DECISIÓN RÁPIDAAñadir una invariante search → read → answer al harness de investigación y registrar por separado disciplina, calidad de evidencia y calidad de respuesta.
NO LO SOBREINTERPRETES

Read-Gate obliga a que ocurra una lectura, no a que se lea el chunk correcto ni a que el razonamiento posterior sea válido; la garantía es procedimental, no una prueba de verdad.

PROBLEMA
Los sistemas suelen culpar al retriever o al razonamiento cuando el harness permite la secuencia search → final answer sin exigir search → read → answer.
MÉTODO
Descompone trayectorias de agentic RAG en fallos de disciplina —buscar pero no leer— y fallos posteriores a una lectura válida; después evalúa Read-Gate como restricción de runtime.
TIPO DE EVIDENCIA
El análisis usa 12.000 trayectorias emparejadas en HotpotQA, 2WikiMultiHopQA y MuSiQue; Read-Gate mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.
LÍMITE
Read-Gate obliga a que ocurra una lectura, no a que se lea el chunk correcto ni a que el razonamiento posterior sea válido; la garantía es procedimental, no una prueba de verdad.
FIGURA DE LECTURA / DISCIPLINABuscar → leer → verificar → responder
Abrir paper original ↗

Una invariante de runtime puede evitar un salto procedimental antes del razonamiento.

SEARCHLocalizar evidencia
READ-GATEAbrir antes de cerrar
ANSWERResponder o abstenerse
PARA RECORDAR

Más tokens de pensamiento no reparan una transición de procedimiento que nunca ocurrió.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / El análisis usa 12.000 trayectorias emparejadas en HotpotQA, 2WikiMultiHopQA y MuSiQue; Read-Gate mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Descompone trayectorias de agentic RAG en fallos de disciplina —buscar pero no leer— y fallos posteriores a una lectura válida; después evalúa Read-Gate como restricción de runtime.

QUÉ APORTA

Añadir una regla pequeña puede mejorar más que añadir tokens de pensamiento: la disciplina del procedimiento merece su propia métrica y su propio control.

QUÉ NO PRUEBA

Read-Gate obliga a que ocurra una lectura, no a que se lea el chunk correcto ni a que el razonamiento posterior sea válido; la garantía es procedimental, no una prueba de verdad.

Cómo lo llevaría a un proyecto

Añadir una invariante search → read → answer al harness de investigación y registrar por separado disciplina, calidad de evidencia y calidad de respuesta.

Deep ResearchEnterprise searchRAG documentalAgentes webEvaluación de harness

Preguntas que conviene probar

  • ¿Qué operaciones deben bloquear la finalización sin lectura?
  • ¿Cómo distinguir una lectura formal de una inspección que realmente cambia la respuesta?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA1.000 consultas mixtas, con documentos conocidos y desconocidos, comparando Read-Gate, lectura forzada y baseline sin gate.
PREGUNTA¿Read-Gate mejora la respuesta y las citas sin convertir consultas sencillas en lecturas innecesarias?
MÉTRICAExactitud, precisión de citas, tokens, latencia, omisiones de evidencia y falsas abstenciones.
PARADAParar si la exactitud no aumenta 5 puntos en consultas multi-hop o si las falsas abstenciones superan 10%.

Mi lectura

La primera garantía de un agente de investigación no es que piense más: es que no pueda concluir sin mirar la evidencia.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.