NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 05

RAG · ABSTENCIÓN · EVALUACIÓN

The RAT: A Bayesian Model of Retrieval, Abstention, and Task Success

ImprescindibleLectura primaria completa

Si retrieval, generación y abstención se mezclan en un único score, es difícil saber si el agente falló por no encontrar, por no responder o por responder cuando debía callar.

AUTHORS / LABPius von Däniken, Felix Matthias Saaro, Mark Cieliebak y Jan Milan Deriu
FECHA25 AGO 2026 · v1
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.

EVIDENCIA DISPONIBLE

El protocolo cubre 27 configuraciones de tres retrievers, tres generadores y tres datasets, con 10.000 consultas por configuración.

Resultado con localizador exacto · 9 localizadores disponibles.
LÍMITE

El modelo depende de supuestos de calibración, del juez y de los datasets KILT. Es un marco de evaluación, no una garantía de que una política concreta vaya a abstenerse correctamente fuera de esa distribución.

SIGUIENTE PRUEBA

Precisión, cobertura, abstención correcta, respuestas sin soporte y calibración del juez.

EN UNA FRASE

The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.

SEÑALdescomposición bayesiana · abstención · evaluación de políticas
EVIDENCIAResultado con localizador exacto
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay localizadores exactos registrados.
RESULTADO REPORTADO

El protocolo cubre 27 configuraciones de tres retrievers, tres generadores y tres datasets, con 10.000 consultas por configuración.

27 × 10.000 consultas · baseline: Diseño factorial del estudio · contexto: KILT datasets

RESULTADO REPORTADO

El modelo separa retrieval success, abstention, task success y generator success para explicar el resultado final.

P(R, A, T, G) · baseline: Task success agregado · contexto: Modelo y análisis bayesiano

RESULTADO REPORTADO

Las anotaciones de recuperación son más informativas para la adherencia de la política que las anotaciones de task success aisladas.

Comparación de información de observaciones · baseline: Task success solamente · contexto: Análisis de condicionales

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PREGUNTA / The RAT intenta separar cuatro eventos que suelen colapsarse en una métrica: encontrar evidencia, abstenerse, resolver la tarea y generar la respuesta.

MÉTODO / El estudio evalúa 27 configuraciones con tres retrievers, tres generadores y tres datasets, y selecciona 10.000 consultas por configuración.

RESULTADO / La lectura sostiene que las etiquetas de retrieval success son más informativas para la adherencia de la política que observar sólo task success; el protocolo incluye una respuesta explícita I do not know.

LÍMITE / El valor del modelo depende de calibración y de la calidad del juez. Debe incorporarse como estructura de diagnóstico, no como una cifra universal de fiabilidad.

DECISIÓN RÁPIDACambiar el score del evaluador interno a un vector con retrieval, abstención, tarea, generador y calibración; no aceptar un aumento de answer rate si sube el riesgo de respuesta sin evidencia.
NO LO SOBREINTERPRETES

El modelo depende de supuestos de calibración, del juez y de los datasets KILT. Es un marco de evaluación, no una garantía de que una política concreta vaya a abstenerse correctamente fuera de esa distribución.

PROBLEMA
El éxito final de una respuesta no identifica la frontera entre evidencia disponible, decisión de abstenerse y capacidad de generación.
MÉTODO
The RAT construye un modelo bayesiano que separa éxito de recuperación, decisión de abstención, éxito de tarea y éxito del generador. Evalúa 27 configuraciones —tres retrievers, tres generadores y tres datasets— con 10.000 consultas por condición y un juez automatizado calibrado.
TIPO DE EVIDENCIA
La contribución verificable es la descomposición de la política: las anotaciones de retrieval success aportan más información sobre adherencia que observar únicamente task success, y la salida explícita I do not know permite separar cobertura de sobreconfianza.
LÍMITE
El modelo depende de supuestos de calibración, del juez y de los datasets KILT. Es un marco de evaluación, no una garantía de que una política concreta vaya a abstenerse correctamente fuera de esa distribución.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

The RAT construye un modelo bayesiano que separa éxito de recuperación, decisión de abstención, éxito de tarea y éxito del generador. Evalúa 27 configuraciones —tres retrievers, tres generadores y tres datasets— con 10.000 consultas por condición y un juez automatizado calibrado.

QUÉ APORTA

Da una gramática de evaluación para políticas de evidencia y permite comparar jueces, retrievers y generadores sin convertir la abstención en un fallo silencioso.

QUÉ NO PRUEBA

El modelo depende de supuestos de calibración, del juez y de los datasets KILT. Es un marco de evaluación, no una garantía de que una política concreta vaya a abstenerse correctamente fuera de esa distribución.

Cómo lo llevaría a un proyecto

Cambiar el score del evaluador interno a un vector con retrieval, abstención, tarea, generador y calibración; no aceptar un aumento de answer rate si sube el riesgo de respuesta sin evidencia.

evaluación de RAGpolíticas de abstenciónjueces LLMQA con incertidumbre

Preguntas que conviene probar

  • ¿Qué componente falla cuando una respuesta no tiene soporte?
  • ¿El juez detecta correctamente recuperación irrelevante y fuente contradictoria?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAUn benchmark de 160 preguntas con evidencia suficiente, insuficiente, contradictoria y no recuperable.
PREGUNTA¿Qué combinación de retrieval y abstención reduce respuestas sin soporte?
MÉTRICAPrecisión, cobertura, abstención correcta, respuestas sin soporte y calibración del juez.
PARADAParar si la cobertura sube a costa de un aumento significativo de respuestas sin evidencia o si la calibración empeora.

Mi lectura

Una métrica de respuesta sin una métrica de recuperación y abstención puede premiar la confianza mal colocada.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.