# The RAT: A Bayesian Model of Retrieval, Abstention, and Task Success
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/the-rat
- Fuente primaria: https://arxiv.org/abs/2608.24753
- Versión leída: arXiv v1 · 25 agosto 2026
- Fuente comprobada: 2026-08-31 · lectura primaria completa; HTML primario verificado
- Autores: Pius von Däniken, Felix Matthias Saaro, Mark Cieliebak y Jan Milan Deriu
- Fecha del corte: 25 AGO 2026 · v1
- Área: RAG · ABSTENCIÓN · EVALUACIÓN

## Tesis y contexto

The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.

- Problema: El éxito final de una respuesta no identifica la frontera entre evidencia disponible, decisión de abstenerse y capacidad de generación.
- Por qué importa: Da una gramática de evaluación para políticas de evidencia y permite comparar jueces, retrievers y generadores sin convertir la abstención en un fallo silencioso.

## Evidencia reportada

- **reported-result**: El protocolo cubre 27 configuraciones de tres retrievers, tres generadores y tres datasets, con 10.000 consultas por configuración. [localizador](https://arxiv.org/html/2608.24753v1#S5.SS3)
- **reported-result**: El modelo separa retrieval success, abstention, task success y generator success para explicar el resultado final. [localizador](https://arxiv.org/html/2608.24753v1#S3)
- **reported-result**: Las anotaciones de recuperación son más informativas para la adherencia de la política que las anotaciones de task success aisladas. [localizador](https://arxiv.org/html/2608.24753v1#S5.SS2)

## Lectura y límite

- Método: The RAT construye un modelo bayesiano que separa éxito de recuperación, decisión de abstención, éxito de tarea y éxito del generador. Evalúa 27 configuraciones —tres retrievers, tres generadores y tres datasets— con 10.000 consultas por condición y un juez automatizado calibrado.
- Límite: El modelo depende de supuestos de calibración, del juez y de los datasets KILT. Es un marco de evaluación, no una garantía de que una política concreta vaya a abstenerse correctamente fuera de esa distribución.
- Confianza editorial: Alta
- Limitación: La evaluación está ligada a datasets KILT, retrievers, generadores y un juez concretos.
- Limitación: Las probabilidades del modelo son útiles para diagnóstico, pero no constituyen una garantía fuera del snapshot calibrado.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.24753): tipo abstract
- [Fuente primaria · resumen](https://arxiv.org/html/2608.24753v1): tipo abstract
- [Modelo bayesiano · §3](https://arxiv.org/html/2608.24753v1#S3): tipo section
- [Marginales · §5.1](https://arxiv.org/html/2608.24753v1#S5.SS1): tipo section
- [Condicionales · §5.2](https://arxiv.org/html/2608.24753v1#S5.SS2): tipo section
- [Asignación de muestras · §5.3](https://arxiv.org/html/2608.24753v1#S5.SS3): tipo section
- [Juez automatizado · §5.4](https://arxiv.org/html/2608.24753v1#S5.SS4): tipo section
- [Tabla 1 · resultados](https://arxiv.org/html/2608.24753v1#S5.T1): tipo table
- [HTML · fuente navegable](https://arxiv.org/html/2608.24753): tipo abstract

## Próxima prueba

- ¿Qué combinación de retrieval y abstención reduce respuestas sin soporte?
- Métrica: Precisión, cobertura, abstención correcta, respuestas sin soporte y calibración del juez.
- Regla de parada: Parar si la cobertura sube a costa de un aumento significativo de respuestas sin evidencia o si la calibración empeora.

## Recursos reproducibles
- [HTML · fuente primaria v1](https://arxiv.org/html/2608.24753v1)
- [Código · GitHub](https://github.com/vodezhaw/rat)

## Enlaces relacionados

- [MetaRAG](https://luiseduardodemiguel.com/research-ia/markdown/papers/metarag)
- [ClueWeaver](https://luiseduardodemiguel.com/research-ia/markdown/papers/clueweaver)
- [Before Reasoning Can Fail](https://luiseduardodemiguel.com/research-ia/markdown/papers/before-reasoning-can-fail)