# RAG-Stack: Co-Optimizing RAG Serving Performance and Quality
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/rag-stack
- Fuente primaria: https://arxiv.org/abs/2608.03487
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Haiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang y Wenqi Jiang
- Fecha del corte: 04 AGO 2026
- Área: RAG · INFRAESTRUCTURA · EFICIENCIA

## Tesis y contexto

RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.

- Problema: Índice, modelo, estrategia de retrieval, hardware y serving producen trade-offs distintos; comparar solo la respuesta final oculta el coste de operar el sistema.
- Por qué importa: La pregunta empresarial madura es qué configuración alcanza la calidad mínima al coste y latencia aceptables, no cuál obtiene el mejor número en un benchmark aislado.

## Evidencia reportada

- **reported-result**: Las fronteras Pareto cubren entre 52,5% y 153,2% más del espacio normalizado calidad-rendimiento que los métodos comparados con el mismo presupuesto. [localizador](https://arxiv.org/html/2608.03487v1#S4)

## Lectura y límite

- Método: Combina RAG-PE para explorar iterativamente configuraciones, RAG-IR para abstraer workloads y RAG-CM para modelar rendimiento en el hardware de serving.
- Límite: La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no elimina la necesidad de validar las configuraciones candidatas con tráfico y datos representativos.
- Confianza editorial: Alta
- Limitación: El área Pareto depende de la normalización, el presupuesto y los datasets; una frontera mayor no garantiza mejores respuestas, evidencia o coste en producción.
- Limitación: La comparación no sustituye una auditoría de latencia, frescura, faithfulness y operación de índices con documentos corporativos cambiantes.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.03487): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.03487v1): tipo abstract
- [Resultados y frontera Pareto · §4](https://arxiv.org/html/2608.03487v1#S4): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.03487): tipo abstract

## Próxima prueba

- ¿La búsqueda de configuraciones Pareto conserva calidad de respuesta y coste cuando cambia el corpus y el presupuesto de iteración?
- Métrica: Cobertura Pareto, nDCG, faithfulness de la respuesta, latencia p95 y coste por consulta.
- Regla de parada: Parar si la cobertura no mejora 10% o si la latencia p95 crece más de 20% a calidad comparable.

## Recursos reproducibles
- [HTML · fuente navegable](https://arxiv.org/html/2608.03487v1)

## Enlaces relacionados

- [SAG](https://luiseduardodemiguel.com/research-ia/markdown/papers/sag)
- [TTT-Embed](https://luiseduardodemiguel.com/research-ia/markdown/papers/ttt-embed)
- [Diagnosis Before Recovery](https://luiseduardodemiguel.com/research-ia/markdown/papers/diagnosis-before-recovery)