NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 04

RAG · INFRAESTRUCTURA · EFICIENCIA

RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

ImprescindibleLectura primaria completa

Un RAG de producción no se elige por accuracy aislada: se elige en una frontera de calidad, coste, hardware y latencia.

AUTHORS / LABHaiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang y Wenqi Jiang
FECHA04 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.

EVIDENCIA DISPONIBLE

Las fronteras Pareto cubren entre 52,5% y 153,2% más del espacio normalizado calidad-rendimiento que los métodos comparados con el mismo presupuesto.

Resultado reportado con fuente enlazada · 4 localizadores disponibles.
LÍMITE

La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no elimina la necesidad de validar las configuraciones candidatas con tráfico y datos representativos.

SIGUIENTE PRUEBA

Cobertura Pareto, nDCG, faithfulness de la respuesta, latencia p95 y coste por consulta.

EN UNA FRASE

RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.

SEÑALRAG · Infraestructura · Pareto
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Las fronteras Pareto cubren entre 52,5% y 153,2% más del espacio normalizado calidad-rendimiento que los métodos comparados con el mismo presupuesto.

+52,5% a +153,2% de espacio calidad-rendimiento · contexto: Distintos datasets y presupuesto igual de iteraciones

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

RAG-Stack parte de que un sistema RAG moderno no tiene una sola perilla. Se puede cambiar el índice, el modelo, la política de retrieval, el modo de invocación y el hardware; cada combinación genera una relación distinta entre calidad de respuesta y rendimiento de serving.

La propuesta une una búsqueda iterativa de configuraciones con una abstracción de workloads y un modelo de rendimiento. La idea es no desplegar y medir cada candidato de forma exhaustiva, sino elegir qué configuración merece la siguiente evaluación y transferir una frontera Pareto cuando cambia el sistema de serving.

El resultado reportado es una cobertura entre 52,5% y 153,2% mayor del espacio normalizado calidad-rendimiento frente a métodos de búsqueda comparados con el mismo número de iteraciones. Eso no significa que toda aplicación RAG gane esa proporción en accuracy; significa que la búsqueda encontró más combinaciones competitivas en el espacio conjunto.

La consecuencia práctica es tratar RAG como una disciplina de sistemas. Antes de cambiar de modelo conviene especificar calidad mínima, p95, coste y throughput, y medir sobre un workload realista. La frontera Pareto es una ayuda para decidir, no una garantía de que la configuración elegida conserve sus propiedades bajo tráfico, datos o hardware nuevos.

DECISIÓN RÁPIDADefinir una frontera propia con calidad mínima, p95 de latencia, coste por respuesta y throughput, y comparar configuraciones RAG bajo el mismo presupuesto de evaluación.
NO LO SOBREINTERPRETES

La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no elimina la necesidad de validar las configuraciones candidatas con tráfico y datos representativos.

PROBLEMA
Índice, modelo, estrategia de retrieval, hardware y serving producen trade-offs distintos; comparar solo la respuesta final oculta el coste de operar el sistema.
MÉTODO
Combina RAG-PE para explorar iterativamente configuraciones, RAG-IR para abstraer workloads y RAG-CM para modelar rendimiento en el hardware de serving.
TIPO DE EVIDENCIA
En distintos datasets, las fronteras Pareto encontradas cubren entre 52,5% y 153,2% más del espacio normalizado calidad-rendimiento que métodos de búsqueda comparados con el mismo presupuesto de iteraciones.
LÍMITE
La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no elimina la necesidad de validar las configuraciones candidatas con tráfico y datos representativos.
FIGURA DE LECTURA / SISTEMA RAGCalidad ↔ coste ↔ latencia
Abrir paper original ↗

La configuración útil vive en una frontera Pareto, no en una única métrica.

DISEÑARÍndice y modelo
SERVIRHardware y throughput
ELEGIRFrontera aceptable
PARA RECORDAR

La mejor configuración es la que cumple el mínimo de calidad dentro del presupuesto real.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / En distintos datasets, las fronteras Pareto encontradas cubren entre 52,5% y 153,2% más del espacio normalizado calidad-rendimiento que métodos de búsqueda comparados con el mismo presupuesto de iteraciones.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Combina RAG-PE para explorar iterativamente configuraciones, RAG-IR para abstraer workloads y RAG-CM para modelar rendimiento en el hardware de serving.

QUÉ APORTA

La pregunta empresarial madura es qué configuración alcanza la calidad mínima al coste y latencia aceptables, no cuál obtiene el mejor número en un benchmark aislado.

QUÉ NO PRUEBA

La frontera depende de la función de calidad, el workload y el hardware; una predicción de serving no elimina la necesidad de validar las configuraciones candidatas con tráfico y datos representativos.

Cómo lo llevaría a un proyecto

Definir una frontera propia con calidad mínima, p95 de latencia, coste por respuesta y throughput, y comparar configuraciones RAG bajo el mismo presupuesto de evaluación.

Diseño de RAGCapacity planningSelección de modelosOptimización de servingReducción de coste

Preguntas que conviene probar

  • ¿Qué calidad mínima hace aceptable una configuración en producción?
  • ¿Qué parte de la frontera cambia cuando cambia el hardware o la mezcla de consultas?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADATres corpus con distinta frescura y dos presupuestos, comparando las fronteras propuestas con dos métodos fijos.
PREGUNTA¿La búsqueda de configuraciones Pareto conserva calidad de respuesta y coste cuando cambia el corpus y el presupuesto de iteración?
MÉTRICACobertura Pareto, nDCG, faithfulness de la respuesta, latencia p95 y coste por consulta.
PARADAParar si la cobertura no mejora 10% o si la latencia p95 crece más de 20% a calidad comparable.

Mi lectura

La arquitectura útil no es la más precisa en abstracto; es la que mantiene una calidad suficiente cuando el sistema entra en el mundo real.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.