# ClueWeaver: Evidence-Guided Multi-Hop Question Answering with Self-Calibration
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/clueweaver
- Fuente primaria: https://arxiv.org/abs/2608.25531
- Versión leída: arXiv v2 · 27 agosto 2026
- Fuente comprobada: 2026-08-31 · lectura primaria completa; HTML primario verificado
- Autores: Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu y Jin B. Hong
- Fecha del corte: 27 AGO 2026 · v2
- Área: RAG · EVIDENCIA · TRAZABILIDAD

## Tesis y contexto

ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.

- Problema: Los sistemas multi-hop pueden acertar por atajo o producir una cita decorativa; el score final no garantiza que el camino sea reproducible.
- Por qué importa: Conecta calidad de respuesta con trazabilidad: 275 de 310 respuestas incluyeron citas y 685 de 690 identificadores fueron válidos en la evaluación reportada.

## Evidencia reportada

- **reported-result**: ClueWeaver obtiene 59,0% global frente a 52,6% de IRCoT y 44,5% de respuesta directa Qwen3-4B. [localizador](https://arxiv.org/html/2608.25531v2#S4.SS2)
- **reported-result**: El sistema recupera 84 de 172 errores en el análisis reportado. [localizador](https://arxiv.org/html/2608.25531v2#S4.SS3)
- **reported-result**: ClueWeaver produce citas en 275 de 310 respuestas y 685 de 690 identificadores de párrafo son válidos. [localizador](https://arxiv.org/html/2608.25531v2#S0.C.SS3)

## Lectura y límite

- Método: ClueWeaver separa un Finder que selecciona pistas de evidencia de un Interpreter que deriva la respuesta con citas a párrafos. Añade self-calibration para casos de alto riesgo y entrena con recompensas guiadas por pistas sobre 310 preguntas de varios benchmarks long-context.
- Límite: La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.
- Confianza editorial: Alta
- Limitación: La evaluación usa 310 preguntas y varios benchmarks long-context; la transferencia a investigación de dominio exige nuevas citas y fuentes.
- Limitación: La cita válida no implica necesariamente soporte semántico completo.
- Limitación: No se reporta abstención explícita tipo I do not know.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.25531): tipo abstract
- [Fuente primaria · resumen](https://arxiv.org/html/2608.25531v2): tipo abstract
- [Finder e Interpreter · §3](https://arxiv.org/html/2608.25531v2#S3): tipo section
- [Resultados principales · §4.2](https://arxiv.org/html/2608.25531v2#S4.SS2): tipo section
- [Ablaciones · §4.3](https://arxiv.org/html/2608.25531v2#S4.SS3): tipo section
- [Trazabilidad · apéndice C](https://arxiv.org/html/2608.25531v2#S0.C.SS3): tipo section
- [Código · GitHub](https://github.com/Ameame1/ClueWeaver): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.25531): tipo abstract

## Próxima prueba

- ¿La trayectoria de pistas mejora la precisión de claims sin convertir la cita en un adorno?
- Métrica: Exactitud de claim, precisión de soporte, IDs válidos, abstención correcta y latencia.
- Regla de parada: Parar si la validez de citas sube pero el soporte semántico no supera al baseline o si la latencia duplica el presupuesto.

## Recursos reproducibles
- [HTML · fuente primaria v2](https://arxiv.org/html/2608.25531v2)
- [Código · GitHub](https://github.com/Ameame1/ClueWeaver)

## Enlaces relacionados

- [The RAT](https://luiseduardodemiguel.com/research-ia/markdown/papers/the-rat)
- [MetaRAG](https://luiseduardodemiguel.com/research-ia/markdown/papers/metarag)
- [RAG-Stack](https://luiseduardodemiguel.com/research-ia/markdown/papers/rag-stack)