NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 07

RAG · EVIDENCIA · TRAZABILIDAD

ClueWeaver: Evidence-Guided Multi-Hop Question Answering with Self-Calibration

ImprescindibleLectura primaria completa

Una respuesta multi-hop es más auditable cuando el agente conserva las pistas que eligió y puede señalar el párrafo que sostiene cada salto.

AUTHORS / LABJihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu y Jin B. Hong
FECHA27 AGO 2026 · v2
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.

EVIDENCIA DISPONIBLE

ClueWeaver obtiene 59,0% global frente a 52,6% de IRCoT y 44,5% de respuesta directa Qwen3-4B.

Resultado reportado con fuente enlazada · 8 localizadores disponibles.
LÍMITE

La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.

SIGUIENTE PRUEBA

Exactitud de claim, precisión de soporte, IDs válidos, abstención correcta y latencia.

EN UNA FRASE

ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.

SEÑALevidence selection · paragraph citations · self-calibration
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

ClueWeaver obtiene 59,0% global frente a 52,6% de IRCoT y 44,5% de respuesta directa Qwen3-4B.

59,0% vs 52,6% vs 44,5% · baseline: IRCoT y respuesta directa · contexto: 310 preguntas multi-hop

RESULTADO REPORTADO

El sistema recupera 84 de 172 errores en el análisis reportado.

84/172 errores · baseline: Errores del sistema base · contexto: Error analysis

RESULTADO REPORTADO

ClueWeaver produce citas en 275 de 310 respuestas y 685 de 690 identificadores de párrafo son válidos.

275/310 citas · 685/690 IDs válidos · baseline: No aplica; control de trazabilidad · contexto: Citación por párrafo

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PREGUNTA / ClueWeaver intenta que la respuesta multi-hop conserve una trayectoria de evidencia que pueda auditarse después.

MÉTODO / El Finder selecciona pistas y el Interpreter compone la respuesta; la señal de riesgo activa autocontrol y la recompensa prioriza evidencia y citas.

RESULTADO / La fuente reporta 59,0% global frente a 52,6% de IRCoT y 44,5% de respuesta directa; recupera 84 de 172 errores y valida 685 de 690 identificadores de párrafo.

LÍMITE / El sistema añade latencia —8,6–9,8 s frente a 2,8 s directo— y no incluye I do not know. Cita válida y claim verdadero deben medirse por separado.

DECISIÓN RÁPIDAExigir que cada claim operativo conserve la pista seleccionada, el párrafo que lo sostiene y un resultado de abstención cuando no exista evidencia suficiente.
NO LO SOBREINTERPRETES

La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.

PROBLEMA
Los sistemas multi-hop pueden acertar por atajo o producir una cita decorativa; el score final no garantiza que el camino sea reproducible.
MÉTODO
ClueWeaver separa un Finder que selecciona pistas de evidencia de un Interpreter que deriva la respuesta con citas a párrafos. Añade self-calibration para casos de alto riesgo y entrena con recompensas guiadas por pistas sobre 310 preguntas de varios benchmarks long-context.
TIPO DE EVIDENCIA
El resultado global reportado es 59,0%, frente a 52,6% para IRCoT y 44,5% para respuesta directa de Qwen3-4B. El sistema recupera 84 de 172 errores anotados; produce citas en 275/310 casos y 685/690 IDs son válidos.
LÍMITE
La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

ClueWeaver separa un Finder que selecciona pistas de evidencia de un Interpreter que deriva la respuesta con citas a párrafos. Añade self-calibration para casos de alto riesgo y entrena con recompensas guiadas por pistas sobre 310 preguntas de varios benchmarks long-context.

QUÉ APORTA

Conecta calidad de respuesta con trazabilidad: 275 de 310 respuestas incluyeron citas y 685 de 690 identificadores fueron válidos en la evaluación reportada.

QUÉ NO PRUEBA

La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.

Cómo lo llevaría a un proyecto

Exigir que cada claim operativo conserve la pista seleccionada, el párrafo que lo sostiene y un resultado de abstención cuando no exista evidencia suficiente.

investigación asistidaQA documentaldue diligenceagentes con citas

Preguntas que conviene probar

  • ¿La cita sostiene el claim o sólo aparece en el mismo documento?
  • ¿Qué coste adicional tiene construir y validar la trayectoria de pistas?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA80 preguntas de dominio con anotación de soporte de claim, distractores y fuentes contradictorias.
PREGUNTA¿La trayectoria de pistas mejora la precisión de claims sin convertir la cita en un adorno?
MÉTRICAExactitud de claim, precisión de soporte, IDs válidos, abstención correcta y latencia.
PARADAParar si la validez de citas sube pero el soporte semántico no supera al baseline o si la latencia duplica el presupuesto.

Mi lectura

La cita útil es una parte de la trayectoria, no un adorno añadido después de generar la respuesta.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.