Lo esencial antes de invertir más tiempo.
ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.
ClueWeaver obtiene 59,0% global frente a 52,6% de IRCoT y 44,5% de respuesta directa Qwen3-4B.
Resultado reportado con fuente enlazada · 8 localizadores disponibles.La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.
Exactitud de claim, precisión de soporte, IDs válidos, abstención correcta y latencia.
ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.
Qué está reportado y qué conviene comprobar.
ClueWeaver obtiene 59,0% global frente a 52,6% de IRCoT y 44,5% de respuesta directa Qwen3-4B.
59,0% vs 52,6% vs 44,5% · baseline: IRCoT y respuesta directa · contexto: 310 preguntas multi-hop
El sistema recupera 84 de 172 errores en el análisis reportado.
84/172 errores · baseline: Errores del sistema base · contexto: Error analysis
ClueWeaver produce citas en 275 de 310 respuestas y 685 de 690 identificadores de párrafo son válidos.
275/310 citas · 685/690 IDs válidos · baseline: No aplica; control de trazabilidad · contexto: Citación por párrafo
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PREGUNTA / ClueWeaver intenta que la respuesta multi-hop conserve una trayectoria de evidencia que pueda auditarse después.
MÉTODO / El Finder selecciona pistas y el Interpreter compone la respuesta; la señal de riesgo activa autocontrol y la recompensa prioriza evidencia y citas.
RESULTADO / La fuente reporta 59,0% global frente a 52,6% de IRCoT y 44,5% de respuesta directa; recupera 84 de 172 errores y valida 685 de 690 identificadores de párrafo.
LÍMITE / El sistema añade latencia —8,6–9,8 s frente a 2,8 s directo— y no incluye I do not know. Cita válida y claim verdadero deben medirse por separado.
La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.
- PROBLEMA
- Los sistemas multi-hop pueden acertar por atajo o producir una cita decorativa; el score final no garantiza que el camino sea reproducible.
- MÉTODO
- ClueWeaver separa un Finder que selecciona pistas de evidencia de un Interpreter que deriva la respuesta con citas a párrafos. Añade self-calibration para casos de alto riesgo y entrena con recompensas guiadas por pistas sobre 310 preguntas de varios benchmarks long-context.
- TIPO DE EVIDENCIA
- El resultado global reportado es 59,0%, frente a 52,6% para IRCoT y 44,5% para respuesta directa de Qwen3-4B. El sistema recupera 84 de 172 errores anotados; produce citas en 275/310 casos y 685/690 IDs son válidos.
- LÍMITE
- La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
ClueWeaver separa un Finder que selecciona pistas de evidencia de un Interpreter que deriva la respuesta con citas a párrafos. Añade self-calibration para casos de alto riesgo y entrena con recompensas guiadas por pistas sobre 310 preguntas de varios benchmarks long-context.
Conecta calidad de respuesta con trazabilidad: 275 de 310 respuestas incluyeron citas y 685 de 690 identificadores fueron válidos en la evaluación reportada.
La autoccalibración anotada reduce el score de 55,8% a 51,0% en la comparación descrita y el sistema no tiene un modo I do not know. Las citas válidas tampoco prueban por sí solas que cada claim esté justificado.
Cómo lo llevaría a un proyecto
Exigir que cada claim operativo conserve la pista seleccionada, el párrafo que lo sostiene y un resultado de abstención cuando no exista evidencia suficiente.
Preguntas que conviene probar
- ¿La cita sostiene el claim o sólo aparece en el mismo documento?
- ¿Qué coste adicional tiene construir y validar la trayectoria de pistas?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La cita útil es una parte de la trayectoria, no un adorno añadido después de generar la respuesta.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.