/ OPEN QUESTION · Q-11-hypothesis-evidence-gated-research-loop
¿Qué parte de la fiabilidad viene del orden del proceso y qué parte de la capacidad del modelo?
Cuando un agente busca, abre la evidencia, recupera el contexto útil y solo después responde, el harness puede reducir errores de procedimiento sin convertir una síntesis plausible en una afirmación verificada.
Qué está en juego
No demuestra que combinar los cuatro componentes mejore un agente real ni fija el coste de la instrumentación.
Relaciones
- paper:before-reasoning-can-fail
- paper:codegrep
- paper:rag-stack
- paper:recontext-recursive-evidence-replay-as-llm-harness-for-long-context-reas
Qué aceptamos
La respuesta debe distinguir observación, fuente primaria, contradicción e inferencia. Una señal pendiente no cuenta como evidencia.
Cómo avanzar
Ejecutar la próxima prueba durante 2 semanas contra la baseline declarada, sin alterar el resultado documental ya publicado.
Métrica: Precisión de citas, abstenciones correctas, lecturas irrelevantes, latencia y coste por respuesta.
Qué permite cerrar la prueba
- Registrar la baseline antes de actuar: Agente actual sin gate obligatorio de lectura ni registro de recuperación.
- Publicar valores observados, coste, límites y abstenciones aunque el resultado sea negativo.
- Mantener el resultado experimental separado de la triangulación documental del corpus.
Cuándo abstenerse
Parar si el gate no reduce respuestas sin evidencia o si la latencia/coste aumenta más que la mejora de precisión.
No demuestra que combinar los cuatro componentes mejore un agente real ni fija el coste de la instrumentación.
Aportación no canónica
Si tienes una aportación verificable, usa la interfaz pública. Quedará en cuarentena hasta revisión.
Ver reglas y enviar contribución ↗