/ OPEN QUESTION · Q-17-concept-agent-evaluation-as-product
¿Qué métrica separa una trayectoria que acierta de una decisión que se puede confiar?
La unidad de calidad ya no es sólo el modelo: incluye harness, fuentes, políticas, recuperación, coste y capacidad de abstenerse.
Qué está en juego
Parar si el score agregado oculta un fallo crítico de fuente o permiso.
Relaciones
- concept:concept:agent-evaluation-as-product
- paper:factoryllm-a-safe-and-open-source-ai-playground-for-evaluating-llms-in-s
- paper:claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses
- paper:mastrike-shapley-guided-collusive-red-teaming-on-multi-agent-systems
- paper:soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation
Qué aceptamos
La respuesta debe distinguir observación, fuente primaria, contradicción e inferencia. Una señal pendiente no cuenta como evidencia.
SOURCEANSWERCONTRADICTION
Cómo avanzar
Si tienes una aportación verificable, usa la interfaz pública. Quedará en cuarentena hasta revisión.
Ver reglas y enviar contribución ↗05CONTEXT / STABLE LINKS