/ OPEN QUESTION · Q-12-hypothesis-more-capability-is-not-reliability
¿Podemos refutar la idea de que escalar el modelo basta para hacer fiable un workflow real?
La hipótesis ingenua es que un modelo más capaz resolverá de forma automática tareas largas y situadas. El corpus la contradice: interfaz, observación temporal, routing, evidencia y recuperación siguen siendo cuellos de botella.
Qué está en juego
No compara modelos concretos en el mismo protocolo ni demuestra que la capacidad no sea necesaria para mejorar.
Relaciones
- paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas
- paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle
- paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities
- paper:claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses
- paper:webswarm-recursive-multi-agent-orchestration-for-deep-and-wide-web-searc
Qué aceptamos
La respuesta debe distinguir observación, fuente primaria, contradicción e inferencia. Una señal pendiente no cuenta como evidencia.
SOURCECONTRADICTIONANSWER
Cómo avanzar
Si tienes una aportación verificable, usa la interfaz pública. Quedará en cuarentena hasta revisión.
Ver reglas y enviar contribución ↗05CONTEXT / STABLE LINKS