/ OPEN QUESTION · Q-15-hypothesis-more-capability-is-not-reliability
¿Podemos refutar la idea de que escalar el modelo basta para hacer fiable un workflow real?
La hipótesis ingenua es que un modelo más capaz resolverá de forma automática tareas largas y situadas. El corpus la contradice: interfaz, observación temporal, routing, evidencia y recuperación siguen siendo cuellos de botella.
Qué está en juego
No compara modelos concretos en el mismo protocolo ni demuestra que la capacidad no sea necesaria para mejorar.
Relaciones
- paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas
- paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle
- paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities
- paper:claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses
- paper:webswarm-recursive-multi-agent-orchestration-for-deep-and-wide-web-searc
Qué aceptamos
La respuesta debe distinguir observación, fuente primaria, contradicción e inferencia. Una señal pendiente no cuenta como evidencia.
Cómo avanzar
Ejecutar la próxima prueba durante 4 semanas contra la baseline declarada, sin alterar el resultado documental ya publicado.
Métrica: Éxito por etapa, recuperación, deriva de objetivo, coste, latencia y acciones no autorizadas.
Qué permite cerrar la prueba
- Registrar la baseline antes de actuar: Modelo pequeño y grande con la misma interfaz, memoria, política y presupuesto operativo.
- Publicar valores observados, coste, límites y abstenciones aunque el resultado sea negativo.
- Mantener el resultado experimental separado de la triangulación documental del corpus.
Cuándo abstenerse
Parar la tesis de 'solo escala' si los fallos dominantes siguen estando en interfaz, estado, evidencia o política.
No compara modelos concretos en el mismo protocolo ni demuestra que la capacidad no sea necesaria para mejorar.
Aportación no canónica
Si tienes una aportación verificable, usa la interfaz pública. Quedará en cuarentena hasta revisión.
Ver reglas y enviar contribución ↗