# Más capacidad del modelo no garantiza fiabilidad de workflow largo
> Hipótesis editorial multi-paper. Resultado del test: refuted-by-corpus.

- Página: https://luiseduardodemiguel.com/research-ia/hypotheses/more-capability-is-not-reliability
- Test: research-hypotheses:corpus-triangulation:v1
- Fecha de comprobación: 2026-08-19
- Combinación: Workflow-GYM + WorkSurface-Bench + AgentCompass + Claw-SWE-Bench + WebSwarm

## Hipótesis

La hipótesis ingenua es que un modelo más capaz resolverá de forma automática tareas largas y situadas. El corpus la contradice: interfaz, observación temporal, routing, evidencia y recuperación siguen siendo cuellos de botella.

Pregunta: ¿Podemos refutar la idea de que escalar el modelo basta para hacer fiable un workflow real?

## Problema y contexto

La intuición ‘un modelo más capaz resolverá el workflow’ confunde el techo de una capacidad con la fiabilidad del sistema que la envuelve. Una interfaz equivocada, una memoria que deriva, una herramienta irrelevante o una cadena demasiado larga pueden seguir rompiendo la tarea.

Esta ficha conserva una hipótesis negativa porque también es una herramienta de investigación: no intenta demostrar que escalar no sirve, sino refutar la versión fuerte en la que el modelo aislado basta para resolver workflows situados.

## Qué aporta cada paper

### Workflow-GYM — Muestra que las tareas profesionales largas mantienen una brecha de éxito aunque el modelo sea fuerte, porque los fallos se acumulan entre etapas.

- Problema que aborda: Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
- Qué aporta: Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
- Resultado reportado por la fuente: As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas
- Fuente primaria (v4): https://arxiv.org/html/2606.11042#S2

### WorkSurface-Bench — Hace visible que una respuesta depende de elegir y combinar superficies de conocimiento, no sólo de razonar sobre un contexto ya preparado.

- Problema que aborda: Los benchmarks suelen medir recuperación una vez elegida la fuente correcta, pero en empresa el primer reto es decidir dónde debe buscarse cada respuesta.
- Qué aporta: Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.
- Resultado reportado por la fuente: Its data pipeline is hybrid: task scenarios and dependency graphs are human-authored and expert-validated against Lark/ByteDance workflows, while workspace files combine public web resources with grounded LLM-generated artifacts.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Benchmark Construction.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle
- Fuente primaria (v1): https://arxiv.org/html/2607.25765#S4

### AgentCompass — Separa capacidades y condiciones de ejecución para evitar que una puntuación agregada oculte qué parte del sistema está fallando.

- Problema que aborda: Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.
- Qué aporta: Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
- Resultado reportado por la fuente: Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities
- Fuente primaria (v3): https://arxiv.org/html/2607.13705#S3

### Claw-SWE-Bench — Evalúa el harness de un coding agent bajo un contrato de workspace, presupuesto y patch comparable, recordando que medir el agente requiere fijar el entorno.

- Problema que aborda: Los agentes generalistas no encajan bien en el contrato limpio de SWE-bench, lo que dificulta comparar su capacidad real de programar.
- Qué aporta: Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.
- Resultado reportado por la fuente: The highest resolved rate is achieved by GPT 5.5, at 78.0\% (273/350), followed by Claude Opus 4.7 at 77.1\% (270/350).
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Results.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses
- Fuente primaria (v1): https://arxiv.org/html/2606.12344#S2

### WebSwarm — Aporta un contraejemplo constructivo: la cobertura y la profundidad pueden organizarse mediante delegación y verificación, no sólo aumentando el modelo base.

- Problema que aborda: Los search agents suelen sacrificar profundidad para ganar cobertura, o cobertura para mantener profundidad.
- Qué aporta: Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.
- Resultado reportado por la fuente: As shown in Table 1 , WebSwarm achieves the best or competitive results across four benchmarks, consistently outperforming both single-agent ReAct and multi-agent baselines.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experiment.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/webswarm-recursive-multi-agent-orchestration-for-deep-and-wide-web-searc
- Fuente primaria (v1): https://arxiv.org/html/2607.08662#Sx3

## Puente de síntesis

La refutación emerge por triangulación: Workflow-GYM pone el coste de la longitud; WorkSurface-Bench pone el coste de la elección de superficie; AgentCompass exige separar capacidades; Claw-SWE-Bench fija el contrato del harness; WebSwarm muestra que parte del rendimiento puede venir de la organización del proceso. La conclusión válida es ‘la capacidad ayuda pero no basta’, no ‘la capacidad no importa’.

## Implicaciones si la dirección es correcta

- Diagnosticar el éxito por etapa y por tipo de fallo antes de comparar modelos como si fueran agentes intercambiables.
- Mantener interfaz, memoria, herramientas, presupuesto y política constantes cuando se quiera medir sólo el efecto del modelo.
- Tratar la mejora del harness como hipótesis experimentable: debe superar al baseline con el mismo trabajo, coste y condiciones de seguridad.

## Resultado y límites

La versión fuerte de la hipótesis queda refutada por el corpus: las evaluaciones muestran que la capacidad no elimina por sí sola los fallos de workflow, interfaz, proactividad o harness. La versión débil —la capacidad ayuda— no queda refutada.

Que existen señales primarias independientes de fallo sistémico y de efecto de interfaz que contradicen la suficiencia del modelo aislado.

Límite: Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
No demuestra: No compara modelos concretos en el mismo protocolo ni demuestra que la capacidad no sea necesaria para mejorar.

## Próxima prueba

- Entrada: Un workflow largo con estados persistentes, varias herramientas, eventos externos y una tarea de recuperación tras error.
- Baseline: Modelo pequeño y grande con la misma interfaz, memoria, política y presupuesto operativo.
- Métrica: Éxito por etapa, recuperación, deriva de objetivo, coste, latencia y acciones no autorizadas.
- Regla de parada: Parar la tesis de 'solo escala' si los fallos dominantes siguen estando en interfaz, estado, evidencia o política.
- Timebox: 4 semanas

## Papers

- [Workflow-GYM](https://luiseduardodemiguel.com/research-ia/markdown/papers/workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas): https://arxiv.org/abs/2606.11042
- [WorkSurface-Bench](https://luiseduardodemiguel.com/research-ia/markdown/papers/worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle): https://arxiv.org/abs/2607.25765
- [AgentCompass](https://luiseduardodemiguel.com/research-ia/markdown/papers/agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities): https://arxiv.org/html/2607.13705v3
- [Claw-SWE-Bench](https://luiseduardodemiguel.com/research-ia/markdown/papers/claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses): https://arxiv.org/abs/2606.12344
- [WebSwarm](https://luiseduardodemiguel.com/research-ia/markdown/papers/webswarm-recursive-multi-agent-orchestration-for-deep-and-wide-web-searc): https://arxiv.org/html/2607.08662v1