¿Podemos refutar la idea de que escalar el modelo basta para hacer fiable un workflow real?
La fiabilidad puede fallar antes del razonamiento.
La intuición ‘un modelo más capaz resolverá el workflow’ confunde el techo de una capacidad con la fiabilidad del sistema que la envuelve. Una interfaz equivocada, una memoria que deriva, una herramienta irrelevante o una cadena demasiado larga pueden seguir rompiendo la tarea.
Esta ficha conserva una hipótesis negativa porque también es una herramienta de investigación: no intenta demostrar que escalar no sirve, sino refutar la versión fuerte en la que el modelo aislado basta para resolver workflows situados.
Qué aporta cada paper
Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.
- Workflow-GYMMuestra que las tareas profesionales largas mantienen una brecha de éxito aunque el modelo sea fuerte, porque los fallos se acumulan entre etapas.
- WorkSurface-BenchHace visible que una respuesta depende de elegir y combinar superficies de conocimiento, no sólo de razonar sobre un contexto ya preparado.
- AgentCompassSepara capacidades y condiciones de ejecución para evitar que una puntuación agregada oculte qué parte del sistema está fallando.
- Claw-SWE-BenchEvalúa el harness de un coding agent bajo un contrato de workspace, presupuesto y patch comparable, recordando que medir el agente requiere fijar el entorno.
- WebSwarmAporta un contraejemplo constructivo: la cobertura y la profundidad pueden organizarse mediante delegación y verificación, no sólo aumentando el modelo base.
- Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
- 01Workflow-GYM2026-06-08 · v4Fuente primaria ↗
Muestra que las tareas profesionales largas mantienen una brecha de éxito aunque el modelo sea fuerte, porque los fallos se acumulan entre etapas.
Problema que aborda. Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
Qué aporta. Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
Resultado reportado por la fuente. As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- 02WorkSurface-Bench2026-07-27 · v1Fuente primaria ↗
Hace visible que una respuesta depende de elegir y combinar superficies de conocimiento, no sólo de razonar sobre un contexto ya preparado.
Problema que aborda. Los benchmarks suelen medir recuperación una vez elegida la fuente correcta, pero en empresa el primer reto es decidir dónde debe buscarse cada respuesta.
Qué aporta. Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.
Resultado reportado por la fuente. Its data pipeline is hybrid: task scenarios and dependency graphs are human-authored and expert-validated against Lark/ByteDance workflows, while workspace files combine public web resources with grounded LLM-generated artifacts.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Benchmark Construction.
- 03AgentCompass2026-07-13 · v3Fuente primaria ↗
Separa capacidades y condiciones de ejecución para evitar que una puntuación agregada oculte qué parte del sistema está fallando.
Problema que aborda. Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.
Qué aporta. Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
Resultado reportado por la fuente. Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- 04Claw-SWE-Bench2026-06-08 · v1Fuente primaria ↗
Evalúa el harness de un coding agent bajo un contrato de workspace, presupuesto y patch comparable, recordando que medir el agente requiere fijar el entorno.
Problema que aborda. Los agentes generalistas no encajan bien en el contrato limpio de SWE-bench, lo que dificulta comparar su capacidad real de programar.
Qué aporta. Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.
Resultado reportado por la fuente. The highest resolved rate is achieved by GPT 5.5, at 78.0\% (273/350), followed by Claude Opus 4.7 at 77.1\% (270/350).
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Results.
- 05WebSwarm2026-07-06 · v1Fuente primaria ↗
Aporta un contraejemplo constructivo: la cobertura y la profundidad pueden organizarse mediante delegación y verificación, no sólo aumentando el modelo base.
Problema que aborda. Los search agents suelen sacrificar profundidad para ganar cobertura, o cobertura para mantener profundidad.
Qué aporta. Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.
Resultado reportado por la fuente. As shown in Table 1 , WebSwarm achieves the best or competitive results across four benchmarks, consistently outperforming both single-agent ReAct and multi-agent baselines.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experiment.
El puente es un orden de controles, no una suma de papers.
La refutación emerge por triangulación: Workflow-GYM pone el coste de la longitud; WorkSurface-Bench pone el coste de la elección de superficie; AgentCompass exige separar capacidades; Claw-SWE-Bench fija el contrato del harness; WebSwarm muestra que parte del rendimiento puede venir de la organización del proceso. La conclusión válida es ‘la capacidad ayuda pero no basta’, no ‘la capacidad no importa’.
Qué cambia si la dirección es correcta
- Diagnosticar el éxito por etapa y por tipo de fallo antes de comparar modelos como si fueran agentes intercambiables.
- Mantener interfaz, memoria, herramientas, presupuesto y política constantes cuando se quiera medir sólo el efecto del modelo.
- Tratar la mejora del harness como hipótesis experimentable: debe superar al baseline con el mismo trabajo, coste y condiciones de seguridad.
La versión fuerte de la hipótesis queda refutada por el corpus: las evaluaciones muestran que la capacidad no elimina por sí sola los fallos de workflow, interfaz, proactividad o harness. La versión débil —la capacidad ayuda— no queda refutada.
Que existen señales primarias independientes de fallo sistémico y de efecto de interfaz que contradicen la suficiencia del modelo aislado.
Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
Qué comprobé
Cómo intentaría confirmarla o hacerla caer.
Timebox: 4 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.
Lo que hice bien
Incluí una hipótesis negativa y distinguí la afirmación fuerte de su versión débil para no confundir 'no basta' con 'no sirve'.
Lo que hice mal o dejé corto
La refutación es conceptual y documental; todavía no es un experimento controlado de escalado en un workflow propio.
No compara modelos concretos en el mismo protocolo ni demuestra que la capacidad no sea necesaria para mejorar.