# Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas
- Fuente primaria: https://arxiv.org/abs/2606.11042
- Versión leída: v4
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Liya Zhu, Jingzhe Ding, Jian Zhang, Jianbo Xue, Shihao Liang, Ge Zhang, Yi Zhu, Duju Zeng, Xiang Gao, Qingshui Gu, Mailun Gao, Huimin Che, Yan Zhao, Peiheng Zhou, Haojun Wang, Chaobo Xian, Lili Le, Chi Wu, Yiwei Liu, Shengda Long, Jiale Yang, Fangzhi Xu, Sijin Wu, Haodong Duan, Chao He, Zhaojian Li, Minchao Wang, Huan Zhou, Jiani Hou, Chuqian Yu, Weiran Shi, Hongwan Gao, Jiamin Chen, Guanhong Chen, Tingqin Luo, Kaiyuan Zhang, Zhixin Yao, Qing Hua, Yuhao Jiang, Jin Chen, Pu Chen, Zhenyu Hu, Xingyu Li, Zhengxuan Jiang, Meng Cao, Tianfeng Long, Haozhe Wang, Mingzhang Wang, Yichen Zhang, Yiming Dai, Chenchen Zhang, Jiaying Wang, Xinying Liu, Xingzu Liu, Lingling Zhang, Xinjie Chen, Yujia Qin, Wangchunshu Zhou, Zhiyong Wu, Yang Liu, Jiaheng Liu, Lei Zhang, Shen Yan, Wenhao Huang, Zaiyuan Wang, Xiaolong Chang
- Fecha del corte: V1 9 JUNIO 2026; V3 11 JUNIO 2026.
- Área: AGENTES · EVALUACIÓN · CODING

## Tesis y contexto

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.

- Problema: Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
- Por qué importa: Es una brújula para saber cuándo los agentes estarán listos para ERP, CRM, gestión documental, legal ops, software industrial o backoffice.

## Evidencia reportada

- **reported-result**: As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively. [localizador](https://arxiv.org/html/2606.11042#S4)
- **reported-result**: In contrast, SOTA models report success rates exceeding 70% on benchmarks such as OS-World [ 20 ] . [localizador](https://arxiv.org/html/2606.11042#S4)
- **reported-result**: In particular, their ability to autonomously execute long-horizon, multi-step workflows in specialized software environments and complete tasks end-to-end at a human level still requires considerable improvement. [localizador](https://arxiv.org/html/2606.11042#S4)
- **reported-result**: Model Performance Degrades severely when Step Number Increases [localizador](https://arxiv.org/html/2606.11042#S4)

## Lectura y límite

- Método: La lectura de 2 Related Works describe la intervención y su construcción: Existing GUI benchmarks can be characterized along two complementary dimensions: interaction device and task scenario. From the device perspective, they include (1) PC-based benchmarks [ 20 , 1 ] and (2) mobile benchmarks [ 12 ] , which differ in interface structure and interaction paradigms. From the task perspective, they can be grouped into (a) general-purpose benchmarks that focus on daily common UI operations, and (b) domain-specific(or software-specific) benchmarks that target specialized applications requiring domain knowledge. For instance, AmbiBench [ 16 ] focuses on everyday user activities in mobile…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: In summary, rich visual demonstrations open a promising path toward stronger long-horizon GUI agents: video tutorials already lift current models to their best performance, yet the models exploit only a fraction of what these demonstrations offer. Closing this gap, through continued training on such trajectories and a more capable harness, is key to turning visual guidance into reliable end-to-end gains.
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2606.11042): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2606.11042): tipo abstract
- [Método · 2 Related Works](https://arxiv.org/html/2606.11042#S2): tipo section
- [Evaluación · 4 Experiments](https://arxiv.org/html/2606.11042#S4): tipo section
- [Cierre · 5 Analysis and Discussions](https://arxiv.org/html/2606.11042#S5): tipo section

## Próxima prueba

- ¿La propuesta mejora benchmarking interno de agentes frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)
- [developer contributions](https://github.com/brucemiller/LaTeXML/issues)

## Enlaces relacionados

- [VAKRA](https://luiseduardodemiguel.com/research-ia/markdown/papers/vakra)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)
- [SkillSentry](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillsentry)