NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 01

AGENTES · EVALUACIÓN · CODING

Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields

ImprescindibleLectura primaria completa

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor.

AUTHORS / LABLiya Zhu, Jingzhe Ding, Jian Zhang, Jianbo Xue, Shihao Liang, Ge Zhang, Yi Zhu, Duju Zeng, Xiang Gao, Qingshui Gu, Mailun Gao, Huimin Che, Yan Zhao, Peiheng Zhou, Haojun Wang, Chaobo Xian, Lili Le, Chi Wu, Yiwei Liu, Shengda Long, Jiale Yang, Fangzhi Xu, Sijin Wu, Haodong Duan, Chao He, Zhaojian Li, Minchao Wang, Huan Zhou, Jiani Hou, Chuqian Yu, Weiran Shi, Hongwan Gao, Jiamin Chen, Guanhong Chen, Tingqin Luo, Kaiyuan Zhang, Zhixin Yao, Qing Hua, Yuhao Jiang, Jin Chen, Pu Chen, Zhenyu Hu, Xingyu Li, Zhengxuan Jiang, Meng Cao, Tianfeng Long, Haozhe Wang, Mingzhang Wang, Yichen Zhang, Yiming Dai, Chenchen Zhang, Jiaying Wang, Xinying Liu, Xingzu Liu, Lingling Zhang, Xinjie Chen, Yujia Qin, Wangchunshu Zhou, Zhiyong Wu, Yang Liu, Jiaheng Liu, Lei Zhang, Shen Yan, Wenhao Huang, Zaiyuan Wang, Xiaolong Chang
FECHAV1 9 JUNIO 2026; V3 11 JUNIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.

EVIDENCIA DISPONIBLE

As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.

Resultado reportado con fuente enlazada · 5 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.

SEÑALSaaS B2B · legal
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.

30.67% · contexto: 4 Experiments

RESULTADO REPORTADO

In contrast, SOTA models report success rates exceeding 70% on benchmarks such as OS-World [ 20 ] .

70% · contexto: 4 Experiments

RESULTADO REPORTADO

In particular, their ability to autonomously execute long-horizon, multi-step workflows in specialized software environments and complete tasks end-to-end at a human level still requires considerable improvement.

contexto: 4 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.

MÉTODO / La lectura de 2 Related Works describe la intervención y su construcción: Existing GUI benchmarks can be characterized along two complementary dimensions: interaction device and task scenario. From the device perspective, they include (1) PC-based benchmarks [ 20 , 1 ] and (2) mobile benchmarks [ 12 ] , which differ in interface structure and interaction paradigms. From the task perspective, they can be grouped into (a) general-purpose benchmarks that focus on daily common UI operations, and (b) domain-specific(or software-specific) benchmarks that target specialized applications requiring domain knowledge. For instance, AmbiBench [ 16 ] focuses on everyday user activities in mobile… [Fuente: https://arxiv.org/html/2606.11042#S2]

RESULTADO / La sección 4 Experiments informa: As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively. In contrast, SOTA models report success rates exceeding 70% on benchmarks such as OS-World [ 20 ] . In particular, their ability to autonomously execute long-horizon, multi-step workflows in specialized software environments and complete tasks end-to-end at a human level still requires considerable improvement. [Fuente: https://arxiv.org/html/2606.11042#S4]

LÍMITE / El cierre de la fuente señala: In summary, rich visual demonstrations open a promising path toward stronger long-horizon GUI agents: video tutorials already lift current models to their best performance, yet the models exploit only a fraction of what these demonstrations offer. Closing this gap, through continued training on such trajectories and a more capable harness, is key to turning visual guidance into reliable end-to-end gains. La transferencia a benchmarking interno de agentes requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2606.11042#S5].

DECISIÓN RÁPIDAProbar la propuesta en benchmarking interno de agentes reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

PROBLEMA
Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
MÉTODO
La lectura de 2 Related Works describe la intervención y su construcción: Existing GUI benchmarks can be characterized along two complementary dimensions: interaction device and task scenario. From the device perspective, they include (1) PC-based benchmarks [ 20 , 1 ] and (2) mobile benchmarks [ 12 ] , which differ in interface structure and interaction paradigms. From the task perspective, they can be grouped into (a) general-purpose benchmarks that focus on daily common UI operations, and (b) domain-specific(or software-specific) benchmarks that target specialized applications requiring domain knowledge. For instance, AmbiBench [ 16 ] focuses on everyday user activities in mobile…
TIPO DE EVIDENCIA
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11042#S4.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 2 Related Works describe la intervención y su construcción: Existing GUI benchmarks can be characterized along two complementary dimensions: interaction device and task scenario. From the device perspective, they include (1) PC-based benchmarks [ 20 , 1 ] and (2) mobile benchmarks [ 12 ] , which differ in interface structure and interaction paradigms. From the task perspective, they can be grouped into (a) general-purpose benchmarks that focus on daily common UI operations, and (b) domain-specific(or software-specific) benchmarks that target specialized applications requiring domain knowledge. For instance, AmbiBench [ 16 ] focuses on everyday user activities in mobile…

QUÉ APORTA

Es una brújula para saber cuándo los agentes estarán listos para ERP, CRM, gestión documental, legal ops, software industrial o backoffice.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en benchmarking interno de agentes reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

benchmarking interno de agentesvalidación de automatizacionesdiseño de copilotos de oficinapruebas de UX agentic.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando benchmarking interno de agentes cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAbenchmarking interno de agentes con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora benchmarking interno de agentes frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si benchmarking interno de agentes puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.