Lo esencial antes de invertir más tiempo.
Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.
Resultado reportado con fuente enlazada · 5 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
Qué está reportado y qué conviene comprobar.
As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.
30.67% · contexto: 4 Experiments
In contrast, SOTA models report success rates exceeding 70% on benchmarks such as OS-World [ 20 ] .
70% · contexto: 4 Experiments
In particular, their ability to autonomously execute long-horizon, multi-step workflows in specialized software environments and complete tasks end-to-end at a human level still requires considerable improvement.
contexto: 4 Experiments
Model Performance Degrades severely when Step Number Increases
contexto: 4 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
MÉTODO / La lectura de 2 Related Works describe la intervención y su construcción: Existing GUI benchmarks can be characterized along two complementary dimensions: interaction device and task scenario. From the device perspective, they include (1) PC-based benchmarks [ 20 , 1 ] and (2) mobile benchmarks [ 12 ] , which differ in interface structure and interaction paradigms. From the task perspective, they can be grouped into (a) general-purpose benchmarks that focus on daily common UI operations, and (b) domain-specific(or software-specific) benchmarks that target specialized applications requiring domain knowledge. For instance, AmbiBench [ 16 ] focuses on everyday user activities in mobile… [Fuente: https://arxiv.org/html/2606.11042#S2]
RESULTADO / La sección 4 Experiments informa: As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively. In contrast, SOTA models report success rates exceeding 70% on benchmarks such as OS-World [ 20 ] . In particular, their ability to autonomously execute long-horizon, multi-step workflows in specialized software environments and complete tasks end-to-end at a human level still requires considerable improvement. [Fuente: https://arxiv.org/html/2606.11042#S4]
LÍMITE / El cierre de la fuente señala: In summary, rich visual demonstrations open a promising path toward stronger long-horizon GUI agents: video tutorials already lift current models to their best performance, yet the models exploit only a fraction of what these demonstrations offer. Closing this gap, through continued training on such trajectories and a more capable harness, is key to turning visual guidance into reliable end-to-end gains. La transferencia a benchmarking interno de agentes requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2606.11042#S5].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- PROBLEMA
- Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
- MÉTODO
- La lectura de 2 Related Works describe la intervención y su construcción: Existing GUI benchmarks can be characterized along two complementary dimensions: interaction device and task scenario. From the device perspective, they include (1) PC-based benchmarks [ 20 , 1 ] and (2) mobile benchmarks [ 12 ] , which differ in interface structure and interaction paradigms. From the task perspective, they can be grouped into (a) general-purpose benchmarks that focus on daily common UI operations, and (b) domain-specific(or software-specific) benchmarks that target specialized applications requiring domain knowledge. For instance, AmbiBench [ 16 ] focuses on everyday user activities in mobile…
- TIPO DE EVIDENCIA
- La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11042#S4.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 2 Related Works describe la intervención y su construcción: Existing GUI benchmarks can be characterized along two complementary dimensions: interaction device and task scenario. From the device perspective, they include (1) PC-based benchmarks [ 20 , 1 ] and (2) mobile benchmarks [ 12 ] , which differ in interface structure and interaction paradigms. From the task perspective, they can be grouped into (a) general-purpose benchmarks that focus on daily common UI operations, and (b) domain-specific(or software-specific) benchmarks that target specialized applications requiring domain knowledge. For instance, AmbiBench [ 16 ] focuses on everyday user activities in mobile…
Es una brújula para saber cuándo los agentes estarán listos para ERP, CRM, gestión documental, legal ops, software industrial o backoffice.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en benchmarking interno de agentes reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando benchmarking interno de agentes cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si benchmarking interno de agentes puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.