# AnTrap: A Comprehensive Benchmark for Anomaly Traps in GUI Agents
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/antrap
- Fuente primaria: https://arxiv.org/abs/2608.24099
- Versión leída: arXiv v1 · 25 agosto 2026
- Fuente comprobada: 2026-08-31 · lectura primaria completa; HTML primario verificado
- Autores: Guo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song, Zheyuan Yang, Lin Fu y colaboradores
- Fecha del corte: 25 AGO 2026 · v1
- Área: AGENTES · GUI · SEGURIDAD

## Tesis y contexto

AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.

- Problema: Los benchmarks de GUI suelen medir éxito limpio, no la degradación cuando aparecen elementos engañosos, cambios de estado o instrucciones que compiten con el objetivo.
- Por qué importa: Convierte la robustez ante anomalías en una métrica separada del éxito nominal, algo necesario antes de confiar en agentes que actúan sobre interfaces.

## Evidencia reportada

- **reported-result**: AnTrap contiene 236 tareas derivadas de 116 escenarios originales y 120 ampliaciones manuales. [localizador](https://arxiv.org/html/2608.24099v1#S3)
- **reported-result**: Claude Sonnet 4.6 baja de 74,2% en limpio a 66,5% con traps; GUI-Owl baja de 69,5% a 62,4%. [localizador](https://arxiv.org/html/2608.24099v1#S4.SS2)

## Lectura y límite

- Método: AnTrap parte de 116 escenarios y añade manualmente 120 tareas para llegar a 236. Organiza las anomalías en cuatro capas —estado, pensamiento, acción y ronda— y diez subcategorías; compara 16 modelos GUI en condiciones limpias y con trampas.
- Límite: Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.
- Confianza editorial: Alta
- Limitación: Las trampas son diseñadas y su prevalencia natural no está estimada.
- Limitación: La mejora de GRPO se concentra en trampas simples; no prueba robustez general ante cambios de contexto.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.24099): tipo abstract
- [Fuente primaria · resumen](https://arxiv.org/html/2608.24099v1): tipo abstract
- [Construcción del benchmark · §3](https://arxiv.org/html/2608.24099v1#S3): tipo section
- [Análisis de datos · §3.4](https://arxiv.org/html/2608.24099v1#S3.SS4): tipo section
- [Resultados principales · §4.2](https://arxiv.org/html/2608.24099v1#S4.SS2): tipo section
- [Limitaciones · §6](https://arxiv.org/html/2608.24099v1#S6): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.24099): tipo abstract

## Próxima prueba

- ¿Qué anomalías de estado y contexto predicen fallos en nuestro agente GUI?
- Métrica: Degradación limpia→trap por categoría, recuperación correcta y acciones peligrosas.
- Regla de parada: Parar la promoción si una categoría crítica degrada más de 5 pp o si la recuperación aumenta acciones no deseadas.

## Recursos reproducibles
- [HTML · fuente primaria v1](https://arxiv.org/html/2608.24099v1)
- [Benchmark · GitHub](https://github.com/gguogan/AnTrap)

## Enlaces relacionados

- [MobilePA-Bench](https://luiseduardodemiguel.com/research-ia/markdown/papers/mobilepa-bench)
- [SPA](https://luiseduardodemiguel.com/research-ia/markdown/papers/spa)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)