NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 03

AGENTES · GUI · SEGURIDAD

AnTrap: A Comprehensive Benchmark for Anomaly Traps in GUI Agents

ImprescindibleLectura primaria completa

Un agente de interfaz puede ejecutar la acción esperada y aun así caer en una trampa contextual colocada en el estado del entorno.

AUTHORS / LABGuo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song, Zheyuan Yang, Lin Fu y colaboradores
FECHA25 AGO 2026 · v1
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.

EVIDENCIA DISPONIBLE

AnTrap contiene 236 tareas derivadas de 116 escenarios originales y 120 ampliaciones manuales.

Resultado reportado con fuente enlazada · 7 localizadores disponibles.
LÍMITE

Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.

SIGUIENTE PRUEBA

Degradación limpia→trap por categoría, recuperación correcta y acciones peligrosas.

EN UNA FRASE

AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.

SEÑALrobustez adversarial · GUI agents · contexto de ejecución
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

AnTrap contiene 236 tareas derivadas de 116 escenarios originales y 120 ampliaciones manuales.

236 tareas · baseline: 116 escenarios originales · contexto: Cuatro capas de anomalía

RESULTADO REPORTADO

Claude Sonnet 4.6 baja de 74,2% en limpio a 66,5% con traps; GUI-Owl baja de 69,5% a 62,4%.

−7,7 pp y −7,1 pp · baseline: Condición limpia · contexto: Evaluación de modelos GUI

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PREGUNTA / AnTrap pregunta qué ocurre cuando un agente GUI encuentra anomalías que compiten con la instrucción, el estado o el orden de ejecución.

MÉTODO / El benchmark amplía 116 tareas a 236 y clasifica las trampas en State, Thinking, Action y Round, con diez subcategorías y 16 modelos.

RESULTADO / Claude Sonnet 4.6 baja de 74,2% limpio a 66,5% con traps; GUI-Owl baja de 69,5% a 62,4%. Las trampas contextuales profundas siguen sin resolverse bien.

LÍMITE / La suite es una intervención controlada, no una estimación de prevalencia en interfaces reales. Hace falta diseñar un corpus propio antes de convertir el score en un SLO.

DECISIÓN RÁPIDAAñadir un slice de anomalías de estado y contexto a cada evaluación GUI interna y bloquear la promoción si sólo se mide el camino limpio.
NO LO SOBREINTERPRETES

Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.

PROBLEMA
Los benchmarks de GUI suelen medir éxito limpio, no la degradación cuando aparecen elementos engañosos, cambios de estado o instrucciones que compiten con el objetivo.
MÉTODO
AnTrap parte de 116 escenarios y añade manualmente 120 tareas para llegar a 236. Organiza las anomalías en cuatro capas —estado, pensamiento, acción y ronda— y diez subcategorías; compara 16 modelos GUI en condiciones limpias y con trampas.
TIPO DE EVIDENCIA
La lectura primaria reporta que Claude Sonnet 4.6 cae de 74,2% a 66,5% y GUI-Owl de 69,5% a 62,4% al introducir traps. GRPO ayuda en trampas sencillas, pero las trampas contextuales profundas siguen siendo difíciles.
LÍMITE
Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

AnTrap parte de 116 escenarios y añade manualmente 120 tareas para llegar a 236. Organiza las anomalías en cuatro capas —estado, pensamiento, acción y ronda— y diez subcategorías; compara 16 modelos GUI en condiciones limpias y con trampas.

QUÉ APORTA

Convierte la robustez ante anomalías en una métrica separada del éxito nominal, algo necesario antes de confiar en agentes que actúan sobre interfaces.

QUÉ NO PRUEBA

Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.

Cómo lo llevaría a un proyecto

Añadir un slice de anomalías de estado y contexto a cada evaluación GUI interna y bloquear la promoción si sólo se mide el camino limpio.

testing de agentes GUIseguridad de computer usered teaming de interfacesasistentes de escritorio

Preguntas que conviene probar

  • ¿Qué trampas de estado son realistas en la interfaz propia?
  • ¿La recuperación mejora la robustez o sólo aumenta acciones?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAUn corpus de tareas limpias con inyecciones controladas de estado obsoleto, instrucción distractora y cambio de ronda.
PREGUNTA¿Qué anomalías de estado y contexto predicen fallos en nuestro agente GUI?
MÉTRICADegradación limpia→trap por categoría, recuperación correcta y acciones peligrosas.
PARADAParar la promoción si una categoría crítica degrada más de 5 pp o si la recuperación aumenta acciones no deseadas.

Mi lectura

La prueba de seguridad de un agente GUI empieza cuando la interfaz deja de ser cooperativa.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.