Lo esencial antes de invertir más tiempo.
AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.
AnTrap contiene 236 tareas derivadas de 116 escenarios originales y 120 ampliaciones manuales.
Resultado reportado con fuente enlazada · 7 localizadores disponibles.Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.
Degradación limpia→trap por categoría, recuperación correcta y acciones peligrosas.
AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.
Qué está reportado y qué conviene comprobar.
AnTrap contiene 236 tareas derivadas de 116 escenarios originales y 120 ampliaciones manuales.
236 tareas · baseline: 116 escenarios originales · contexto: Cuatro capas de anomalía
Claude Sonnet 4.6 baja de 74,2% en limpio a 66,5% con traps; GUI-Owl baja de 69,5% a 62,4%.
−7,7 pp y −7,1 pp · baseline: Condición limpia · contexto: Evaluación de modelos GUI
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PREGUNTA / AnTrap pregunta qué ocurre cuando un agente GUI encuentra anomalías que compiten con la instrucción, el estado o el orden de ejecución.
MÉTODO / El benchmark amplía 116 tareas a 236 y clasifica las trampas en State, Thinking, Action y Round, con diez subcategorías y 16 modelos.
RESULTADO / Claude Sonnet 4.6 baja de 74,2% limpio a 66,5% con traps; GUI-Owl baja de 69,5% a 62,4%. Las trampas contextuales profundas siguen sin resolverse bien.
LÍMITE / La suite es una intervención controlada, no una estimación de prevalencia en interfaces reales. Hace falta diseñar un corpus propio antes de convertir el score en un SLO.
Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.
- PROBLEMA
- Los benchmarks de GUI suelen medir éxito limpio, no la degradación cuando aparecen elementos engañosos, cambios de estado o instrucciones que compiten con el objetivo.
- MÉTODO
- AnTrap parte de 116 escenarios y añade manualmente 120 tareas para llegar a 236. Organiza las anomalías en cuatro capas —estado, pensamiento, acción y ronda— y diez subcategorías; compara 16 modelos GUI en condiciones limpias y con trampas.
- TIPO DE EVIDENCIA
- La lectura primaria reporta que Claude Sonnet 4.6 cae de 74,2% a 66,5% y GUI-Owl de 69,5% a 62,4% al introducir traps. GRPO ayuda en trampas sencillas, pero las trampas contextuales profundas siguen siendo difíciles.
- LÍMITE
- Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
AnTrap parte de 116 escenarios y añade manualmente 120 tareas para llegar a 236. Organiza las anomalías en cuatro capas —estado, pensamiento, acción y ronda— y diez subcategorías; compara 16 modelos GUI en condiciones limpias y con trampas.
Convierte la robustez ante anomalías en una métrica separada del éxito nominal, algo necesario antes de confiar en agentes que actúan sobre interfaces.
Las anomalías son construidas por el benchmark y no representan una distribución natural de interfaces. La degradación no debe interpretarse como una tasa de riesgo de producción sin calibración por dominio.
Cómo lo llevaría a un proyecto
Añadir un slice de anomalías de estado y contexto a cada evaluación GUI interna y bloquear la promoción si sólo se mide el camino limpio.
Preguntas que conviene probar
- ¿Qué trampas de estado son realistas en la interfaz propia?
- ¿La recuperación mejora la robustez o sólo aumenta acciones?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La prueba de seguridad de un agente GUI empieza cuando la interfaz deja de ser cooperativa.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.