# MobilePA-Bench: Evaluating Mobile Personal Agents in Real-World Tasks
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/mobilepa-bench
- Fuente primaria: https://arxiv.org/abs/2608.23035
- Versión leída: arXiv v2 · 25 agosto 2026
- Fuente comprobada: 2026-08-31 · lectura primaria completa; HTML primario verificado
- Autores: Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi y MAI Team
- Fecha del corte: 24 AGO 2026 · v2
- Área: AGENTES · MÓVIL · EVALUACIÓN

## Tesis y contexto

MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.

- Problema: Los benchmarks de computer use suelen medir trayectorias cortas y dejan ocultos los fallos que aparecen cuando la tarea exige estado persistente, delegación o herramientas especializadas.
- Por qué importa: Ofrece una línea base más cercana al producto móvil real y hace visible qué parte del fallo pertenece al tool use, a la colaboración o a la memoria.

## Evidencia reportada

- **reported-result**: El benchmark contiene 1.705 tareas, 13 dominios funcionales y 212 herramientas. [localizador](https://arxiv.org/html/2608.23035v2#S1)
- **reported-result**: El mejor resultado global reportado es 75,52%, mientras que el uso básico de herramientas alcanza 83,85%. [localizador](https://arxiv.org/html/2608.23035v2#S4)
- **reported-result**: La colaboración y la memoria muestran un rendimiento inferior al uso básico de herramientas en la descomposición reportada. [localizador](https://arxiv.org/html/2608.23035v2#S4)

## Lectura y límite

- Método: El benchmark organiza 1.705 tareas en 13 dominios funcionales y 212 herramientas. La evaluación separa cuatro dimensiones: uso básico de herramientas, colaboración con subagentes, memoria y skills; además compara agentes y modelos bajo un entorno móvil con verificadores preasignados.
- Límite: El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.
- Confianza editorial: Alta
- Limitación: El benchmark depende de tareas, sandbox y verificadores preasignados.
- Limitación: La ponderación 50/10/20/20 y los 89 ejemplos de subagente pueden cambiar la lectura del score agregado.
- Limitación: No se reporta una tasa específica de abstención o recuperación.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.23035): tipo abstract
- [Fuente primaria · resumen y alcance](https://arxiv.org/html/2608.23035v2): tipo abstract
- [Alcance y composición · §1](https://arxiv.org/html/2608.23035v2#S1): tipo section
- [Dimensiones · §3.4.1–§3.4.4](https://arxiv.org/html/2608.23035v2#S3.SS4): tipo section
- [Scoring · §3.5](https://arxiv.org/html/2608.23035v2#S3.SS5): tipo section
- [Experimentos · §4](https://arxiv.org/html/2608.23035v2#S4): tipo section
- [Tabla 2 · dominios y herramientas](https://arxiv.org/html/2608.23035v2#S3.T2): tipo table
- [HTML · fuente navegable](https://arxiv.org/html/2608.23035): tipo abstract

## Próxima prueba

- ¿Qué combinación de memoria y delegación mejora el workflow móvil sin degradar la tasa de acciones correctas?
- Métrica: Éxito por dimensión, abstención correcta, latencia p95 y errores de acción.
- Regla de parada: Parar si la mejora global no supera 3 puntos porcentuales o si memoria/delegación aumenta errores o latencia sin beneficio por slice.

## Recursos reproducibles
- [HTML · fuente primaria v2](https://arxiv.org/html/2608.23035v2)
- [Código y benchmark · GitHub](https://github.com/Tongyi-MAI/MobilePA-Bench)

## Enlaces relacionados

- [OODA-Tool](https://luiseduardodemiguel.com/research-ia/markdown/papers/ooda-tool)
- [AnTrap](https://luiseduardodemiguel.com/research-ia/markdown/papers/antrap)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)