NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 01

AGENTES · MÓVIL · EVALUACIÓN

MobilePA-Bench: Evaluating Mobile Personal Agents in Real-World Tasks

ImprescindibleLectura primaria completa

Un agente móvil no se evalúa sólo por si pulsa el botón correcto: también debe coordinar herramientas, memoria y subagentes dentro de una tarea real.

AUTHORS / LABYi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi y MAI Team
FECHA24 AGO 2026 · v2
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.

EVIDENCIA DISPONIBLE

El benchmark contiene 1.705 tareas, 13 dominios funcionales y 212 herramientas.

Resultado con localizador exacto · 8 localizadores disponibles.
LÍMITE

El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.

SIGUIENTE PRUEBA

Éxito por dimensión, abstención correcta, latencia p95 y errores de acción.

EN UNA FRASE

MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.

SEÑALbenchmark operativo · decomposición de capacidades · memoria y colaboración
EVIDENCIAResultado con localizador exacto
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay localizadores exactos registrados.
RESULTADO REPORTADO

El benchmark contiene 1.705 tareas, 13 dominios funcionales y 212 herramientas.

1.705 tareas · 13 dominios · 212 herramientas · baseline: No aplica; descripción del benchmark · contexto: MobilePA-Bench

RESULTADO REPORTADO

El mejor resultado global reportado es 75,52%, mientras que el uso básico de herramientas alcanza 83,85%.

75,52% global · 83,85% basic tool use · baseline: Comparativa de agentes del benchmark · contexto: Resultados principales · §4

RESULTADO REPORTADO

La colaboración y la memoria muestran un rendimiento inferior al uso básico de herramientas en la descomposición reportada.

Collaboration 43,82–77,53%; memory 33,78–64,63% · baseline: Basic tool use 83,85% · contexto: Dimensiones del benchmark

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PREGUNTA / MobilePA-Bench intenta medir agentes personales móviles en tareas más cercanas a un producto, incluyendo dominios funcionales y herramientas heterogéneas.

MÉTODO / La evaluación separa basic tool use, colaboración de subagentes, memory usage y skill usage, en lugar de reducir todo a una sola tasa de éxito.

RESULTADO / La fuente reporta 75,52% como mejor resultado global y 83,85% en uso básico de herramientas; las dimensiones de colaboración y memoria quedan más bajas y muestran el margen de trabajo.

LÍMITE / La configuración depende de sandbox y checkers preasignados y no mide de forma explícita cuándo el agente debe abstenerse. La transferencia a un teléfono o app concreta exige un protocolo propio.

DECISIÓN RÁPIDAUsar las cuatro dimensiones como contrato de aceptación para un agente móvil interno: no promoverlo por éxito global si memoria o colaboración quedan por debajo del umbral del workflow.
NO LO SOBREINTERPRETES

El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.

PROBLEMA
Los benchmarks de computer use suelen medir trayectorias cortas y dejan ocultos los fallos que aparecen cuando la tarea exige estado persistente, delegación o herramientas especializadas.
MÉTODO
El benchmark organiza 1.705 tareas en 13 dominios funcionales y 212 herramientas. La evaluación separa cuatro dimensiones: uso básico de herramientas, colaboración con subagentes, memoria y skills; además compara agentes y modelos bajo un entorno móvil con verificadores preasignados.
TIPO DE EVIDENCIA
La lectura primaria reporta un mejor resultado global de 75,52%, con 83,85% en uso básico de herramientas y un descenso visible en colaboración y memoria. El valor editorial está en descomponer el éxito, no en tratar el score agregado como capacidad general.
LÍMITE
El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

El benchmark organiza 1.705 tareas en 13 dominios funcionales y 212 herramientas. La evaluación separa cuatro dimensiones: uso básico de herramientas, colaboración con subagentes, memoria y skills; además compara agentes y modelos bajo un entorno móvil con verificadores preasignados.

QUÉ APORTA

Ofrece una línea base más cercana al producto móvil real y hace visible qué parte del fallo pertenece al tool use, a la colaboración o a la memoria.

QUÉ NO PRUEBA

El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.

Cómo lo llevaría a un proyecto

Usar las cuatro dimensiones como contrato de aceptación para un agente móvil interno: no promoverlo por éxito global si memoria o colaboración quedan por debajo del umbral del workflow.

copilotos móvilesautomatización de operacionesasistentes personalesevaluación de agentes

Preguntas que conviene probar

  • ¿Qué dimensión explica los fallos del workflow móvil propio?
  • ¿La memoria mejora la tarea completa o sólo el slice que la activa?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAUn conjunto congelado de 50 tareas móviles con casos de memoria necesaria, memoria distractora y subagente opcional.
PREGUNTA¿Qué combinación de memoria y delegación mejora el workflow móvil sin degradar la tasa de acciones correctas?
MÉTRICAÉxito por dimensión, abstención correcta, latencia p95 y errores de acción.
PARADAParar si la mejora global no supera 3 puntos porcentuales o si memoria/delegación aumenta errores o latencia sin beneficio por slice.

Mi lectura

La pregunta no es si el agente completa una demo, sino qué contrato de estado y herramientas necesita para completar una tarea móvil completa.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.