Lo esencial antes de invertir más tiempo.
MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.
El benchmark contiene 1.705 tareas, 13 dominios funcionales y 212 herramientas.
Resultado con localizador exacto · 8 localizadores disponibles.El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.
Éxito por dimensión, abstención correcta, latencia p95 y errores de acción.
MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.
Qué está reportado y qué conviene comprobar.
El benchmark contiene 1.705 tareas, 13 dominios funcionales y 212 herramientas.
1.705 tareas · 13 dominios · 212 herramientas · baseline: No aplica; descripción del benchmark · contexto: MobilePA-Bench
El mejor resultado global reportado es 75,52%, mientras que el uso básico de herramientas alcanza 83,85%.
75,52% global · 83,85% basic tool use · baseline: Comparativa de agentes del benchmark · contexto: Resultados principales · §4
La colaboración y la memoria muestran un rendimiento inferior al uso básico de herramientas en la descomposición reportada.
Collaboration 43,82–77,53%; memory 33,78–64,63% · baseline: Basic tool use 83,85% · contexto: Dimensiones del benchmark
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PREGUNTA / MobilePA-Bench intenta medir agentes personales móviles en tareas más cercanas a un producto, incluyendo dominios funcionales y herramientas heterogéneas.
MÉTODO / La evaluación separa basic tool use, colaboración de subagentes, memory usage y skill usage, en lugar de reducir todo a una sola tasa de éxito.
RESULTADO / La fuente reporta 75,52% como mejor resultado global y 83,85% en uso básico de herramientas; las dimensiones de colaboración y memoria quedan más bajas y muestran el margen de trabajo.
LÍMITE / La configuración depende de sandbox y checkers preasignados y no mide de forma explícita cuándo el agente debe abstenerse. La transferencia a un teléfono o app concreta exige un protocolo propio.
El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.
- PROBLEMA
- Los benchmarks de computer use suelen medir trayectorias cortas y dejan ocultos los fallos que aparecen cuando la tarea exige estado persistente, delegación o herramientas especializadas.
- MÉTODO
- El benchmark organiza 1.705 tareas en 13 dominios funcionales y 212 herramientas. La evaluación separa cuatro dimensiones: uso básico de herramientas, colaboración con subagentes, memoria y skills; además compara agentes y modelos bajo un entorno móvil con verificadores preasignados.
- TIPO DE EVIDENCIA
- La lectura primaria reporta un mejor resultado global de 75,52%, con 83,85% en uso básico de herramientas y un descenso visible en colaboración y memoria. El valor editorial está en descomponer el éxito, no en tratar el score agregado como capacidad general.
- LÍMITE
- El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
El benchmark organiza 1.705 tareas en 13 dominios funcionales y 212 herramientas. La evaluación separa cuatro dimensiones: uso básico de herramientas, colaboración con subagentes, memoria y skills; además compara agentes y modelos bajo un entorno móvil con verificadores preasignados.
Ofrece una línea base más cercana al producto móvil real y hace visible qué parte del fallo pertenece al tool use, a la colaboración o a la memoria.
El entorno usa tareas y checkers predefinidos; la ponderación de dimensiones es 50/10/20/20 y el conjunto de ejemplos de subagentes es pequeño. No hay una métrica explícita de abstención.
Cómo lo llevaría a un proyecto
Usar las cuatro dimensiones como contrato de aceptación para un agente móvil interno: no promoverlo por éxito global si memoria o colaboración quedan por debajo del umbral del workflow.
Preguntas que conviene probar
- ¿Qué dimensión explica los fallos del workflow móvil propio?
- ¿La memoria mejora la tarea completa o sólo el slice que la activa?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta no es si el agente completa una demo, sino qué contrato de estado y herramientas necesita para completar una tarea móvil completa.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.