# VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/vibelifebench
- Fuente primaria: https://arxiv.org/abs/2608.10875
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Xiaohongshu Dots Studio y Evolvent AI
- Fecha del corte: 11 AGO 2026
- Área: MEMORIA · PROACTIVIDAD · EVALUACIÓN

## Tesis y contexto

El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.

- Problema: La mayoría de benchmarks espera que el usuario dispare cada acción, mientras que los asistentes reales viven en un entorno que cambia entre una interacción y otra.
- Por qué importa: Introduce la proactividad temporal como dimensión separada: no solo recordar, sino saber cuándo comprobar, preguntar o abstenerse.

## Evidencia reportada

- **reported-result**: VibeLifeBench evalúa siete modelos frontier en 200 tareas de varias semanas, diez dominios y 22 servicios simulados; todos obtienen puntuaciones bajas en el benchmark según los autores. [localizador](https://arxiv.org/html/2608.10875v1#S4)

## Lectura y límite

- Método: Simula una vida o entorno que cambia aunque el usuario no escriba. Evalúa si el agente conserva compromisos, recuerda restricciones y decide cuándo volver a observar.
- Límite: Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.
- Confianza editorial: Media
- Limitación: El mundo es simulado y usa 22 backends de servicio; las puntuaciones miden cumplimiento de una rúbrica diseñada, no utilidad o confianza en la vida real.
- Limitación: Las tareas multi-semana y los modelos evaluados exponen fallos de proactividad, pero no separan completamente memoria, planificación, polling, herramientas y calidad del modelo.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.10875): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.10875v1): tipo abstract
- [Experimentos · §4](https://arxiv.org/html/2608.10875v1#S4): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.10875): tipo abstract

## Próxima prueba

- ¿Una política explícita de volver a observar y recordar compromisos mejora la proactividad sin generar acciones innecesarias?
- Métrica: Cumplimiento de restricciones duras, intervenciones a tiempo, falsas alarmas, coste de herramientas y consistencia final.
- Regla de parada: Parar si el cumplimiento de restricciones baja de 95% o si el coste de interacción aumenta más de 20% sin ganar cumplimiento.

## Recursos reproducibles
- [Research · Evolvent AI](https://evolvent.co/en/research)

## Enlaces relacionados

- [MBA](https://luiseduardodemiguel.com/research-ia/markdown/papers/mbabench)
- [Diagnosis Before Recovery](https://luiseduardodemiguel.com/research-ia/markdown/papers/diagnosis-before-recovery)
- [MMDiff](https://luiseduardodemiguel.com/research-ia/markdown/papers/mmdiff)