Lo esencial antes de invertir más tiempo.
El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.
VibeLifeBench evalúa siete modelos frontier en 200 tareas de varias semanas, diez dominios y 22 servicios simulados; todos obtienen puntuaciones bajas en el benchmark según los autores.
Resultado reportado con fuente enlazada · 4 localizadores disponibles.Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.
Cumplimiento de restricciones duras, intervenciones a tiempo, falsas alarmas, coste de herramientas y consistencia final.
El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.
Qué está reportado y qué conviene comprobar.
VibeLifeBench evalúa siete modelos frontier en 200 tareas de varias semanas, diez dominios y 22 servicios simulados; todos obtienen puntuaciones bajas en el benchmark según los autores.
200 tareas; 10 dominios; 22 servicios; 7 modelos · baseline: siete modelos frontier · contexto: Mundos simulados con cambios silenciosos, timing y restricciones implícitas
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.VibeLifeBench cambia la unidad de evaluación de un asistente: no basta con contestar bien cuando el usuario escribe. En una vida real el mundo cambia en segundo plano, los compromisos tienen fechas, las restricciones pueden ser implícitas y el agente debe decidir cuándo volver a comprobar algo sin recibir un nuevo mensaje.
El benchmark contiene 200 tareas de horizonte largo en diez dominios y un mundo simulado con 22 servicios. El reloj avanza, algunos cambios ocurren en silencio y el agente tiene que mantener compromisos, detectar que una condición ya no se cumple y elegir entre actuar, preguntar o esperar. La evaluación pondera el estado final, la puntualidad y el cumplimiento de restricciones implícitas, y prueba siete modelos frontier.
Todos los modelos obtienen puntuaciones bajas en la evaluación descrita por el paper. La señal no significa que cada asistente real falle exactamente en esa proporción; indica que combinar memoria, observación recurrente, proactividad y restricciones temporales sigue siendo difícil incluso cuando cada sub-tarea parece sencilla por separado.
Para Research IA, la idea central es tratar la memoria como una política de revisión, no como un almacén de datos: qué se guarda, qué evento dispara una nueva observación, qué acción necesita aprobación y cuándo abstenerse. La limitación es que una simulación guionizada no captura por completo preferencias, consentimiento, ruido ni el coste emocional de una intervención inoportuna en la vida de una persona.
Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.
- PROBLEMA
- La mayoría de benchmarks espera que el usuario dispare cada acción, mientras que los asistentes reales viven en un entorno que cambia entre una interacción y otra.
- MÉTODO
- Simula una vida o entorno que cambia aunque el usuario no escriba. Evalúa si el agente conserva compromisos, recuerda restricciones y decide cuándo volver a observar.
- TIPO DE EVIDENCIA
- Benchmark de proactividad y persistencia temporal; separa recordar un dato de saber cuándo ese dato vuelve a ser relevante.
- LÍMITE
- Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.
La proactividad es decidir cuándo actuar, preguntar o guardar silencio.
La memoria útil es una política de revisión, no solo una colección de hechos.
No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.
Abrir fuente primaria ↗La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
Simula una vida o entorno que cambia aunque el usuario no escriba. Evalúa si el agente conserva compromisos, recuerda restricciones y decide cuándo volver a observar.
Introduce la proactividad temporal como dimensión separada: no solo recordar, sino saber cuándo comprobar, preguntar o abstenerse.
Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.
Cómo lo llevaría a un proyecto
Diseñar memoria como una política de revisión: qué se guarda, qué dispara una comprobación y qué exige aprobación.
Preguntas que conviene probar
- ¿Cuál es la unidad correcta de memoria: hecho, compromiso, contexto o permiso?
- ¿Qué significa abstenerse correctamente?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La memoria de un agente no es un almacén: es una política sobre cuándo volver a observar.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.