NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 21

MEMORIA · PROACTIVIDAD · EVALUACIÓN

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

InteresanteLectura primaria completa

La vida continúa aunque nadie escriba al agente: un asistente útil necesita volver a mirar, preservar intención y actuar en el momento adecuado.

AUTHORS / LABXiaohongshu Dots Studio y Evolvent AI
FECHA11 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.

EVIDENCIA DISPONIBLE

VibeLifeBench evalúa siete modelos frontier en 200 tareas de varias semanas, diez dominios y 22 servicios simulados; todos obtienen puntuaciones bajas en el benchmark según los autores.

Resultado reportado con fuente enlazada · 4 localizadores disponibles.
LÍMITE

Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.

SIGUIENTE PRUEBA

Cumplimiento de restricciones duras, intervenciones a tiempo, falsas alarmas, coste de herramientas y consistencia final.

EN UNA FRASE

El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.

SEÑALMemoria · Proactividad
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

VibeLifeBench evalúa siete modelos frontier en 200 tareas de varias semanas, diez dominios y 22 servicios simulados; todos obtienen puntuaciones bajas en el benchmark según los autores.

200 tareas; 10 dominios; 22 servicios; 7 modelos · baseline: siete modelos frontier · contexto: Mundos simulados con cambios silenciosos, timing y restricciones implícitas

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

VibeLifeBench cambia la unidad de evaluación de un asistente: no basta con contestar bien cuando el usuario escribe. En una vida real el mundo cambia en segundo plano, los compromisos tienen fechas, las restricciones pueden ser implícitas y el agente debe decidir cuándo volver a comprobar algo sin recibir un nuevo mensaje.

El benchmark contiene 200 tareas de horizonte largo en diez dominios y un mundo simulado con 22 servicios. El reloj avanza, algunos cambios ocurren en silencio y el agente tiene que mantener compromisos, detectar que una condición ya no se cumple y elegir entre actuar, preguntar o esperar. La evaluación pondera el estado final, la puntualidad y el cumplimiento de restricciones implícitas, y prueba siete modelos frontier.

Todos los modelos obtienen puntuaciones bajas en la evaluación descrita por el paper. La señal no significa que cada asistente real falle exactamente en esa proporción; indica que combinar memoria, observación recurrente, proactividad y restricciones temporales sigue siendo difícil incluso cuando cada sub-tarea parece sencilla por separado.

Para Research IA, la idea central es tratar la memoria como una política de revisión, no como un almacén de datos: qué se guarda, qué evento dispara una nueva observación, qué acción necesita aprobación y cuándo abstenerse. La limitación es que una simulación guionizada no captura por completo preferencias, consentimiento, ruido ni el coste emocional de una intervención inoportuna en la vida de una persona.

DECISIÓN RÁPIDADiseñar memoria como una política de revisión: qué se guarda, qué dispara una comprobación y qué exige aprobación.
NO LO SOBREINTERPRETES

Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.

PROBLEMA
La mayoría de benchmarks espera que el usuario dispare cada acción, mientras que los asistentes reales viven en un entorno que cambia entre una interacción y otra.
MÉTODO
Simula una vida o entorno que cambia aunque el usuario no escriba. Evalúa si el agente conserva compromisos, recuerda restricciones y decide cuándo volver a observar.
TIPO DE EVIDENCIA
Benchmark de proactividad y persistencia temporal; separa recordar un dato de saber cuándo ese dato vuelve a ser relevante.
LÍMITE
Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.
FIGURA DE LECTURA / MEMORIACompromiso → mundo cambia → volver a mirar
Abrir paper original ↗

La proactividad es decidir cuándo actuar, preguntar o guardar silencio.

PLANIntención a largo plazo
TIEMPOEventos silenciosos
REVISIÓNAcción o abstención
PARA RECORDAR

La memoria útil es una política de revisión, no solo una colección de hechos.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / Benchmark de proactividad y persistencia temporal; separa recordar un dato de saber cuándo ese dato vuelve a ser relevante.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Simula una vida o entorno que cambia aunque el usuario no escriba. Evalúa si el agente conserva compromisos, recuerda restricciones y decide cuándo volver a observar.

QUÉ APORTA

Introduce la proactividad temporal como dimensión separada: no solo recordar, sino saber cuándo comprobar, preguntar o abstenerse.

QUÉ NO PRUEBA

Los entornos simulados no capturan por completo preferencias humanas, consentimiento, ruido ni el coste emocional de una intervención inoportuna.

Cómo lo llevaría a un proyecto

Diseñar memoria como una política de revisión: qué se guarda, qué dispara una comprobación y qué exige aprobación.

Asistentes familiaresViajesHogarRenovacionesProductividad

Preguntas que conviene probar

  • ¿Cuál es la unidad correcta de memoria: hecho, compromiso, contexto o permiso?
  • ¿Qué significa abstenerse correctamente?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA20 tareas con eventos silenciosos de frecuencia variable, comparando agente reactivo, memoria persistente y polling con presupuesto.
PREGUNTA¿Una política explícita de volver a observar y recordar compromisos mejora la proactividad sin generar acciones innecesarias?
MÉTRICACumplimiento de restricciones duras, intervenciones a tiempo, falsas alarmas, coste de herramientas y consistencia final.
PARADAParar si el cumplimiento de restricciones baja de 95% o si el coste de interacción aumenta más de 20% sin ganar cumplimiento.

Mi lectura

La memoria de un agente no es un almacén: es una política sobre cuándo volver a observar.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.