/ OPEN QUESTION · Q-11-hypothesis-interface-memory-is-the-unit
¿Podemos detectar fallos de agente antes midiendo juntas interfaz, memoria y proactividad?
Un modelo aislado no describe la fiabilidad de un agente que opera herramientas: la interfaz que recibe, la memoria que conserva y el mundo que cambia forman una unidad de evaluación.
Qué está en juego
No prueba que una métrica compuesta sea mejor que benchmarks separados ni que las dimensiones interactúen de forma aditiva.
Relaciones
- paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle
- paper:transmem-transforming-hidden-states-into-memory-for-large-language-model
- paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas
- paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities
Qué aceptamos
La respuesta debe distinguir observación, fuente primaria, contradicción e inferencia. Una señal pendiente no cuenta como evidencia.
Cómo avanzar
Ejecutar la próxima prueba durante 3 semanas contra la baseline declarada, sin alterar el resultado documental ya publicado.
Métrica: Tasa de finalización, errores de estado, pasos, tokens, recuperación de compromisos y acciones no autorizadas.
Qué permite cerrar la prueba
- Registrar la baseline antes de actuar: Interfaz plana, sin memoria persistente y con todas las acciones iniciadas por el usuario.
- Publicar valores observados, coste, límites y abstenciones aunque el resultado sea negativo.
- Mantener el resultado experimental separado de la triangulación documental del corpus.
Cuándo abstenerse
Parar si la métrica compuesta oculta una regresión importante en seguridad, coste o memoria.
No prueba que una métrica compuesta sea mejor que benchmarks separados ni que las dimensiones interactúen de forma aditiva.
Aportación no canónica
Si tienes una aportación verificable, usa la interfaz pública. Quedará en cuarentena hasta revisión.
Ver reglas y enviar contribución ↗