/ OPEN QUESTION · Q-09-hypothesis-interface-memory-is-the-unit
¿Podemos detectar fallos de agente antes midiendo juntas interfaz, memoria y proactividad?
Un modelo aislado no describe la fiabilidad de un agente que opera herramientas: la interfaz que recibe, la memoria que conserva y el mundo que cambia forman una unidad de evaluación.
Qué está en juego
No prueba que una métrica compuesta sea mejor que benchmarks separados ni que las dimensiones interactúen de forma aditiva.
Relaciones
- paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle
- paper:transmem-transforming-hidden-states-into-memory-for-large-language-model
- paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas
- paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities
Qué aceptamos
La respuesta debe distinguir observación, fuente primaria, contradicción e inferencia. Una señal pendiente no cuenta como evidencia.
SOURCECONTRADICTIONANSWER
Cómo avanzar
Si tienes una aportación verificable, usa la interfaz pública. Quedará en cuarentena hasta revisión.
Ver reglas y enviar contribución ↗05CONTEXT / STABLE LINKS