# La unidad evaluable de un agente es sistema + memoria + mundo temporal
> Hipótesis editorial multi-paper. Resultado del test: partially-supported-by-corpus.

- Página: https://luiseduardodemiguel.com/research-ia/hypotheses/interface-memory-is-the-unit
- Test: research-hypotheses:corpus-triangulation:v1
- Fecha de comprobación: 2026-08-19
- Combinación: WorkSurface-Bench + TransMem + Workflow-GYM + AgentCompass

## Hipótesis

Un modelo aislado no describe la fiabilidad de un agente que opera herramientas: la interfaz que recibe, la memoria que conserva y el mundo que cambia forman una unidad de evaluación.

Pregunta: ¿Podemos detectar fallos de agente antes midiendo juntas interfaz, memoria y proactividad?

## Problema y contexto

Un agente empresarial no trabaja dentro de una conversación aislada. Decide qué superficie consultar, conserva estado entre etapas y actúa en un mundo donde cambian datos, permisos y obligaciones.

La hipótesis junta esas dimensiones para comprobar si la fiabilidad se puede medir como una propiedad del sistema completo. El riesgo es mezclar benchmarks heterogéneos y llamar teoría a una coincidencia temática; por eso cada fuente conserva aquí su función y su límite.

## Qué aporta cada paper

### WorkSurface-Bench — Separa elegir la superficie correcta de contestar bien y convierte el routing entre documentos, tablas y grafos en una capacidad observable.

- Problema que aborda: Los benchmarks suelen medir recuperación una vez elegida la fuente correcta, pero en empresa el primer reto es decidir dónde debe buscarse cada respuesta.
- Qué aporta: Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.
- Resultado reportado por la fuente: Its data pipeline is hybrid: task scenarios and dependency graphs are human-authored and expert-validated against Lark/ByteDance workflows, while workspace files combine public web resources with grounded LLM-generated artifacts.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Benchmark Construction.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle
- Fuente primaria (v1): https://arxiv.org/html/2607.25765#S4

### TransMem — Amplía la unidad de memoria: no sólo se recupera texto, también puede conservarse estado interno procesado por el modelo.

- Problema que aborda: Los agentes con historiales largos pagan repetidamente por releer texto y pueden perder información importante al resumirlo.
- Qué aporta: TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.
- Resultado reportado por la fuente: As shown in Table 1 , TransMem consistently improves long-context reasoning performance across all evaluated models.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experiments.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/transmem-transforming-hidden-states-into-memory-for-large-language-model
- Fuente primaria (v1): https://arxiv.org/html/2607.29032#Sx3

### Workflow-GYM — Introduce workflows profesionales largos donde omitir una etapa, derivar el objetivo o propagar un error rompe la tarea completa.

- Problema que aborda: Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
- Qué aporta: Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
- Resultado reportado por la fuente: As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas
- Fuente primaria (v4): https://arxiv.org/html/2606.11042#S2

### AgentCompass — Aporta una infraestructura para evaluar capacidades de agente bajo condiciones comparables, en vez de atribuir todo el resultado a una única puntuación del modelo.

- Problema que aborda: Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.
- Qué aporta: Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
- Resultado reportado por la fuente: Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities
- Fuente primaria (v3): https://arxiv.org/html/2607.13705#S3

## Puente de síntesis

La conexión editorial es temporal y operacional: WorkSurface-Bench fija dónde se busca; TransMem pregunta qué estado se conserva después de procesar; Workflow-GYM muestra cómo se deteriora una cadena larga cuando cambian las condiciones; AgentCompass aporta el marco para comparar esas capacidades sin esconderlas en una media. La hipótesis resultante no dice que las cuatro dimensiones sean aditivas: propone medirlas juntas en el mismo agente, tarea, interfaz, memoria y presupuesto.

## Implicaciones si la dirección es correcta

- Registrar la superficie elegida, el estado que cruza cada etapa y el evento externo que estaba vigente cuando se tomó una decisión.
- Evaluar recuperación de memoria y routing por separado antes de agregarlos a una tasa de éxito final.
- Usar workflows largos con fallos inyectados y cambios temporales; una demo de una sola interacción no puede validar continuidad.

## Resultado y límites

La hipótesis queda parcialmente apoyada: cada dimensión aparece medida, pero el corpus no contiene todavía una evaluación conjunta con el mismo agente, tarea y presupuesto.

Que las cuatro fichas tienen evidencia primaria y cubren al menos dos semanas y tres dimensiones del sistema.

Límite: Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
No demuestra: No prueba que una métrica compuesta sea mejor que benchmarks separados ni que las dimensiones interactúen de forma aditiva.

## Próxima prueba

- Entrada: El mismo agente y workflow ejecutados con dos interfaces de herramientas, memoria activada/desactivada y eventos temporales inyectados.
- Baseline: Interfaz plana, sin memoria persistente y con todas las acciones iniciadas por el usuario.
- Métrica: Tasa de finalización, errores de estado, pasos, tokens, recuperación de compromisos y acciones no autorizadas.
- Regla de parada: Parar si la métrica compuesta oculta una regresión importante en seguridad, coste o memoria.
- Timebox: 3 semanas

## Papers

- [WorkSurface-Bench](https://luiseduardodemiguel.com/research-ia/markdown/papers/worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle): https://arxiv.org/abs/2607.25765
- [TransMem](https://luiseduardodemiguel.com/research-ia/markdown/papers/transmem-transforming-hidden-states-into-memory-for-large-language-model): https://arxiv.org/abs/2607.29032
- [Workflow-GYM](https://luiseduardodemiguel.com/research-ia/markdown/papers/workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas): https://arxiv.org/abs/2606.11042
- [AgentCompass](https://luiseduardodemiguel.com/research-ia/markdown/papers/agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities): https://arxiv.org/html/2607.13705v3