NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
HIPÓTESIS/PUBLICACIÓN 02

INTERFAZ / MEMORIA / TIEMPO

La unidad evaluable de un agente es sistema + memoria + mundo temporal

Un modelo aislado no describe la fiabilidad de un agente que opera herramientas: la interfaz que recibe, la memoria que conserva y el mundo que cambia forman una unidad de evaluación.

COMBINACIÓNWorkSurface-Bench + TransMem + Workflow-GYM + AgentCompass
TESTtriangulación documental reproducible
ESTADOpartially supported by corpus
PREGUNTA DE INVESTIGACIÓN

¿Podemos detectar fallos de agente antes midiendo juntas interfaz, memoria y proactividad?

PROBLEMA Y CONTEXTO

La fiabilidad puede fallar antes del razonamiento.

Un agente empresarial no trabaja dentro de una conversación aislada. Decide qué superficie consultar, conserva estado entre etapas y actúa en un mundo donde cambian datos, permisos y obligaciones.

La hipótesis junta esas dimensiones para comprobar si la fiabilidad se puede medir como una propiedad del sistema completo. El riesgo es mezclar benchmarks heterogéneos y llamar teoría a una coincidencia temática; por eso cada fuente conserva aquí su función y su límite.

EVIDENCE MAP / RESULTADOS DE LAS FUENTES

Qué aporta cada paper

Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.

FIGURA / MAPA DE EVIDENCIA4 fuentes, un puente que todavía hay que probar.
SVG estático · sin runtime de gráficos
Mapa de evidencia de la hipótesis4 papers aportan controles distintos que convergen en un orden de lectura, recuperación, organización de evidencia y respuesta bajo presupuesto.FUENTE 01WorkSurface-BenchFUENTE 02TransMemFUENTE 03Workflow-GYMFUENTE 04AgentCompassPUENTE EDITORIALsuperficie → memoriaworkflow → evaluaciónsin asumir que sean aditivasAFIRMACIÓN A PROBARinterfaz y memoriaexplican continuidadpuente editorial, no resultado conjunto
La figura muestra una síntesis editorial: las flechas no significan que los autores hayan evaluado juntos este workflow.
  1. WorkSurface-BenchSepara elegir la superficie correcta de contestar bien y convierte el routing entre documentos, tablas y grafos en una capacidad observable.
  2. TransMemAmplía la unidad de memoria: no sólo se recupera texto, también puede conservarse estado interno procesado por el modelo.
  3. Workflow-GYMIntroduce workflows profesionales largos donde omitir una etapa, derivar el objetivo o propagar un error rompe la tarea completa.
  4. AgentCompassAporta una infraestructura para evaluar capacidades de agente bajo condiciones comparables, en vez de atribuir todo el resultado a una única puntuación del modelo.
  5. Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
  1. 01

    Separa elegir la superficie correcta de contestar bien y convierte el routing entre documentos, tablas y grafos en una capacidad observable.

    Problema que aborda. Los benchmarks suelen medir recuperación una vez elegida la fuente correcta, pero en empresa el primer reto es decidir dónde debe buscarse cada respuesta.

    Qué aporta. Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.

    Resultado reportado por la fuente. Its data pipeline is hybrid: task scenarios and dependency graphs are human-authored and expert-validated against Lark/ByteDance workflows, while workspace files combine public web resources with grounded LLM-generated artifacts.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Benchmark Construction.

  2. 02

    Amplía la unidad de memoria: no sólo se recupera texto, también puede conservarse estado interno procesado por el modelo.

    Problema que aborda. Los agentes con historiales largos pagan repetidamente por releer texto y pueden perder información importante al resumirlo.

    Qué aporta. TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.

    Resultado reportado por la fuente. As shown in Table 1 , TransMem consistently improves long-context reasoning performance across all evaluated models.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experiments.

  3. 03

    Introduce workflows profesionales largos donde omitir una etapa, derivar el objetivo o propagar un error rompe la tarea completa.

    Problema que aborda. Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.

    Qué aporta. Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.

    Resultado reportado por la fuente. As shown in Table 2 , even the best-performing models, Gemini-3.1-pro and Kimi-k2.6, merely achieves an average pass rate of 30.67% and pass@3 rate of 41.42%, respectively.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

  4. 04

    Aporta una infraestructura para evaluar capacidades de agente bajo condiciones comparables, en vez de atribuir todo el resultado a una única puntuación del modelo.

    Problema que aborda. Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.

    Qué aporta. Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

    Resultado reportado por la fuente. Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

SÍNTESIS EDITORIAL / INFERENCIA DEL AUTOR

El puente es un orden de controles, no una suma de papers.

La conexión editorial es temporal y operacional: WorkSurface-Bench fija dónde se busca; TransMem pregunta qué estado se conserva después de procesar; Workflow-GYM muestra cómo se deteriora una cadena larga cuando cambian las condiciones; AgentCompass aporta el marco para comparar esas capacidades sin esconderlas en una media. La hipótesis resultante no dice que las cuatro dimensiones sean aditivas: propone medirlas juntas en el mismo agente, tarea, interfaz, memoria y presupuesto.

Qué cambia si la dirección es correcta

  • Registrar la superficie elegida, el estado que cruza cada etapa y el evento externo que estaba vigente cuando se tomó una decisión.
  • Evaluar recuperación de memoria y routing por separado antes de agregarlos a una tasa de éxito final.
  • Usar workflows largos con fallos inyectados y cambios temporales; una demo de una sola interacción no puede validar continuidad.
RESULTADO DEL TEST / 2026-08-19

La hipótesis queda parcialmente apoyada: cada dimensión aparece medida, pero el corpus no contiene todavía una evaluación conjunta con el mismo agente, tarea y presupuesto.

Que las cuatro fichas tienen evidencia primaria y cubren al menos dos semanas y tres dimensiones del sistema.

Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.

partially supported by corpus5/5 checks pasados

Qué comprobé

PASSPapers públicos encontrados4/4
PASSLecturas primarias completas4/4
PASSCortes o fechas cubiertos3
PASSLocalizadores disponibles21
PASSReferencias de resultado resueltas3/3
PRÓXIMA PRUEBA / TODAVÍA NO EJECUTADA

Cómo intentaría confirmarla o hacerla caer.

ENTRADAEl mismo agente y workflow ejecutados con dos interfaces de herramientas, memoria activada/desactivada y eventos temporales inyectados.
BASELINEInterfaz plana, sin memoria persistente y con todas las acciones iniciadas por el usuario.
MÉTRICATasa de finalización, errores de estado, pasos, tokens, recuperación de compromisos y acciones no autorizadas.
PARADAParar si la métrica compuesta oculta una regresión importante en seguridad, coste o memoria.

Timebox: 3 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.

AUTOCRÍTICA / REVISIÓN DEL AUTOR

Lo que hice bien

La síntesis conserva la diferencia entre efecto de interfaz, continuidad de memoria y proactividad temporal.

Lo que hice mal o dejé corto

La combinación mezcla tareas y métricas heterogéneas; falta un protocolo común antes de llamarla teoría.

No prueba que una métrica compuesta sea mejor que benchmarks separados ni que las dimensiones interactúen de forma aditiva.