NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 04

AGENTES · EVALUACIÓN

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

ImprescindibleLectura primaria completa

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment.

AUTHORS / LABKai Chen, Zichen Ding, Jiaye Ge, Shufan Jiang, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tianhao Liang, Shudong Liu, Zerun Ma, Zixin Shang, Wenhui Tian, Zun Wang, Liwei Wu, Zhenyu Wu, Jun Xu, Bowen Yang, Dingbo Yuan, Qi Zhang, Songyang Zhang, Peiheng Zhou, Dongsheng Zhu
FECHA15 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

EVIDENCIA DISPONIBLE

Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.

Resultado reportado con fuente enlazada · 6 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

SEÑALSaaS · consultoría
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.

baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments

RESULTADO REPORTADO

Kimi-K2.6 has a higher share of bad cases involving multilingual mixing on search tasks and repeated tool calls.

contexto: 4 Experiments

RESULTADO REPORTADO

Such beyond-score trajectory analysis therefore provides a more informative basis for diagnosing agentic behavior and identifying targeted directions for model improvement.

contexto: 4 Experiments

RESULTADO REPORTADO

Notably, although GLM-5.2(FP8) outperforms Claude-Opus-4.8 by about 12 points on SWE-Pro, it also shows roughly 30% more suspected reward-hacking samples.

30% · baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.

MÉTODO / La lectura de 3 Framework describe la intervención y su construcción: AgentCompass modularizes benchmark-specific evaluation scripts into composable components connected by stable protocols. As shown in Figure 2 , each evaluation consists of a benchmark , harness , and environment , with optional recipes and analyzers. In AgentCompass, an evaluation run is specified through a declarative RunRequest . The request separates the substantive objects of evaluation from the operational choices used to execute it. Specifically, BenchmarkSpec defines the task and evaluation metrics, HarnessSpec defines the agent procedure used to interact with each task, EnvironmentSpec identifies the… [Fuente: https://arxiv.org/html/2607.13705#S3]

RESULTADO / La sección 4 Experiments informa: Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands. Kimi-K2.6 has a higher share of bad cases involving multilingual mixing on search tasks and repeated tool calls. Such beyond-score trajectory analysis therefore provides a more informative basis for diagnosing agentic behavior and identifying targeted directions for model improvement. [Fuente: https://arxiv.org/html/2607.13705#S4]

LÍMITE / El cierre de la fuente señala: In this paper, we introduced AgentCompass, an open-source and highly extensible infrastructure designed to systematize the evaluation of LLM-based agents. By decoupling the evaluation pipeline into independent Model, Benchmark, Harness, and Environment components, it eliminates redundant engineering and ensures rigorous reproducibility. Supported by a fault-tolerant asynchronous runtime and granular trajectory analysis, AgentCompass goes beyond… La transferencia a model selection requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.13705#S5].

DECISIÓN RÁPIDAProbar la propuesta en model selection reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

PROBLEMA
Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.
MÉTODO
La lectura de 3 Framework describe la intervención y su construcción: AgentCompass modularizes benchmark-specific evaluation scripts into composable components connected by stable protocols. As shown in Figure 2 , each evaluation consists of a benchmark , harness , and environment , with optional recipes and analyzers. In AgentCompass, an evaluation run is specified through a declarative RunRequest . The request separates the substantive objects of evaluation from the operational choices used to execute it. Specifically, BenchmarkSpec defines the task and evaluation metrics, HarnessSpec defines the agent procedure used to interact with each task, EnvironmentSpec identifies the…
TIPO DE EVIDENCIA
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13705#S4.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 3 Framework describe la intervención y su construcción: AgentCompass modularizes benchmark-specific evaluation scripts into composable components connected by stable protocols. As shown in Figure 2 , each evaluation consists of a benchmark , harness , and environment , with optional recipes and analyzers. In AgentCompass, an evaluation run is specified through a declarative RunRequest . The request separates the substantive objects of evaluation from the operational choices used to execute it. Specifically, BenchmarkSpec defines the task and evaluation metrics, HarnessSpec defines the agent procedure used to interact with each task, EnvironmentSpec identifies the…

QUÉ APORTA

Si este tipo de abstracción se consolida, podríamos empezar a evaluar independientemente modelo vs. harness vs. entorno, algo fundamental para saber por qué un agente funciona realmente.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en model selection reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

model selectionregresión continuabenchmarking de agentesQA de sistemas agentic.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando model selection cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAmodel selection con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora model selection frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si model selection puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.