Lo esencial antes de invertir más tiempo.
Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.
Resultado reportado con fuente enlazada · 6 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
Qué está reportado y qué conviene comprobar.
Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands.
baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments
Kimi-K2.6 has a higher share of bad cases involving multilingual mixing on search tasks and repeated tool calls.
contexto: 4 Experiments
Such beyond-score trajectory analysis therefore provides a more informative basis for diagnosing agentic behavior and identifying targeted directions for model improvement.
contexto: 4 Experiments
Notably, although GLM-5.2(FP8) outperforms Claude-Opus-4.8 by about 12 points on SWE-Pro, it also shows roughly 30% more suspected reward-hacking samples.
30% · baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.
MÉTODO / La lectura de 3 Framework describe la intervención y su construcción: AgentCompass modularizes benchmark-specific evaluation scripts into composable components connected by stable protocols. As shown in Figure 2 , each evaluation consists of a benchmark , harness , and environment , with optional recipes and analyzers. In AgentCompass, an evaluation run is specified through a declarative RunRequest . The request separates the substantive objects of evaluation from the operational choices used to execute it. Specifically, BenchmarkSpec defines the task and evaluation metrics, HarnessSpec defines the agent procedure used to interact with each task, EnvironmentSpec identifies the… [Fuente: https://arxiv.org/html/2607.13705#S3]
RESULTADO / La sección 4 Experiments informa: Models can deviate substantially from their officially reported baselines under the unified AgentCompass protocol, such as Claude-Opus-4.8 dropping by 8.7 points on DeepSearchQA and GLM-5.2(FP8) improving by 15.0 points on SWE-bench-Pro with OpenHands. Kimi-K2.6 has a higher share of bad cases involving multilingual mixing on search tasks and repeated tool calls. Such beyond-score trajectory analysis therefore provides a more informative basis for diagnosing agentic behavior and identifying targeted directions for model improvement. [Fuente: https://arxiv.org/html/2607.13705#S4]
LÍMITE / El cierre de la fuente señala: In this paper, we introduced AgentCompass, an open-source and highly extensible infrastructure designed to systematize the evaluation of LLM-based agents. By decoupling the evaluation pipeline into independent Model, Benchmark, Harness, and Environment components, it eliminates redundant engineering and ensures rigorous reproducibility. Supported by a fault-tolerant asynchronous runtime and granular trajectory analysis, AgentCompass goes beyond… La transferencia a model selection requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.13705#S5].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- PROBLEMA
- Comparar agentes es difícil porque cada benchmark trae su propio entorno, harness y lógica de ejecución.
- MÉTODO
- La lectura de 3 Framework describe la intervención y su construcción: AgentCompass modularizes benchmark-specific evaluation scripts into composable components connected by stable protocols. As shown in Figure 2 , each evaluation consists of a benchmark , harness , and environment , with optional recipes and analyzers. In AgentCompass, an evaluation run is specified through a declarative RunRequest . The request separates the substantive objects of evaluation from the operational choices used to execute it. Specifically, BenchmarkSpec defines the task and evaluation metrics, HarnessSpec defines the agent procedure used to interact with each task, EnvironmentSpec identifies the…
- TIPO DE EVIDENCIA
- La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13705#S4.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 3 Framework describe la intervención y su construcción: AgentCompass modularizes benchmark-specific evaluation scripts into composable components connected by stable protocols. As shown in Figure 2 , each evaluation consists of a benchmark , harness , and environment , with optional recipes and analyzers. In AgentCompass, an evaluation run is specified through a declarative RunRequest . The request separates the substantive objects of evaluation from the operational choices used to execute it. Specifically, BenchmarkSpec defines the task and evaluation metrics, HarnessSpec defines the agent procedure used to interact with each task, EnvironmentSpec identifies the…
Si este tipo de abstracción se consolida, podríamos empezar a evaluar independientemente modelo vs. harness vs. entorno, algo fundamental para saber por qué un agente funciona realmente.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en model selection reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando model selection cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si model selection puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.