# Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/harness-handbook-making-evolving-agent-harnesses-readable-navigable-and
- Fuente primaria: https://arxiv.org/abs/2607.13285
- Versión leída: v1
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang
- Fecha del corte: 14 JULIO 2026.
- Área: AGENTES

## Tesis y contexto

Trata el harness agentic como un objeto de ingeniería de primera clase. El comportamiento de prompts, estado, tools y coordinación suele estar distribuido por grandes repositorios; el trabajo busca hacerlo navegable y editable según comportamientos, no simplemente según archivos.

- Problema: Cambiar «cómo actúa el agente» exige localizar código disperso entre múltiples componentes.
- Por qué importa: Continúa una tendencia muy marcada en las últimas semanas: el modelo deja de ser el único producto; el harness se convierte en software crítico que también necesitará arquitectura, observabilidad y mantenimiento automatizado.

## Evidencia reportada

- **reported-result**: Handbook guidance improves plan quality without increasing planner token use. [localizador](https://arxiv.org/html/2607.13285#S4)
- **reported-result**: These gains persist across request types and localization difficulty levels. [localizador](https://arxiv.org/html/2607.13285#S4)
- **reported-result**: The Handbook-Assisted arm achieves a higher overall win rate on both harnesses: 38.3% versus 28.3% on Codex and 45.6% versus 26.7% on Terminus-2. [localizador](https://arxiv.org/html/2607.13285#S4)
- **reported-result**: The improvement is consistent across all three judges: the gap is 10.0 percentage points for every judge on Codex and ranges from 13.3 to 26.7 points on Terminus-2. [localizador](https://arxiv.org/html/2607.13285#S4)

## Lectura y límite

- Método: La lectura de 2 Related Work describe la intervención y su construcción: Our work is closely related to three research directions: agent harnesses, harness evolution, and repository representations for coding agents. We briefly review each direction and discuss how Harness Handbook differs from existing approaches by introducing an explicit operational behavior representation for behavior localization. Recent work has increasingly recognized the agent harness as a first-class software abstraction that extends foundation models into deployable agentic systems. Rather than treating prompting, tool use, memory, and execution logic as implementation details, Code as Agent Harness…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiment.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: Before — two-mark Boolean handshake:
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiment.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2607.13285): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2607.13285): tipo abstract
- [Método · 2 Related Work](https://arxiv.org/html/2607.13285#S2): tipo section
- [Evaluación · 4 Experiment](https://arxiv.org/html/2607.13285#S4): tipo section
- [Cierre · 5 Conclusion](https://arxiv.org/html/2607.13285#S5): tipo section

## Próxima prueba

- ¿La propuesta mejora desarrollo de plataformas agentic frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [https://openai.com/index/introducing-codex/](https://openai.com/index/introducing-codex/)
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)
- [developer contributions](https://github.com/brucemiller/LaTeXML/issues)

## Enlaces relacionados

- [VAKRA](https://luiseduardodemiguel.com/research-ia/markdown/papers/vakra)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)
- [SkillSentry](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillsentry)