# Una skill reusable vale cuando conserva su contrato de comportamiento
> Hipótesis editorial multi-paper. Resultado del test: partially-supported-by-corpus.

- Página: https://luiseduardodemiguel.com/research-ia/hypotheses/skill-contracts-are-evolvable-assets
- Test: research-hypotheses:corpus-triangulation:v1
- Fecha de comprobación: 2026-08-19
- Combinación: Automating SKILL.md + TTHE + Self-Improving Coding Agents + From Prompts to Contracts

## Hipótesis

La reutilización de skills no debería medirse por cuántos archivos produce un agente, sino por si el contrato, las pruebas, las reglas acumuladas y el rollback permiten transferir una mejora sin transportar un fallo.

Pregunta: ¿Puede una skill convertirse en un activo evolutivo sin volverse una caja negra peligrosa?

## Problema y contexto

Una skill reusable no es sólo un archivo de instrucciones. Es una pieza de comportamiento que debe conservar sus precondiciones, pruebas, límites, reglas acumuladas y posibilidad de rollback cuando cambia de tarea o repositorio.

La pregunta es si la mejora de un harness puede viajar entre trabajos sin convertir el aprendizaje en una caja negra. Para responderla hay que seguir la cadena completa: extraer comportamiento, evolucionarlo, registrar reglas y comprobar el contrato.

## Qué aporta cada paper

### Automating SKILL.md Generation for Computer-Using Agents via Interaction Tra — Explora extraer una skill desde trayectorias de interacción, haciendo explícito qué comportamiento se pretende reutilizar.

- Problema que aborda: Las skills explícitas hacen agentes más inspeccionables, pero escribirlas a mano no escala.
- Qué aporta: Extrae bibliotecas de habilidades desde trayectorias GUI: segmenta interacciones, agrupa skills candidatas y entrena una política consciente de esas skills.
- Resultado reportado por la fuente: NMI drops for larger k , while purity stays near 0.63, so we use k=8 in the main analysis.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/automating-skill-md-generation-for-computer-using-agents-via-interaction
- Fuente primaria (v1): https://arxiv.org/html/2606.20363#S4

### TTHE — Trata el harness como un componente que puede evolucionar durante la ejecución, lo que convierte la mejora en un problema de control y no sólo de prompting.

- Problema que aborda: Los agentes actuales suelen desplegarse con un workflow fijo, aunque cambien la distribución de tareas, las herramientas o los errores encontrados.
- Qué aporta: Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.
- Resultado reportado por la fuente: Table 1 sweeps the number of proposers per round G against the maximum number of generation rounds R .
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/tthe-test-time-harness-evolution
- Fuente primaria (v1): https://arxiv.org/html/2607.08124#S4

### Self-Improving AI Coding Agents Through Accumulated Behavioral Rules — Acumula reglas de comportamiento a partir de tareas anteriores y abre la pregunta de cuándo una regla ayuda y cuándo congela un sesgo o un fallo.

- Problema que aborda: Los coding agents pueden recibir la misma corrección humana repetidamente y volver a cometer el mismo error en sesiones posteriores.
- Qué aporta: Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.
- Resultado reportado por la fuente: Table III shows the growth of the rule set across the observation period.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experimental Results.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/self-improving-ai-coding-agents-through-accumulated-behavioral-rules
- Fuente primaria (v1): https://arxiv.org/html/2607.13091#S2

### From Prompts to Contracts — Traslada el centro de gravedad desde el prompt hacia contratos, artefactos y validaciones que permiten auditar el comportamiento empresarial.

- Problema que aborda: Los prompts monolíticos mezclan lógica de negocio, recuperación, reglas, formato y razonamiento, dificultando auditoría y mantenimiento.
- Qué aporta: Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.
- Resultado reportado por la fuente: In the harness condition, live structured output is validated against the output contract and, on failure, the deterministic composer supplies the reader-facing answer.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 System Validation Results.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/from-prompts-to-contracts-harness-engineering-for-auditable-enterprise-l
- Fuente primaria (v1): https://arxiv.org/html/2607.08028#S3

## Puente de síntesis

La conexión editorial es un ciclo de evolución gobernada: una interacción descubre una práctica; el harness la convierte en regla; el contrato define cuándo es válida; las pruebas y el rollback limitan su transferencia. Los papers aportan piezas de ese ciclo, pero no prueban todavía una métrica común de reutilización segura entre repositorios, modelos y equipos.

## Implicaciones si la dirección es correcta

- Versionar cada skill junto con sus condiciones de uso, casos de regresión y señales que obligan a revertirla.
- Evaluar transferencia a una tarea nueva, no sólo mejora en la trayectoria que generó la regla.
- Hacer que una skill no confiable falle cerrada y explique qué contrato o prueba le falta antes de entrar en producción.

## Resultado y límites

La dirección queda parcialmente apoyada: los trabajos cubren piezas complementarias, pero no presentan una métrica común de reutilización segura ni una historia de rollback entre tareas y repositorios.

Que los cuatro papers comparten una relación verificable con skills, reglas, harness o contratos y no son solo una coincidencia temática.

Límite: Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
No demuestra: No prueba que las skills aprendidas sean seguras fuera del benchmark ni que un contrato detecte todos los efectos laterales.

## Próxima prueba

- Entrada: Tres tareas repetidas con una skill base, una variante generada y un conjunto de pruebas de regresión sobre permisos y calidad.
- Baseline: Prompt/manual operativo sin skill versionada ni reglas acumuladas.
- Métrica: Tasa de éxito, regresiones, transferencia a una tarea nueva, coste de revisión humana y reversibilidad.
- Regla de parada: Parar y hacer rollback ante una regresión de seguridad o si la mejora solo aparece en la tarea de entrenamiento.
- Timebox: 3 semanas

## Papers

- [Automating SKILL.md Generation for Computer-Using Agents via Interaction Tra](https://luiseduardodemiguel.com/research-ia/markdown/papers/automating-skill-md-generation-for-computer-using-agents-via-interaction): https://arxiv.org/abs/2606.20363
- [TTHE](https://luiseduardodemiguel.com/research-ia/markdown/papers/tthe-test-time-harness-evolution): https://arxiv.org/html/2607.08124v1
- [Self-Improving AI Coding Agents Through Accumulated Behavioral Rules](https://luiseduardodemiguel.com/research-ia/markdown/papers/self-improving-ai-coding-agents-through-accumulated-behavioral-rules): https://arxiv.org/abs/2607.13091
- [From Prompts to Contracts](https://luiseduardodemiguel.com/research-ia/markdown/papers/from-prompts-to-contracts-harness-engineering-for-auditable-enterprise-l): https://arxiv.org/html/2607.08028v1