¿Puede una skill convertirse en un activo evolutivo sin volverse una caja negra peligrosa?
La fiabilidad puede fallar antes del razonamiento.
Una skill reusable no es sólo un archivo de instrucciones. Es una pieza de comportamiento que debe conservar sus precondiciones, pruebas, límites, reglas acumuladas y posibilidad de rollback cuando cambia de tarea o repositorio.
La pregunta es si la mejora de un harness puede viajar entre trabajos sin convertir el aprendizaje en una caja negra. Para responderla hay que seguir la cadena completa: extraer comportamiento, evolucionarlo, registrar reglas y comprobar el contrato.
Qué aporta cada paper
Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.
- Automating SKILL.md Generation for Computer-Using Agents via Interaction TraExplora extraer una skill desde trayectorias de interacción, haciendo explícito qué comportamiento se pretende reutilizar.
- TTHETrata el harness como un componente que puede evolucionar durante la ejecución, lo que convierte la mejora en un problema de control y no sólo de prompting.
- Self-Improving AI Coding Agents Through Accumulated Behavioral RulesAcumula reglas de comportamiento a partir de tareas anteriores y abre la pregunta de cuándo una regla ayuda y cuándo congela un sesgo o un fallo.
- From Prompts to ContractsTraslada el centro de gravedad desde el prompt hacia contratos, artefactos y validaciones que permiten auditar el comportamiento empresarial.
- Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
- 01
Explora extraer una skill desde trayectorias de interacción, haciendo explícito qué comportamiento se pretende reutilizar.
Problema que aborda. Las skills explícitas hacen agentes más inspeccionables, pero escribirlas a mano no escala.
Qué aporta. Extrae bibliotecas de habilidades desde trayectorias GUI: segmenta interacciones, agrupa skills candidatas y entrena una política consciente de esas skills.
Resultado reportado por la fuente. NMI drops for larger k , while purity stays near 0.63, so we use k=8 in the main analysis.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.
- 02TTHE2026-07-06 · v1Fuente primaria ↗
Trata el harness como un componente que puede evolucionar durante la ejecución, lo que convierte la mejora en un problema de control y no sólo de prompting.
Problema que aborda. Los agentes actuales suelen desplegarse con un workflow fijo, aunque cambien la distribución de tareas, las herramientas o los errores encontrados.
Qué aporta. Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.
Resultado reportado por la fuente. Table 1 sweeps the number of proposers per round G against the maximum number of generation rounds R .
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- 03
Acumula reglas de comportamiento a partir de tareas anteriores y abre la pregunta de cuándo una regla ayuda y cuándo congela un sesgo o un fallo.
Problema que aborda. Los coding agents pueden recibir la misma corrección humana repetidamente y volver a cometer el mismo error en sesiones posteriores.
Qué aporta. Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.
Resultado reportado por la fuente. Table III shows the growth of the rule set across the observation period.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experimental Results.
- 04From Prompts to Contracts2026-07-06 · v1Fuente primaria ↗
Traslada el centro de gravedad desde el prompt hacia contratos, artefactos y validaciones que permiten auditar el comportamiento empresarial.
Problema que aborda. Los prompts monolíticos mezclan lógica de negocio, recuperación, reglas, formato y razonamiento, dificultando auditoría y mantenimiento.
Qué aporta. Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.
Resultado reportado por la fuente. In the harness condition, live structured output is validated against the output contract and, on failure, the deterministic composer supplies the reader-facing answer.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 System Validation Results.
El puente es un orden de controles, no una suma de papers.
La conexión editorial es un ciclo de evolución gobernada: una interacción descubre una práctica; el harness la convierte en regla; el contrato define cuándo es válida; las pruebas y el rollback limitan su transferencia. Los papers aportan piezas de ese ciclo, pero no prueban todavía una métrica común de reutilización segura entre repositorios, modelos y equipos.
Qué cambia si la dirección es correcta
- Versionar cada skill junto con sus condiciones de uso, casos de regresión y señales que obligan a revertirla.
- Evaluar transferencia a una tarea nueva, no sólo mejora en la trayectoria que generó la regla.
- Hacer que una skill no confiable falle cerrada y explique qué contrato o prueba le falta antes de entrar en producción.
La dirección queda parcialmente apoyada: los trabajos cubren piezas complementarias, pero no presentan una métrica común de reutilización segura ni una historia de rollback entre tareas y repositorios.
Que los cuatro papers comparten una relación verificable con skills, reglas, harness o contratos y no son solo una coincidencia temática.
Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
Qué comprobé
Cómo intentaría confirmarla o hacerla caer.
Timebox: 3 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.
Lo que hice bien
Convertí la combinación en una pregunta de evolución y rollback, no en una promesa de automatización total.
Lo que hice mal o dejé corto
La unidad 'skill' sigue siendo ambigua entre paper, archivo, política y comportamiento observado.
No prueba que las skills aprendidas sean seguras fuera del benchmark ni que un contrato detecte todos los efectos laterales.