NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
HIPÓTESIS/PUBLICACIÓN 04

SKILLS / CONTRATOS / MEJORA

Una skill reusable vale cuando conserva su contrato de comportamiento

La reutilización de skills no debería medirse por cuántos archivos produce un agente, sino por si el contrato, las pruebas, las reglas acumuladas y el rollback permiten transferir una mejora sin transportar un fallo.

COMBINACIÓNAutomating SKILL.md + TTHE + Self-Improving Coding Agents + From Prompts to Contracts
TESTtriangulación documental reproducible
ESTADOpartially supported by corpus
PREGUNTA DE INVESTIGACIÓN

¿Puede una skill convertirse en un activo evolutivo sin volverse una caja negra peligrosa?

PROBLEMA Y CONTEXTO

La fiabilidad puede fallar antes del razonamiento.

Una skill reusable no es sólo un archivo de instrucciones. Es una pieza de comportamiento que debe conservar sus precondiciones, pruebas, límites, reglas acumuladas y posibilidad de rollback cuando cambia de tarea o repositorio.

La pregunta es si la mejora de un harness puede viajar entre trabajos sin convertir el aprendizaje en una caja negra. Para responderla hay que seguir la cadena completa: extraer comportamiento, evolucionarlo, registrar reglas y comprobar el contrato.

EVIDENCE MAP / RESULTADOS DE LAS FUENTES

Qué aporta cada paper

Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.

FIGURA / MAPA DE EVIDENCIA4 fuentes, un puente que todavía hay que probar.
SVG estático · sin runtime de gráficos
Mapa de evidencia de la hipótesis4 papers aportan controles distintos que convergen en un orden de lectura, recuperación, organización de evidencia y respuesta bajo presupuesto.FUENTE 01Automating SKILL.md Generation for Computer-Using Agents via Interaction TraFUENTE 02TTHEFUENTE 03Self-Improving AI Coding Agents Through Accumulated Behavioral RulesFUENTE 04From Prompts to ContractsPUENTE EDITORIALextraer → contratarprobar → revertircon contrato y rollbackAFIRMACIÓN A PROBARlas skills evolucionansin ocultar regresionespuente editorial, no resultado conjunto
La figura muestra una síntesis editorial: las flechas no significan que los autores hayan evaluado juntos este workflow.
  1. Automating SKILL.md Generation for Computer-Using Agents via Interaction TraExplora extraer una skill desde trayectorias de interacción, haciendo explícito qué comportamiento se pretende reutilizar.
  2. TTHETrata el harness como un componente que puede evolucionar durante la ejecución, lo que convierte la mejora en un problema de control y no sólo de prompting.
  3. Self-Improving AI Coding Agents Through Accumulated Behavioral RulesAcumula reglas de comportamiento a partir de tareas anteriores y abre la pregunta de cuándo una regla ayuda y cuándo congela un sesgo o un fallo.
  4. From Prompts to ContractsTraslada el centro de gravedad desde el prompt hacia contratos, artefactos y validaciones que permiten auditar el comportamiento empresarial.
  5. Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
  1. 01

    Explora extraer una skill desde trayectorias de interacción, haciendo explícito qué comportamiento se pretende reutilizar.

    Problema que aborda. Las skills explícitas hacen agentes más inspeccionables, pero escribirlas a mano no escala.

    Qué aporta. Extrae bibliotecas de habilidades desde trayectorias GUI: segmenta interacciones, agrupa skills candidatas y entrena una política consciente de esas skills.

    Resultado reportado por la fuente. NMI drops for larger k , while purity stays near 0.63, so we use k=8 in the main analysis.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.

  2. 02
    TTHE2026-07-06 · v1
    Fuente primaria ↗

    Trata el harness como un componente que puede evolucionar durante la ejecución, lo que convierte la mejora en un problema de control y no sólo de prompting.

    Problema que aborda. Los agentes actuales suelen desplegarse con un workflow fijo, aunque cambien la distribución de tareas, las herramientas o los errores encontrados.

    Qué aporta. Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.

    Resultado reportado por la fuente. Table 1 sweeps the number of proposers per round G against the maximum number of generation rounds R .

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

  3. 03

    Acumula reglas de comportamiento a partir de tareas anteriores y abre la pregunta de cuándo una regla ayuda y cuándo congela un sesgo o un fallo.

    Problema que aborda. Los coding agents pueden recibir la misma corrección humana repetidamente y volver a cometer el mismo error en sesiones posteriores.

    Qué aporta. Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.

    Resultado reportado por la fuente. Table III shows the growth of the rule set across the observation period.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experimental Results.

  4. 04

    Traslada el centro de gravedad desde el prompt hacia contratos, artefactos y validaciones que permiten auditar el comportamiento empresarial.

    Problema que aborda. Los prompts monolíticos mezclan lógica de negocio, recuperación, reglas, formato y razonamiento, dificultando auditoría y mantenimiento.

    Qué aporta. Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.

    Resultado reportado por la fuente. In the harness condition, live structured output is validated against the output contract and, on failure, the deterministic composer supplies the reader-facing answer.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 System Validation Results.

SÍNTESIS EDITORIAL / INFERENCIA DEL AUTOR

El puente es un orden de controles, no una suma de papers.

La conexión editorial es un ciclo de evolución gobernada: una interacción descubre una práctica; el harness la convierte en regla; el contrato define cuándo es válida; las pruebas y el rollback limitan su transferencia. Los papers aportan piezas de ese ciclo, pero no prueban todavía una métrica común de reutilización segura entre repositorios, modelos y equipos.

Qué cambia si la dirección es correcta

  • Versionar cada skill junto con sus condiciones de uso, casos de regresión y señales que obligan a revertirla.
  • Evaluar transferencia a una tarea nueva, no sólo mejora en la trayectoria que generó la regla.
  • Hacer que una skill no confiable falle cerrada y explique qué contrato o prueba le falta antes de entrar en producción.
RESULTADO DEL TEST / 2026-08-19

La dirección queda parcialmente apoyada: los trabajos cubren piezas complementarias, pero no presentan una métrica común de reutilización segura ni una historia de rollback entre tareas y repositorios.

Que los cuatro papers comparten una relación verificable con skills, reglas, harness o contratos y no son solo una coincidencia temática.

Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.

partially supported by corpus5/5 checks pasados

Qué comprobé

PASSPapers públicos encontrados4/4
PASSLecturas primarias completas4/4
PASSCortes o fechas cubiertos3
PASSLocalizadores disponibles22
PASSReferencias de resultado resueltas3/3
PRÓXIMA PRUEBA / TODAVÍA NO EJECUTADA

Cómo intentaría confirmarla o hacerla caer.

ENTRADATres tareas repetidas con una skill base, una variante generada y un conjunto de pruebas de regresión sobre permisos y calidad.
BASELINEPrompt/manual operativo sin skill versionada ni reglas acumuladas.
MÉTRICATasa de éxito, regresiones, transferencia a una tarea nueva, coste de revisión humana y reversibilidad.
PARADAParar y hacer rollback ante una regresión de seguridad o si la mejora solo aparece en la tarea de entrenamiento.

Timebox: 3 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.

AUTOCRÍTICA / REVISIÓN DEL AUTOR

Lo que hice bien

Convertí la combinación en una pregunta de evolución y rollback, no en una promesa de automatización total.

Lo que hice mal o dejé corto

La unidad 'skill' sigue siendo ambigua entre paper, archivo, política y comportamiento observado.

No prueba que las skills aprendidas sean seguras fuera del benchmark ni que un contrato detecte todos los efectos laterales.