# SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/skiller
- Fuente primaria: https://arxiv.org/abs/2608.10538
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Chenhao Dang, Siyuan Xiong, Conghui He y Weijia Li
- Fecha del corte: 11 AGO 2026
- Área: SLM · SKILLS · RL

## Tesis y contexto

SKILLER usa un modelo fuerte como actor y crítico para generar skills adaptados al ejecutor pequeño. La señal de aprendizaje viaja en lenguaje natural y no exige modificar directamente el modelo executor.

- Problema: Un procedimiento escrito para un modelo frontier no tiene por qué ser comprensible, económico o eficaz para un modelo pequeño.
- Por qué importa: Apunta a una arquitectura con economía clara: un modelo caro diseña procedimientos y un SLM barato los ejecuta muchas veces. Eso puede abrir agentes verticales locales y edge.

## Evidencia reportada

- **reported-result**: En cinco benchmarks, los skills de SKILLER mejoran entre 4,3 y 20,4 puntos el modelo Qwen3.5-9B y entre 1,8 y 13,3 puntos el modelo 4B frente a los métodos comparados. [localizador](https://arxiv.org/html/2608.10538v1#S4)

## Lectura y límite

- Método: Usa un modelo fuerte como profesor y crítico para extraer procedimientos en lenguaje natural que un modelo pequeño pueda ejecutar. La transferencia ocurre en forma de skill, no de pesos.
- Límite: Un skill claro para una tarea estable puede degradarse cuando cambian los datos, las herramientas o las condiciones del entorno.
- Confianza editorial: Alta
- Limitación: Los resultados proceden de cinco benchmarks y dos modelos pequeños; la transferencia entre ejecutores, tareas abiertas y herramientas no queda demostrada por la tabla principal.
- Limitación: La generación con un modelo fuerte desplaza el coste a la fase de diseño y el skill puede degradarse cuando cambia el entorno, por lo que la mejora no es una reducción de coste total garantizada.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.10538): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.10538v1): tipo abstract
- [Código · GitHub](https://github.com/DANG-ai/SKILLER): tipo section
- [Resultados principales · §4](https://arxiv.org/html/2608.10538v1#S4): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.10538): tipo abstract

## Próxima prueba

- ¿Los skills adaptados al ejecutor conservan la mejora cuando cambian las tareas y el modelo pequeño, sin depender de una semilla concreta?
- Métrica: Puntuación media, transferencia a tareas no vistas, coste de generación y variación entre semillas.
- Regla de parada: Parar si la mejora mediana es menor de 5 puntos o si la variación entre semillas supera 20% de la del baseline.

## Recursos reproducibles
- [Código · GitHub](https://github.com/DANG-ai/SKILLER)

## Enlaces relacionados

- [SkillSentry](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillsentry)
- [ElasticBack](https://luiseduardodemiguel.com/research-ia/markdown/papers/elasticback)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)