# SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/skillsentry
- Fuente primaria: https://arxiv.org/abs/2608.09253
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: You Lu, Xinyu Huang, Bihuan Chen y Xin Peng
- Fecha del corte: 10 AGO 2026
- Área: SKILLS · FIABILIDAD · RUNTIME

## Tesis y contexto

SkillSentry transforma un skill y trazas previas en una guía de runtime, monitoriza la ejecución y la actualiza con nuevas evidencias. El objetivo no es mejorar la prosa del procedimiento, sino su cumplimiento.

- Problema: Los LLM pueden saltarse pasos, improvisar o desviarse de una secuencia aunque el procedimiento original sea correcto.
- Por qué importa: Los skills empiezan a parecerse a procedimientos verificables: tienen ciclo de vida, observabilidad, control de versiones y necesidad de assurance.

## Evidencia reportada

- **reported-result**: SkillSentry mejora 24,1% de media la tasa de éxito entre skills y reduce 41,1% la desviación estándar entre ejecuciones repetidas; entregar la guía por paso aporta 5,8% más éxito que colocarla completa en el system prompt. [localizador](https://arxiv.org/html/2608.09253v1#S4.T2)

## Lectura y límite

- Método: Convierte un skill en una guía de ejecución observada: monitoriza la trayectoria, detecta desviaciones y puede actualizar la orientación usando nuevas trazas.
- Límite: La monitorización puede añadir latencia o convertirse en otra capa opaca si no explica qué regla activó una intervención.
- Confianza editorial: Alta
- Limitación: La evaluación cubre 15 skills, dos agentes y dos backbones por agente; la robustez ante procedimientos nuevos, herramientas no observadas o equipos distintos queda abierta.
- Limitación: La mejora media y la reducción de desviación dependen de las trazas históricas y del DSL; una guía de runtime puede introducir latencia o intervenir sobre una decisión correcta.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.09253): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.09253v1): tipo abstract
- [Tabla II · efectividad · §IV](https://arxiv.org/html/2608.09253v1#S4.T2): tipo table
- [HTML · fuente navegable](https://arxiv.org/html/2608.09253): tipo abstract

## Próxima prueba

- ¿La guía por paso mejora la fiabilidad de skills nuevos sin convertir el runtime en un cuello de botella?
- Métrica: Tasa de éxito, desviación entre repeticiones, intervenciones correctas, latencia p95 y pasos omitidos.
- Regla de parada: Parar si no hay al menos 5% de mejora de éxito y si la latencia p95 crece más de 15%.

## Recursos reproducibles
- [HTML · fuente primaria](https://arxiv.org/html/2608.09253v1)

## Enlaces relacionados

- [SKILLER](https://luiseduardodemiguel.com/research-ia/markdown/papers/skiller)
- [ElasticBack](https://luiseduardodemiguel.com/research-ia/markdown/papers/elasticback)
- [Diagnosis Before Recovery](https://luiseduardodemiguel.com/research-ia/markdown/papers/diagnosis-before-recovery)