# ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger–Rule Optimization
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/elasticback
- Fuente primaria: https://arxiv.org/abs/2608.09577
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Hao Sui, Simeng Qin, Jie Liao y colaboradores
- Fecha del corte: 10 AGO 2026
- Área: SEGURIDAD · SKILLS · SUPPLY CHAIN

## Tesis y contexto

ElasticBack demuestra un ataque de backdoor sobre skills de agentes sin modificar los pesos del modelo. La regla maliciosa se activa solo bajo una condición y mantiene un comportamiento normal fuera de ella.

- Problema: Los equipos empiezan a descargar y compartir skills como si fueran archivos de configuración, sin aplicar todavía controles equivalentes a los de una dependencia de software.
- Por qué importa: La procedencia, los permisos, el sandbox, la firma y la auditoría de un skill deberían formar parte del producto, no quedar como una revisión manual opcional.

## Evidencia reportada

- **reported-result**: En tres comportamientos objetivo, 50 skills por comportamiento y cuatro LLMs de agente, ElasticBack reporta una tasa de ataque alta con falsos positivos cercanos a cero, mantiene la accuracy limpia y transfiere entre modelos. [localizador](https://arxiv.org/html/2608.09577v1#S5.T1)

## Lectura y límite

- Método: Demuestra que un skill puede contener una regla condicional maliciosa que permanece inactiva hasta que aparece un disparador. El riesgo está en la cadena de suministro del procedimiento.
- Límite: El patrón de ataque puede cambiar cuando los agentes, los marketplaces y los sistemas de permisos evolucionen.
- Confianza editorial: Alta
- Limitación: Es un estudio ofensivo controlado sobre skills construidos y cuatro modelos; no mide la prevalencia de ataques reales ni la eficacia de una cadena de suministro concreta.
- Limitación: La evasión de las defensas evaluadas no significa invisibilidad universal: firmas, sandboxing, análisis de procedencia y pruebas de comportamiento pueden cambiar el resultado.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.09577): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.09577v1): tipo abstract
- [Tabla 1 · resultados · §5](https://arxiv.org/html/2608.09577v1#S5.T1): tipo table
- [HTML · fuente navegable](https://arxiv.org/html/2608.09577): tipo abstract

## Próxima prueba

- ¿Un gate de procedencia y ejecución en sandbox detecta skills sospechosos sin bloquear skills benignos?
- Métrica: Recall de casos inseguros, falsos positivos, tiempo de revisión y cobertura de reglas por skill.
- Regla de parada: Parar si el recall de casos críticos baja de 95% o si los falsos positivos superan 2% en skills benignos.

## Recursos reproducibles
- [HTML · fuente primaria](https://arxiv.org/html/2608.09577v1)

## Enlaces relacionados

- [SKILLER](https://luiseduardodemiguel.com/research-ia/markdown/papers/skiller)
- [SkillSentry](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillsentry)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)