NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 15

SEGURIDAD · SKILLS · SUPPLY CHAIN

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger–Rule Optimization

ImprescindibleLectura primaria completa

Un skill puede convertirse en una dependencia maliciosa: el comportamiento peligroso puede permanecer dormido hasta que aparece un disparador aparentemente inocuo.

AUTHORS / LABHao Sui, Simeng Qin, Jie Liao y colaboradores
FECHA10 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

ElasticBack demuestra un ataque de backdoor sobre skills de agentes sin modificar los pesos del modelo. La regla maliciosa se activa solo bajo una condición y mantiene un comportamiento normal fuera de ella.

EVIDENCIA DISPONIBLE

En tres comportamientos objetivo, 50 skills por comportamiento y cuatro LLMs de agente, ElasticBack reporta una tasa de ataque alta con falsos positivos cercanos a cero, mantiene la accuracy limpia y transfiere entre modelos.

Resultado con localizador exacto · 4 localizadores disponibles.
LÍMITE

El patrón de ataque puede cambiar cuando los agentes, los marketplaces y los sistemas de permisos evolucionen.

SIGUIENTE PRUEBA

Recall de casos inseguros, falsos positivos, tiempo de revisión y cobertura de reglas por skill.

EN UNA FRASE

ElasticBack demuestra un ataque de backdoor sobre skills de agentes sin modificar los pesos del modelo. La regla maliciosa se activa solo bajo una condición y mantiene un comportamiento normal fuera de ella.

SEÑALSeguridad · Supply chain
EVIDENCIAResultado con localizador exacto
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay localizadores exactos registrados.
RESULTADO REPORTADO

En tres comportamientos objetivo, 50 skills por comportamiento y cuatro LLMs de agente, ElasticBack reporta una tasa de ataque alta con falsos positivos cercanos a cero, mantiene la accuracy limpia y transfiere entre modelos.

3 comportamientos · 50 skills por comportamiento · 4 LLMs · baseline: entradas benignas y defensas de despliegue evaluadas por los autores · contexto: Backdoor condicional de un único skill sin modificar pesos

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

ElasticBack trata los skills como lo que pueden llegar a ser en un ecosistema de agentes: dependencias de software que se descargan, cargan bajo demanda y afectan a cada agente que las instala. El riesgo que estudia no exige modificar los pesos del modelo. Basta con introducir una regla en el documento del skill que permanezca dormida hasta que el usuario produzca una señal concreta.

El ataque acopla dos piezas: una regla maliciosa R dentro del skill y un disparador aparentemente benigno T en la consulta. Una construcción de trigger-as-switch hace que la carga solo se active cuando ambas coinciden. Después congela la regla y busca disparadores que mantengan el comportamiento malicioso eficaz y discreto, de modo que las entradas benignas sigan pareciendo normales.

Los experimentos cubren tres comportamientos objetivo, 50 skills por comportamiento y cuatro LLMs de agentes. El resumen informa de una tasa de éxito de ataque alta, una tasa de falsos positivos cercana a cero, precisión limpia preservada, transferencia entre modelos y evasión de defensas de despliegue. La conclusión no es que todos los skills estén comprometidos, sino que un skill individual ya puede ser un vector suficiente.

La consecuencia de diseño es tratar cada skill como una dependencia ejecutable: procedencia, permisos, firma, diff de cambios, sandbox, escaneo de instrucciones y monitorización de comportamiento. El trabajo es un threat model experimental, no una medición de prevalencia en marketplaces reales; aun así, demuestra que revisar solo los pesos del modelo o probar una ruta feliz no cubre la superficie de riesgo.

DECISIÓN RÁPIDATratar los skills como dependencias ejecutables: revisar procedencia, permisos, disparadores, cambios y comportamiento en sandbox.
NO LO SOBREINTERPRETES

El patrón de ataque puede cambiar cuando los agentes, los marketplaces y los sistemas de permisos evolucionen.

PROBLEMA
Los equipos empiezan a descargar y compartir skills como si fueran archivos de configuración, sin aplicar todavía controles equivalentes a los de una dependencia de software.
MÉTODO
Demuestra que un skill puede contener una regla condicional maliciosa que permanece inactiva hasta que aparece un disparador. El riesgo está en la cadena de suministro del procedimiento.
TIPO DE EVIDENCIA
Ataque experimental sobre skills de agentes; sirve como señal de threat model, no como estimación de frecuencia de ataques reales.
LÍMITE
El patrón de ataque puede cambiar cuando los agentes, los marketplaces y los sistemas de permisos evolucionen.
FIGURA DE LECTURA / THREAT MODELSkill normal / disparador oculto / acción maliciosa
Abrir paper original ↗

El riesgo se desplaza a la dependencia que el agente carga y ejecuta.

A SIMPLE VISTAComportamiento normal
TRIGGERCondición aparentemente inocua
BACKDOORRegla que se activa
PARA RECORDAR

La procedencia, el permiso y el sandbox deben ser parte de la experiencia del skill.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / Ataque experimental sobre skills de agentes; sirve como señal de threat model, no como estimación de frecuencia de ataques reales.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Demuestra que un skill puede contener una regla condicional maliciosa que permanece inactiva hasta que aparece un disparador. El riesgo está en la cadena de suministro del procedimiento.

QUÉ APORTA

La procedencia, los permisos, el sandbox, la firma y la auditoría de un skill deberían formar parte del producto, no quedar como una revisión manual opcional.

QUÉ NO PRUEBA

El patrón de ataque puede cambiar cuando los agentes, los marketplaces y los sistemas de permisos evolucionen.

Cómo lo llevaría a un proyecto

Tratar los skills como dependencias ejecutables: revisar procedencia, permisos, disparadores, cambios y comportamiento en sandbox.

Scanners de skillsMarketplaces segurosCI agenticSandboxingControl de dependencias

Preguntas que conviene probar

  • ¿Qué permisos necesita realmente cada skill?
  • ¿Podemos detectar una regla dormida sin ejecutar todos sus escenarios?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADACorpus aislado de skills firmados y mutados, sin ejecutar payloads, con revisión estática, sandbox y monitor de comportamiento.
PREGUNTA¿Un gate de procedencia y ejecución en sandbox detecta skills sospechosos sin bloquear skills benignos?
MÉTRICARecall de casos inseguros, falsos positivos, tiempo de revisión y cobertura de reglas por skill.
PARADAParar si el recall de casos críticos baja de 95% o si los falsos positivos superan 2% en skills benignos.

Mi lectura

La cadena de suministro de agentes empieza en el documento que el modelo carga, no solo en el modelo que ejecuta.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.