# Robust Harmful Features Under Jailbreak Attacks
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/robust-harmful-features-under-jailbreak-attacks
- Fuente primaria: https://arxiv.org/abs/2606.28153
- Versión leída: v2
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Yanchen Yin, Dongqi Han, Linghui Li
- Fecha del corte: 26 JUNIO 2026; ICML 2026 ORAL.
- Área: MEMORIA · SEGURIDAD

## Tesis y contexto

Estudia mecánicamente qué pasa dentro de un LLM durante jailbreaks. Encuentra cabezas de atención comprometidas y cabezas alineadas con seguridad; las señales dañinas persisten incluso cuando el modelo falla externamente. Leer esas activaciones permite detección robusta sin entrenamiento.

- Problema: Los jailbreaks se tratan como prompts, pero faltaba evidencia mecanística.
- Por qué importa: Puede guiar defensas internas más robustas.

## Evidencia reportada

- **reported-result**: For Jaccard consistency , under extreme under-smoothing ( \alpha\leq 0.4 ), estimator variance increases, causing heads near the threshold boundary to cross the threshold and reducing Jaccard consistency. [localizador](https://arxiv.org/html/2606.28153#Sx2)
- **reported-result**: As \alpha increases to 0.6–0.8, consistency rapidly recovers, with both J_{\text{ACH}} and J_{\text{SAH}} rising into the 0.7–0.9 range. [localizador](https://arxiv.org/html/2606.28153#Sx2)
- **reported-result**: At \alpha=1.4 , Llama-2 still achieves J_{\text{SAH}}=1.000 , while Llama-3 yields 0.882. [localizador](https://arxiv.org/html/2606.28153#Sx2)
- **reported-result**: Under extreme over-smoothing ( \alpha\geq 1.6 ), high bias blurs distributional differences, and Jaccard consistency decreases again. [localizador](https://arxiv.org/html/2606.28153#Sx2)

## Lectura y límite

- Método: La lectura de 3 Method describe la intervención y su construcción: Our goal is to identify which attention heads provide a localized causal pathway for attack success and which heads provide robust safety features. To this end, we propose a distribution-overlap-based framework for classifying attention heads. The core idea is as follows: we back-project the mid-layer refusal direction through the OV circuits to attention heads across layers, quantifying each head’s contribution to refusal behavior; we then collect activation distributions under three input types (benign, harmful, attack) and apply a two-stage filtering procedure based on overlap coefficients to identify two…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Impact Statement.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: This work has limitations: our analysis focuses on attention mechanisms without covering MLP layers; it uses a single refusal direction as a first-order summary rather than a full refusal subspace; and the primary mechanistic experiments use 7–8B strongly aligned models, though cross-family detection results and preliminary 70B analysis (Appendix E ) provide generalization evidence. Dataset construction requires paired samples where attacks succeed…
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Impact Statement.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2606.28153): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2606.28153): tipo abstract
- [Método · 3 Method](https://arxiv.org/html/2606.28153#S3): tipo section
- [Evaluación · Impact Statement](https://arxiv.org/html/2606.28153#Sx2): tipo section
- [Cierre · 6 Conclusion](https://arxiv.org/html/2606.28153#S6): tipo section

## Próxima prueba

- ¿La propuesta mejora safety monitors frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [https://github.com/MorningYin/Robust-Harmful-Features](https://github.com/MorningYin/Robust-Harmful-Features)
- [https://github.com/tatsu-lab/stanford_alpaca](https://github.com/tatsu-lab/stanford_alpaca)
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)

## Enlaces relacionados

- [NiyamAI](https://luiseduardodemiguel.com/research-ia/markdown/papers/niyamai)
- [MNC](https://luiseduardodemiguel.com/research-ia/markdown/papers/mnc)
- [Mechanism Design for Generative Engine](https://luiseduardodemiguel.com/research-ia/markdown/papers/mechanism-design-generative-engines)