# Multimodal Model Diffing for Feature Discovery and Control
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/mmdiff
- Fuente primaria: https://arxiv.org/abs/2608.09928
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar y colaboradores; University of Oxford y Microsoft
- Fecha del corte: 10 AGO 2026
- Área: MULTIMODAL · SAE · CONTROL

## Tesis y contexto

MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.

- Problema: No sabemos con precisión qué mecanismos internos aparecen al añadir visión ni cómo intervenir sobre OCR, razonamiento espacial o seguridad multimodal.
- Por qué importa: Acerca la interpretabilidad a una herramienta operativa: auditar una capacidad, localizarla y cambiarla sin volver a entrenar todo el modelo.

## Evidencia reportada

- **reported-result**: Retirar las features descubiertas por MMDiff reduce de forma selectiva 12% el rendimiento espacial, 17% el OCR y 24% la tasa de éxito de ataques multimodales sin afectar VQA; dirigir esas features mejora 3,6% la accuracy espacial y 1,8% la de OCR frente al steering de una capa. [localizador](https://arxiv.org/html/2608.09928v1#S4)

## Lectura y límite

- Método: Compara features de un modelo lingüístico y su versión multimodal para localizar cambios, aislar capacidades y probar intervenciones causales.
- Límite: Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.
- Confianza editorial: Media
- Limitación: La selección de SAE, capas y modelos multimodales puede cambiar qué se llama feature específica; una intervención causal aislada no garantiza una explicación completa.
- Limitación: Las variaciones en OCR, razonamiento espacial y ataques no cubren toda la seguridad multimodal ni descartan artefactos del steering o pérdida de capacidades no medidas.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.09928): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.09928v1): tipo abstract
- [Proyecto · MMDiff](https://pixl.cs.ox.ac.uk/mmdiff): tipo section
- [Experimentos de diff y steering · §4](https://arxiv.org/html/2608.09928v1#S4): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.09928): tipo abstract

## Próxima prueba

- ¿Las features identificadas siguen siendo selectivas cuando se prueban en modelos y tareas visuales que no participaron en el descubrimiento?
- Métrica: Cambio causal por tarea, accuracy no objetivo, tasa de rechazo seguro y reproducibilidad entre semillas.
- Regla de parada: Parar si una intervención selectiva reduce más de 2% una capacidad no objetivo o no replica el efecto en dos semillas.

## Recursos reproducibles
- [Proyecto · MMDiff](https://pixl.cs.ox.ac.uk/mmdiff)

## Enlaces relacionados

- [Mechanist](https://luiseduardodemiguel.com/research-ia/markdown/papers/mechanist)
- [MBA](https://luiseduardodemiguel.com/research-ia/markdown/papers/mbabench)
- [VibeLifeBench](https://luiseduardodemiguel.com/research-ia/markdown/papers/vibelifebench)