NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 20

MULTIMODAL · SAE · CONTROL

Multimodal Model Diffing for Feature Discovery and Control

InteresanteLectura primaria completa

Comparar cómo cambian las features al añadir visión permite convertir la interpretabilidad multimodal en una interfaz de auditoría y control.

AUTHORS / LABHunar Batra, Lachin Naghashyar, Ashkan Khakzar y colaboradores; University of Oxford y Microsoft
FECHA10 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.

EVIDENCIA DISPONIBLE

Retirar las features descubiertas por MMDiff reduce de forma selectiva 12% el rendimiento espacial, 17% el OCR y 24% la tasa de éxito de ataques multimodales sin afectar VQA; dirigir esas features mejora 3,6% la accuracy espacial y 1,8% la de OCR frente al steering de una capa.

Resultado reportado con fuente enlazada · 5 localizadores disponibles.
LÍMITE

Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.

SIGUIENTE PRUEBA

Cambio causal por tarea, accuracy no objetivo, tasa de rechazo seguro y reproducibilidad entre semillas.

EN UNA FRASE

MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.

SEÑALMultimodal · Safety
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Retirar las features descubiertas por MMDiff reduce de forma selectiva 12% el rendimiento espacial, 17% el OCR y 24% la tasa de éxito de ataques multimodales sin afectar VQA; dirigir esas features mejora 3,6% la accuracy espacial y 1,8% la de OCR frente al steering de una capa.

-12% espacial; -17% OCR; -24% ASR; +3,6% espacial; +1,8% OCR · baseline: steering estándar de una sola capa y rendimiento sin intervención · contexto: LLaVA-MORE, PaliGemma 2 e InternVL3.5

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

MMDiff intenta hacer visible qué cambia dentro de un modelo cuando se añade la modalidad visual. Las features multimodales son difíciles de identificar, auditar y controlar; aplicar un sparse autoencoder únicamente a la versión final no dice con claridad qué representación apareció o cambió por el entrenamiento multimodal.

El método compara SAEs de un modelo lingüístico base con los de su versión multimodal y construye interfaces a nivel de feature. Puede aislar el diff entre modelos, buscar activaciones contrastivas por token y por tarea, y probar intervenciones causales: eliminar una feature para observar qué capacidad cae o dirigirla para intentar reforzarla. La evaluación cubre familias como LLaVA-MORE, PaliGemma 2 e InternVL3.5 y tareas visuales, espaciales, de seguridad y OCR.

Los experimentos de eliminación degradan selectivamente el comportamiento objetivo: aproximadamente un 12 % en capacidades espaciales y un 17 % en OCR, mientras reducen un 24 % la tasa de éxito de ataques multimodales de seguridad sin impacto en VQA. Las intervenciones de steering mejoran un 3,6 % lo espacial y un 1,8 % OCR frente a una baseline de una sola capa. Es evidencia de control causal, no solo de correlación de activaciones.

La consecuencia para producto es que un diff multimodal puede funcionar como una prueba de regresión: antes y después de añadir visión, localizar qué familias de features han cambiado y qué coste tiene intervenir. El límite es que las features y sus efectos son dependientes de la familia y de la intervención; localizar una feature no equivale a explicar por completo una capacidad distribuida ni garantiza ausencia de efectos colaterales.

DECISIÓN RÁPIDAUsar el diff multimodal como checklist de regresión cuando un modelo incorpora visión, OCR o razonamiento espacial.
NO LO SOBREINTERPRETES

Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.

PROBLEMA
No sabemos con precisión qué mecanismos internos aparecen al añadir visión ni cómo intervenir sobre OCR, razonamiento espacial o seguridad multimodal.
MÉTODO
Compara features de un modelo lingüístico y su versión multimodal para localizar cambios, aislar capacidades y probar intervenciones causales.
TIPO DE EVIDENCIA
Análisis de representaciones y experimentos de intervención sobre capacidades multimodales; es una herramienta de auditoría más que un benchmark de producto.
LÍMITE
Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.
FIGURA DE LECTURA / MULTIMODALModelo texto / modelo visión / feature diferencial
Abrir paper original ↗

Comparar representaciones abre una interfaz para auditar y dirigir capacidades.

BASEFeature lingüística
DELTACambio al añadir visión
CONTROLIntervención causal
PARA RECORDAR

Localizar una feature es el inicio de una auditoría, no una explicación completa.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / Análisis de representaciones y experimentos de intervención sobre capacidades multimodales; es una herramienta de auditoría más que un benchmark de producto.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Compara features de un modelo lingüístico y su versión multimodal para localizar cambios, aislar capacidades y probar intervenciones causales.

QUÉ APORTA

Acerca la interpretabilidad a una herramienta operativa: auditar una capacidad, localizarla y cambiarla sin volver a entrenar todo el modelo.

QUÉ NO PRUEBA

Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.

Cómo lo llevaría a un proyecto

Usar el diff multimodal como checklist de regresión cuando un modelo incorpora visión, OCR o razonamiento espacial.

Safety multimodalAuditoría de VLMsDebuggingModel steeringRobótica

Preguntas que conviene probar

  • ¿Qué features cambian cuando añadimos datos de nuestro dominio?
  • ¿Podemos intervenir sin degradar capacidades no relacionadas?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADATres VLMs, tareas espaciales/OCR/VQA y un conjunto de seguridad visual held out, con ablación y steering preregistrados.
PREGUNTA¿Las features identificadas siguen siendo selectivas cuando se prueban en modelos y tareas visuales que no participaron en el descubrimiento?
MÉTRICACambio causal por tarea, accuracy no objetivo, tasa de rechazo seguro y reproducibilidad entre semillas.
PARADAParar si una intervención selectiva reduce más de 2% una capacidad no objetivo o no replica el efecto en dos semillas.

Mi lectura

La interpretabilidad deja de ser solo una lupa: empieza a parecerse a un panel de control causal.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.