Lo esencial antes de invertir más tiempo.
MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.
Retirar las features descubiertas por MMDiff reduce de forma selectiva 12% el rendimiento espacial, 17% el OCR y 24% la tasa de éxito de ataques multimodales sin afectar VQA; dirigir esas features mejora 3,6% la accuracy espacial y 1,8% la de OCR frente al steering de una capa.
Resultado reportado con fuente enlazada · 5 localizadores disponibles.Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.
Cambio causal por tarea, accuracy no objetivo, tasa de rechazo seguro y reproducibilidad entre semillas.
MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.
Qué está reportado y qué conviene comprobar.
Retirar las features descubiertas por MMDiff reduce de forma selectiva 12% el rendimiento espacial, 17% el OCR y 24% la tasa de éxito de ataques multimodales sin afectar VQA; dirigir esas features mejora 3,6% la accuracy espacial y 1,8% la de OCR frente al steering de una capa.
-12% espacial; -17% OCR; -24% ASR; +3,6% espacial; +1,8% OCR · baseline: steering estándar de una sola capa y rendimiento sin intervención · contexto: LLaVA-MORE, PaliGemma 2 e InternVL3.5
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.MMDiff intenta hacer visible qué cambia dentro de un modelo cuando se añade la modalidad visual. Las features multimodales son difíciles de identificar, auditar y controlar; aplicar un sparse autoencoder únicamente a la versión final no dice con claridad qué representación apareció o cambió por el entrenamiento multimodal.
El método compara SAEs de un modelo lingüístico base con los de su versión multimodal y construye interfaces a nivel de feature. Puede aislar el diff entre modelos, buscar activaciones contrastivas por token y por tarea, y probar intervenciones causales: eliminar una feature para observar qué capacidad cae o dirigirla para intentar reforzarla. La evaluación cubre familias como LLaVA-MORE, PaliGemma 2 e InternVL3.5 y tareas visuales, espaciales, de seguridad y OCR.
Los experimentos de eliminación degradan selectivamente el comportamiento objetivo: aproximadamente un 12 % en capacidades espaciales y un 17 % en OCR, mientras reducen un 24 % la tasa de éxito de ataques multimodales de seguridad sin impacto en VQA. Las intervenciones de steering mejoran un 3,6 % lo espacial y un 1,8 % OCR frente a una baseline de una sola capa. Es evidencia de control causal, no solo de correlación de activaciones.
La consecuencia para producto es que un diff multimodal puede funcionar como una prueba de regresión: antes y después de añadir visión, localizar qué familias de features han cambiado y qué coste tiene intervenir. El límite es que las features y sus efectos son dependientes de la familia y de la intervención; localizar una feature no equivale a explicar por completo una capacidad distribuida ni garantiza ausencia de efectos colaterales.
Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.
- PROBLEMA
- No sabemos con precisión qué mecanismos internos aparecen al añadir visión ni cómo intervenir sobre OCR, razonamiento espacial o seguridad multimodal.
- MÉTODO
- Compara features de un modelo lingüístico y su versión multimodal para localizar cambios, aislar capacidades y probar intervenciones causales.
- TIPO DE EVIDENCIA
- Análisis de representaciones y experimentos de intervención sobre capacidades multimodales; es una herramienta de auditoría más que un benchmark de producto.
- LÍMITE
- Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.
Comparar representaciones abre una interfaz para auditar y dirigir capacidades.
Localizar una feature es el inicio de una auditoría, no una explicación completa.
No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.
Abrir fuente primaria ↗La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
Compara features de un modelo lingüístico y su versión multimodal para localizar cambios, aislar capacidades y probar intervenciones causales.
Acerca la interpretabilidad a una herramienta operativa: auditar una capacidad, localizarla y cambiarla sin volver a entrenar todo el modelo.
Localizar una feature no basta para entender una capacidad distribuida; eliminarla puede producir efectos colaterales difíciles de prever.
Cómo lo llevaría a un proyecto
Usar el diff multimodal como checklist de regresión cuando un modelo incorpora visión, OCR o razonamiento espacial.
Preguntas que conviene probar
- ¿Qué features cambian cuando añadimos datos de nuestro dominio?
- ¿Podemos intervenir sin degradar capacidades no relacionadas?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La interpretabilidad deja de ser solo una lupa: empieza a parecerse a un panel de control causal.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.