Investigadores de la Universidad de Oxford y la Universidad de Toronto publicaron MMDiff el 10 de agosto, un framework que utiliza autocodificadores dispersos como herramientas de auditoría quirúrgica para modelos multimodales. La herramienta permite que los ingenieros aíslen exactamente qué características internas cambiaron cuando la columna vertebral del lenguaje fue expuesta a datos visuales, y luego eliminen o amplíen esas características sin tocar los pesos.

El ajuste fino de un LLM preentrenado en datos de visión reformula su espacio de características internas de maneras difíciles de rastrear posteriormente. Los autocodificadores dispersos pueden descomponer estados ocultos en direcciones interpretables post-hoc, pero no te dicen qué direcciones fueron alteradas por el entrenamiento multimodal ni te dan un medio limpio para orientar esas direcciones una vez encontradas. MMDiff cierra ambas brechas entrenando un par de SAE — uno en el modelo de lenguaje base, otro en su contraparte adaptada para multimodal — y comparando los diccionarios de características resultantes para señalar direcciones que rotaron o emergieron.

El framework expone tres operaciones. El aislamiento de características compara diccionarios SAE de LM base y multimodales para identificar qué características fueron reutilizadas por el entrenamiento visión-lenguaje. La detección específica de tareas ejecuta análisis de disparo contrastivo por token: proporciona al modelo una consulta de razonamiento espacial versus una consulta VQA genérica y mantén solo características que se activan diferencialmente. El control a nivel de características permite a los equipos eliminar causalmente una dirección descubierta (ablación) u orientarse a lo largo de ella (amplificación) sin reentrenamiento.

Los autores probaron MMDiff en LLaVA-MORE, PaliGemma 2 e InternVL3.5, evaluando comprensión visual-espacial, OCR y benchmarks de seguridad multimodal. La eliminación causal de características identificadas degradó comportamientos objetivo selectivamente: el desempeño de tareas espaciales disminuyó 12%, OCR disminuyó 17% y las tasas de éxito de ataques de seguridad multimodal cayeron 24%. El desempeño de VQA no se vio afectado, confirmando que las características eliminadas eran específicas del comportamiento objetivo en lugar de estar entrelazadas con el razonamiento visual general. Amplificar las direcciones descubiertas mejoró la precisión espacial en 3,6% y la precisión de OCR en 1,8% en promedio comparado con una línea base de dirección de capa única estándar.

Para equipos ajustando modelos visión-lenguaje en datos propietarios — documentos internos, imágenes médicas, esquemas de fabricación — MMDiff responde "¿qué exactamente enseñó el ajuste fino al modelo?" antes de implementar. Hoy esa auditoría es en gran medida cualitativa: suites de evaluación, red-teaming, pruebas de comportamiento. MMDiff ofrece una respuesta a nivel de características: aquí están las direcciones que se movieron, aquí está el subconjunto específico de tareas, aquí hay un interruptor para cada uno. La reducción de ataques de seguridad del 24% se logró eliminando un pequeño conjunto de direcciones identificadas, no mediante entrenamiento adversarial o filtrado a nivel de salida.

El entrenamiento SAE de MMDiff añade un paso de cómputo además del entrenamiento multimodal — necesitas entrenar SAE tanto en el LM base como en el modelo adaptado antes de que comience la comparación. El documento no reporta el costo de entrenamiento SAE ni la sobrecarga de latencia para dirección en tiempo de inferencia, que importa para implementaciones en producción. Las tres familias de modelos probadas son todas arquitecturas de peso abierto; la transferencia a modelos con solo acceso de inferencia es incierta. Y los reclamos causales descansan en intervenciones en espacio de activación que asumen que la descomposición SAE es fiel — una pregunta abierta conocida en interpretabilidad mecanicista.

Para arquitectos que construyen pipelines de comprensión de documentos o IA incorporada con ajuste fino interno, MMDiff es un paso concreto hacia puertas de implementación interpretables: entrena el par SAE, compara las características, ejecuta pruebas contrastivas contra tu tarea, y decide qué direcciones suprimir antes de la producción.