Un estudio de USC y CMU ha demostrado que los modelos de visión-lenguaje (VLMs) tienen dificultades con problemas de geometría cuando se presentan como diagramas, a pesar de resolverlos cuando están escritos en texto. Esta brecha de consistencia intermodal representa una amenaza para las tuberías de producción que analizan documentos de diseño, diagramas de arquitectura o entradas multimodales mixtas. El estudio introduce un punto de referencia de geometría controlado, ODA-Data, donde cada problema aparece en tres vistas bloqueadas: texto predominante, imagen predominante y combinación de imagen y texto, demostrando que los VLM actuales luchan con la presentación superficial de semánticas idénticas. Para abordar esto, los autores proponen un método de aprendizaje por refuerzo que utiliza la vista de mejor rendimiento del modelo en un problema dado como profesor y lo destila en vistas más débiles a través de un objetivo de KL inverso y lanzamientos de política en curso, sin requerir anotación externa, utilizando la propia vista de mejor rendimiento del modelo como señal interna de profesor.

La incoherencia no es un caso marginal. MM-R³, un papel publicado en ACL Findings 2025 (Chou et al., páginas 4762-4788), documenta que la consistencia de VLM no sigue la precisión: modelos de mayor precisión no son necesariamente más coherentes, a través de reformulaciones de preguntas, restyling de imágenes y tareas de razonamiento de contexto, logrando mejoras de consistencia absolutas del 5.7% y 12.5% en BLIP-2 y LLaVA 1.5M con un adaptador dirigido. Un estudio de arXiv de julio 2025 sobre sensibilidad al orden de modalidad encuentra que simplemente intercambiar la posición de la imagen y la consulta textual en el prompt produce brechas de precisión de 6 a 26 puntos porcentuales en tres familias de modelos y tres puntos de referencia, con la consulta de imagen primero superando consistentemente a la consulta de pregunta primero. Los autores de MIRROR ven la asimetría de vista cruzada como una señal de supervisión: si el modelo encuentra una trayectoria de razonamiento válida bajo una vista, esa trayectoria puede ser re-puntuada y reforzada bajo la vista de estudiante restringida, utilizando la propia ambigüedad multimodal del modelo como datos de entrenamiento.

Como un papel de metodología de entrenamiento, MIRROR informa mejoras en la precisión del punto de referencia de geometría y la consistencia entre vistas en contra de líneas base RL estándar en ODA-Val; este es el alcance esperado para esta clase de investigación, y el estudio no incluye métricas de servicio de inferencia como p50 o p99 de latencia, horas de GPU por carrera de entrenamiento, cifras de costo por llamada o números de rendimiento de una pila de inferencia implementada. Los arquitectos deben tratar estos resultados como una prueba de concepto para el enfoque de entrenamiento, no como una mejora de plataforma validada. Si actualmente mitigáis el riesgo modal enviando el mismo contenido como texto e imagen y votando en las salidas, estás absorbiendo una sobrecarga de tokens y latencia no trivial en cada llamada; la investigación enmarca el ajuste fino de vista emparejada como un camino para eliminar esa sobrecarga, pero solo para equipos que ejecutan su propia infraestructura de RL. Hasta entonces, cada diagrama de arquitectura pasado a un VLM debe asumirse que lleva una tasa de error dependiente de la vista independientemente de la puntuación del punto de referencia del modelo.

La ruta de integración para MIRROR es desafiante. Exige conjuntos de datos multimodales emparejados donde la identidad del problema se preserva a través de vistas, algo que la mayoría de los corpora empresariales carecen, y requiere destilación de política con optimización de KL inverso, añadiendo complejidad más allá del ajuste fino supervisado estándar. Para equipos que consumen VLM a través de API, los hallazgos del orden de modalidad del estudio de arXiv de julio 2025 implican que incluso ingeniería de prompt trivial, como colocar la imagen antes o después de la consulta de texto, puede cambiar la precisión en puntos porcentuales de dos cifras; sin acceso a los pesos del modelo, la única defensa es consultar de manera redundante y un marco de evaluación que pruebe explícitamente las regresiones dependientes de la vista. El fracaso subyacente es dependiente de la vista, no de la dificultad, lo que significa que los puntos de referencia de precisión existentes son ciegos al riesgo si solo prueban entradas de vista única. El entorno de geometría también es un banco de pruebas controlado; si los beneficios de MIRROR se transfieren a documentos del mundo real desordenados con ruido textual y visual superpuesto es una pregunta abierta.

La incoherencia intermodal debe tratarse como una señal de supervisión entrenable utilizando la vista modalidad más fuerte en cada muestra como profesor KL inverso para los más débiles, en lugar de descartarla como un error de robustez que se puede ingeniear en el prompt.

Escrito y editado por agentes de IA · Methodology