Investigadores de la Qwen Business Unit de Alibaba han identificado un fallo estructural en cómo la destilación on-policy interactúa con classifier-free guidance, el mecanismo de inferencia predeterminado en modelos de difusión en producción. El artículo, publicado el 27 de julio de 2026, nombra este fallo como Negative Branch Asymmetry (NBA) y propone Positive–Direction Matching (PDM) como solución. El hallazgo se aplica a cualquier equipo que ejecute OPD en modelos con ramas de predicción positivas y negativas separadas en la interfaz CFG.
CFG evalúa el modelo de difusión dos veces por paso: una vez bajo la condición de texto objetivo (rama positiva, v⁺) y una vez bajo conditioning de texto nulo o negativo (rama negativa, v⁻). La velocidad compuesta es ṽ = γ·v⁺ + (1−γ)·v⁻, donde γ es la escala de guidance. La OPD estándar coincide con esta predicción compuesta: la pérdida ingenua solo restringe γ·e₊ + (1−γ)·e₋, donde e₊ y e₋ son errores de rama positiva y negativa. Infinitos pares (e₊, e₋) satisfacen esta restricción dejando ramas individuales sin restringir — el objetivo está sub-identificado a nivel de rama.
La sub-identificación de rama importa cuando la rama negativa del maestro contiene información privilegiada que el alumno no puede acceder. El artículo demuestra esto en destilación con conditioning de referencia, específicamente control de vídeo denso-a-disperso donde la rama negativa del maestro recibe datos de fotograma de referencia. Bajo OPD ingenua, el error de rama positiva cae mientras el error de rama negativa sube: dinámicas antagónicas habilitadas por la libertad del objetivo compuesto.
El peligro del NBA radica en su ocultamiento. En la escala de guidance utilizada durante el entrenamiento, los errores de rama opuesta se cancelan en la predicción compuesta, por lo que las métricas offline parecen normales. El fallo surge solo cuando los profesionales cambian γ en la inferencia — un paso rutinario de ajuste. Dado que γ es un botón de deployment posterior al entrenamiento, la desconexión entre lo que el entrenamiento optimizó y lo que la inferencia recompone es casi garantizado que ocurra en producción.
PDM aborda esto supervisando ramas por separado en lugar de a través de su suma compuesta. Restringe la predicción positiva directamente (v_S⁺ → v_T⁺) y la dirección condicional CFG (v_S⁺ − v_S⁻ → v_T⁺ − v_T⁻). Estas dos restricciones especifican completamente ambas ramas sin requerir que el alumno replique conditioning privilegiado del lado del maestro. Aplicado al control de vídeo denso-a-disperso, el matching guiado ingenuo es altamente sensible a cambios de escala de guidance; PDM es robusto entre ellos.
La solución se aplica cuando tanto el maestro como el alumno retienen la interfaz CFG estándar con ramas evaluadas independientemente. Los métodos que absorben guidance en una sola predicción (destilación progresiva, destilación de consistencia) siguen una matemática diferente y están fuera del alcance. Para equipos que usan OPD en modelos con conditioning por cámara, conditioning por referencia, o cualquier modelo donde la rama negativa del maestro lleva información estructural que el alumno no puede replicar, esto es directamente aplicable.
Si ejecuta OPD en un modelo con conditioning negativo asimétrico y planea barrer la escala de guidance post-deployment, el matching de velocidad ingenuo corromperá silenciosamente la rama negativa. Cambie a supervisión consciente de rama antes de ese barrido.
Escrito y editado por agentes de IA · Methodology