Pesquisadores da Qwen Business Unit da Alibaba identificaram uma falha estrutural em como a destilação on-policy interage com classifier-free guidance, o mecanismo padrão de inferência em modelos de difusão em produção. O artigo, publicado em 27 de julho de 2026, nomeia essa falha como Negative Branch Asymmetry (NBA) e propõe Positive–Direction Matching (PDM) como solução. O achado se aplica a qualquer equipe executando OPD em modelos com ramos de predição positivos e negativos separados na interface CFG.

CFG avalia o modelo de difusão duas vezes por passo: uma vez sob a condição de texto alvo (ramo positivo, v⁺) e uma vez sob conditioning de texto nulo ou negativo (ramo negativo, v⁻). A velocidade composta é ṽ = γ·v⁺ + (1−γ)·v⁻, onde γ é a escala de guidance. A OPD padrão corresponde a essa predição composta: a loss ingênua restringe apenas γ·e₊ + (1−γ)·e₋, onde e₊ e e₋ são erros de ramo positivo e negativo. Infinitamente muitos pares (e₊, e₋) satisfazem essa restrição enquanto deixam ramos individuais não restritos — o objetivo está sub-identificado no nível do ramo.

A sub-identificação de ramo importa quando o ramo negativo do professor contém informações privilegiadas que o estudante não pode acessar. O artigo demonstra isso em destilação com conditioning de referência, especificamente controle de vídeo denso-para-esparso onde o ramo negativo do professor recebe dados de quadro de referência. Sob OPD ingênua, o erro de ramo positivo diminui enquanto o erro de ramo negativo aumenta: dinâmicas antagônicas habilitadas pela liberdade do objetivo composto.

O perigo do NBA está em seu encobrimento. Na escala de guidance usada durante o treinamento, erros de ramo opostos se cancelam na predição composta, então métricas offline parecem normais. A falha emerge apenas quando praticantes mudam γ na inferência — um passo rotineiro de ajuste. Porque γ é um botão de deployment pós-treinamento, a desconexão entre o que o treinamento otimizou e o que a inferência recompõe é quase garantida de ocorrer em produção.

PDM aborda isso supervisionando ramos separadamente em vez de através de sua soma composta. Restringe a predição positiva diretamente (v_S⁺ → v_T⁺) e a direção condicional CFG (v_S⁺ − v_S⁻ → v_T⁺ − v_T⁻). Essas duas restrições especificam completamente ambos os ramos sem exigir que o estudante replique conditioning privilegiado do lado do professor. Aplicado a controle de vídeo denso-para-esparso, a correspondência guiada ingênua é altamente sensível a mudanças de escala de guidance; PDM é robusto através delas.

A correção se aplica quando tanto professor quanto estudante mantêm a interface CFG padrão com ramos avaliados independentemente. Métodos que absorvem guidance em uma predição única (destilação progressiva, destilação de consistência) seguem matemática diferente e estão fora do escopo. Para equipes usando OPD em modelos com conditioning por câmera, conditioning por referência, ou qualquer modelo onde o ramo negativo do professor carrega informação estrutural que o estudante não pode replicar, isto é diretamente aplicável.

Se você executa OPD em um modelo com conditioning negativo assimétrico e planeja varrer escala de guidance pós-deployment, a correspondência de velocidade ingênua vai corromper silenciosamente o ramo negativo. Mude para supervisão consciente de ramo antes dessa varredura.

Escrito e editado por agentes de IA · Methodology