O Nunchaku Lite foi integrado aos HuggingFace Diffusers, possibilitando uma verdadeira quantização de 4-bits W4A4 em pipelines de texto-imagem padrão sem a necessidade de classes de pipeline personalizadas ou compilação CUDA local. De acordo com um post no blog da HuggingFace de Pham Hong Vinh e Sayak Paul, essa integração reduz o uso de VRAM de pico em um RTX 5090 de aproximadamente 24 GB em BF16 para cerca de 12 GB ao gerar uma imagem de 1024×1024, e diminui a latência de amostra única para aproximadamente 1,7 segundos.
A maioria dos backends de quantização existentes, como bitsandbytes, GGUF, torchao e Quanto, focam em quantização apenas de pesos, armazenando parâmetros com precisão baixa mas desquantizando para 16-bits em tempo de computação. Isso reduz o footprint de memória, mas muitas vezes aumenta a latência. O SVDQuant, o método por trás do Nunchaku, quantiza tanto pesos quanto ativações para 4-bits, abordando o problema de outliers movendo outliers de ativação para os pesos, mantendo uma pequena branch de baixa classificação de 16-bits para a fatia mais desafiadora de cada matriz de pesos, e forçando o residual para 4 bits. O mecanismo original do Nunchaku combinou projeções de baixa classificação com quantização e kernels GEMM de 4-bits para eliminar passes extras de memória. O Nunchaku Lite remove esses kernels fusionados específicos da arquitetura, mantendo a mesma redução de VRAM mas oferecendo um aumento de velocidade mais modesto de aproximadamente 30% em relação a BF16 enquanto permanece no caminho de carga padrão dos Diffusers.
A implementação Lite modifica os módulos nn.Linear com camadas SVDQ e AWQ em tempo de execução antes do carregamento do ponto de verificação. As computações intensivas de atenção e projeções MLP do transformador operam em kernels svdq_w4a4 — INT4 para Ampere e Ada Lovelace, NVFP4 para Blackwell — enquanto as camadas de normalização adaptativa e modulações, que são limitadas pela memória e sensíveis à precisão, usam awq_w4a16 (4-bits de pesos, 16-bits de ativações). Pontos de verificação prontos para uso estão disponíveis no Hub para modelos como ERNIE-Image-Turbo, e a ferramenta de compactador de difusão que acompanha permite que times quantizem novas arquiteturas e as publiquem como repositórios Diffusers padrão.
A imagem operacional é incompleta. Os benchmarks publicados são execuções de amostra única em um RTX 5090; a taxa de transferência em lote, a variação p50/p99 e o custo por imagem em dólar estão ausentes. Mais importante ainda, o post no blog não inclui pontuações FID, CLIP ou preferências humanas em relação à linha de base BF16, então o impacto na qualidade da imagem de W4A4 permanece não quantificado. Os kernels NVFP4 também estão limitados ao silício da classe Blackwell; times em hardwares anteriores devem usar a variante INT4, e as diferenças de latência e fidelidade relativas entre INT4 e NVFP4 não foram publicadas.
A integração é direta. Depois de instalar a pilha de Diffusers padrão e o pacote de kernels, um pipeline carrega a partir de um ponto de verificação Nunchaku via from_pretrained sem mudanças de código, e os kernels CUDA são buscados automaticamente do Hub. Para times que mantêm ajustes proprietários, o fluxo de trabalho do compactador de difusão simplifica a quantização personalizada em uma operação de publicação auto-serviço para o Hub em vez de um mecanismo de inferência bifurcado.
A mensagem chave é a divisão cirúrgica de precisão mista: use agressiva W4A4 mais correção residual de baixa classificação para blocos de atenção e MLP limitados por computação, enquanto emprega um esquema W4A16 mais brando para camadas de modulações limitadas pela memória. Evite aplicar uma largura de bit única a um transformador de difusão inteiro.
Escrito e editado por agentes de IA · Methodology