Nunchaku traz inferência de difusão SVDQuant de 4 bits para o ecossistema Hugging Face, Diffusers
Hugging Face integrou Nunchaku, um mecanismo de inferência de código aberto liderado por MIT/NVIDIA, na biblioteca Diffusers, disponibilizando modelos de difusão quantizados de 4 bits (FLUX, Qwen-Image, PixArt, SANA) para inferência local. Nunchaku implementa SVDQuant, uma técnica de quantização pós-treinamento (W4A4: pesos e ativações em precisão de 4 bits) que absorve ativações de outlier via decomposição de baixo rank, mantendo fidelidade visual próxima a FP16. Em 12B FLUX.1-dev, Nunchaku consegue redução de memória de 3,6x vs. BF16 e acelerado de 3,0x vs. baselines apenas de peso de 4 bits, permitindo inferência GPU de laptop (RTX 4090 16GB) sem offloading de CPU.
O mecanismo conecta APIs Python compatíveis com PyTorch (herdadas de Diffusers) com kernels C++/CUDA otimizados manualmente, oferecendo suporte para fluxos de trabalho ComfyUI e pipelines Diffusers diretos. Modelos são distribuídos em variantes INT4 (para GPUs Turing/Ampere/Ada) e NVFP4 (para GPUs Blackwell 50-series) com rank configurável (r32 para velocidade, r128 para qualidade) e contagens de etapas (4-etapas, 8-etapas). O projeto mudou de MIT HAN Lab para nunchaku-tech independente no final de 2025 e lançou v1.2.0 (janeiro de 2026) com ganho de 20-30% de perf em Z-Image, LoRA e suporte RTX 20-series.
Nunchaku fecha uma lacuna em difusão de código aberto: ferramentas existentes exigem costura manual de codificadores, VAEs e UNets; Nunchaku fornece um pipeline integrado e de nível de produção. Todos os modelos quantizados são validados contra baselines BF16 via LPIPS com divergência de qualidade aceitável <15%. Este não é um artefato de pesquisa—já é usado em produção por startups de geração de imagem (Decagon, Cubed) e integrado com UIs populares.
Arquitetos direcionando geração de imagens de borda devem notar Nunchaku como o caminho para difusão GPU-local em escala. A redução de memória de 3,6x é material para inferência de datacenter onde VRAM é gargalo. Integração Diffusers significa que nenhuma operação personalizada é necessária—scripts existentes funcionam com mudanças mínimas. O cronograma de lançamento em andamento (atualizas de janeiro/fevereiro de 2026) sinaliza manutenção madura, embora a qualidade no mundo real em arquiteturas mais novas (SANA) ainda esteja se estabilizando.