Nunchaku trae inferencia de difusión SVDQuant de 4 bits al ecosistema Hugging Face, Diffusers
Hugging Face integró Nunchaku, un motor de inferencia de código abierto liderado por MIT/NVIDIA, en la biblioteca Diffusers, poniendo a disposición modelos de difusión cuantificados de 4 bits (FLUX, Qwen-Image, PixArt, SANA) para inferencia local. Nunchaku implementa SVDQuant, una técnica de cuantificación post-entrenamiento (W4A4: pesos y activaciones en precisión de 4 bits) que absorbe activaciones atípicas mediante descomposición de rango bajo, manteniendo fidelidad visual cercana a FP16. En 12B FLUX.1-dev, Nunchaku logra una reducción de memoria de 3,6x vs. BF16 y una aceleración de 3,0x vs. líneas base solo de peso de 4 bits, permitiendo inferencia de GPU portátil (RTX 4090 16GB) sin offloading de CPU.
El motor conecta API compatibles con PyTorch (heredadas de Diffusers) con kernels C++/CUDA optimizados manualmente, soportando flujos de trabajo ComfyUI y canalizaciones Diffusers directas. Los modelos se distribuyen en variantes INT4 (para GPUs Turing/Ampere/Ada) y NVFP4 (para GPUs Blackwell 50-series) con rango configurable (r32 para velocidad, r128 para calidad) y conteos de pasos (4 pasos, 8 pasos). El proyecto se trasladó del MIT HAN Lab a nunchaku-tech independiente a fines de 2025 y lanzó v1.2.0 (enero de 2026) con mejora de 20-30% de rendimiento en Z-Image, LoRA y soporte de RTX 20 series.
Nunchaku cierra una brecha en difusión de código abierto: las herramientas existentes requieren coser manualmente codificadores, VAE y UNet; Nunchaku proporciona una canalización integrada y de grado producción. Todos los modelos cuantificados se validan contra líneas base BF16 a través de LPIPS con divergencia de calidad aceptable <15%. Este no es un artefacto de investigación—ya se utiliza en producción por startups de generación de imágenes (Decagon, Cubed) e integrado con interfaces populares.
Los arquitectos dirigidos a la generación de imágenes de borde deben considerar Nunchaku como el camino hacia la difusión GPU-local a escala. La reducción de memoria de 3,6x es material para inferencia de centro de datos donde VRAM es cuello de botella. La integración de Diffusers significa que no se requieren operaciones personalizadas—los scripts existentes funcionan con cambios mínimos. El cronograma de lanzamiento continuo (actualizaciones de enero/febrero de 2026) señala mantenimiento maduro, aunque la calidad en el mundo real en arquitecturas más nuevas (SANA) aún se está estabilizando.