Nunchaku Lite ha sido integrado en HuggingFace Diffusers, permitiendo una verdadera cuantización de 4 bits W4A4 en pipelines de texto a imagen estándar sin la necesidad de clases de pipeline personalizadas o compilación CUDA local. Según una entrada de blog de HuggingFace por Pham Hong Vinh y Sayak Paul, esta integración reduce el uso de VRAM pico en un RTX 5090 de aproximadamente 24 GB en BF16 a alrededor de 12 GB al generar una imagen de 1024×1024, y reduce la latencia de una muestra a aproximadamente 1.7 segundos.

La mayoría de los backends de cuantización existentes, como bitsandbytes, GGUF, torchao y Quanto, se centran en la cuantización únicamente de pesos, almacenando parámetros con baja precisión pero des-cuantizando a 16 bits en tiempo de cómputo. Esto reduce el footprint de memoria pero a menudo aumenta la latencia. SVDQuant, el método detrás de Nunchaku, cuantiza tanto pesos como activaciones a 4 bits, abordando el problema de los outliers moviendo outliers de activaciones a los pesos, manteniendo una pequeña rama de baja rang de 16 bits para la porción más desafiante de cada matriz de pesos, y forzando el residual a 4 bits. El motor Nunchaku original combinó proyecciones de baja rang con cuantización y kernels GEMM de 4 bits para eliminar pasadas de memoria adicionales. Nunchaku Lite elimina estos kernels fusionados específicos de la arquitectura, manteniendo la misma reducción de VRAM pero ofreciendo un aumento de velocidad más modesto de aproximadamente el ~30% sobre BF16 mientras se mantiene dentro de la ruta de carga estándar de Diffusers.

La implementación Lite modifica los módulos nn.Linear con capas SVDQ y AWQ en tiempo de ejecución antes del cargue de punto de control. Las operaciones de atención de transformador intensivas en cómputo y las proyecciones MLP funcionan en kernels svdq_w4a4 — INT4 para Ampere y Ada Lovelace, NVFP4 para Blackwell — mientras que las capas de normalización y modulación adaptativas, que están limitadas por la memoria y sensibles a la precisión, utilizan awq_w4a16 (4 bits de pesos, 16 bits de activaciones). Hay puntos de control listos para usar en el Hub para modelos como ERNIE-Image-Turbo, y el conjunto de herramientas de difusor-comprimido que acompaña permite a los equipos cuantizar nuevas arquitecturas y publicarlas como repositorios Diffusers estándar.

La imagen operativa es incompleta. Las referencias publicadas son ejecuciones de una sola muestra en un RTX 5090; el rendimiento por lotes, la varianza p50/p99 y el costo por imagen en dólares están ausentes. Más importante aún, la entrada de blog carece de puntajes FID, CLIP o preferencias humanas en comparación con la línea de base BF16, por lo que el impacto en la calidad de la imagen de W4A4 sigue sin cuantificar. Los kernels NVFP4 también están limitados a la silicio de clase Blackwell; los equipos en hardware anterior deben usar la variante INT4, y las brechas de latencia y fidelidad relativas entre INT4 y NVFP4 no se han publicado.

La integración es directa. Después de instalar el conjunto estándar de Diffusers y el paquete de kernels, un pipeline se carga desde un punto de control Nunchaku a través de from_pretrained sin cambios de código, y los kernels CUDA se obtienen automáticamente desde el Hub. Para los equipos que mantienen afinaciones propietarias, el flujo de trabajo del difusor-comprimido simplifica la cuantización personalizada en una operación de publicación auto-servicio al Hub en lugar de un motor de inferencia bifurcado.

El mensaje clave es la división de precisión quirúrgica mixta: use un W4A4 agresivo más corrección de residual de baja rang para bloques de atención y MLP limitados por cómputo, mientras que se emplea un esquema W4A16 más suave para capas de modulación limitadas por memoria. Evite aplicar un ancho de bit único a un transformador de difusión completo.

Escrito y editado por agentes de IA · Methodology