Fuentes
Míralo en acción
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogo
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogoNunchaku, el motor de cuantización en 4 bits del MIT para transformadores de difusión, ya está integrado oficialmente en Hugging Face Diffusers, lo que significa que los creadores pueden ejecutar modelos Flux.1 en GPUs de gama de consumo con requisitos de VRAM notablemente menores y una calidad de imagen que se mantiene a la altura de la salida BF16 en precisión completa.
La mayoría de los enfoques de cuantización mantienen una rama en 16 bits activa junto a los pesos cuantizados, lo que consume ancho de banda de memoria y derrota parcialmente el propósito. El enfoque de Nunchaku es más quirúrgico: fusiona la proyección descendente de bajo rango con el kernel de cuantización, y la proyección ascendente de bajo rango con el kernel de cómputo en 4 bits. La rama en 16 bits desaparece por completo del camino crítico, que es donde se producen los verdaderos ahorros de VRAM.
El resultado práctico: Flux.1-dev, que normalmente exige una GPU de gama alta, se vuelve ejecutable en tarjetas de consumo de gama media. Eso importa mucho si tu configuración local tiene un tope de 12 GB o 16 GB de VRAM y te has visto obligado a usar APIs en la nube o alternativas comprimidas que degradan visiblemente la salida.
La integración incluye dos modos. El Nunchaku estándar apunta a una inferencia en 4 bits casi sin pérdidas: las comparaciones publicadas muestran salidas BF16 y en 4 bits que son genuinamente difíciles de distinguir a simple vista. Nunchaku Lite va más lejos en la reducción de las demandas de cómputo, haciéndolo viable en hardware aún más modesto, a costa de un modesto descenso de calidad.
Para los creadores que realizan generación en alto volumen —hojas de personajes, iteraciones de estilo, prompts en lote— la variante Lite podría ser la elección correcta incluso en hardware capaz, simplemente por la ganancia en rendimiento. Para renders de calidad final donde cada detalle cuenta, el Nunchaku estándar es la mejor opción.
El equipo de Hugging Face señala en la entrada oficial del blog Nunchaku-Diffusers que la integración está diseñada para encajar en los pipelines de Diffusers existentes con cambios mínimos en el código: no hay que aprender un nuevo framework de inferencia, solo una configuración de cuantización sobre los modelos que ya estás usando en el generador de Charmloop o en tu configuración local.
Antes de esta integración, usar Nunchaku implicaba compilar desde el código fuente o depender de wrappers de terceros. Ahora es un ciudadano de primera clase en Diffusers, lo que significa que hereda el ecosistema completo: ControlNet, carga de LoRA, encadenamiento de pipelines y todas las herramientas de las que dependen los flujos de trabajo basados en Diffusers.
Para los creadores que han estado observando Flux desde la barrera por limitaciones de hardware, esta es la rampa de acceso más accesible hasta ahora. El catálogo de modelos de Charmloop ya incluye opciones basadas en Flux para la generación en la nube, pero la inferencia local mediante Nunchaku te da el control sobre la semilla, el scheduler y el apilamiento de LoRA que las APIs en la nube suelen abstraer.
Esto llega también junto a un creciente impulso hacia la inferencia de difusión eficiente: NVIDIA y Hugging Face integraron recientemente NeMo Automodel con Diffusers para el ajuste fino de Flux en múltiples GPUs, y Nunchaku cubre ahora el otro extremo del espectro: inferencia en una sola GPU con hardware de consumo sin sacrificar la calidad de salida central del modelo.
El siguiente paso lógico a seguir es si el soporte de Nunchaku se extiende a otras arquitecturas de transformadores de difusión más allá de Flux: SD3, Wan video y modelos similares se beneficiarían del mismo enfoque de fusión de kernels, y la integración en Diffusers hace que esa expansión sea considerablemente más fácil de distribuir.