Sources
Voyez-le à l’œuvre
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogue
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogueNunchaku, le moteur de quantification 4 bits du MIT pour les transformeurs de diffusion, est désormais officiellement intégré à Hugging Face Diffusers — ce qui signifie que les créateurs peuvent faire tourner les modèles Flux.1 sur des GPU grand public avec des besoins en VRAM considérablement réduits et une qualité d'image qui soutient la comparaison avec la sortie BF16 en pleine précision.
La plupart des approches de quantification maintiennent une branche 16 bits active aux côtés des poids quantifiés, ce qui consomme de la bande passante mémoire et contrecarre en partie l'objectif visé. L'approche de Nunchaku est plus chirurgicale : elle fusionne la projection descendante de rang faible avec le noyau de quantification, et la projection montante de rang faible avec le noyau de calcul 4 bits. La branche 16 bits disparaît entièrement du chemin critique, ce qui est là que proviennent les véritables économies de VRAM.
La conséquence pratique : Flux.1-dev, qui exige normalement un GPU haut de gamme, devient utilisable sur des cartes grand public de milieu de gamme. C'est très important si votre configuration locale plafonne à 12 Go ou 16 Go de VRAM et que vous avez été contraint de recourir à des API cloud ou à des alternatives compressées qui dégradent visiblement le rendu.
L'intégration est livrée avec deux modes. Le Nunchaku standard vise une inférence 4 bits quasi sans perte — les comparaisons publiées montrent des sorties BF16 et 4 bits qu'il est véritablement difficile de distinguer au premier coup d'œil. Nunchaku Lite va plus loin dans la réduction des besoins de calcul, le rendant viable sur du matériel encore plus modeste, au prix d'une légère baisse de qualité.
Pour les créateurs qui font de la génération en volume — planches de personnages, itérations de style, prompts en lot — la variante Lite pourrait être le bon choix même sur du matériel performant, simplement pour le gain de débit. Pour les rendus en qualité finale où chaque détail compte, le Nunchaku standard est le meilleur choix.
L'équipe Hugging Face note dans le billet de blog officiel Nunchaku-Diffusers que l'intégration est conçue pour s'insérer dans les pipelines Diffusers existants avec un minimum de modifications de code — pas de nouveau framework d'inférence à apprendre, juste une configuration de quantification par-dessus les modèles que vous utilisez déjà dans le générateur Charmloop ou votre configuration locale.
Avant cette intégration, utiliser Nunchaku impliquait soit de compiler depuis les sources, soit de s'appuyer sur des wrappers tiers. Désormais, c'est un citoyen de première classe dans Diffusers, ce qui signifie qu'il hérite de l'écosystème complet : ControlNet, chargement de LoRA, chaînage de pipelines, et tous les outils dont dépendent les workflows basés sur Diffusers.
Pour les créateurs qui observaient Flux de loin en raison de limitations matérielles, c'est la rampe d'accès la plus accessible à ce jour. Le catalogue de modèles Charmloop inclut déjà des options basées sur Flux pour la génération cloud, mais l'inférence locale via Nunchaku vous donne le contrôle sur la graine, le planificateur et l'empilement de LoRA que les API cloud abstraient généralement.
Cela arrive également dans un contexte de dynamique croissante en faveur d'une inférence de diffusion efficace — NVIDIA et Hugging Face ont récemment intégré NeMo Automodel avec Diffusers pour le fine-tuning Flux multi-GPU, et Nunchaku couvre désormais l'autre extrémité du spectre : l'inférence sur GPU unique, matériel grand public, sans sacrifier la qualité de sortie fondamentale du modèle.
La prochaine étape logique à surveiller est de savoir si le support de Nunchaku s'étend à d'autres architectures de transformeurs de diffusion au-delà de Flux — SD3, Wan video et des modèles similaires bénéficieraient de la même approche de fusion de noyaux, et l'intégration Diffusers rend cette expansion considérablement plus facile à déployer.