

拡散トランスフォーマー向けMITの4ビット量子化エンジン「Nunchaku」が、Hugging Face Diffusersに正式統合された。これにより、クリエイターはFlux.1モデルをコンシューマー向けGPUで大幅に低いVRAM要件で動作させることができ、フル精度のBF16出力に匹敵する画像品質を得られる。
多くの量子化アプローチでは、量子化済みウェイトと並行して16ビットブランチを維持するため、メモリ帯域幅を消費し、量子化の目的を部分的に損なう。Nunchakuのアプローチはより精緻だ。低ランクのダウン射影を量子化カーネルと融合させ、低ランクのアップ射影を4ビット演算カーネルと融合させる。16ビットブランチはホットパスから完全に消え去り、これこそが実質的なVRAM削減の源泉となる。
実際の効果として、通常はハイエンドGPUを必要とするFlux.1-devが、ミドルレンジのコンシューマーカードで動作可能になる。ローカル環境のVRAMが12GBや16GBで頭打ちになっており、クラウドAPIや出力が目に見えて劣化する圧縮版を使わざるを得なかったユーザーにとって、これは大きな意味を持つ。
この統合には2つのモードが用意されている。標準Nunchakuはほぼロスレスの4ビット推論を目指しており、公開されている比較ではBF16と4ビットの出力が一見して区別しにくいほど近似している。Nunchaku Liteはさらに演算要件を下げ、より控えめなハードウェアでも動作可能にするが、その代わりに品質がわずかに低下する。
キャラクターシート、スタイルの反復、バッチプロンプトなど大量生成を行うクリエイターにとっては、スループット向上のためだけでも、高性能なハードウェアでもLiteバリアントが適切な選択肢となり得る。細部まで品質にこだわる最終レンダリングには、標準Nunchakuの方が適している。
Hugging FaceチームはNunchaku-Diffusers公式ブログ記事で、この統合が既存のDiffusersパイプラインに最小限のコード変更で組み込めるよう設計されていると述べている——新しい推論フレームワークを学ぶ必要はなく、Charmloopジェネレーターやローカル環境で既に使用しているモデルに量子化設定を追加するだけだ。
この統合以前は、Nunchakuを使用するにはソースからビルドするか、サードパーティのラッパーに頼る必要があった。今やDiffusersの正式な機能となり、ControlNet、LoRAの読み込み、パイプラインチェーン、そしてDiffusersベースのワークフローが依存するすべてのツール群を継承する。
ハードウェアの制約からFluxを傍観してきたクリエイターにとって、これは今までで最もアクセスしやすい入り口だ。Charmloopモデルカタログにはすでにクラウド生成向けのFluxベースのオプションが含まれているが、Nunchakuによるローカル推論では、クラウドAPIが通常は抽象化してしまうシード、スケジューラー、LoRAスタッキングを自分でコントロールできる。
この統合は、効率的な拡散推論への高まる勢いとともに登場した——NVIDIAとHugging Faceは最近、マルチGPUによるFluxファインチューニングに向けてNeMo AutomodelをDiffusersと統合しており、Nunchakuはスペクトルの反対側をカバーする:モデルのコア出力品質を犠牲にすることなく、シングルGPU・コンシューマーハードウェアでの推論を実現する。
次に注目すべき展開は、NunchakuのサポートがFlux以外の拡散トランスフォーマーアーキテクチャにも拡張されるかどうかだ——SD3、Wan動画、および類似モデルも同じカーネル融合アプローチから恩恵を受けられるはずであり、Diffusers統合によってその拡張の実装はかなり容易になっている。