

MIT의 확산 트랜스포머용 4비트 양자화 엔진 Nunchaku가 Hugging Face Diffusers에 공식 통합됐습니다. 이제 크리에이터들은 소비자용 GPU에서 Flux.1 모델을 훨씬 낮은 VRAM 요구 사항으로 실행할 수 있으며, 이미지 품질은 완전 정밀도 BF16 출력과 비교해도 손색이 없습니다.
대부분의 양자화 방식은 양자화된 가중치와 함께 16비트 브랜치를 유지하는데, 이는 메모리 대역폭을 소모하고 양자화의 목적을 부분적으로 무력화합니다. Nunchaku의 접근 방식은 더 정교합니다. 저랭크 다운 프로젝션을 양자화 커널과 융합하고, 저랭크 업 프로젝션을 4비트 연산 커널과 융합합니다. 16비트 브랜치는 핫 패스에서 완전히 사라지며, 이것이 실질적인 VRAM 절감의 핵심입니다.
실질적인 효과는 다음과 같습니다. 일반적으로 고사양 GPU를 요구하는 Flux.1-dev를 중급 소비자용 그래픽 카드에서 실행할 수 있게 됩니다. 로컬 환경의 VRAM이 12GB 또는 16GB에 그쳐 클라우드 API나 출력 품질이 눈에 띄게 저하되는 압축 대안을 사용할 수밖에 없었던 분들에게 이는 매우 중요한 변화입니다.
이번 통합은 두 가지 모드를 제공합니다. 표준 Nunchaku는 무손실에 가까운 4비트 추론을 목표로 하며, 공개된 비교 결과에서 BF16과 4비트 출력은 한눈에 구분하기 어려울 정도로 유사합니다. Nunchaku Lite는 연산 요구 사항을 더욱 낮춰 더 저사양 하드웨어에서도 사용 가능하지만, 소폭의 품질 저하가 발생합니다.
캐릭터 시트, 스타일 반복 작업, 배치 프롬프팅 등 대량 생성 작업을 하는 크리에이터라면, 충분한 성능의 하드웨어를 보유하고 있더라도 처리량 향상을 위해 Lite 변형을 선택하는 것이 합리적일 수 있습니다. 모든 디테일이 중요한 최종 품질 렌더링에는 표준 Nunchaku가 더 적합합니다.
Hugging Face 팀은 공식 Nunchaku-Diffusers 블로그 포스트에서 이번 통합이 기존 Diffusers 파이프라인에 최소한의 코드 변경만으로 적용될 수 있도록 설계되었다고 밝혔습니다. 새로운 추론 프레임워크를 배울 필요 없이, Charmloop 생성기나 로컬 환경에서 이미 사용 중인 모델에 양자화 설정만 추가하면 됩니다.
이번 통합 이전에는 Nunchaku를 사용하려면 소스에서 직접 빌드하거나 서드파티 래퍼에 의존해야 했습니다. 이제 Nunchaku는 Diffusers의 공식 구성 요소가 되어, ControlNet, LoRA 로딩, 파이프라인 체이닝, 그리고 Diffusers 기반 워크플로가 의존하는 모든 도구를 그대로 활용할 수 있습니다.
하드웨어 한계로 인해 Flux를 관망해 온 크리에이터들에게 이번 통합은 지금까지 중 가장 접근하기 쉬운 진입로입니다. Charmloop 모델 카탈로그에는 이미 클라우드 생성을 위한 Flux 기반 옵션이 포함되어 있지만, Nunchaku를 통한 로컬 추론은 클라우드 API가 일반적으로 추상화하는 시드, 스케줄러, LoRA 스태킹에 대한 직접적인 제어권을 제공합니다.
이번 통합은 효율적인 확산 추론에 대한 성장하는 모멘텀과 함께 이루어졌습니다. NVIDIA와 Hugging Face는 최근 멀티 GPU Flux 파인튜닝을 위해 NeMo Automodel을 Diffusers와 통합했으며, Nunchaku는 이제 스펙트럼의 반대편을 담당합니다. 즉, 모델의 핵심 출력 품질을 희생하지 않고 단일 GPU 소비자용 하드웨어에서의 추론을 가능하게 합니다.
다음으로 주목할 점은 Nunchaku 지원이 Flux를 넘어 다른 확산 트랜스포머 아키텍처로 확장될지 여부입니다. SD3, Wan 비디오 등 유사한 모델들도 동일한 커널 융합 방식의 혜택을 받을 수 있으며, Diffusers 통합은 그러한 확장을 훨씬 쉽게 구현할 수 있는 기반을 마련해 줍니다.