Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталог
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогNunchaku, рушій 4-бітного квантування для дифузійних трансформерів від MIT, тепер офіційно інтегровано у Hugging Face Diffusers — це означає, що автори можуть запускати моделі Flux.1 на споживчих GPU з суттєво нижчими вимогами до VRAM, а якість зображень витримує порівняння з повноточним виводом BF16.
Більшість підходів до квантування зберігають 16-бітну гілку поруч із квантованими вагами, що з'їдає пропускну здатність пам'яті й частково нівелює мету. Підхід Nunchaku більш хірургічний: він зливає низькорангову проєкцію вниз із ядром квантування, а низькорангову проєкцію вгору — з 4-бітним обчислювальним ядром. 16-бітна гілка повністю зникає з гарячого шляху — саме звідси й походить реальна економія VRAM.
Практичний результат: Flux.1-dev, який зазвичай потребує топового GPU, стає придатним для запуску на середньокласних споживчих картах. Це дуже важливо, якщо ваша локальна конфігурація обмежена 12 ГБ або 16 ГБ VRAM і ви були змушені використовувати хмарні API або стиснуті альтернативи, що помітно погіршують вивід.
Інтеграція постачається у двох режимах. Стандартний Nunchaku орієнтований на 4-бітний інференс із мінімальними втратами — опубліковані порівняння показують вивід BF16 і 4-біт, які справді важко розрізнити на перший погляд. Nunchaku Lite іде далі у зниженні обчислювальних вимог, роблячи його придатним для ще скромнішого обладнання, ціною помірного зниження якості.
Для авторів, які займаються масовою генерацією — аркуші персонажів, ітерації стилів, пакетні промпти — варіант Lite може бути правильним вибором навіть на потужному обладнанні, суто заради приросту пропускної здатності. Для фінальних рендерів, де важлива кожна деталь, стандартний Nunchaku є кращим вибором.
Команда Hugging Face зазначає у офіційному блог-пості Nunchaku-Diffusers, що інтеграція розроблена для вбудовування в існуючі пайплайни Diffusers з мінімальними змінами коду — жодного нового фреймворку для інференсу вивчати не потрібно, лише конфігурація квантування поверх моделей, які ви вже використовуєте у генераторі Charmloop або локальному середовищі.
До цієї інтеграції використання Nunchaku означало або збірку з вихідного коду, або покладання на сторонні обгортки. Тепер це повноцінний громадянин Diffusers, що означає успадкування всієї екосистеми: ControlNet, завантаження LoRA, ланцюжки пайплайнів і весь інструментарій, від якого залежать робочі процеси на основі Diffusers.
Для авторів, які спостерігали за Flux збоку через апаратні обмеження, це найдоступніша точка входу на сьогодні. Каталог моделей Charmloop вже включає варіанти на основі Flux для хмарної генерації, але локальний інференс через Nunchaku дає вам контроль над сідом, планувальником і стекуванням LoRA, який хмарні API зазвичай приховують.
Це також відбувається на тлі зростаючого імпульсу до ефективного дифузійного інференсу — NVIDIA та Hugging Face нещодавно інтегрували NeMo Automodel з Diffusers для дообробки Flux на кількох GPU, а Nunchaku тепер охоплює інший кінець спектра: інференс на одному GPU, споживчому обладнанні без жертвування основною якістю виводу моделі.
Наступний логічний крок, за яким варто стежити, — чи поширюється підтримка Nunchaku на інші архітектури дифузійних трансформерів поза Flux. SD3, Wan video та подібні моделі виграли б від того самого підходу злиття ядер, а інтеграція з Diffusers значно спрощує таке розширення.