Источники
Посмотри в деле
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталог
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталогNunchaku, движок 4-битного квантования диффузионных трансформеров от MIT, теперь официально интегрирован в Hugging Face Diffusers — это означает, что авторы могут запускать модели Flux.1 на потребительских GPU с существенно меньшими требованиями к VRAM, при этом качество изображений выдерживает сравнение с полноточным выводом BF16.
Большинство подходов к квантованию сохраняют 16-битную ветку рядом с квантованными весами, что съедает пропускную способность памяти и частично сводит на нет весь смысл. Подход Nunchaku более хирургический: он объединяет низкоранговую проекцию вниз с ядром квантования, а низкоранговую проекцию вверх — с 4-битным вычислительным ядром. 16-битная ветка полностью исчезает из горячего пути, и именно здесь достигается реальная экономия VRAM.
Практический итог: Flux.1-dev, который обычно требует высококлассного GPU, становится запускаемым на потребительских картах среднего уровня. Это важно, если ваша локальная система ограничена 12 ГБ или 16 ГБ VRAM и вы были вынуждены использовать облачные API или сжатые альтернативы, заметно ухудшающие результат.
Интеграция поставляется в двух режимах. Стандартный Nunchaku нацелен на практически безпотерный 4-битный инференс — опубликованные сравнения показывают, что выводы BF16 и 4-bit на первый взгляд действительно трудно различить. Nunchaku Lite идёт дальше в снижении вычислительных требований, делая его жизнеспособным на ещё более скромном оборудовании, ценой умеренного снижения качества.
Для авторов, занимающихся высокообъёмной генерацией — листы персонажей, итерации стилей, пакетные промпты — вариант Lite может оказаться правильным выбором даже на мощном оборудовании, просто ради прироста производительности. Для финальных рендеров, где важна каждая деталь, стандартный Nunchaku — лучший выбор.
Команда Hugging Face отмечает в официальном блог-посте Nunchaku-Diffusers, что интеграция разработана для встраивания в существующие пайплайны Diffusers с минимальными изменениями кода — никакого нового фреймворка инференса для изучения, просто конфигурация квантования поверх моделей, которые вы уже используете в генераторе Charmloop или в локальной среде.
До этой интеграции использование Nunchaku означало либо сборку из исходников, либо зависимость от сторонних обёрток. Теперь это полноправный компонент Diffusers, что означает наследование всей экосистемы: ControlNet, загрузка LoRA, цепочки пайплайнов и весь инструментарий, на который опираются рабочие процессы на основе Diffusers.
Для авторов, наблюдавших за Flux со стороны из-за аппаратных ограничений, это наиболее доступная точка входа на сегодняшний день. Каталог моделей Charmloop уже включает варианты на основе Flux для облачной генерации, но локальный инференс через Nunchaku даёт вам контроль над сидом, планировщиком и стекингом LoRA, который облачные API обычно скрывают.
Это также происходит на фоне растущего импульса к эффективному диффузионному инференсу — NVIDIA и Hugging Face недавно интегрировали NeMo Automodel с Diffusers для дообучения Flux на нескольких GPU, а Nunchaku теперь закрывает другой конец спектра: инференс на одном GPU, потребительском оборудовании без жертвы базовым качеством вывода модели.
Следующий логичный шаг, за которым стоит следить, — распространится ли поддержка Nunchaku на другие архитектуры диффузионных трансформеров помимо Flux. SD3, Wan video и аналогичные модели выиграли бы от того же подхода слияния ядер, а интеграция с Diffusers значительно упрощает реализацию такого расширения.