Источники
Посмотри в деле
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталог
Майя прогоняет через бенчмарки каждый новый релиз — сначала цифры, и никакого хайпа.
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталогВыбери компаньона и узнай его мнение об этой истории
Multiverse Computing опубликовала технику под названием Quantization-Aware Healing (QAH), которая сжимает модель со 120 миллиардами параметров до чекпоинта 60B MXFP4 — и эта сжатая модель показывает более высокие результаты на стандартных бенчмарках, чем исходная полноточная версия 120B, из которой она была получена.
Контринтуитивный результат — меньшая квантизованная модель обходит большую полноточную — объясняется тем, как QAH выстраивает фазу восстановления. Стандартное обучение с учётом квантизации начинается со сжатого чекпоинта и дообучает его, однако сжатая модель уже потеряла структурную информацию, которую сложно восстановить. QAH вместо этого сохраняет исходную модель до сжатия замороженной в роли учителя и дистиллирует знания обратно в сжатого ученика. Поскольку учитель никогда не изменяется, сигнал, на котором обучается ученик, остаётся чистым.

QAH выполняет дистилляцию из исходной модели до сжатия как замороженного учителя, восстанавливая производительность после структурного сжатия и квантизации.
Изображение: Hugging Face Blog
Практическое следствие: если ваш рабочий процесс предполагает локальный запуск крупных открытых моделей — для пайплайнов генерации изображений, проверки согласованности персонажей или уточнения промптов — чекпоинты, обработанные QAH, могут позволить вам запускать модель, которая ведёт себя как значительно более крупная, при доле затрат памяти. Модель 60B MXFP4 помещается на оборудовании, которое испытывало бы трудности с моделью 120B bfloat16, а формат MXFP4 всё активнее поддерживается нативно на новых чипах.

Производительность на бенчмарках трёх чекпоинтов: учитель 120B MXFP4, сжатая модель 60B bfloat16 и модель 60B MXFP4, восстановленная с помощью QAH.
Изображение: Hugging Face Blog
Согласно публикации в блоге Hugging Face от Multiverse Computing, чекпоинт 60B MXFP4 с применённым QAH показывает результаты выше, чем промежуточная модель 60B bfloat16 и учитель 120B MXFP4, на всех представленных бенчмарках. В публикации также показано, что при применении к меньшей модели GPT-OSS 9B, квантизованной до MXFP4, QAH достигает пика рано и остаётся стабильным на протяжении 1 200 шагов — тогда как базовый метод QAT требует значительно больше времени и затем деградирует.

QAH достигает пика рано и остаётся стабильным на протяжении 1 200 шагов; QAT достигает сопоставимого пика значительно позже, а затем деградирует.
Изображение: Hugging Face Blog
Что пока не подтверждено: независимая репликация на сторонних бенчмарках, производительность на задачах за пределами представленного набора и поведение на специализированных рабочих нагрузках — например, тех, что используются в подписях для генерации изображений или мультимодальных пайплайнах. Multiverse Computing не раскрыла полный набор бенчмарков и конкретные использованные задачи.
Для авторов, которые скачивают открытые модели для локального запуска — будь то генерация изображений или создание пользовательских пайплайнов для персонажей — уровень сжатия, в котором поставляется модель, всегда предполагал компромисс с качеством. QAH, если результаты окажутся обобщаемыми, переосмысляет этот компромисс: агрессивная квантизация до MXFP4 перестаёт быть крайней мерой для оборудования с ограниченной памятью и начинает выглядеть как жизнеспособный основной формат.
Техника также применяется быстрее, чем полноценный QAT. Это важно для мейнтейнеров моделей, которые хотят оперативно выпускать квантизованные варианты после релиза базовой модели, что обеспечило бы экосистеме открытого исходного кода больше высококачественных 4-битных чекпоинтов для работы на таких платформах, как каталог моделей Charmloop.
Multiverse Computing опубликовала методологию и детали чекпоинта на Hugging Face. Выдержат ли полученные на бенчмарках преимущества независимую проверку — следующий вопрос, за которым стоит следить, прежде чем переводить рабочий процесс на MXFP4 как формат по умолчанию.