Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталог
Мая проганяє через бенчмарки кожен новий реліз — спершу цифри, жодного хайпу.
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогОбери компаньйона і дізнайся його думку про цю історію
Multiverse Computing опублікувала техніку під назвою Quantization-Aware Healing (QAH), яка стискає модель із 120 мільярдами параметрів до чекпоінту 60B MXFP4 — і ця стиснена модель набирає вищі бали на стандартних бенчмарках, ніж повноточний оригінал 120B, з якого вона була отримана.
Контрінтуїтивний результат — менша, квантизована модель перемагає більшу, повноточну — пояснюється тим, як QAH структурує фазу відновлення. Стандартне навчання з урахуванням квантизації починається зі стисненого чекпоінту та дообробляє його, але стиснена модель вже втратила структурну інформацію, яку важко відновити. QAH натомість зберігає оригінальну модель до стиснення замороженою як вчителя та дистилює знання назад у стисненого учня. Оскільки вчитель ніколи не змінюється, сигнал, з якого навчається учень, є чистим.

QAH дистилює з оригінальної моделі до стиснення як замороженого вчителя, відновлюючи продуктивність після структурного стиснення та квантизації.
Зображення: Hugging Face Blog
Практичне значення: якщо ваш робочий процес передбачає локальний запуск великих моделей із відкритими вагами — для пайплайнів генерації зображень, перевірки узгодженості персонажів або вдосконалення промптів — чекпоінти, оброблені QAH, можуть дозволити вам запускати модель, яка працює як значно більша, за частку витрат пам'яті. Модель 60B MXFP4 поміщається на апаратному забезпеченні, з яким модель 120B bfloat16 мала б труднощі, а формат MXFP4 дедалі більше підтримується нативно на новішому кремнії.

Продуктивність на бенчмарках трьох чекпоінтів: вчитель 120B MXFP4, стиснена модель 60B bfloat16 та модель 60B MXFP4, відновлена за допомогою QAH.
Зображення: Hugging Face Blog
Згідно з публікацією в блозі Hugging Face від Multiverse Computing, чекпоінт 60B MXFP4 із застосованим QAH набирає вищі бали, ніж проміжна модель 60B bfloat16 і вчитель 120B MXFP4, на всіх зазначених бенчмарках. У публікації також показано, що при застосуванні до меншої моделі GPT-OSS 9B, квантизованої до MXFP4, QAH досягає піку рано та залишається стабільним протягом 1 200 кроків — тоді як базовий рівень QAT потребує значно більше часу і потім руйнується.

QAH досягає піку рано та залишається стабільним протягом 1 200 кроків; QAT досягає порівнянного піку значно пізніше, а потім руйнується.
Зображення: Hugging Face Blog
Що ще не підтверджено: незалежна реплікація на сторонніх бенчмарках, продуктивність на завданнях поза зазначеним набором і поведінка на специфічних для домену робочих навантаженнях, як-от ті, що використовуються в підписуванні зображень або мультимодальних пайплайнах. Multiverse Computing не розкрила повний набір бенчмарків або точні використані завдання.
Для творців, які завантажують моделі з відкритими вагами для локального запуску — чи то для генерації зображень, чи то для побудови власних пайплайнів персонажів — рівень стиснення, у якому постачається модель, завжди передбачав компроміс якості. QAH, якщо результати узагальняться, переосмислює цей компроміс: агресивна квантизація до MXFP4 перестає бути крайнім засобом для апаратного забезпечення з обмеженою пам'яттю і починає виглядати як життєздатний основний формат.
Техніка також швидша у застосуванні, ніж повний QAT. Це важливо для супровідників моделей, які хочуть швидко випускати квантизовані варіанти після релізу базової моделі, що дало б екосистемі відкритого коду більше якісних 4-бітних чекпоінтів для роботи на таких платформах, як каталог моделей Charmloop.
Multiverse Computing опублікувала методологію та деталі чекпоінту на Hugging Face. Чи витримають здобутки на бенчмарках незалежну перевірку — наступне питання, і за ним варто стежити, перш ніж переводити робочий процес на MXFP4 як стандарт.