Źródła
Zobacz w akcji
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalog
Maya benchmarkuje każdą premierę modelu — najpierw liczby, nigdy hype.
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogWybierz towarzysza i poznaj jego zdanie na temat tej historii
Multiverse Computing opublikowało technikę zwaną Quantization-Aware Healing (QAH), która kompresuje model o 120 miliardach parametrów do checkpointu 60B MXFP4 — a ten skompresowany model osiąga wyższe wyniki w standardowych benchmarkach niż oryginał o pełnej precyzji 120B, z którego został wyprowadzony.
Kontraintuicyjny wynik — mniejszy, skwantyzowany model pokonujący większy o pełnej precyzji — wynika z tego, jak QAH strukturyzuje fazę odzyskiwania. Standardowy trening świadomy kwantyzacji zaczyna od skompresowanego checkpointu i go dostrajuje, ale skompresowany model już utracił informacje strukturalne, które są trudne do odzyskania. QAH zamiast tego utrzymuje oryginalny model przed kompresją zamrożony jako nauczyciela i destyluje wiedzę z powrotem do skompresowanego ucznia. Ponieważ nauczyciel nigdy nie jest modyfikowany, sygnał, z którego uczy się uczeń, jest czysty.

QAH destyluje z oryginalnego modelu przed kompresją jako zamrożonego nauczyciela, przywracając wydajność po kompresji strukturalnej i kwantyzacji.
Obraz: Hugging Face Blog
Praktyczna implikacja: jeśli twój przepływ pracy obejmuje lokalne uruchamianie dużych modeli o otwartych wagach — do pipelinów generowania obrazów, sprawdzania spójności postaci lub udoskonalania promptów — checkpointy przetworzone QAH mogłyby pozwolić ci uruchomić model, który działa jak znacznie większy, przy ułamku kosztów pamięci. Model 60B MXFP4 mieści się na sprzęcie, który miałby problemy z modelem 120B bfloat16, a format MXFP4 jest coraz częściej natywnie obsługiwany na nowszym krzemie.

Wydajność benchmarkowa trzech checkpointów: nauczyciela 120B MXFP4, skompresowanego modelu 60B bfloat16 i modelu 60B MXFP4 odzyskanego za pomocą QAH.
Obraz: Hugging Face Blog
Zgodnie z postem na blogu Hugging Face od Multiverse Computing, checkpoint 60B MXFP4 z zastosowanym QAH osiąga wyniki powyżej zarówno pośredniego 60B bfloat16, jak i nauczyciela 120B MXFP4 we wszystkich raportowanych benchmarkach. Post pokazuje również, że gdy zastosowano do mniejszego modelu GPT-OSS 9B skwantyzowanego do MXFP4, QAH osiąga szczyt wcześnie i utrzymuje się stabilnie przez 1200 kroków — podczas gdy baseline QAT potrzebuje znacznie więcej czasu, a następnie się załamuje.

QAH osiąga szczyt wcześnie i pozostaje stabilny przez 1200 kroków; QAT osiąga porównywalny szczyt znacznie później, następnie się załamuje.
Obraz: Hugging Face Blog
Co nie zostało potwierdzone: niezależna replikacja na benchmarkach stron trzecich, wydajność w zadaniach poza raportowanym zestawem oraz zachowanie w obciążeniach specyficznych dla domeny, takich jak te używane w opisywaniu generowania obrazów lub pipelinach multimodalnych. Multiverse Computing nie ujawniło pełnego zestawu benchmarków ani dokładnych zadań użytych.
Dla twórców, którzy pobierają modele o otwartych wagach do lokalnego uruchamiania — czy to do generowania obrazów, czy budowania niestandardowych pipelinów postaci — warstwa kompresji, w której model jest dostarczany, zawsze wiązała się z kompromisem jakości. QAH, jeśli wyniki się uogólnią, redefiniuje ten kompromis: agresywna kwantyzacja do MXFP4 przestaje być ostatecznością dla sprzętu ograniczonego pamięcią i zaczyna wyglądać jak realny format podstawowy.
Technika jest również szybsza w zastosowaniu niż pełny QAT. To ma znaczenie dla opiekunów modeli, którzy chcą szybko dostarczyć skwantyzowane warianty po wydaniu modelu bazowego, co dałoby ekosystemowi open-source więcej wysokiej jakości checkpointów 4-bitowych do pracy na platformach takich jak katalog modeli Charmloop.
Multiverse Computing opublikowało metodologię i szczegóły checkpointów na Hugging Face. Czy zyski benchmarkowe przetrwają niezależną kontrolę to następne pytanie — i warte obserwowania przed zaangażowaniem przepływu pracy w MXFP4 jako domyślny.