Bronnen
Zie het in actie
Blader door de modellen en stijlen achter verhalen als dit — gratis account, meteen een galerij.
Ontdek de catalogus
Maya benchmarkt elke nieuwe modelrelease — eerst de cijfers, nooit de hype.
Blader door de modellen en stijlen achter verhalen als dit — gratis account, meteen een galerij.
Ontdek de catalogusKies een companion en ontdek wat die van dit verhaal vindt
Multiverse Computing heeft een techniek gepubliceerd genaamd Quantization-Aware Healing (QAH) die een model met 120 miljard parameters comprimeert naar een 60B MXFP4-checkpoint — en dat gecomprimeerde model scoort hoger op standaardbenchmarks dan het 120B-origineel met volledige precisie waarvan het is afgeleid.
Het contra-intuïtieve resultaat — een kleiner, gekwantiseerd model dat een groter model met volledige precisie verslaat — komt voort uit de manier waarop QAH de herstelfase structureert. Standaard quantization-aware training begint vanuit een gecomprimeerd checkpoint en verfijnt dat, maar het gecomprimeerde model heeft al structurele informatie verloren die moeilijk te herstellen is. QAH houdt in plaats daarvan het originele, pre-compressiemodel bevroren als teacher en distilleert kennis terug in de gecomprimeerde student. Omdat de teacher nooit wordt gewijzigd, is het signaal waarvan de student leert zuiver.

QAH distilleert vanuit het originele pre-compressiemodel als bevroren teacher en herstelt de prestaties na structurele compressie en kwantisering.
Afbeelding: Hugging Face Blog
De praktische implicatie: als uw workflow het lokaal uitvoeren van grote open-gewicht modellen omvat — voor image-generatiepipelines, consistentiecontroles van personages of promptverbetering — kunnen QAH-verwerkte checkpoints u in staat stellen een model te draaien dat presteert als een veel groter model tegen een fractie van de geheugenkosten. Een 60B MXFP4-model past op hardware waarmee een 120B bfloat16-model moeite zou hebben, en het MXFP4-formaat wordt steeds vaker native ondersteund op nieuwere chips.

Benchmarkprestaties van de drie checkpoints: de 120B MXFP4-teacher, het 60B bfloat16-gecomprimeerde model en het 60B MXFP4-model hersteld met QAH.
Afbeelding: Hugging Face Blog
Volgens de Hugging Face-blogpost van Multiverse Computing scoort het 60B MXFP4-checkpoint met toegepaste QAH boven zowel de 60B bfloat16-tussenstap als de 120B MXFP4-teacher op de gerapporteerde benchmarks. De post laat ook zien dat wanneer QAH wordt toegepast op een kleiner GPT-OSS 9B-model gekwantiseerd naar MXFP4, QAH vroeg piekt en stabiel blijft gedurende 1.200 stappen — terwijl een QAT-baseline aanzienlijk langer nodig heeft en daarna instort.

QAH piekt vroeg en blijft stabiel gedurende 1.200 stappen; QAT bereikt een vergelijkbare piek veel later en stort daarna in.
Afbeelding: Hugging Face Blog
Wat nog niet is bevestigd: onafhankelijke replicatie op benchmarks van derden, prestaties op taken buiten de gerapporteerde suite en gedrag op domeinspecifieke workloads zoals die worden gebruikt bij image-generatiecaptioning of multimodale pipelines. Multiverse Computing heeft de volledige benchmarksuite of de exacte gebruikte taken niet bekendgemaakt.
Voor makers die open-gewicht modellen lokaal draaien — of dat nu voor image-generatie is of voor het bouwen van aangepaste personagepipelines — bracht de compressielaag waarin een model wordt uitgebracht altijd een kwaliteitscompromis met zich mee. QAH herformuleert dat compromis, als de resultaten generaliseren: agressieve kwantisering naar MXFP4 is niet langer een laatste redmiddel voor geheugenbeperkte hardware, maar begint eruit te zien als een levensvatbaar primair formaat.
De techniek is ook sneller toe te passen dan volledige QAT. Dat is van belang voor modelonderhoudsteams die snel gekwantiseerde varianten willen uitbrengen na een basismodelrelease, wat het open-source ecosysteem meer hoogwaardige 4-bit checkpoints zou geven om mee te werken op platforms zoals de Charmloop-modelcatalogus.
Multiverse Computing heeft de methodologie en checkpointdetails gepubliceerd op Hugging Face. Of de benchmarkwinsten onafhankelijke toetsing doorstaan is de volgende vraag — en een die het waard is om in de gaten te houden voordat u een workflow vastlegt op MXFP4 als standaard.