Sources
Voyez-le à l’œuvre
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogue
Maya passe chaque nouveau modèle au banc d'essai — les chiffres d'abord, jamais le battage.
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogueChoisissez un compagnon et découvrez son avis sur cette histoire
Multiverse Computing a publié une technique appelée Quantization-Aware Healing (QAH) qui compresse un modèle de 120 milliards de paramètres en un checkpoint 60B MXFP4 — et ce modèle compressé obtient des scores plus élevés sur les benchmarks standard que l'original 120B en pleine précision dont il est issu.
Ce résultat contre-intuitif — un modèle plus petit et quantifié surpassant un modèle plus grand en pleine précision — découle de la façon dont QAH structure la phase de récupération. L'entraînement standard avec prise en compte de la quantification part d'un checkpoint compressé et l'affine, mais le modèle compressé a déjà perdu des informations structurelles difficiles à récupérer. QAH maintient plutôt le modèle original pré-compression figé en tant qu'enseignant et distille la connaissance dans l'étudiant compressé. Comme l'enseignant n'est jamais modifié, le signal dont l'étudiant apprend est pur.

QAH distille à partir du modèle original pré-compression utilisé comme enseignant figé, restaurant les performances après compression structurelle et quantification.
Image : Hugging Face Blog
L'implication pratique : si votre flux de travail implique d'exécuter de grands modèles open-weight en local — pour des pipelines de génération d'images, des vérifications de cohérence de personnages ou l'affinement de prompts — les checkpoints traités par QAH pourraient vous permettre d'exécuter un modèle qui performe comme un modèle bien plus grand, pour une fraction du coût en mémoire. Un modèle 60B MXFP4 s'adapte à du matériel qui peinerait avec un modèle 120B bfloat16, et le format MXFP4 est de plus en plus pris en charge nativement sur les nouvelles puces.

Performances sur les benchmarks des trois checkpoints : l'enseignant 120B MXFP4, le modèle compressé 60B bfloat16 et le modèle 60B MXFP4 récupéré avec QAH.
Image : Hugging Face Blog
Selon le billet de blog Hugging Face de Multiverse Computing, le checkpoint 60B MXFP4 avec QAH appliqué obtient des scores supérieurs à la fois au modèle intermédiaire 60B bfloat16 et à l'enseignant 120B MXFP4 sur les benchmarks rapportés. Le billet montre également que lorsqu'il est appliqué à un modèle GPT-OSS 9B plus petit quantifié en MXFP4, QAH atteint son pic rapidement et reste stable jusqu'à 1 200 étapes — tandis qu'une baseline QAT met nettement plus de temps et s'effondre ensuite.

QAH atteint son pic rapidement et reste stable jusqu'à 1 200 étapes ; QAT atteint un pic comparable bien plus tard, puis s'effondre.
Image : Hugging Face Blog
Ce qui n'a pas encore été confirmé : la réplication indépendante sur des benchmarks tiers, les performances sur des tâches en dehors de la suite rapportée, et le comportement sur des charges de travail spécifiques à un domaine comme celles utilisées dans le sous-titrage de génération d'images ou les pipelines multimodaux. Multiverse Computing n'a pas divulgué la suite complète de benchmarks ni les tâches exactes utilisées.
Pour les créateurs qui téléchargent des modèles open-weight pour les exécuter en local — que ce soit pour la génération d'images ou la construction de pipelines de personnages personnalisés — le niveau de compression dans lequel un modèle est livré a toujours impliqué un compromis sur la qualité. QAH, si les résultats se généralisent, recadre ce compromis : une quantification agressive en MXFP4 cesse d'être un dernier recours pour le matériel limité en mémoire et commence à ressembler à un format principal viable.
La technique est également plus rapide à appliquer que le QAT complet. Cela compte pour les mainteneurs de modèles qui souhaitent publier rapidement des variantes quantifiées après la sortie d'un modèle de base, ce qui donnerait à l'écosystème open source davantage de checkpoints 4 bits de haute qualité avec lesquels travailler sur des plateformes comme le catalogue de modèles Charmloop.
Multiverse Computing a publié la méthodologie et les détails des checkpoints sur Hugging Face. La question de savoir si les gains sur les benchmarks résistent à un examen indépendant est la prochaine étape — et une question qui mérite d'être suivie avant de s'engager à utiliser MXFP4 comme format par défaut dans un flux de travail.