Fuentes
Míralo en acción
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogo
Maya somete a prueba cada lanzamiento de modelo — primero los números, nunca el hype.
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogoElige un compañero y descubre su opinión sobre esta noticia
Multiverse Computing ha publicado una técnica llamada Quantization-Aware Healing (QAH) que comprime un modelo de 120.000 millones de parámetros a un checkpoint de 60B MXFP4 — y ese modelo comprimido obtiene puntuaciones más altas en los benchmarks estándar que el original de 120B en precisión completa del que deriva.
El resultado contraintuitivo — un modelo más pequeño y cuantizado que supera a uno más grande en precisión completa — proviene de cómo QAH estructura la fase de recuperación. El entrenamiento estándar con reconocimiento de cuantización parte de un checkpoint comprimido y lo ajusta, pero el modelo comprimido ya ha perdido información estructural difícil de recuperar. QAH, en cambio, mantiene el modelo original previo a la compresión congelado como profesor y destila el conocimiento de vuelta en el estudiante comprimido. Como el profesor nunca se modifica, la señal de la que aprende el estudiante es limpia.

QAH destila a partir del modelo original previo a la compresión como profesor congelado, restaurando el rendimiento tras la compresión estructural y la cuantización.
Imagen: Hugging Face Blog
La implicación práctica: si tu flujo de trabajo implica ejecutar modelos grandes de pesos abiertos localmente — para pipelines de generación de imágenes, comprobaciones de consistencia de personajes o refinamiento de prompts — los checkpoints procesados con QAH podrían permitirte ejecutar un modelo que rinde como uno mucho más grande a una fracción del coste de memoria. Un modelo de 60B MXFP4 cabe en hardware que tendría dificultades con un modelo de 120B bfloat16, y el formato MXFP4 cuenta cada vez con más soporte nativo en el silicio más reciente.

Rendimiento en benchmarks de los tres checkpoints: el profesor de 120B MXFP4, el modelo comprimido de 60B bfloat16 y el modelo de 60B MXFP4 recuperado con QAH.
Imagen: Hugging Face Blog
Según la entrada del blog de Hugging Face de Multiverse Computing, el checkpoint de 60B MXFP4 con QAH aplicado obtiene puntuaciones por encima tanto del intermedio de 60B bfloat16 como del profesor de 120B MXFP4 en los benchmarks reportados. La entrada también muestra que, cuando se aplica a un modelo GPT-OSS 9B más pequeño cuantizado a MXFP4, QAH alcanza su pico pronto y se mantiene estable durante 1.200 pasos — mientras que una línea base QAT tarda significativamente más y luego colapsa.

QAH alcanza su pico pronto y se mantiene estable durante 1.200 pasos; QAT alcanza un pico comparable mucho más tarde y luego colapsa.
Imagen: Hugging Face Blog
Lo que no se ha confirmado: la replicación independiente en benchmarks de terceros, el rendimiento en tareas fuera del conjunto reportado y el comportamiento en cargas de trabajo específicas de dominio como las utilizadas en el subtitulado para generación de imágenes o en pipelines multimodales. Multiverse Computing no ha divulgado el conjunto completo de benchmarks ni las tareas exactas utilizadas.
Para los creadores que descargan modelos de pesos abiertos para ejecutarlos localmente — ya sea para generación de imágenes o para construir pipelines de personajes personalizados — el nivel de compresión con el que se distribuye un modelo siempre ha implicado un compromiso de calidad. QAH, si los resultados se generalizan, reformula ese compromiso: la cuantización agresiva a MXFP4 deja de ser un último recurso para hardware con memoria limitada y empieza a parecer un formato primario viable.
La técnica también es más rápida de aplicar que el QAT completo. Eso importa para los mantenedores de modelos que quieren distribuir variantes cuantizadas rápidamente tras el lanzamiento de un modelo base, lo que daría al ecosistema de código abierto más checkpoints de 4 bits de alta calidad con los que trabajar en plataformas como el catálogo de modelos de Charmloop.
Multiverse Computing ha publicado la metodología y los detalles del checkpoint en Hugging Face. Si las ganancias en benchmarks sobreviven al escrutinio independiente es la siguiente pregunta — y una que vale la pena seguir antes de comprometer un flujo de trabajo con MXFP4 como formato predeterminado.