출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Maya는 새 모델이 나올 때마다 직접 벤치마크합니다 — 숫자가 먼저, 과장은 없습니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Multiverse Computing이 양자화 인식 힐링(Quantization-Aware Healing, QAH)이라는 기법을 공개했습니다. 이 기법은 1200억 파라미터 모델을 600억 MXFP4 체크포인트로 압축하며, 압축된 모델이 원본인 풀 프리시전 1200억 모델보다 표준 벤치마크에서 더 높은 점수를 기록합니다.
더 작고 양자화된 모델이 더 크고 풀 프리시전인 모델을 이긴다는 직관에 반하는 결과는, QAH가 복원 단계를 구성하는 방식에서 비롯됩니다. 표준 양자화 인식 학습은 압축된 체크포인트에서 시작해 파인튜닝하지만, 압축된 모델은 이미 복원하기 어려운 구조적 정보를 잃은 상태입니다. QAH는 대신 원래의 사전 압축 모델을 교사로 고정시키고, 압축된 학생(student) 모델에 지식을 다시 증류합니다. 교사가 수정되지 않기 때문에 학생이 학습하는 신호가 깨끗합니다.

QAH는 원래의 사전 압축 모델을 고정된 교사로 삼아 증류하며, 구조적 압축 및 양자화 이후 성능을 복원합니다.
이미지: Hugging Face Blog
실질적인 시사점: 이미지 생성 파이프라인, 캐릭터 일관성 검사, 프롬프트 정제 등을 위해 대형 오픈 웨이트 모델을 로컬에서 실행하는 워크플로우라면, QAH 처리된 체크포인트를 통해 훨씬 적은 메모리 비용으로 훨씬 큰 모델에 준하는 성능을 낼 수 있습니다. 600억 MXFP4 모델은 1200억 bfloat16 모델을 감당하기 어려운 하드웨어에서도 실행 가능하며, MXFP4 포맷은 최신 실리콘에서 네이티브 지원이 점점 확대되고 있습니다.

세 체크포인트의 벤치마크 성능 비교: 1200억 MXFP4 교사, 600억 bfloat16 압축 모델, QAH로 복원된 600억 MXFP4 모델.
이미지: Hugging Face Blog
Multiverse Computing의 Hugging Face 블로그 포스트에 따르면, QAH가 적용된 600억 MXFP4 체크포인트는 보고된 벤치마크 전반에서 600억 bfloat16 중간 모델과 1200억 MXFP4 교사 모델 모두를 능가합니다. 또한 MXFP4로 양자화된 소형 GPT-OSS 9B 모델에 적용했을 때, QAH는 초기에 최고점에 도달해 1,200 스텝 내내 안정적으로 유지되는 반면, QAT 기준선은 훨씬 오래 걸린 후 붕괴되는 양상을 보입니다.

QAH는 초기에 최고점에 도달해 1,200 스텝 내내 안정적으로 유지되며, QAT는 훨씬 늦게 유사한 최고점에 도달한 후 붕괴됩니다.
이미지: Hugging Face Blog
아직 확인되지 않은 사항: 서드파티 벤치마크에서의 독립적인 재현, 보고된 테스트 범위 외 태스크에서의 성능, 이미지 생성 캡셔닝이나 멀티모달 파이프라인 같은 도메인 특화 워크로드에서의 동작. Multiverse Computing은 전체 벤치마크 스위트나 사용된 정확한 태스크를 공개하지 않았습니다.
이미지 생성이나 커스텀 캐릭터 파이프라인 구축을 위해 오픈 웨이트 모델을 로컬에서 실행하는 크리에이터들에게, 모델이 출시되는 압축 단계는 항상 품질 트레이드오프를 수반해 왔습니다. QAH의 결과가 일반화된다면, 이 트레이드오프를 재정의합니다. MXFP4로의 공격적인 양자화는 메모리 제약 하드웨어의 최후 수단이 아니라 실행 가능한 기본 포맷으로 자리잡을 수 있습니다.
이 기법은 또한 전체 QAT보다 적용 속도가 빠릅니다. 베이스 모델 출시 후 빠르게 양자화 변형을 배포하려는 모델 관리자에게 중요한 점이며, Charmloop 모델 카탈로그 같은 플랫폼에서 오픈소스 생태계가 활용할 수 있는 고품질 4비트 체크포인트를 더 많이 제공할 수 있습니다.
Multiverse Computing은 Hugging Face에 방법론과 체크포인트 세부 정보를 게시했습니다. 벤치마크 성과가 독립적인 검증을 통과할지가 다음 질문이며, MXFP4를 기본 포맷으로 워크플로우에 도입하기 전에 주목할 가치가 있습니다.