출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Maya는 새 모델이 나올 때마다 직접 벤치마크합니다 — 숫자가 먼저, 과장은 없습니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
Hugging Face의 Transformers 라이브러리가 이제 llama.cpp GGUF 양자화 모델을 직접 로드할 수 있게 되어, llama.cpp를 별도의 종속성으로 설치할 필요가 없어졌습니다. 이는 소비자용 하드웨어에서 대형 언어 모델이나 이미지 캡셔닝 모델을 실행하는 모든 사용자에게 중요한 마찰 요소의 제거입니다.
from_pretrained() 호출로 Hugging Face Hub에서 GGUF 양자화 모델을 직접 가져올 수 있습니다.GGUF는 llama.cpp가 양자화된 모델 가중치를 저장하는 데 사용하는 바이너리 형식입니다. 이는 부동소수점 정밀도의 일부를 희생하여 메모리 사용량을 줄인 압축된 모델 버전입니다. 일반적으로 전체 float16에서 14GB의 VRAM을 요구하는 7B 매개변수 모델이 Q4 양자화에서는 5GB 미만으로 줄어들어, 단일 소비자용 GPU나 심지어 잘 구성된 CPU로도 실행할 수 있게 됩니다. 이러한 트레이드오프가 GGUF가 Hugging Face Hub에서 커뮤니티 파인튜닝 모델의 사실상 표준 배포 형식이 된 이유입니다.
지금까지는 Transformers 파이프라인 내에서 이러한 양자화 모델을 사용하려면 llama.cpp의 Python 바인딩을 별도로 설치하거나 가중치를 다른 형식으로 먼저 변환해야 했습니다. 두 방법 모두 머신 간 재현성을 깨뜨리고 컨테이너화된 배포를 복잡하게 만드는 설정 단계를 추가했습니다.

Hugging Face의 Transformers 라이브러리가 이제 표준 from_pretrained() 호출로 llama.cpp GGUF 양자화 모델을 로드합니다.
이미지: Hugging Face Blog
Hugging Face 블로그에 따르면, 이 변경사항으로 사용자들이 GGUF 파일명을 from_pretrained()에 직접 전달할 수 있게 되었습니다. 이는 Transformers가 이미 표준 모델 로딩에 사용하는 동일한 함수 호출입니다. 라이브러리가 양자화된 가중치를 내부적으로 처리하여, 사용자가 직면하는 종속성으로 노출하지 않고 llama.cpp의 백엔드를 통해 라우팅합니다. 결과적으로 양자화된 Llama, Mistral 또는 호환 모델이 추가 설치 단계 없이 표준 Transformers 파이프라인 내에서 로드됩니다.
프롬프트 확장, 캡션 생성 또는 멀티모달 조건화를 위해 언어 모델에 의존하는 이미지 생성 파이프라인을 구축하는 크리에이터들에게, 이는 환경 오류의 일반적인 지점을 제거합니다. 이전에 맞춤형 설정이 필요했던 GGUF 양자화 비전-언어 모델이 이제 다른 모든 것에 사용되는 동일한 Transformers 워크플로우에 슬롯할 수 있습니다.
여기서의 가치는 8-12GB VRAM 카드를 사용하는 크리에이터들에게 가장 구체적입니다. 이는 모델 선택이 메모리에 의해 지속적으로 제약받는 하드웨어 계층입니다. 13B 모델의 Q5_K_M 양자화는 일반적으로 약 9GB의 VRAM에 맞습니다. 동일한 모델을 bfloat16으로 실행하려면 대략 26GB가 필요합니다. 이 차이는 로컬에서 실행할 수 있는 것과 전혀 실행할 수 없는 것 사이의 차이입니다.
통합이 표준 Transformers 패키지 내부에 있기 때문에, Charmloop의 이미지 생성기를 중심으로 구축된 많은 파이프라인을 포함하여 이미 Transformers 기반 도구를 사용하는 크리에이터들은 스택을 재구성하지 않고도 프롬프트 지원이나 캡셔닝을 위한 양자화 언어 모델을 실험할 수 있습니다.
이 발표는 llama.cpp 호환 패밀리를 넘어 어떤 모델 아키텍처가 지원되는지 명시하지 않았으며, Transformers 내부의 GGUF 추론 속도와 네이티브 llama.cpp 호출을 비교한 성능 벤치마크도 자세히 설명하지 않았습니다. 이러한 수치는 중요합니다. Transformers를 통한 라우팅은 추상화 레이어를 추가하며, 이것이 CPU 전용 설정에서 의미 있는 토큰/초 비용을 발생시키는지는 아직 독립적으로 테스트되지 않았습니다. 지연 시간에 민감한 워크플로우를 위해 이를 벤치마킹하는 크리에이터들은 통합이 원활하다는 Hugging Face의 설명을 실제 측정이 필요한 벤더 주장으로 취급해야 합니다.
이제 더 직접적으로 사용할 수 있게 된 Hub의 양자화 모델의 광범위한 카탈로그는 이 업데이트와 함께 Charmloop의 모델 카탈로그를 통해 살펴볼 가치가 있습니다. 동일한 효율성 향상이 캐릭터 생성과 AI 동반자 캐릭터 프롬프팅에 사용되는 모델에도 적용됩니다.