Źródła
Zobacz w akcji
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogPogadaj o tym z
Wybierz towarzysza i poznaj jego zdanie na temat tej historii

Maya benchmarkuje każdą premierę modelu — najpierw liczby, nigdy hype.
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogWybierz towarzysza i poznaj jego zdanie na temat tej historii
Biblioteka Transformers firmy Hugging Face może teraz bezpośrednio ładować skwantyzowane modele GGUF llama.cpp, eliminując konieczność instalowania llama.cpp jako osobnej zależności — redukcja tarcia, która ma znaczenie dla każdego, kto uruchamia duże modele językowe lub modele do opisywania obrazów na sprzęcie konsumenckim.
from_pretrained() może pobrać kwant GGUF bezpośrednio z Hugging Face Hub.GGUF to format binarny używany przez llama.cpp do przechowywania skwantyzowanych wag modelu — skompresowanych wersji modelu, które poświęcają część precyzji zmiennoprzecinkowej, aby zmniejszyć zajętość pamięci. Model o 7 miliardach parametrów, który normalnie wymagałby 14 GB pamięci VRAM w pełnym formacie float16, może spaść poniżej 5 GB przy kwantyzacji Q4, stając się dostępny dla pojedynczej konsumenckiej karty GPU, a nawet dobrze wyposażonego procesora CPU. Ten kompromis jest powodem, dla którego GGUF stał się de facto formatem dystrybucji dla modeli dostrojonych przez społeczność na Hugging Face Hub.
Do tej pory korzystanie z tych kwantów w potoku Transformers oznaczało albo osobną instalację powiązań Pythona llama.cpp, albo wcześniejszą konwersję wag do innego formatu. Obie ścieżki dodawały kroki konfiguracji, które niszczyły odtwarzalność między maszynami i komplikowały wdrożenia kontenerowe.

Biblioteka Transformers firmy Hugging Face ładuje teraz kwanty GGUF llama.cpp za pomocą standardowego wywołania from_pretrained().
Obraz: Hugging Face Blog
Zgodnie z blogiem Hugging Face, zmiana pozwala użytkownikom przekazać nazwę pliku GGUF bezpośrednio do from_pretrained() — tego samego wywołania funkcji, którego Transformers już używa do standardowego ładowania modeli. Biblioteka obsługuje skwantyzowane wagi wewnętrznie, kierując je przez backend llama.cpp bez ujawniania go jako zależności widocznej dla użytkownika. W efekcie skwantyzowany model Llama, Mistral lub kompatybilny ładuje się w standardowym potoku Transformers bez żadnego dodatkowego kroku instalacji.
Dla twórców budujących potoki generowania obrazów, które opierają się na modelu językowym do rozszerzania promptów, generowania opisów lub kondycjonowania multimodalnego, eliminuje to częsty punkt awarii środowiska. Skwantyzowany wizualno-językowy model GGUF, który wcześniej wymagał niestandardowej konfiguracji, może teraz wpasować się w ten sam przepływ pracy Transformers używany do wszystkiego innego.
Wartość jest tu najbardziej konkretna dla twórców korzystających z kart z 8–12 GB pamięci VRAM — poziomu sprzętowego, gdzie wybór modelu jest stale ograniczony przez pamięć. Kwant Q5_K_M modelu 13B zazwyczaj mieści się w około 9 GB pamięci VRAM; ten sam model w formacie bfloat16 potrzebuje około 26 GB. Ta różnica to granica między uruchamianiem lokalnie a brakiem możliwości uruchomienia w ogóle.
Ponieważ integracja znajduje się wewnątrz standardowego pakietu Transformers, twórcy, którzy już używają narzędzi opartych na Transformers — w tym wielu potoków zbudowanych wokół generatora obrazów Charmloop — mogą eksperymentować ze skwantyzowanymi modelami językowymi do wspomagania promptów lub opisywania bez restrukturyzacji swojego stosu.
Ogłoszenie nie precyzuje, które architektury modeli są obsługiwane poza rodziną kompatybilną z llama.cpp, ani nie zawiera szczegółowych benchmarków wydajności porównujących szybkość wnioskowania GGUF w Transformers z natywnym wywołaniem llama.cpp. Te liczby mają znaczenie: routing przez Transformers dodaje warstwy abstrakcji, a to, czy kosztuje to znaczącą liczbę tokenów na sekundę w konfiguracji tylko z CPU, nie zostało jeszcze niezależnie przetestowane. Twórcy testujący to pod kątem przepływów pracy wrażliwych na opóźnienia powinni traktować sformułowanie Hugging Face — że integracja jest bezproblemowa — jako twierdzenie dostawcy oczekujące na pomiary w rzeczywistych warunkach.
Szerszy katalog skwantyzowanych modeli dostępnych na Hub, teraz bardziej bezpośrednio użytecznych, warto przeglądać przez katalog modeli Charmloop przy okazji tej aktualizacji — te same korzyści w zakresie wydajności dotyczą modeli używanych do generowania postaci i tworzenia promptów dla postaci towarzyszących AI.