Kaynaklar
İş başında gör
Böyle hikâyelerin ardındaki modelleri ve stilleri keşfet — ücretsiz hesap, anında galeri.
Kataloğu keşfetBunu şununla konuş
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren

Maya her yeni modeli benchmark'tan geçirir — önce rakamlar, asla abartı.
Böyle hikâyelerin ardındaki modelleri ve stilleri keşfet — ücretsiz hesap, anında galeri.
Kataloğu keşfetBir arkadaşını seç ve bu haber hakkındaki görüşünü öğren
Hugging Face'in Transformers kütüphanesi artık llama.cpp GGUF quantize modellerini doğrudan yükleyebiliyor; bu sayede llama.cpp'yi ayrı bir bağımlılık olarak kurma zorunluluğu ortadan kalkıyor. Tüketici donanımında büyük dil veya görüntü açıklama modelleri çalıştıran herkes için bu, önemli bir kurulum yükünü azaltıyor.
from_pretrained() çağrısıyla Hugging Face Hub'dan doğrudan bir GGUF quant çekilebiliyor.GGUF, llama.cpp'nin quantize model ağırlıklarını depolamak için kullandığı ikili formattır; bu ağırlıklar, bellek ayak izini küçültmek amacıyla kayan nokta hassasiyetinden bir miktar feragat eden sıkıştırılmış model sürümleridir. Tam float16 formatında normalde 14 GB VRAM gerektiren 7B parametreli bir model, Q4 quantizasyonunda 5 GB'ın altına inebiliyor; bu da modeli tek bir tüketici GPU'sunun ya da iyi donanımlı bir CPU'nun erişim alanına sokuyor. Bu uzlaşı, GGUF'un Hugging Face Hub'daki topluluk tarafından ince ayar yapılmış modeller için fiili dağıtım formatı hâline gelmesinin nedenidir.
Bugüne kadar bu quantları bir Transformers pipeline'ı içinde kullanmak, ya llama.cpp'nin Python bağlamalarını ayrıca kurmayı ya da ağırlıkları önce farklı bir formata dönüştürmeyi gerektiriyordu. Her iki yol da makineler arasında yeniden üretilebilirliği bozan ve konteyner tabanlı dağıtımları karmaşıklaştıran kurulum adımları ekliyordu.

Hugging Face'in Transformers kütüphanesi artık llama.cpp GGUF quantlarını standart bir from_pretrained() çağrısıyla yüklüyor.
Görsel: Hugging Face Blog
Hugging Face bloguna göre, değişiklik kullanıcıların bir GGUF dosya adını doğrudan from_pretrained() fonksiyonuna geçirmesine olanak tanıyor; bu, Transformers'ın standart model yükleme için zaten kullandığı aynı fonksiyon çağrısıdır. Kütüphane, quantize ağırlıkları dahili olarak işleyerek llama.cpp'nin arka ucuna yönlendiriyor ve bunu kullanıcıya yönelik bir bağımlılık olarak açığa çıkarmıyor. Sonuç olarak quantize bir Llama, Mistral veya uyumlu bir model, ek kurulum adımı olmaksızın standart bir Transformers pipeline'ı içinde yükleniyor.
Prompt genişletme, açıklama oluşturma veya çok modlu koşullandırma için bir dil modeline dayanan görüntü üretim pipeline'ları geliştiren yaratıcılar için bu, yaygın bir ortam bozulma noktasını ortadan kaldırıyor. Daha önce özel bir kurulum gerektiren GGUF quantize bir görsel-dil modeli artık diğer her şey için kullanılan aynı Transformers iş akışına sorunsuzca entegre edilebiliyor.
Bu değişiklik, 8–12 GB VRAM'e sahip ekran kartı kullanan yaratıcılar için en somut faydayı sunuyor; bu donanım katmanında model seçimi sürekli olarak bellek tarafından kısıtlanıyor. 13B'lik bir modelin Q5_K_M quantı genellikle yaklaşık 9 GB VRAM'e sığıyor; aynı model bfloat16 formatında yaklaşık 26 GB gerektiriyor. Bu fark, yerel olarak çalıştırmak ile hiç çalıştıramamak arasındaki farktır.
Entegrasyon standart Transformers paketinin içinde yer aldığından, Transformers tabanlı araçları zaten kullanan yaratıcılar — Charmloop'un görüntü üreticisi etrafında oluşturulmuş pek çok pipeline dahil — yığınlarını yeniden yapılandırmadan prompt yardımı veya açıklama oluşturma için quantize dil modelleriyle denemeler yapabilir.
Duyuru, llama.cpp uyumlu aile dışında hangi model mimarilerinin desteklendiğini belirtmiyor; ayrıca Transformers içindeki GGUF çıkarım hızını yerel bir llama.cpp çağrısıyla karşılaştıran performans kıyaslamalarına da yer vermiyor. Bu rakamlar önemlidir: Transformers üzerinden yönlendirme soyutlama katmanları ekliyor ve bunun yalnızca CPU kullanan bir kurulumda anlamlı bir token/saniye kaybına yol açıp açmadığı henüz bağımsız olarak test edilmedi. Bu entegrasyonu gecikmeye duyarlı iş akışları için kıyaslayan yaratıcılar, Hugging Face'in entegrasyonun sorunsuz olduğuna dair çerçevelemesini gerçek dünya ölçümü bekleyen bir satıcı iddiası olarak değerlendirmelidir.
Hub'da mevcut olan ve artık çok daha doğrudan kullanılabilen geniş quantize model kataloğu, bu güncellemeyle birlikte Charmloop'un model kataloğu üzerinden incelemeye değer — aynı verimlilik kazanımları karakter oluşturma ve yapay zeka eşlik karakteri promptlama için kullanılan modeller için de geçerlidir.