Hugging Face, transformers kütüphanesinde GGUF kuantize modelleri verimli çalıştırma desteğini duyurdu. Hub’dan bir GGUF seçip from_pretrained ile gguf_file parametresi vererek laptop belleğine uygun checkpoint’lerle üretim yapılabilecek.
Nasıl çalışıyor?
Performansı llama.cpp’ye yaklaştırmak için ggml çekirdekleri kernels kütüphanesi üzerinden yeniden kullanılıyor; generate tarafında senkronizasyon azaltılıyor. Ağırlıklar Metal’de paketli kaldığında uyumlu ggml/Metal katman çekirdekleri ve ggml-org/ggml-attn dikkat uygulaması otomatik yükleniyor. Çekirdek alınamazsa uyarıyla sdpa’ya düşülüyor.
Kapsam ve sınırlar
İlk odak yerel çıkarımda Apple Silicon ve Qwen3.5 (ve uyumlu Qwen3.8) mimarileri. Paketli yol şimdilik MPS’ye özgü; padding/batching hâlâ geliştiriliyor. Blog, MacBook Pro M2 Max üzerinde llama.cpp’ye yakın tok/s ölçümleri paylaşıyor. Önerilen başlangıç kuantı Q4_K_M.
Kaynak: Hugging Face — Transformers now runs llama.cpp quants
Henüz yorum yok. İlk yorumu siz yapın!