GGUF dosyası nedir?
GGUF, llama.cpp gibi GGML tabanlı çıkarım yazılımları için oluşturulmuş ikili model biçimidir. GGUF dosyası türlendirilmiş tensörleri modeli açıklamak için gereken yapılandırılmış meta verilerle birlikte saklar. Hızlı yükleme ve bellek eşleme için tasarlanmıştır. Pek çok GGUF dosyası verimli yerel çıkarım için kuantize edilir; ancak biçimin kendisi kuantizasyonla eş anlamlı değildir.

GGUF dosyasının içinde ne var?
Güncel GGUF belirtimi başlık, anahtar-değer meta veri bölümü, tensör bilgileri ve hizalanmış tensör verilerini tanımlar. Meta veriler model mimarisini, bağlam parametrelerini, tokenizer bilgilerini ve diğer uygulama ayrıntılarını belirtebilir. Tensör kayıtları adları, boyutları, türleri ve veri bölgesindeki offsetleri açıklar.
Bu birleşim, tek bir GGUF'un çoğu zaman “ağırlıklar artı birkaç JSON dosyası”ndan daha kendi kendine yeterli hissettirmesinin nedenidir. Yürütücüye ihtiyaç duyduğu bilgileri bulmak için standart yer sağlar. “Çoğu zaman” önemlidir: belirli bir uygulama yine de uzantının sihirli biçimde garanti etmediği dış şablonlara, oluşturma ayarlarına veya tamamlayıcı varlıklara ihtiyaç duyabilir.
Yerel çalışma zamanları GGUF'u neden sever
GGUF çıkarım ihtiyaçları etrafında oluşturulmuştur. Tensör verileri hizalanır, biçim açıkça sürümlenir ve dosyalar bellek eşlemeli olabilir; bu sayede uyumlu yürütücüler tüm modeli önce başka bir bellek içi gösterime çevirmeden verilere erişebilir. Belirtim de genişletilebilir: eski okuyucuların temel düzeni yanlış anlamasına yol açmadan yeni meta veriler eklenebilir.
Pratik sonuç, aynı mimariyi ve GGUF kurallarını uygulayan araçlar arasında taşınabilir artefakttır. Her AI uygulaması arasında evrensel taşınabilirlik değildir. SafeTensors checkpointi bekleyen Stable Diffusion kullanıcı arayüzü, her iki dosya da tensör içeriyor diye GGUF çalışma zamanına dönüşmez.
GGUF modelin kuantize olduğu anlamına gelir mi?
Hayır. GGUF, eksiksiz hassasiyetli ve kuantize türler dâhil birden fazla tensör türünü saklayabilir. Dağıtım sayfaları belirli dönüştürmeyi açıklamak için sık sık Q4_K_M, Q5_K_M veya F16 gibi etiketler kullanır. Bu etiketler dosya içindeki tensör gösterimi seçimlerini açıklar; .gguf kapsayıcıyı açıklar.
Kuantizasyon, genellikle modele, kuantize ediciye ve iş yüküne bağlı kalite veya kapasite ödünleşimiyle depolama ve bellek gereksinimlerini azaltabilir. Daha yüksek hassasiyetli kaynağı kuantize GGUF'a dönüştürmek tensör değerlerini değiştirir. Bu mükemmel bir çıkarım artefaktı olabilir; ancak kaynağı daha sonra kurtarmayı bekliyorsanız kaynak checkpointin bayt düzeyinde birebir ikamesi değildir.
Kaynağı dosyanın yanında tutun. Kaynak modeli ve revizyonu, dönüştürme aracını ve sürümünü, kuantizasyon yöntemini, dosya adını ve checksum değerini kaydedin. “Q4 GGUF” aynı artefaktı güvenle yeniden oluşturmak için yeterli değildir.
GGUF dosya adına aşırı güvenmeden nasıl okunur
Dosya adı model adı, parametre ölçeği, ince ayar etiketi, bağlam ipucu ve kuantizasyon son eki içerebilir. Bunlar yayımlama kurallarıdır, güvenlik sınırı değildir. Meta verileri güvenilir inceleyiciyle veya çalışma zamanıyla doğrulayın ve dosyaları kaynağını ve lisansını değerlendirebildiğiniz bir yerden edinin.
Dosya biçimi ayrıştırıcıların belirsizliğini azaltır; ağırlıkları kimin oluşturduğunu, model kartının doğru olduğunu veya içeriğin kullanımınıza uygun olduğunu onaylamaz. Checksum, byte'ların bilinen değere göre değişmediğini kanıtlar; iyi huylu veya doğru lisanslanmış olduğunu kanıtlamaz.
Tek cümlede GGUF ile SafeTensors
GGUF, GGML yürütücüleri tarafından yoğun kullanılan tanımlı meta veri sözlüğüne sahip çıkarım odaklı model kapsayıcısıdır; SafeTensors yaygın olarak ayrı yapılandırma ve tokenizer dosyalarıyla birlikte taşınan güvenli, hızlı tensör serileştirme biçimidir. Hiçbiri evrensel “daha iyi biçim” değildir. Doğru seçim çalışma zamanını ve korumanız gereken artefaktı izler. Eksiksiz karşılaştırma GGUF ile SafeTensors bölümündedir.
Neleri saklamalısınız?
GGUF güvenilir kaynak ve dönüştürme reçetesinden yeniden üretilebiliyorsa her türetilmiş varyant yerine reçeteyi ve kaynağı saklayabilirsiniz. Bant genişliği azsa, kaynak kaybolabilecekse veya belirli dönüştürme işletim bakımından önemliyse GGUF'un kendisini saklamak mantıklı olabilir. Bu kararı uzantıya göre değil aile başına verin.
Tensor Archive seçilen yerel tensörleri korur ve birebir kurtarmayı doğrular. GGUF'u özgün daha yüksek hassasiyetli modele geri dönüştürmez, eksik kaynağı çıkarmaz veya kuantizasyon ödünleşiminin kabul edilebilir olup olmadığına karar vermez.
Daha temiz bir biçim haritası oluşturun
SafeTensors ile GGUF karşılaştırmasıyla devam edin, ardından birebir saklamayı dönüştürülmüş çıkarım kopyalarından ayırmak için SafeTensors depolama ve kuantizasyon rehberini kullanın.
Kaynaklar
- GGML: GGUF belirtimi — ikili düzen, meta veriler, tensör bilgileri, hizalama, genişletilebilirlik ve desteklenen tensör türleri.
- llama.cpp — birincil yerel çıkarım uygulaması ve güncel GGUF araçları.
- Hugging Face Hub: GGUF — Hub üzerinde meta verileri görüntüleme ve GGUF dosyalarıyla çalışma için ekosistem rehberi.