Co je soubor GGUF?
GGUF je binární formát modelu vytvořený pro inferenční software založený na GGML, například llama.cpp. Soubor GGUF ukládá typované tenzory spolu se strukturovanými metadaty potřebnými k popisu modelu. Je navržen pro rychlé načítání a mapování do paměti. Mnoho souborů GGUF je kvantováno pro efektivní místní inferenci, samotný formát však není synonymem kvantování.

Co je uvnitř souboru GGUF?
Aktuální specifikace GGUF definuje hlavičku, sekci metadat klíč–hodnota, informace o tenzorech a zarovnaná tenzorová data. Metadata mohou určit architekturu modelu, parametry kontextu, informace tokenizéru a další implementační podrobnosti. Záznamy tenzorů popisují názvy, rozměry, typy a offsety do datové oblasti.
Tato kombinace způsobuje, že jeden GGUF často působí samostatněji než „váhy a několik souborů JSON“. Vykonavateli nabízí standardní místo pro nalezení potřebných informací. Slovo „často“ je důležité: konkrétní aplikace může stále vyžadovat externí šablony, nastavení generování nebo doprovodné prostředky, které přípona nijak nezaručuje.
Důvody, proč místní běhová prostředí používají GGUF
GGUF je navržen pro potřeby inference. Tenzorová data jsou zarovnána, formát je výslovně verzován a soubory lze mapovat do paměti, takže kompatibilní vykonavatelé mohou k datům přistupovat bez předchozího převodu celého modelu do jiné reprezentace v paměti. Specifikace je také rozšiřitelná: nová metadata lze přidat, aniž by starší čtečky chybně vyložily základní rozvržení.
Praktickým výsledkem je přenosný artefakt mezi nástroji, které implementují stejnou architekturu a konvence GGUF. Nejde o univerzální přenositelnost mezi všemi aplikacemi AI. Uživatelské rozhraní Stable Diffusion očekávající checkpoint SafeTensors se nestane běhovým prostředím GGUF jen proto, že oba soubory obsahují tenzory.
Znamená GGUF, že je model kvantovaný?
Ne. GGUF může ukládat více typů tenzorů včetně typů s plnou přesností a kvantovaných typů. Distribuční stránky často používají označení jako Q4_K_M, Q5_K_M nebo F16 k popisu konkrétního převodu. Tato označení popisují volby reprezentace tenzorů uvnitř souboru; .gguf označuje kontejner.
Kvantování může snížit nároky na úložiště a paměť, obvykle za cenu kompromisu v kvalitě nebo schopnostech, který závisí na modelu, kvantizéru a pracovní úloze. Převod zdroje s vyšší přesností na kvantovaný GGUF mění hodnoty tenzorů. Může jít o výborný inferenční artefakt, ale nejde o bajtově přesnou náhradu zdrojového kontrolního bodu, pokud očekáváte jeho pozdější obnovu.
Uchovávejte původ spolu se souborem. Zaznamenejte zdrojový model a revizi, nástroj převodu a jeho verzi, metodu kvantování, název souboru a kontrolní součet. „Je to Q4 GGUF“ nestačí k důvěryhodnému znovuvytvoření stejného artefaktu.
Jak číst název souboru GGUF, aniž byste mu příliš důvěřovali
Název souboru může obsahovat název modelu, počet parametrů, označení doladění, údaj o kontextu a příponu kvantování. Jde o publikační konvence, nikoli o bezpečnostní hranici. Ověřte metadata důvěryhodným kontrolním nástrojem nebo samotným běhovým prostředím a získávejte soubory ze zdroje, jehož původ a licenci můžete posoudit.
Formát souboru snižuje nejednoznačnost pro parsery; neosvědčuje, kdo váhy vytvořil, zda je karta modelu přesná ani zda je obsah vhodný pro vaše použití. Kontrolní součet dokazuje, že se bajty oproti známé hodnotě nezměnily, nikoli že jsou neškodné nebo správně licencované.
GGUF a SafeTensors jednou větou
GGUF je kontejner modelu zaměřený na inferenci s definovaným slovníkem metadat, který široce používají vykonavatelé GGML; SafeTensors je bezpečný a rychlý formát serializace tenzorů, který obvykle doprovázejí samostatné soubory konfigurace a tokenizéru. Ani jeden není univerzálním „lepším formátem“. Správná volba vychází z běhového prostředí a artefaktu, který potřebujete uchovat. Úplné srovnání najdete v článku GGUF a SafeTensors.
Co byste měli zachovat?
Pokud lze GGUF reprodukovat z důvěryhodného zdroje a postupu převodu, můžete místo každé odvozené varianty zachovat postup a zdroj. Pokud je přenosová kapacita omezená, zdroj může zmizet nebo je konkrétní převod provozně důležitý, může být rozumné uchovat samotný GGUF. Rozhodujte podle jednotlivých rodin, nikoli podle přípony.
Tensor Archive uchovává vybrané místní tenzory a ověřuje přesnou obnovu. Nepřevádí GGUF zpět na původní model s vyšší přesností, nedohledává chybějící původ ani nerozhoduje, zda je kompromis kvantování přijatelný.
Vytvořte přehlednější mapu formátů
Pokračujte článkem SafeTensors a GGUF a poté pomocí průvodce úložištěm SafeTensors a kvantováním oddělte přesné uchování od transformovaných inferenčních kopií.
Zdroje
- GGML: specifikace GGUF — binární rozvržení, metadata, informace o tenzorech, zarovnání, rozšiřitelnost a podporované typy tenzorů.
- llama.cpp — hlavní implementace místní inference a aktuální nástroje GGUF.
- Hugging Face Hub: GGUF — pokyny ekosystému k prohlížení metadat a práci se soubory GGUF na Hub.