Bezztrátové ukládání SafeTensors není kvantizace vah
„Komprimovat SafeTensors“ může znamenat dvě zásadně odlišné věci: zachovat původní bajty pro přesné obnovení, nebo vytvořit jinou reprezentaci vah, která je menší pro konkrétní běhové prostředí. Nejdříve zvolte požadavek; nástroje z něj vyplynou.
Přesné obnovení versus pozměněné váhy
Kvantizace je rozhodnutí o formátu modelu. Snižuje numerickou přesnost nebo jinak mění reprezentaci, aby běhové prostředí využilo méně paměti či úložiště. Může být pro nasazení zcela vhodná, ale výstup není původní artefakt.
Bezztrátový archiv má jiný úkol: přesně obnovit původní bajty souborů. Tensor Archive slouží k uchování souvisejících místních verzí modelů v kompaktní spravované rodině a k obnovení vybrané verze na vyžádání. Není kvantizátorem, nástrojem pro prořezávání ani převodníkem formátů.
Položte si jednu konkrétní otázku: musí být tento model při pozdějším načtení bajt po bajtu totožný se souborem, s nímž jste začali? Pokud ano, nespoléhejte při uchovávání pouze na transformaci formátu.
Jeden soubor SafeTensors se může změnit jen nepatrně
Samotná velikost souboru neříká, zda bude mít úložný postup výrazný výsledek. Jednotlivý soubor může obsahovat data, která se pro přesný archiv užitečně neopakují. Související rodina může být jiná: samostatná nasazení mohou opakovat základní kontrolní bod a dokončené verze projektu mohou sdílet podstatnou část materiálu.
Proto má být prvním krokem analýza souborů, které hodláte uchovávat společně. Neslibujte procento podle přípony a nepředpokládejte, že velký soubor je automaticky vhodným kandidátem pro archivaci.
Čtěte benchmark v jeho skutečném rozsahu
Tensor Archive zveřejňuje kontrolovaný příklad pěti nasazení, v němž se 907.3 MB uložených nezávisle změnilo na 261.6 MB jako jedna související rodina modelu a adaptérů: o 71.2% méně fyzického úložiště. Srovnání je hodnotné, protože pracovní zátěž, vztah mezi soubory a podmínka přesného obnovení jsou uvedeny vedle výsledku.
Co z toho nevyplývá: že jeden soubor SafeTensors, náhodná složka nebo každá LoRA ušetří 71.2%. Nesouvisející a již komprimované soubory mohou ušetřit jen málo. Skutečné rozhodnutí má vycházet z analýzy rodiny před vámi.
Jak bezpečně otestovat úložný postup
- Vytvořte nezávislou kopii všeho, co nelze nahradit.
- Vyberte jednu související rodinu a prohlédněte ji před změnou pracovní složky.
- Analyzujte zdroj a zkontrolujte očekávaný výsledek.
- Archivujte, spusťte Verify a obnovte do samostatného výstupu.
- Porovnejte nebo načtěte obnovený artefakt v důležitém pracovním postupu.
- Až po tomto testu rozhodněte, zda lze pracovní kopii ručně odstranit.
Vyberte nástroj, který odpovídá problému
Kvantizaci použijte, když záměrně chcete jinou reprezentaci pro nasazení a rozumíte jejím kompromisům za běhu. Přesný místní archiv použijte, když potřebujete zachovat a obnovit původní bajty souvisejících modelů a omezit opakované ukládání tam, kde vztah existuje. Postup úklidu zaměřený na LoRA popisuje článek jak uvolnit místo na disku v knihovně LoRA.
Začněte jednou rodinou a výsledkem, který dokážete zkontrolovat. Stáhněte Tensor Archive a spusťte postup místně nebo si před vyzkoušením projděte veřejné shrnutí benchmarku.
Zdroje
- dokumentace projektu SafeTensors – cíle formátu, rozvržení a podporované typy tenzorů.
- Souhrn benchmarku Tensor Archive – publikovaná pracovní zátěž a doklady přesného obnovení.