Tabsfri SafeTensors-lagring er ikke vægtkvantisering

»Komprimér SafeTensors« kan betyde to grundlæggende forskellige ting: at bevare de oprindelige bytes til nøjagtig gendannelse eller at oprette en anden vægtrepræsentation, som er mindre til en bestemt runtime. Vælg først kravet; værktøjerne følger af det.

En SafeTensors-model, der følger én vej til et nøjagtigt arkiv og én vej til transformerede vægte.
Begge resultater kan være nyttige, men kun det ene lover de oprindelige bytes tilbage.

Nøjagtig gendannelse kontra ændrede vægte

Kvantisering er en beslutning om modelformat. Den reducerer den numeriske præcision eller ændrer repræsentationen på anden vis, så en runtime kan bruge mindre hukommelse eller lagerplads. Det kan være helt passende til implementering, men resultatet er ikke det oprindelige artefakt.

Et tabsfrit arkiv har en anden opgave: at gendanne den oprindelige fils bytes nøjagtigt. Tensor Archive bevarer relaterede lokale modelversioner i en kompakt, administreret familie og gendanner en valgt version efter behov. Det er hverken et kvantiseringsværktøj, et beskæringsværktøj eller en formatkonverter.

Stil ét konkret spørgsmål: Skal den model, du henter senere, være nøjagtig den fil byte for byte, som du begyndte med? Hvis ja, må en formattransformation ikke være din eneste bevaringsplan.

Derfor ændrer én SafeTensors-fil måske næsten ikke størrelse

Filstørrelsen alene fortæller ikke, om en lagerarbejdsgang giver et godt resultat. En enkelt fil kan indeholde data, der ikke kan gentages på en nyttig måde i et nøjagtigt arkiv. En relateret familie kan være anderledes: Selvstændige installationer kan gentage et basis-checkpoint, og færdige projektversioner kan dele en væsentlig mængde materiale.

Derfor bør det første trin være en analyse af de filer, du vil bevare sammen. Lov ikke en procentdel ud fra filtypen, og antag ikke, at en stor fil automatisk er en god arkivkandidat.

Læs benchmarket i dets rette afgrænsning

Tensor Archive offentliggør et kontrolleret eksempel med fem installationer, hvor 907.3 MB, der var gemt hver for sig, blev til 261.6 MB som én relateret model- og adapterfamilie: 71.2% mindre fysisk lagerplads. Sammenligningen er værdifuld, fordi arbejdsbelastningen, relationen mellem filerne og kravet om nøjagtig gendannelse står ved siden af resultatet.

Det siger dette ikke: at én SafeTensors-fil, en tilfældig mappe eller alle LoRA'er sparer 71.2%. Uvedkommende og allerede komprimerede filer kan give en lille besparelse. En reel beslutning bør bygge på analysen af den konkrete familie.

Sådan tester du en lagerarbejdsgang sikkert

  1. Lav en uafhængig kopi af alt, der ikke kan erstattes.
  2. Vælg én relateret familie, og undersøg den, før du ændrer en arbejdsmappe.
  3. Analysér kilden, og gennemgå det forventede resultat.
  4. Arkivér den, kør Verify, og gendan til et separat output.
  5. Sammenlign eller indlæs det gendannede artefakt i den relevante arbejdsgang.
  6. Først efter denne test bør du vælge, om en arbejdskopi kan fjernes manuelt.

Vælg det værktøj, der passer til problemet

Brug kvantisering, når du bevidst ønsker en anden repræsentation til implementering og forstår kompromiserne i runtimen. Brug et nøjagtigt lokalt arkiv, når du skal bevare og gendanne de oprindelige bytes fra relaterede modeller og samtidig reducere gentaget lagerforbrug dér, hvor relationen findes. Læs hvordan du frigør diskplads i et LoRA-bibliotek for en LoRA-specifik oprydningsarbejdsgang.

Start med én familie og et resultat, du kan gennemgå. Download Tensor Archive for at køre arbejdsgangen lokalt, eller læs den offentlige benchmarkoversigt, før du prøver.

Kilder

Behold modellen. Ryd arbejdsdisken.Gratis download ↓