De Hugging Face-cache veilig wissen

Gebruik de huidige opdrachten van hf cache om de cache te inspecteren voordat je iets verwijdert. Verwijder een bekende repository of revisie met hf cache rm; gebruik hf cache prune voor revisies waarnaar niet meer wordt verwezen. Behandel de cachemap niet als een verzameling onafhankelijke bestanden — snapshots kunnen dezelfde blobs delen.

Een vertakkende modelcache die selectief wordt gesnoeid, terwijl snapshots waarnaar wordt verwezen en gedeelde blobs beschermd blijven.
Bij een veilige cacheopschoning worden verwijzingen weloverwogen verwijderd en kan de cachebeheerder begrijpen welke gedeelde blobs nog nodig zijn.

Waarom handmatig verwijderen riskant is

De Hub-cache is ontworpen om te voorkomen dat identieke inhoud tweemaal wordt gedownload. Onder de cache hub heeft een repository normaal gesproken refs, snapshots en blobs. Een snapshot presenteert een revisie als een bruikbare map, terwijl de bestanden kunnen terugverwijzen naar gedeelde inhoud in blobs. Twee revisies kunnen daardoor hetzelfde grote gewichtsbestand lijken te bevatten zonder twee volledige kopieën aan ruimte te verbruiken.

Die indeling is efficiënt, maar maakt ‘verwijder de grootste map’ tot een slechte regel. Een actieve blob handmatig verwijderen kan meer dan één snapshot breken. Eén snapshot verwijderen kan veel minder ruimte vrijmaken dan de schijnbare grootte, omdat andere revisies nog naar dezelfde inhoud verwijzen.

Meet de cache die je daadwerkelijk gebruikt

Zoek eerst de actieve Hugging Face-cachemap. HF_HOME, HF_HUB_CACHE en verwante variabelen kunnen die van de standaardlocatie hebben verplaatst. Vraag vervolgens de CLI hoe die de cache ziet:

hf cache ls
hf cache ls --revisions

De eerste opdracht toont gecachte repositories; de tweede maakt afzonderlijke revisies zichtbaar. Gebruik filters of sortering uit de huidige CLI wanneer de lijst lang is. De beslissing is niet simpelweg ‘wat is oud?’, maar ‘welke exacte repository of revisie kan opnieuw worden opgehaald, en welke ondersteunt huidig werk?’

Trainingsuitvoer is niet automatisch cache-inhoud. Een checkpoint dat door je trainingsscript wordt opgeslagen, kan elders staan. Controleer het pad voordat je aanneemt dat een opschoning van Hugging Face het wel of niet raakt.

Verwijder doelbewust een repository of revisie

Wanneer je weet dat een volledige gecachte repository kan worden weggegooid, geef je de cache-identificatie door aan hf cache rm. De huidige documentatie gebruikt bijvoorbeeld een repository-identificatie als:

hf cache rm model/gpt2

Selecteer voor gerichtere opschoning de specifieke revisie-identificatie die door hf cache ls --revisions wordt gemeld. Lees de voorvertoning en bevestiging zorgvuldig. De CLI kan berekenen wat niet langer wordt aangehaald; een selectie in het bestandssysteem kan die relaties niet toelichten.

Snoei losgekoppelde revisies, niet je werkset

hf cache prune richt zich op revisies waarnaar niet meer wordt verwezen. Het is het juiste gereedschap voor verouderde revisiegegevens die achterblijven wanneer verwijzingen naar branches of tags veranderen, maar het garandeert niet dat elk oud model dat je je niet meer herinnert verdwijnt. Voer het uit nadat je de voorgestelde verwijdering hebt bekeken, niet als automatische reflex aan het eind van elke sessie.

hf cache prune

Als meerdere gebruikers, containers of geplande taken de cache beheren, stop dan eerst actieve downloads. Opruimen terwijl een ander proces een snapshot materialiseert, veroorzaakt onnodige onduidelijkheid, zelfs wanneer de cache-implementatie is ontworpen om te herstellen.

Controleer wat er overblijft

  1. Voer hf cache ls opnieuw uit en leg de nieuwe omvang vast.
  2. Gebruik hf cache verify <repo> voor een behouden repository die belangrijk voor je is.
  3. Start een echte workflow die een behouden model laadt.
  4. Let op een nieuwe download: een model dat ongemerkt opnieuw wordt opgehaald, was lokaal niet volledig beschikbaar.

Opnieuw downloaden is niet altijd een mislukking — de cache is tenslotte een cache — maar het is wel van belang wanneer je offline werkt, een bepaalde revisie vastzet of afhankelijk bent van een upstreambestand dat kan verdwijnen.

Cacheopschoning en langdurige retentie lossen verschillende problemen op

De Hub-cache is geoptimaliseerd voor hergebruik en opnieuw ophalen. Het is geen zorgvuldig samengesteld dossier van waarom een model, tokenizer, configuratie of adapter bij elkaar hoorde. Bepaal vóór het wissen van een moeilijk reproduceerbare revisie welke volledige familie nodig is om die te gebruiken. Bij een PEFT-adapter kan dat een compatibel basismodel en configuratie omvatten; bij een trainingsresultaat kan meer nodig zijn dan alleen de gewichten.

Tensor Archive hoort aan die weloverwogen kant van de grens. Bewaar een voltooide lokale familie, verifieer het archief en bewijs een exact herstel. Daarna kan de cache weer wegwerpinfrastructuur zijn in plaats van een toevallig museum.

Gerelateerde gidsen

Als de huidige cache alleen op de verkeerde schijf staat, volg dan de afzonderlijke gids om de Hugging Face-cachemap te wijzigen. Als de bibliotheek meerdere runtimes omvat, gebruik dan de retentiechecklist voordat je bepaalt wat slechts vervangbare cachestatus is.

Bronnen

Behoud de zeldzame versies. Wis de cache.Gratis download ↓