LoRA vs. QLoRA: vad förändras och vad förblir?
LoRA och QLoRA är närbesläktade finjusteringsmetoder, men de hanterar olika resursbegränsningar. LoRA tränar små adapteruppdateringar tillsammans med en basmodell; QLoRA kombinerar adaptermetoden med en kvantiserad basmodell under finjusteringen för att minska minnesbelastningen.
Vad LoRA betyder i praktiken
Low-Rank Adaptation (LoRA) lägger till tränbara lågranksuppdateringar istället för att ändra varje parameter i basmodellen. Den resulterande adaptern är vanligtvis mycket mindre än en helt finjusterad modell, men den är endast meningsfull i relation till sin förväntade basmodell, arkitektur och inläsningsflöde.
För behållning är det förhållandet som är det viktigaste. En fil som heter "style-v7" kan inte säga för en framtida du vilken bas den förväntar sig, vilket projekt som skapade den eller vilken färdig version du menade att behålla. Behandla anpassningen och den kontext du behöver återställa som en avsiktlig familj.
Vad QLoRA tillför
QLoRA använder en kvantiserad basmodell vid finjustering medan man tränar LoRA-anpassningar. Dess huvudsakliga syfte är att göra finjustering av stora modeller mer minneseffektivt. Det innebär inte att alla artefakter som produceras av körningen är kompatibla med den icke-kvantiserade konfigurationen, och det eliminerar inte behovet av att spara basmodellen, konfigurationen och den färdiga utgången du vill bevara.
Använd inte "QLoRA" som ett lagringsetikett. Den beskriver en justeringsmetod och begränsningar kring den grundläggande modellen. Det är inte en garanti att en arkivfil kommer att göra varje resultatfil mindre, och det är inte en ersättning för en exakt återställningstest.
Vad bör du behålla efter en slutförd körning?
Håll tillräckligt med sammanhang kvar för att tydligt kunna identifiera det färdiga verktyget: den utgivna tilläggsmodellen, den avsedda basmodellens identitet eller version, konfiguration och utvärderingsmaterial som ditt projekt kräver, samt ett tydligt projekt- och versionsnamn. Behåll separat körningshanteringsmaterial om din träningsstack behöver det för att återuppta arbetet.
När en version är färdig kan en lokal arkivlösning hjälpa till att bevara relaterade filer som en familj och senare återställa dem exakt. Arkivera inte en pågående körning bara för att frigöra utrymme snabbt; slutför körningen, behåll det som behövs och tillämpa en lagringsarbetsflöde på de färdiga artefakten.
Var Tensor Archive passar
Tensor Archive är ett lokalt lagrings- och återställningstjänst, inte ett finjusteringsramverk. Efter avslutningsgränsen kan du analysera en relaterad familj, arkivera den, kontrollera återställbarhet och återställa en separat kopia innan du manuellt raderar en onödig källa. Detta är särskilt användbart när en bas och dess färdiga anpassningar eller närliggande versioner hålls tillsammans.
En praktisk regel för tummen
Om metoden själv är okänd, börja med vad LoRA betyder inom AI. Använd LoRA- eller QLoRA-termer för att beskriva hur artefakten tillverkades, och använd sedan kontrollpunkt mot LoRA för att identifiera vad de färdiga filerna beror på. För lagringssekvensen, läs guiden till den färdiga kontrollpunktsarkivet.