Cos'è LoRA nell'AI?

LoRA significa Low-Rank Adaptation. È un metodo di fine-tuning efficiente in termini di parametri che mantiene congelati i pesi originali di un modello preaddestrato e apprende matrici a basso rango molto più piccole per i livelli selezionati. Tali aggiornamenti appresi possono essere salvati come adapter e applicati in seguito al modello di base compatibile.

Due piccole matrici a basso rango che guidano un reticolo molto più grande di pesi congelati di una rete neurale.
La grande matrice preaddestrata resta congelata; il percorso addestrabile fattorizza il relativo aggiornamento attraverso un rango molto più piccolo.

Questa pagina riguarda l'adattamento dei modelli AI. LoRa, con la «a» minuscola, indica anche una tecnologia radio a lungo raggio. Non è correlata agli adapter LoRA per modelli linguistici o di generazione delle immagini.

L'idea centrale, senza la nebbia algebrica

Un fine-tuning completo convenzionale può aggiornare molti o tutti i parametri di un modello. LoRA presume che la modifica utile per una determinata attività possa spesso essere rappresentata con molti meno gradi di libertà. Invece di apprendere una matrice di aggiornamento completa, esprime l'aggiornamento come il prodotto di due matrici più sottili con rango r.

Il peso effettivo combina il peso di base congelato con un aggiornamento a basso rango scalato:

W′ = W + (B × A) · scale

Se il rango scelto è molto inferiore alle dimensioni originali, le matrici A e B contengono molti meno parametri addestrabili rispetto a un aggiornamento completo. Ciò riduce la memoria di addestramento e produce un artefatto adapter compatto. Il modello di base svolge ancora la maggior parte del lavoro.

Modello LoRA, adapter LoRA e pesi LoRA

Le persone usano queste espressioni in modo impreciso, quindi è utile distinguerle:

Un file LoRA scaricato generalmente non contiene l'intero modello di base. Per questo una UI ti chiede di selezionare un checkpoint e quindi applicare una o più LoRAs.

Cosa può apprendere una LoRA?

Nei modelli linguistici, un adapter può specializzare il comportamento per un dominio, un'attività o uno stile di istruzioni. Nei modelli di diffusione, le LoRAs sono comunemente utilizzate per stili visivi, personaggi, soggetti, prodotti, concetti o piccoli adattamenti del comportamento. Moduli di destinazione, rango, dataset e procedura di addestramento determinano ciò che l'adapter può esprimere.

LoRA non garantisce qualità o fedeltà. Un adapter compatto può subire overfitting, entrare in conflitto con la base, rispondere in modo imprevedibile a intensità diverse o dipendere da token trigger e scelte di preelaborazione. Considera la scheda del modello e il contesto di addestramento come metadati operativi, non decorazioni.

Come viene utilizzato un adapter durante l'inferenza

Un framework compatibile carica la base, legge la configurazione dell'adapter e applica i relativi tensori ai moduli di destinazione. Alcuni runtime mantengono separato l'aggiornamento affinché possa essere abilitato, ponderato o rimosso dalla memoria. Altri possono integrarlo in una copia derivata per il deployment.

L'integrazione non equivale a rendere autonomo l'adapter originale. Se vuoi regolare l'intensità, combinare adapter o riprodurre il file di output, conserva l'adapter non integrato, la base esatta e la ricetta. La guida al confronto tra checkpoint e LoRA mappa tali differenze di recupero.

LoRA, QLoRA e fine-tuning completo

LoRA descrive l'aggiornamento a basso rango. QLoRA combina l'addestramento LoRA con una base quantizzata e congelata e ulteriori tecniche di risparmio della memoria. Il risultato finale può comunque essere un adapter, motivo per cui il solo nome del file potrebbe non rivelare come è stato addestrato. Consulta LoRA e QLoRA a confronto per il confronto a livello di metodo.

Il fine-tuning completo aggiorna una parte molto più ampia del modello e può offrire capacità e compromessi operativi diversi, ma produce uno stato più grande e requisiti di risorse più elevati. La scelta corretta dipende da attività, hardware, valutazione e deployment, non dal presupposto che un metodo sia sempre più «professionale».

Perché le librerie LoRA diventano comunque grandi

Un adapter è compatto rispetto alla base, ma le raccolte crescono attraverso varianti, ranghi, epoche, intensità, download duplicati e più famiglie di base compatibili. Checkpoint di base, VAEs, encoder, anteprime e output di addestramento spesso superano di gran lunga qualsiasi singolo adapter. Una cartella piena di piccoli file può quindi dipendere da un insieme di modelli molto più grande.

Usa la guida per organizzare un modello di base con molti adapter e il flusso pratico per liberare spazio su disco LoRA senza modificare i pesi. L'obiettivo è una famiglia coerente che puoi recuperare, non la directory più piccola possibile a qualsiasi costo.

Cosa dovrebbe essere archiviato con una LoRA?

Conserva almeno i pesi dell'adapter, la relativa configurazione e un identificativo preciso del modello di base. Se la base è privata, modificata localmente o potrebbe scomparire, conserva anche la base esatta. Per la riproducibilità, mantieni i token trigger pertinenti, la configurazione di addestramento, il riferimento al dataset, la licenza o le condizioni d'uso e i checksum.

Tensor Archive conserva famiglie di tensori locali selezionate e verifica il ripristino esatto. Non ricrea una base mancante, non inventa metadati dell'adapter e non dimostra che due architetture dai nomi simili siano compatibili.

Fonti

Conserva l'adapter con la relativa base esatta.Download gratuito ↓