Cos'è LoRA nell'AI?
LoRA significa Low-Rank Adaptation. È un metodo di fine-tuning efficiente in termini di parametri che mantiene congelati i pesi originali di un modello preaddestrato e apprende matrici a basso rango molto più piccole per i livelli selezionati. Tali aggiornamenti appresi possono essere salvati come adapter e applicati in seguito al modello di base compatibile.

Questa pagina riguarda l'adattamento dei modelli AI. LoRa, con la «a» minuscola, indica anche una tecnologia radio a lungo raggio. Non è correlata agli adapter LoRA per modelli linguistici o di generazione delle immagini.
L'idea centrale, senza la nebbia algebrica
Un fine-tuning completo convenzionale può aggiornare molti o tutti i parametri di un modello. LoRA presume che la modifica utile per una determinata attività possa spesso essere rappresentata con molti meno gradi di libertà. Invece di apprendere una matrice di aggiornamento completa, esprime l'aggiornamento come il prodotto di due matrici più sottili con rango r.
Il peso effettivo combina il peso di base congelato con un aggiornamento a basso rango scalato:
W′ = W + (B × A) · scale
Se il rango scelto è molto inferiore alle dimensioni originali, le matrici A e B contengono molti meno parametri addestrabili rispetto a un aggiornamento completo. Ciò riduce la memoria di addestramento e produce un artefatto adapter compatto. Il modello di base svolge ancora la maggior parte del lavoro.
Modello LoRA, adapter LoRA e pesi LoRA
Le persone usano queste espressioni in modo impreciso, quindi è utile distinguerle:
- Metodo LoRA: la tecnica di adattamento a basso rango utilizzata durante il fine-tuning.
- Adapter LoRA: l'aggiornamento appreso e la configurazione necessari per applicarlo a una base compatibile.
- Pesi LoRA: i valori addestrabili dei tensori in tale adapter.
- «Modello LoRA»: abbreviazione comune per l'adapter o per la combinazione base-adapter. È ambiguo; chiedi quale artefatto è effettivamente presente.
Un file LoRA scaricato generalmente non contiene l'intero modello di base. Per questo una UI ti chiede di selezionare un checkpoint e quindi applicare una o più LoRAs.
Cosa può apprendere una LoRA?
Nei modelli linguistici, un adapter può specializzare il comportamento per un dominio, un'attività o uno stile di istruzioni. Nei modelli di diffusione, le LoRAs sono comunemente utilizzate per stili visivi, personaggi, soggetti, prodotti, concetti o piccoli adattamenti del comportamento. Moduli di destinazione, rango, dataset e procedura di addestramento determinano ciò che l'adapter può esprimere.
LoRA non garantisce qualità o fedeltà. Un adapter compatto può subire overfitting, entrare in conflitto con la base, rispondere in modo imprevedibile a intensità diverse o dipendere da token trigger e scelte di preelaborazione. Considera la scheda del modello e il contesto di addestramento come metadati operativi, non decorazioni.
Come viene utilizzato un adapter durante l'inferenza
Un framework compatibile carica la base, legge la configurazione dell'adapter e applica i relativi tensori ai moduli di destinazione. Alcuni runtime mantengono separato l'aggiornamento affinché possa essere abilitato, ponderato o rimosso dalla memoria. Altri possono integrarlo in una copia derivata per il deployment.
L'integrazione non equivale a rendere autonomo l'adapter originale. Se vuoi regolare l'intensità, combinare adapter o riprodurre il file di output, conserva l'adapter non integrato, la base esatta e la ricetta. La guida al confronto tra checkpoint e LoRA mappa tali differenze di recupero.
LoRA, QLoRA e fine-tuning completo
LoRA descrive l'aggiornamento a basso rango. QLoRA combina l'addestramento LoRA con una base quantizzata e congelata e ulteriori tecniche di risparmio della memoria. Il risultato finale può comunque essere un adapter, motivo per cui il solo nome del file potrebbe non rivelare come è stato addestrato. Consulta LoRA e QLoRA a confronto per il confronto a livello di metodo.
Il fine-tuning completo aggiorna una parte molto più ampia del modello e può offrire capacità e compromessi operativi diversi, ma produce uno stato più grande e requisiti di risorse più elevati. La scelta corretta dipende da attività, hardware, valutazione e deployment, non dal presupposto che un metodo sia sempre più «professionale».
Perché le librerie LoRA diventano comunque grandi
Un adapter è compatto rispetto alla base, ma le raccolte crescono attraverso varianti, ranghi, epoche, intensità, download duplicati e più famiglie di base compatibili. Checkpoint di base, VAEs, encoder, anteprime e output di addestramento spesso superano di gran lunga qualsiasi singolo adapter. Una cartella piena di piccoli file può quindi dipendere da un insieme di modelli molto più grande.
Usa la guida per organizzare un modello di base con molti adapter e il flusso pratico per liberare spazio su disco LoRA senza modificare i pesi. L'obiettivo è una famiglia coerente che puoi recuperare, non la directory più piccola possibile a qualsiasi costo.
Cosa dovrebbe essere archiviato con una LoRA?
Conserva almeno i pesi dell'adapter, la relativa configurazione e un identificativo preciso del modello di base. Se la base è privata, modificata localmente o potrebbe scomparire, conserva anche la base esatta. Per la riproducibilità, mantieni i token trigger pertinenti, la configurazione di addestramento, il riferimento al dataset, la licenza o le condizioni d'uso e i checksum.
Tensor Archive conserva famiglie di tensori locali selezionate e verifica il ripristino esatto. Non ricrea una base mancante, non inventa metadati dell'adapter e non dimostra che due architetture dai nomi simili siano compatibili.
Fonti
- LoRA: Low-Rank Adaptation of Large Language Models — il documento originale che definisce pesi preaddestrati congelati e decomposizione a basso rango addestrabile.
- Hugging Face PEFT: LoRA — concetti attuali di configurazione, rango, scalatura e moduli di destinazione.
- Formato dei checkpoint Hugging Face PEFT — cosa salvano i checkpoint degli adapter e come fanno riferimento a un modello di base.
- Diffusers: caricamento degli adapter — applicazione, ponderazione, rimozione dalla memoria e fusione degli adapter LoRA.