LoRA と QLoRA:変わるもの、変わらないもの

LoRA と QLoRA は関連するファインチューニング手法ですが、異なるリソース制約へ対応します。LoRA はベースモデルとともに小さなアダプター更新をトレーニングします。QLoRA はそのアダプター手法を、ファインチューニング中の量子化ベースモデルと組み合わせてメモリ負荷を軽減します。

フル精度ベースモデルと量子化トレーニングベースが、どちらも小さな LoRA アダプター更新へ接続された構成。
LoRA はトレーニング対象を変え、QLoRA はファインチューニング中のベース表現も変えます。

実践における LoRA の意味

Low-Rank Adaptation(LoRA)は、ベースモデルの全パラメーターを変更せず、トレーニング可能な低ランク更新を追加します。生成されるアダプターは通常、完全ファインチューニング済みモデルよりはるかに小さいものの、想定するベースモデル、アーキテクチャ、読み込みワークフローとの関係があって初めて意味を持ちます。

保持において重要なのはその関係です。「style-v7」というファイル名だけでは、将来の自分に想定ベース、生成元プロジェクト、保持するつもりだった完成バージョンは伝わらない場合があります。アダプターと復元に必要な文脈を、意図的なファミリーとして扱ってください。

QLoRA が加えるもの

QLoRA は、LoRA アダプターをトレーニングしながら、ファインチューニング中に量子化ベースモデルを使用します。主な目的は、大規模モデルのファインチューニングをメモリ効率よく行うことです。実行によるすべての成果物が非量子化構成と置き換え可能になるわけでも、保存するベース、設定、完成出力を記録する必要がなくなるわけでもありません。

「QLoRA」をストレージのラベルとして使わない。これはファインチューニング手法とベースモデル周辺の制約を表します。アーカイブがあらゆる生成ファイルを小さくするとの約束ではなく、完全な復元テストの代わりにもなりません。

完成した実行後に何を保持すべき?

完成済み成果物を明確に識別できるだけの文脈を保持します。公開済みアダプター、対象ベースモデルの識別情報またはリビジョン、プロジェクトに必要な設定と評価資料、明確なプロジェクト名/バージョン名です。トレーニングスタックが作業再開に必要とする場合は、実行管理資料を別途保持してください。

バージョンの完成後、ローカルアーカイブは関連ファイルを一つのファミリーとして保存し、後で完全に復元するのに役立ちます。容量をすぐ空けるため、進行中の実行をアーカイブしないでください。実行を完了し、必要なものを保持してから、完成済み成果物一式にストレージワークフローを適用します。

Tensor Archive が役立つ場面

Tensor Archive はローカルのストレージ・復元ツールであり、ファインチューニングフレームワークではありません。完了後、関連ファミリーを解析、アーカイブし、復元可能性を検証して、重複ソースを手作業で削除する前に別のコピーを復元できます。ベースと完成済みアダプターまたは近接リリースをまとめて保持する場合に特に役立ちます。

実践的な原則

手法自体になじみがなければ、AI における LoRA の意味から始めてください。成果物の生成方法を LoRA または QLoRA の用語で表し、次にチェックポイントと LoRA の比較で完成ファイルの依存関係を特定します。ストレージ手順については、完成済みチェックポイントのアーカイブガイドをお読みください。

出典

モデルは残し、作業ディスクを空ける。無料ダウンロード ↓