復元を後付けにせず、完成済み LoRA 学習チェックポイントをアーカイブする
完成済みの学習成果物と、実行中の学習チェックポイントは同じものではありません。保持と復元が必要な完成版を保存しつつ、ストレージアーカイブを、中断した実行の再開に必要な仕組みと混同しないでください。
ストレージ、学習、復旧を分ける
「チェックポイント保存」という言葉は、完成版を推論用に保持すること、プロジェクト履歴の保存、失敗した実行からの復旧、マシン間のデータ移動など、複数の役割を同時に指すことがあります。これらは置き換え可能な要件ではありません。
Tensor Archive が役立つのは、バージョンが完成し、関連成果物のローカルファミリーを復元可能な状態で残したいときです。トレーナーでも、実行中のチェックポイント管理ツールでも、学習スタックが安全に再開するために必要とするファイルや処理の代用品でもありません。実行が本当に完了するまで、使用中のデータは学習スタックが想定する場所に保持してください。
完成済みファミリーを意図的に選ぶ
適切なファミリーには、一つの実験で完成した LoRA バージョン、それらが対応するベースモデル、保持すべき評価出力、リリース内容を理解するための小さなプロジェクトファイルなどを含められます。ディスク上のすべての実験を自動的に含めるべきではありません。
アーカイブ前に、プロジェクト、想定ベース、バージョン境界が分かる簡潔な名前を付けます。これは雑務ではありません。元の学習コンテキストが薄れた後でも、明確なファミリーなら正しく復元しやすくなります。
完了ゲートを通過してからアーカイブする
- 実行を完了し、学習ワークフローが必要とする使用中の学習データを保持します。
- 取得またはデプロイのために、一緒に扱う完成済み成果物を選びます。
- Tensor Archive で Analyse source を実行し、含まれる内容を確認します。
- ファミリーを管理されたローカルコピーとしてアーカイブし、Verify を実行します。
- 別の出力先へ復元し、対象の推論または評価ワークフローで復元版をテストします。
- その証明が得られた後でのみ、冗長な作業コピーを手動で削除してください。
正確な復旧の意味は限定的です。 アーカイブ済みファイルを正確に復元できることを示します。復元モデルが最良のチェックポイントであること、期待する評価品質と同じであること、実行中の学習を再開できることは示しません。
公開済みチェックポイントの結果が示すもの
Tensor Archive の管理された連続 BF16 チェックポイント検証では、ソース合計 4.060 GB の完全な五つのバージョンが Tensor Archive で 1.846 GB を占め、Gear CDC の比較より 34.318% 少なくなりました。50 ファイル中 50 ファイルが復元され、差異のあるバイトはゼロでした。これは、その固定ワークロードにおけるストレージと正確な復旧の結果です。
数値には対象範囲を添えてください。 この結果は、無関係な実験、実行中の学習ループの性能、一般的な節約率について何も示しません。期待を決める前に、完成済みファミリーを Analyse してください。
実践的な運用ルール
方針は一つではなく二つに分けます。学習ワークフローが管理する実行中の方針と、ローカル保持と後の取得に使う完成済み成果物の方針です。分離すると削除のリスクが下がり、アーカイブが実際に何を証明するかも明確になります。
ユーザー向け手順は Tensor Archive クイックスタートを参照してください。関連するストレージ判断には、可逆的な保存が重みの量子化ではない理由を読み、Tensor Archive をダウンロードして、完成済みファミリーをローカルでテストします。
出典
- LoRA: Low-Rank Adaptation of Large Language Models — ここで扱う完成済み成果物の基礎となるアダプター手法。
- Tensor Archive ベンチマーク概要 — 固定チェックポイントのワークロード、比較、バイト単位で正確に復元された件数。