可逆的な SafeTensors 保存は重みの量子化ではない

「SafeTensors を圧縮する」には、根本的に異なる二つの意味があります。正確に復旧できるよう元のバイト列を保持することと、特定の実行環境向けに、より小さい別の重み表現を作ることです。まず要件を選べば、使うツールが決まります。

一つの SafeTensors モデルが、正確なアーカイブ経路と、重みを変換する経路へ分かれる様子。
どちらの出力も有用な場合がありますが、元のバイト列を取り戻せると約束するのは一方だけです。

正確な復旧と変更された重み

量子化はモデル形式についての判断です。数値精度を下げるなどして表現を変え、実行環境が使うメモリやストレージを減らします。デプロイには適切な場合がありますが、出力は元の成果物ではありません。

可逆的なアーカイブには別の役割があります。元のファイルのバイト列を正確に復元することです。Tensor Archive は、関連するローカルモデルのバージョンを、コンパクトで管理されたファミリーとして保持し、選んだバージョンを必要時に復元します。量子化、剪定、形式変換を行うツールではありません。

具体的な問いを一つ立ててください。 後でこのモデルを取り出すとき、元のファイルとバイト単位で完全に同一である必要がありますか。必要なら、形式変換だけを唯一の保持手段にしないでください。

SafeTensors ファイル一つではサイズがほとんど変わらない理由

ファイルサイズだけでは、ストレージ手順が大きな効果を得られるか判断できません。単一ファイルには、正確なアーカイブで有効に重複排除できないデータが含まれる場合があります。関連ファミリーは異なります。自己完結型デプロイがベースチェックポイントを繰り返し、完成済みプロジェクトのバージョンが大量のデータを共有することがあります。

そのため、最初に行うべきことは、一緒に保持する予定のファイルを分析することです。拡張子だけから割合を約束したり、大きなファイルなら自動的に良いアーカイブ候補だと決めつけたりしないでください。

実際の対象範囲でベンチマークを読む

Tensor Archive は管理された五デプロイの例を公開しています。個別では 907.3 MB だったデータが、関連する一つのモデルとアダプターのファミリーでは 261.6 MB となり、物理ストレージが 71.2% 少なくなりました。ワークロード、ファイル間の関係、正確な復元という条件が結果とともに明記されているため、この比較には価値があります。

この結果が意味しないこと: 単一の SafeTensors ファイル、無作為なフォルダー、すべての LoRA が 71.2% 小さくなるという意味ではありません。無関係なファイルや圧縮済みファイルでは、節約量が小さい場合があります。判断は、目の前のファミリーを分析した結果に基づくべきです。

ストレージ手順を安全にテストする方法

  1. 置き換えられないものは、独立したコピーを作成します。
  2. 関連ファミリーを一つ選び、作業フォルダーを変更する前に内容を確認します。
  3. ソースを分析し、予想される結果を確認します。
  4. アーカイブして Verify を実行し、別の出力先へ復元します。
  5. 重要なワークフローで、復元成果物を比較または読み込みます。
  6. そのテスト後に初めて、作業コピーを手動で削除できるか判断します。

問題に合うツールを選ぶ

別のデプロイ表現を意図的に求め、その実行時のトレードオフを理解しているなら量子化を使います。関連モデルの元のバイト列を保持、復元しつつ、その関係に含まれる重複ストレージを減らす必要があるなら、正確なローカルアーカイブを使います。LoRA 固有の整理手順は、LoRA ライブラリのディスク容量を解放する方法を参照してください。

確認できる結果が得られる一つのファミリーから始めます。ローカルで手順を実行するには Tensor Archive をダウンロードし、試す前に公開情報を確認するにはベンチマーク概要を参照してください。

出典

モデルは残し、作業ディスクを空ける。無料ダウンロード ↓