無損 SafeTensors 儲存不是權重量化

“壓縮 SafeTensors”可能表示兩件根本不同的事:保留原始位元組以便精確還原,或為特定執行環境建立更小的不同權重表示。先選擇需求,再選擇工具。

一個 SafeTensors 模型沿著精確封存路徑和轉換權重路徑分別前進。
兩種輸出都可能有用,但只有一種承諾能復原原始位元組。

精確還原與已修改權重

量化是一項模型格式決策。它會降低數值精度或以其他方式改變表示,使執行環境減少記憶體或儲存用量。這可能非常適合部署,但輸出不是原始產出物。

無損封存的任務不同:精確還原原始檔案位元組。Tensor Archive 用於把相關本機模型版本儲存在緊湊的受管理模型系列中,並按需復原選定版本。它不是量化器、修剪工具或格式轉換器。

提出一個具體問題:日後取回該模型時,它是否必須逐位元組與起始檔案相同?如果是,請勿把格式轉換作為唯一保留方案。

為什麼單個 SafeTensors 檔案可能幾乎不改變大小

僅憑檔案大小無法判斷儲存工作流程是否會取得顯著效果。單個檔案可能不含適合在精確封存中複用的資料。相關模型系列則可能不同:自含式部署可能重複基礎檢查點,已完成專案版本也可能共享大量材料。

因此第一步應當分析你準備放在一起的檔案。不要根據副檔名承諾百分比,也不要假定大檔案自動就是好的封存候選。

按真實適用範圍閱讀基準測試

Tensor Archive 釋出了一個受控五部署範例:獨立儲存時為 907.3 MB,作為一個相關模型和適配器系列時為 261.6 MB,實體儲存減少 71.2%。這項比較有價值,因為工作負載、檔案之間的關係和精確還原條件都與結果一同說明。

這裡沒有說明:單個 SafeTensors 檔案、隨機資料夾或每個 LoRA 都會節省 71.2%。不相關和已壓縮檔案可能節省很少。真實決策應來自對眼前模型系列的分析。

如何安全測試儲存工作流程

  1. 為任何無法替代的內容製作獨立副本。
  2. 選擇一個相關模型系列,並在改變工作資料夾前進行檢查。
  3. 分析原始檔並檢查預期結果。
  4. 將其封存,執行 Verify,並復原到單獨輸出位置。
  5. 在重要工作流程中比較或載入復原的產出物。
  6. 只有完成該測試後,才應選擇是否手動刪除工作副本。

選擇與問題匹配的工具

當你有意需要不同的部署表示並理解其執行環境取捨時,請使用量化。當你需要保留和復原相關模型的原始位元組,並在確有關係的地方減少重複儲存時,請使用精確本機封存。針對 LoRA 的清理流程請閱讀如何釋放 LoRA 模型庫磁碟空間

從一個模型系列和一個可檢查結果開始。下載 Tensor Archive在本機執行流程,或在嘗試前檢視公開的基準測試摘要

來源

保留模型。清理工作硬碟。免費下載 ↓