封存已完成 LoRA 訓練檢查點,不要把復原當作事後補救
已完成訓練產出物與即時訓練檢查點並非同一事物。保留需要儲存和復原的最終版本,但不要把儲存封存與復原中斷執行所需的機制混為一談。
分開儲存、訓練與復原
“檢查點儲存”常被同時用於多項工作:保留已完成版本供推理使用、儲存專案歷史、從失敗執行中復原,以及在機器間移動資料。這些需求並不能相互替代。
當版本完成且你希望相關產出物的本機模型系列保持可復原時,Tensor Archive 很有用。它不是訓練器、即時檢查點管理器,也不能替代訓練棧安全復原所需的檔案和流程。請將即時執行材料保留在該訓練棧預期的位置,直到執行真正結束。
有意選擇已完成模型系列
合理的模型系列可以包括同一實驗中已完成的 LoRA 版本、其配套基礎模型、必須保留的評估輸出,以及讓版本可理解的小型專案檔案。它不應自動包含硬碟上的每個實驗。
封存前,請用清晰名稱記錄專案、預期基礎模型和版本邊界。這不是繁瑣工作:當原始訓練上下文逐漸淡忘時,清晰的模型系列更容易正確復原。
越過完成門檻後封存
- 完成執行,並保留訓練工作流程所需的即時訓練材料。
- 選擇為檢索或部署而應歸為一組的已完成產出物。
- 在 Tensor Archive 中執行 Analyse source,並檢查將要包含的內容。
- 將模型系列封存為受管理的本機副本,然後執行 Verify。
- 復原到單獨輸出位置,並在目標推理或評估工作流程中測試還原版本。
- 只有獲得該證明後,才應手動回收冗餘工作副本。
精確還原的含義很窄。 它證明封存檔案可以精確還原。它不能說明復原模型是最佳檢查點、具有你預期的評估品質,或能夠繼續中斷前的即時訓練執行。
已釋出檢查點結果表明什麼
在 Tensor Archive 的受控連續 BF16 檢查點驗證中,五個完整版本的原始檔總計 4.060 GB,在 Tensor Archive 中佔用 1.846 GB,比 Gear CDC 對照少 34.318%,50 個檔案中有 50 個全部復原,且差異位元組為零。這是該固定工作負載的儲存和精確還原結果。
讓範圍始終與數字相連。 該結果沒有說明你不相關的實驗、即時訓練迴圈效能或一般性節省承諾。在形成預期前,對已完成模型系列執行 Analyse。
實用操作規則
保留兩套政策,而不是一套:由訓練工作流程負責的即時執行政策,以及用於本機保留和日後檢索的已完成產出物政策。分開後刪除風險更低,也更清楚封存究竟證明了什麼。
面向使用者的流程請參閱 Tensor Archive 快速入門。要了解相關儲存決策,請閱讀無損儲存為何不是權重量化,然後下載 Tensor Archive,在本機測試一個已完成模型系列。
來源
- LoRA: Low-Rank Adaptation of Large Language Models — 本文所述已完成產出物背後的適配器方法。
- Tensor Archive 基準測試摘要 — 固定檢查點工作負載、比較和逐位元組精確還原數量。