归档已完成 LoRA 训练检查点,不要把恢复当作事后补救
已完成训练工件与实时训练检查点并非同一事物。保留需要保存和恢复的最终版本,但不要把存储归档与恢复中断运行所需的机制混为一谈。
分开存储、训练与恢复
“检查点存储”常被同时用于多项工作:保留已完成版本供推理使用、保存项目历史、从失败运行中恢复,以及在机器间移动数据。这些需求并不能相互替代。
当版本完成且你希望相关工件的本地模型系列保持可恢复时,Tensor Archive 很有用。它不是训练器、实时检查点管理器,也不能替代训练栈安全恢复所需的文件和流程。请将实时运行材料保留在该训练栈预期的位置,直到运行真正结束。
有意选择已完成模型系列
合理的模型系列可以包括同一实验中已完成的 LoRA 版本、其配套基础模型、必须保留的评估输出,以及让版本可理解的小型项目文件。它不应自动包含硬盘上的每个实验。
归档前,请用清晰名称记录项目、预期基础模型和版本边界。这不是繁琐工作:当原始训练上下文逐渐淡忘时,清晰的模型系列更容易正确恢复。
越过完成门槛后归档
- 完成运行,并保留训练工作流程所需的实时训练材料。
- 选择为检索或部署而应归为一组的已完成工件。
- 在 Tensor Archive 中运行 Analyse source,并检查将要包含的内容。
- 将模型系列归档为受管理的本地副本,然后运行 Verify。
- 恢复到单独输出位置,并在目标推理或评估工作流程中测试恢复版本。
- 只有获得该证明后,才应手动回收冗余工作副本。
精确恢复的含义很窄。 它证明归档文件可以精确恢复。它不能说明恢复模型是最佳检查点、具有你预期的评估质量,或能够恢复实时运行。
已发布检查点结果表明什么
在 Tensor Archive 的受控连续 BF16检查点验证中,五个完整版本的源文件总计 4.060 GB,在 Tensor Archive 中占用 1.846 GB,比 Gear CDC 对照少 34.318%,50 个文件中有 50 个全部恢复,且差异字节为零。这是该固定工作负载的存储和精确恢复结果。
让范围始终与数字相连。 该结果没有说明你不相关的实验、实时训练循环性能或一般性节省承诺。在形成预期前,对已完成模型系列运行 Analyse。
实用操作规则
保留两套政策,而不是一套:由训练工作流程负责的实时运行政策,以及用于本地保留和日后检索的已完成工件政策。分开后删除风险更低,也更清楚归档究竟证明了什么。
面向用户的流程请参阅 Tensor Archive 快速入门。要了解相关存储决策,请阅读无损存储为何不是权重量化,然后下载 Tensor Archive,在本地测试一个已完成模型系列。
来源
- LoRA: Low-Rank Adaptation of Large Language Models — 本文所述已完成工件背后的适配器方法。
- Tensor Archive 基准测试摘要 — 固定检查点工作负载、比较和逐字节精确恢复数量。