归档已完成 LoRA 训练检查点,不要把恢复当作事后补救

已完成训练工件与实时训练检查点并非同一事物。保留需要保存和恢复的最终版本,但不要把存储归档与恢复中断运行所需的机制混为一谈。

一条微调检查点时间线穿过完成门槛,进入经验证的归档和恢复。
将实时恢复运行状态交给训练器;只有明确越过完成边界后才归档。

分开存储、训练与恢复

“检查点存储”常被同时用于多项工作:保留已完成版本供推理使用、保存项目历史、从失败运行中恢复,以及在机器间移动数据。这些需求并不能相互替代。

当版本完成且你希望相关工件的本地模型系列保持可恢复时,Tensor Archive 很有用。它不是训练器、实时检查点管理器,也不能替代训练栈安全恢复所需的文件和流程。请将实时运行材料保留在该训练栈预期的位置,直到运行真正结束。

有意选择已完成模型系列

合理的模型系列可以包括同一实验中已完成的 LoRA 版本、其配套基础模型、必须保留的评估输出,以及让版本可理解的小型项目文件。它不应自动包含硬盘上的每个实验。

归档前,请用清晰名称记录项目、预期基础模型和版本边界。这不是繁琐工作:当原始训练上下文逐渐淡忘时,清晰的模型系列更容易正确恢复。

越过完成门槛后归档

  1. 完成运行,并保留训练工作流程所需的实时训练材料。
  2. 选择为检索或部署而应归为一组的已完成工件。
  3. 在 Tensor Archive 中运行 Analyse source,并检查将要包含的内容。
  4. 将模型系列归档为受管理的本地副本,然后运行 Verify
  5. 恢复到单独输出位置,并在目标推理或评估工作流程中测试恢复版本。
  6. 只有获得该证明后,才应手动回收冗余工作副本。

精确恢复的含义很窄。 它证明归档文件可以精确恢复。它不能说明恢复模型是最佳检查点、具有你预期的评估质量,或能够恢复实时运行。

已发布检查点结果表明什么

在 Tensor Archive 的受控连续 BF16检查点验证中,五个完整版本的源文件总计 4.060 GB,在 Tensor Archive 中占用 1.846 GB,比 Gear CDC 对照少 34.318%,50 个文件中有 50 个全部恢复,且差异字节为零。这是该固定工作负载的存储和精确恢复结果。

让范围始终与数字相连。 该结果没有说明你不相关的实验、实时训练循环性能或一般性节省承诺。在形成预期前,对已完成模型系列运行 Analyse。

实用操作规则

保留两套政策,而不是一套:由训练工作流程负责的实时运行政策,以及用于本地保留和日后检索的已完成工件政策。分开后删除风险更低,也更清楚归档究竟证明了什么。

面向用户的流程请参阅 Tensor Archive 快速入门。要了解相关存储决策,请阅读无损存储为何不是权重量化,然后下载 Tensor Archive,在本地测试一个已完成模型系列。

来源

保留模型。清理工作硬盘。免费下载 ↓