无损 SafeTensors 存储不是权重量化
“压缩 SafeTensors”可能表示两件根本不同的事:保留原始字节以便精确恢复,或为特定运行时创建更小的不同权重表示。先选择需求,再选择工具。
精确恢复与已修改权重
量化是一项模型格式决策。它会降低数值精度或以其他方式改变表示,使运行时减少内存或存储用量。这可能非常适合部署,但输出不是原始工件。
无损归档的任务不同:精确恢复原始文件字节。Tensor Archive 用于把相关本地模型版本保存在紧凑的受管理模型系列中,并按需恢复选定版本。它不是量化器、修剪工具或格式转换器。
提出一个具体问题:日后取回该模型时,它是否必须逐字节与起始文件相同?如果是,请勿把格式转换作为唯一保留方案。
为什么单个 SafeTensors 文件可能几乎不改变大小
仅凭文件大小无法判断存储工作流程是否会取得显著效果。单个文件可能不含适合在精确归档中复用的数据。相关模型系列则可能不同:自包含部署可能重复基础检查点,已完成项目版本也可能共享大量材料。
因此第一步应当分析你准备放在一起的文件。不要根据扩展名承诺百分比,也不要假定大文件自动就是好的归档候选。
按真实适用范围阅读基准测试
Tensor Archive 发布了一个受控五部署示例:独立存储时为 907.3 MB,作为一个相关模型和适配器系列时为 261.6 MB,物理存储减少 71.2%。这项比较有价值,因为工作负载、文件之间的关系和精确恢复条件都与结果一同说明。
这里没有说明:单个 SafeTensors 文件、随机文件夹或每个 LoRA 都会节省 71.2%。不相关和已压缩文件可能节省很少。真实决策应来自对眼前模型系列的分析。
如何安全测试存储工作流程
- 为任何无法替代的内容制作独立副本。
- 选择一个相关模型系列,并在改变工作文件夹前进行检查。
- 分析源文件并检查预期结果。
- 将其归档,运行 Verify,并恢复到单独输出位置。
- 在重要工作流程中比较或加载恢复的工件。
- 只有完成该测试后,才应选择是否手动删除工作副本。
选择与问题匹配的工具
当你有意需要不同的部署表示并理解其运行时取舍时,请使用量化。当你需要保留和恢复相关模型的原始字节,并在确有关系的地方减少重复存储时,请使用精确本地归档。针对 LoRA 的清理流程请阅读如何释放 LoRA 模型库磁盘空间。
从一个模型系列和一个可检查结果开始。下载 Tensor Archive在本地运行流程,或在尝试前查看公开的基准测试摘要。
来源
- SafeTensors 项目文档 — 格式目标、布局和支持的张量类型。
- Tensor Archive 基准测试摘要 — 已发布工作负载和精确恢复证据。