无损 SafeTensors 存储不是权重量化

“压缩 SafeTensors”可能表示两件根本不同的事:保留原始字节以便精确恢复,或为特定运行时创建更小的不同权重表示。先选择需求,再选择工具。

一个 SafeTensors 模型沿着精确归档路径和转换权重路径分别前进。
两种输出都可能有用,但只有一种承诺能恢复原始字节。

精确恢复与已修改权重

量化是一项模型格式决策。它会降低数值精度或以其他方式改变表示,使运行时减少内存或存储用量。这可能非常适合部署,但输出不是原始工件。

无损归档的任务不同:精确恢复原始文件字节。Tensor Archive 用于把相关本地模型版本保存在紧凑的受管理模型系列中,并按需恢复选定版本。它不是量化器、修剪工具或格式转换器。

提出一个具体问题:日后取回该模型时,它是否必须逐字节与起始文件相同?如果是,请勿把格式转换作为唯一保留方案。

为什么单个 SafeTensors 文件可能几乎不改变大小

仅凭文件大小无法判断存储工作流程是否会取得显著效果。单个文件可能不含适合在精确归档中复用的数据。相关模型系列则可能不同:自包含部署可能重复基础检查点,已完成项目版本也可能共享大量材料。

因此第一步应当分析你准备放在一起的文件。不要根据扩展名承诺百分比,也不要假定大文件自动就是好的归档候选。

按真实适用范围阅读基准测试

Tensor Archive 发布了一个受控五部署示例:独立存储时为 907.3 MB,作为一个相关模型和适配器系列时为 261.6 MB,物理存储减少 71.2%。这项比较有价值,因为工作负载、文件之间的关系和精确恢复条件都与结果一同说明。

这里没有说明:单个 SafeTensors 文件、随机文件夹或每个 LoRA 都会节省 71.2%。不相关和已压缩文件可能节省很少。真实决策应来自对眼前模型系列的分析。

如何安全测试存储工作流程

  1. 为任何无法替代的内容制作独立副本。
  2. 选择一个相关模型系列,并在改变工作文件夹前进行检查。
  3. 分析源文件并检查预期结果。
  4. 将其归档,运行 Verify,并恢复到单独输出位置。
  5. 在重要工作流程中比较或加载恢复的工件。
  6. 只有完成该测试后,才应选择是否手动删除工作副本。

选择与问题匹配的工具

当你有意需要不同的部署表示并理解其运行时取舍时,请使用量化。当你需要保留和恢复相关模型的原始字节,并在确有关系的地方减少重复存储时,请使用精确本地归档。针对 LoRA 的清理流程请阅读如何释放 LoRA 模型库磁盘空间

从一个模型系列和一个可检查结果开始。下载 Tensor Archive在本地运行流程,或在尝试前查看公开的基准测试摘要

来源

保留模型。清理工作硬盘。免费下载 ↓