Хранение SafeTensors без потерь — не квантование весов
«Сжать SafeTensors» может означать две принципиально разные задачи: сохранить исходные байты для точного восстановления или создать другое, меньшее представление весов для конкретной среды выполнения. Сначала определите требование, а затем выбирайте инструменты.
Точное восстановление и изменённые веса
Квантование — решение о формате модели. Оно снижает числовую точность или иначе меняет представление, чтобы среда выполнения использовала меньше памяти или хранилища. Для развёртывания это может быть вполне уместно, но результат уже не является исходным артефактом.
У архива без потерь иная задача: точно восстановить исходные байты файлов. Tensor Archive предназначен для компактного управляемого хранения связанных локальных версий моделей и восстановления выбранной версии по запросу. Это не квантователь, не инструмент обрезки и не конвертер форматов.
Задайте один конкретный вопрос: когда вы извлечёте эту модель позже, должна ли она побайтово совпадать с исходным файлом? Если да, преобразование формата не должно быть единственным планом сохранения.
Почему один файл SafeTensors может почти не изменить размер
Один размер файла не показывает, насколько эффективным окажется процесс хранения. В отдельном файле может не быть данных, повторение которых полезно точному архиву. Связанное семейство может вести себя иначе: автономные развёртывания способны повторять базовый чекпойнт, а завершённые версии проекта — содержать значительный общий материал.
Поэтому первым шагом должен быть анализ файлов, которые вы хотите хранить вместе. Не обещайте процент, исходя из расширения, и не считайте большой файл автоматически хорошим кандидатом для архивирования.
Рассматривайте тест в его реальной области применимости
Tensor Archive публикует контролируемый пример с пятью развёртываниями, где 907.3 MB при раздельном хранении превратились в 261.6 MB в составе одного связанного семейства моделей и адаптеров: физический объём хранения уменьшился на 71.2%. Сравнение ценно тем, что рабочая нагрузка, связь между файлами и условие точного восстановления указаны рядом с результатом.
Из этого не следует, что отдельный файл SafeTensors, случайная папка или каждая LoRA сэкономит 71.2%. Несвязанные и уже сжатые файлы могут почти не уменьшиться. Реальное решение следует принимать по анализу конкретного семейства перед вами.
Как безопасно проверить процесс хранения
- Создайте независимую копию всего, что невозможно заменить.
- Выберите одно связанное семейство и изучите его до изменения рабочей папки.
- Проанализируйте источник и проверьте ожидаемый результат.
- Заархивируйте, запустите Verify и восстановите в отдельную папку.
- Сравните или загрузите восстановленный артефакт в важном рабочем процессе.
- Только после этой проверки решайте, можно ли вручную удалить рабочую копию.
Выберите инструмент, соответствующий задаче
Используйте квантование, когда намеренно требуется другое представление для развёртывания и вы понимаете компромиссы среды выполнения. Используйте точный локальный архив, когда необходимо сохранять и восстанавливать исходные байты связанных моделей, уменьшая повторное хранение там, где существует такая связь. Процесс очистки специально для LoRA описан в руководстве о том, как освободить место в библиотеке LoRA.
Начните с одного семейства и результата, который можно проверить. Скачайте Tensor Archive, чтобы выполнить процесс локально, или предварительно изучите общедоступную сводку теста.
Источники
- Документация проекта SafeTensors — цели формата, структура и поддерживаемые типы тензоров.
- Сводка теста Tensor Archive — опубликованная рабочая нагрузка и подтверждение точного восстановления.