Почему pruning и 2-битная квантизация ломают LLM
квантизация LLMpruningсжатие моделей
Где сжатие перестает быть оптимизацией
Я бы не ставил знак равенства между меньшим весом модели и более эффективной системой. При агрессивном pruning вместе с экстремальной квантизацией крупная LLM может потерять столько качества, что ее исходный масштаб уже ничего не дает.
Именно это описал пользователь 144406 в исходном комментарии: несколько опробованных им пруненных моделей показали провальное качество. На конец сентября 2026 года это не новость о конкретном релизе, а практическое наблюдение, которое хорошо совпадает с опубликованными материалами о компрессии моделей.
В документации Hugging Face по квантизации 8- и 4-битные режимы представлены как обычные варианты развертывания, тогда как переход к 2 битам заметно сильнее зависит от выбранного метода. Например, 4-битный NF4 во многих сценариях сохраняет качество с небольшими потерями, особенно при использовании double quantization и QLoRA. Но сам по себе низкий битрейт ничего не гарантирует.
В обзорной статье ACL результат для GPTQ при 2 битах описан как резкое падение вплоть до неспособности модели генерировать связный текст. При этом SpQR на той же разрядности оставался сравнительно пригодным. И вот тут главное: ломает не только число битов, а вся связка из метода, калибровки, архитектуры и последующего восстановления качества.
С pruning риск еще жестче. Квантизация снижает точность представления весов, а агрессивное удаление параметров способно разрушить выученные структуры. Без аккуратного переобучения или дистилляции такая экономия действительно начинает напоминать не оптимизацию, а удаление рабочих частей системы.
Почему меньшая модель иногда оказывается сильнее
Практический победитель здесь не обязательно самый большой чекпойнт, который удалось втиснуть в память. Меньшая модель с умеренной 4- или 8-битной квантизацией может быть стабильнее сильно пруненной крупной модели и лучше держать связность, инструкции и фактическую точность.
Первым делом я бы сравнивал не размер файла и число исходных параметров, а качество на реальной задаче после всех преобразований. Затем уже идут пропускная способность, задержка и расход памяти. Документация Hugging Face Optimum добавляет еще одну неприятную деталь: для небольших моделей деквантизация иногда создает такой накладной расход, что компрессия увеличивает энергопотребление вместо ожидаемой экономии.
Поэтому тезис о превосходстве большой сжатой модели работает только до границы, за которой компрессия съедает ее способности. Эта граница определяется не красивой цифрой в названии файла, а тем, что модель еще умеет после операции.