2 мин чтения

Почему pruning и 2-битная квантизация ломают LLM

квантизация LLMpruningсжатие моделей

Агрессивный pruning и экстремальная квантизация могут лишить большую LLM ее преимуществ. При точности 2 бита качество особенно зависит от метода и способно резко обвалиться. На практике меньшая модель с умеренной 4- или 8-битной квантизацией часто надежнее крупной, но чрезмерно урезанной модели.

Где сжатие перестает быть оптимизацией

Я бы не ставил знак равенства между меньшим весом модели и более эффективной системой. При агрессивном pruning вместе с экстремальной квантизацией крупная LLM может потерять столько качества, что ее исходный масштаб уже ничего не дает.

Именно это описал пользователь 144406 в исходном комментарии: несколько опробованных им пруненных моделей показали провальное качество. На конец сентября 2026 года это не новость о конкретном релизе, а практическое наблюдение, которое хорошо совпадает с опубликованными материалами о компрессии моделей.

В документации Hugging Face по квантизации 8- и 4-битные режимы представлены как обычные варианты развертывания, тогда как переход к 2 битам заметно сильнее зависит от выбранного метода. Например, 4-битный NF4 во многих сценариях сохраняет качество с небольшими потерями, особенно при использовании double quantization и QLoRA. Но сам по себе низкий битрейт ничего не гарантирует.

В обзорной статье ACL результат для GPTQ при 2 битах описан как резкое падение вплоть до неспособности модели генерировать связный текст. При этом SpQR на той же разрядности оставался сравнительно пригодным. И вот тут главное: ломает не только число битов, а вся связка из метода, калибровки, архитектуры и последующего восстановления качества.

С pruning риск еще жестче. Квантизация снижает точность представления весов, а агрессивное удаление параметров способно разрушить выученные структуры. Без аккуратного переобучения или дистилляции такая экономия действительно начинает напоминать не оптимизацию, а удаление рабочих частей системы.

Почему меньшая модель иногда оказывается сильнее

Практический победитель здесь не обязательно самый большой чекпойнт, который удалось втиснуть в память. Меньшая модель с умеренной 4- или 8-битной квантизацией может быть стабильнее сильно пруненной крупной модели и лучше держать связность, инструкции и фактическую точность.

Первым делом я бы сравнивал не размер файла и число исходных параметров, а качество на реальной задаче после всех преобразований. Затем уже идут пропускная способность, задержка и расход памяти. Документация Hugging Face Optimum добавляет еще одну неприятную деталь: для небольших моделей деквантизация иногда создает такой накладной расход, что компрессия увеличивает энергопотребление вместо ожидаемой экономии.

Поэтому тезис о превосходстве большой сжатой модели работает только до границы, за которой компрессия съедает ее способности. Эта граница определяется не красивой цифрой в названии файла, а тем, что модель еще умеет после операции.

Мы также рассматривали Rust LocalGPT — локального ассистента в одном бинарном файле с памятью и HTTP API. Этот пример хорошо показывает, как выбор модели влияет на практичность локального развертывания.