2 хв читання

Чому pruning і 2-бітна квантизація ламають LLM

квантизация LLMpruningсжатие моделей

Агресивний pruning та екстремальна квантизація можуть позбавити велику LLM її переваг. За точності 2 біти якість особливо залежить від методу й може різко впасти. На практиці менша модель із помірною 4- або 8-бітною квантизацією часто надійніша за велику, але надмірно урізану.

Коли стиснення перестає бути оптимізацією

Я б не ставив знак рівності між меншою вагою моделі та ефективнішою системою. За поєднання агресивного pruning з екстремальною квантизацією велика LLM може втратити стільки якості, що її початковий масштаб уже нічого не дає.

Саме це описав користувач 144406 в оригінальному коментарі: кілька протестованих ним прунених моделей показали провальну якість. Станом на кінець вересня 2026 року це не новина про конкретний реліз, а практичне спостереження, що добре узгоджується з опублікованими матеріалами про стиснення моделей.

У документації Hugging Face режими квантизації на 8 і 4 біти подані як звичайні варіанти розгортання, тоді як перехід до 2 бітів значно сильніше залежить від вибраного методу. Наприклад, 4-бітний NF4 у багатьох сценаріях зберігає якість із невеликими втратами, особливо з double quantization і QLoRA. Але сам по собі низький бітрейт нічого не гарантує.

В оглядовій статті ACL результат GPTQ за 2 бітів описано як різке падіння, аж до нездатності моделі генерувати зв’язний текст. Водночас SpQR за тієї самої розрядності залишався порівняно придатним. І тут головне: ламає не лише кількість бітів, а весь комплекс методу, калібрування, архітектури та подальшого відновлення якості.

З pruning ризик ще жорсткіший. Квантизація знижує точність подання ваг, а агресивне видалення параметрів здатне зруйнувати вивчені структури. Без ретельного донавчання або дистиляції така економія справді починає нагадувати не оптимізацію, а вилучення робочих частин системи.

Чому менша модель іноді виявляється сильнішою

Практичний переможець тут не обов’язково найбільший чекпойнт, який вдалося вмістити в пам’ять. Менша модель із помірною 4- або 8-бітною квантизацією може бути стабільнішою за сильно прунену велику модель і краще зберігати зв’язність, виконання інструкцій та фактичну точність.

Насамперед я б порівнював не розмір файлу й початкову кількість параметрів, а якість на реальному завданні після всіх перетворень. Уже потім — пропускну здатність, затримку та витрати пам’яті. Документація Hugging Face Optimum додає ще одну неприємну деталь: для невеликих моделей деквантизація іноді створює такі накладні витрати, що стиснення збільшує енергоспоживання замість очікуваної економії.

Тому теза про перевагу великої стисненої моделі працює лише до межі, за якою стиснення з’їдає її можливості. Цю межу визначає не гарна цифра в назві файлу, а те, що модель іще вміє після операції.

Ми також розглядали Rust LocalGPT — локального асистента в одному бінарному файлі з пам’яттю та HTTP API. Цей приклад добре показує, як вибір моделі впливає на практичність локального розгортання.