2 хв читання

GLM-5.3 стиснули з 1,51 ТБ до 328 ГБ для пошуку вразливостей

GLM-5.3квантование LLMбезопасность кода

Aikido стиснула спеціалізовану версію GLM-5.3 для пошуку вразливостей із 1,51 ТБ до 328 ГБ: спершу квантуванням, а потім видаленням частини MoE-експертів. Це робить модель практичнішою для локального аудиту коду на сервері, хоча офіційний варіант і далі потребує потужної багатопроцесорної GPU-конфігурації.

Як GLM-5.3 зменшили майже у п'ять разів

Тут привертає увагу конкретний інженерний компроміс: Aikido стиснула спеціалізовану версію GLM-5.3 з 1,51 ТБ до 328 ГБ не обіцянками магії, а зміною представлення моделі. В анонсі Aikido та картці моделі описано двоетапний процес: квантування зменшило вагу до 488 ГБ, а проріджування MoE-експертів прибрало ще 160 ГБ.

У фінальній конфігурації видалено 88 із 256 маршрутизованих експертів, тобто 34%, і залишилося 168. До цих експертів застосовано стиснення W4A16, а attention, спільний експерт, щільні шари та head збережено у BF16. Це гібридна схема, а не бездумне переведення всіх ваг у чотири біти.

Саме тут розмір перестає бути абстрактною метрикою. За карткою Aikido, на момент анонсу варіант на 328 ГБ був розрахований на запуск через vLLM на чотирьох H200; решти пам'яті має вистачити для KV-кешу контексту 128k за виробничих розмірів батчу.

Це все ще важкий сервер, а не робоча станція під столом. Проте різниця між 1,51 ТБ і 328 ГБ переводить ідею з категорії майже непереносного артефакту в категорію системи, яку може розгорнути серйозна команда безпеки.

У картці також зазначено, що Altar-1 калібрували на трасах кібербезпеки, завданнях програмування, викликах інструментів, міркуванні та англійській мові. Це розумний набір для аудиту, але саме калібрування не доводить якість на нових класах вразливостей.

Стиснення допомагає, але не робить модель малою

Практичний зсув реальний, але називати це демократизацією поки зарано. Виграють команди, яким потрібна локальна обробка коду і які вже мають великий GPU-сервер: вони отримують вужчу модель без повного апаратного апетиту початкової GLM-5.3.

Головний ризик у тому, що видалення експертів може зберегти середню якість міркування, але зашкодити рідкісним патернам, а саме вони часто цікавлять аудитора. Насамперед варто дивитися не на загальний бал, а на повноту за мовами, класами вразливостей, довгими репозиторіями та сценаріями з інструментами.

Отже, це не історія про малу модель. Це історія про те, як вибіркове стиснення перетворює величезну MoE-модель на спеціалізований інструмент, а головне відкрите питання лишається тим самим: які вразливості зникли разом із вирізаними експертами?

Раніше ми розглядали Pydantic Monty — безпечний інтерпретатор Python, створений для обмеження виконання коду, згенерованого LLM. Його підхід до ізоляції небезпечної поведінки доповнює потребу у спеціалізованих моделях, що ефективно виявляють вразливості.