GLM-5.3 сжали с 1,51 ТБ до 328 ГБ для поиска уязвимостей
GLM-5.3квантование LLMбезопасность кода
Как GLM-5.3 уменьшили почти в пять раз
Меня здесь цепляет конкретная инженерная развилка: Aikido сжала специализированную версию GLM-5.3 с 1,51 ТБ до 328 ГБ, не обещая магию, а меняя представление модели. В анонсе Aikido и карточке модели описан двухшаговый процесс: квантование уменьшило вес до 488 ГБ, затем прореживание MoE-экспертов сняло ещё 160 ГБ.
В финальной конфигурации удалены 88 из 256 маршрутизируемых экспертов, то есть 34%, осталось 168. Для них применено W4A16-сжатие, а attention, общий эксперт, плотные слои и head сохранены в BF16; это гибридная схема, а не бездумное превращение всех весов в четыре бита.
И вот тут размер перестаёт быть абстрактной метрикой. По карточке Aikido, на момент анонса 328 ГБ рассчитаны на запуск через vLLM на четырёх H200; оставшейся памяти должно хватать для KV-кэша контекста 128k при производственных размерах батча.
Это всё ещё тяжёлый сервер, не рабочая станция под столом. Но разница между 1,51 ТБ и 328 ГБ уже переводит идею из категории почти непереносимого артефакта в категорию развёртываемой системы для серьёзной команды безопасности.
Карточка также говорит, что Altar-1 калибровали на трассах кибербезопасности, задачах программирования, вызовах инструментов, рассуждении и английском языке. Это разумный набор для аудита, но калибровка сама по себе не доказывает качество на новых классах уязвимостей.
Сжатие помогает, но не делает модель маленькой
Практический сдвиг реальный, но демократизацией я бы это пока не называл. Выигрывают команды, которым нужна локальная обработка кода и которые уже располагают крупным GPU-сервером: они получают более узкую модель без полного аппаратного аппетита исходной GLM-5.3.
Главный риск в том, что удаление экспертов может сохранить среднее качество рассуждения, но ударить по редким паттернам, а именно они часто и интересуют аудитора. Я бы первым делом смотрел не на общий балл, а на полноту по языкам, классам уязвимостей, длинным репозиториям и сценариям с инструментами.
Так что это не история о маленькой модели. Это история о том, как выборочное сжатие превращает огромную MoE-модель в специализированный прибор, а главный открытый вопрос остаётся прежним: какие уязвимости исчезли вместе с вырезанными экспертами.