3 min de lecture

GLM-5.3 passe de 1,51 To à 328 Go pour trouver les vulnérabilités

GLM-5.3квантование LLMбезопасность кода

Aikido a réduit une version de GLM-5.3 dédiée à la sécurité, de 1,51 To à 328 Go, d'abord par quantification puis en supprimant certains experts MoE. Le modèle devient plus réaliste pour l'audit local du code sur serveur, même si la configuration officielle exige toujours plusieurs GPU puissants.

Comment GLM-5.3 a été réduit de presque cinq fois

Ce qui retient l'attention ici est un compromis d'ingénierie très concret : Aikido a compressé une version spécialisée de GLM-5.3 de 1,51 To à 328 Go, sans promettre de miracle, mais en modifiant la représentation du modèle. L'annonce d'Aikido et la fiche du modèle décrivent un processus en deux étapes : la quantification a ramené les poids à 488 Go, puis l'élagage des experts MoE a retiré 160 Go supplémentaires.

Dans la configuration finale, 88 des 256 experts routés ont été supprimés, soit 34 %, laissant 168 experts. Ces experts utilisent une compression W4A16, tandis que l'attention, l'expert partagé, les couches denses et la tête restent en BF16. Il s'agit d'un schéma hybride, pas d'une conversion aveugle de tous les poids en quatre bits.

C'est à ce stade que la taille cesse d'être une métrique abstraite. Selon la fiche d'Aikido, la version de 328 Go était conçue au lancement pour tourner avec vLLM sur quatre H200 ; la mémoire restante devrait suffire à un cache KV de contexte de 128k avec des tailles de lots de production.

Il s'agit toujours d'un serveur lourd, pas d'une station de travail sous un bureau. Mais l'écart entre 1,51 To et 328 Go fait passer l'idée d'un artefact presque impossible à déplacer à un système déployable pour une équipe de sécurité sérieuse.

La fiche précise aussi qu'Altar-1 a été calibré sur des traces de cybersécurité, des tâches de programmation, des appels d'outils, du raisonnement et l'anglais. C'est un ensemble logique pour l'audit, mais la calibration ne prouve pas à elle seule la qualité face à de nouvelles classes de vulnérabilités.

La compression aide, mais ne rend pas le modèle petit

Le changement pratique est réel, mais il serait prématuré de parler de démocratisation. Les équipes qui en bénéficient sont celles qui doivent traiter le code localement et disposent déjà d'un gros serveur GPU : elles obtiennent un modèle plus ciblé sans absorber toute la demande matérielle de GLM-5.3 d'origine.

Le risque principal est que la suppression d'experts préserve la qualité moyenne du raisonnement tout en dégradant les motifs rares, qui sont souvent précisément ceux qu'un auditeur recherche. Je regarderais d'abord non pas le score global, mais le rappel selon les langages, les classes de vulnérabilités, les longs dépôts et les scénarios avec outils.

Ce n'est donc pas l'histoire d'un petit modèle. C'est celle d'une compression sélective qui transforme un immense modèle MoE en instrument spécialisé, tandis que la question essentielle reste ouverte : quelles vulnérabilités ont disparu avec les experts retirés ?

Nous avons déjà présenté Pydantic Monty, un interpréteur Python sécurisé conçu pour limiter l'exécution de code généré par les LLM. Son approche d'isolation des comportements dangereux complète le besoin de modèles spécialisés capables d'identifier efficacement les vulnérabilités.