GLM-5.3 passe de 1,51 To à 328 Go pour trouver les vulnérabilités
GLM-5.3квантование LLMбезопасность кода
Comment GLM-5.3 a été réduit de presque cinq fois
Ce qui retient l'attention ici est un compromis d'ingénierie très concret : Aikido a compressé une version spécialisée de GLM-5.3 de 1,51 To à 328 Go, sans promettre de miracle, mais en modifiant la représentation du modèle. L'annonce d'Aikido et la fiche du modèle décrivent un processus en deux étapes : la quantification a ramené les poids à 488 Go, puis l'élagage des experts MoE a retiré 160 Go supplémentaires.
Dans la configuration finale, 88 des 256 experts routés ont été supprimés, soit 34 %, laissant 168 experts. Ces experts utilisent une compression W4A16, tandis que l'attention, l'expert partagé, les couches denses et la tête restent en BF16. Il s'agit d'un schéma hybride, pas d'une conversion aveugle de tous les poids en quatre bits.
C'est à ce stade que la taille cesse d'être une métrique abstraite. Selon la fiche d'Aikido, la version de 328 Go était conçue au lancement pour tourner avec vLLM sur quatre H200 ; la mémoire restante devrait suffire à un cache KV de contexte de 128k avec des tailles de lots de production.
Il s'agit toujours d'un serveur lourd, pas d'une station de travail sous un bureau. Mais l'écart entre 1,51 To et 328 Go fait passer l'idée d'un artefact presque impossible à déplacer à un système déployable pour une équipe de sécurité sérieuse.
La fiche précise aussi qu'Altar-1 a été calibré sur des traces de cybersécurité, des tâches de programmation, des appels d'outils, du raisonnement et l'anglais. C'est un ensemble logique pour l'audit, mais la calibration ne prouve pas à elle seule la qualité face à de nouvelles classes de vulnérabilités.
La compression aide, mais ne rend pas le modèle petit
Le changement pratique est réel, mais il serait prématuré de parler de démocratisation. Les équipes qui en bénéficient sont celles qui doivent traiter le code localement et disposent déjà d'un gros serveur GPU : elles obtiennent un modèle plus ciblé sans absorber toute la demande matérielle de GLM-5.3 d'origine.
Le risque principal est que la suppression d'experts préserve la qualité moyenne du raisonnement tout en dégradant les motifs rares, qui sont souvent précisément ceux qu'un auditeur recherche. Je regarderais d'abord non pas le score global, mais le rappel selon les langages, les classes de vulnérabilités, les longs dépôts et les scénarios avec outils.
Ce n'est donc pas l'histoire d'un petit modèle. C'est celle d'une compression sélective qui transforme un immense modèle MoE en instrument spécialisé, tandis que la question essentielle reste ouverte : quelles vulnérabilités ont disparu avec les experts retirés ?