GLM-5.3 wurde für die Schwachstellensuche von 1,51 TB auf 328 GB reduziert
GLM-5.3квантование LLMбезопасность кода
Wie GLM-5.3 auf fast ein Fünftel schrumpfte
Bemerkenswert ist hier ein konkreter technischer Kompromiss: Aikido komprimierte eine spezialisierte GLM-5.3-Variante von 1,51 TB auf 328 GB, ohne Magie zu versprechen, sondern indem die Repräsentation des Modells verändert wurde. Die Ankündigung von Aikido und die Modellkarte beschreiben einen zweistufigen Prozess: Quantisierung senkte das Gewicht auf 488 GB, anschließend entfernte das Pruning von MoE-Experten weitere 160 GB.
In der finalen Konfiguration wurden 88 von 256 gerouteten Experten entfernt, also 34 %, sodass 168 übrig bleiben. Für diese Experten kommt W4A16-Kompression zum Einsatz, während Attention, der gemeinsame Experte, dichte Schichten und der Head in BF16 bleiben. Das ist ein hybrides Verfahren und keine gedankenlose Umwandlung aller Gewichte in vier Bit.
An diesem Punkt ist die Größe keine abstrakte Kennzahl mehr. Laut Aikidos Modellkarte war die 328-GB-Version zum Zeitpunkt der Ankündigung für vLLM auf vier H200-GPUs ausgelegt; der verbleibende Speicher sollte für einen KV-Cache mit 128k Kontext bei produktiven Batch-Größen reichen.
Das ist weiterhin ein schweres Server-Deployment und keine Workstation unter dem Schreibtisch. Doch der Unterschied zwischen 1,51 TB und 328 GB verschiebt die Idee von einem nahezu untransportierbaren Artefakt zu einem ausrollbaren System für ein ernsthaftes Sicherheitsteam.
Die Modellkarte besagt außerdem, dass Altar-1 auf Cybersecurity-Traces, Programmieraufgaben, Tool-Aufrufe, Reasoning und Englisch kalibriert wurde. Das ist eine sinnvolle Mischung für Audits, doch Kalibrierung allein belegt keine Qualität bei neuen Klassen von Schwachstellen.
Kompression hilft, macht das Modell aber nicht klein
Der praktische Fortschritt ist real, doch von Demokratisierung würde ich noch nicht sprechen. Profitieren werden Teams, die Code lokal verarbeiten müssen und bereits einen großen GPU-Server betreiben: Sie erhalten ein enger fokussiertes Modell ohne den vollständigen Hardwarehunger der ursprünglichen GLM-5.3.
Das größte Risiko besteht darin, dass das Entfernen von Experten die durchschnittliche Reasoning-Qualität erhält, aber seltene Muster beeinträchtigt – und genau diese interessieren Auditoren oft besonders. Ich würde zuerst nicht auf einen Gesamtscore schauen, sondern auf den Recall über Sprachen, Schwachstellenklassen, große Repositories und Szenarien mit Tools hinweg.
Es ist also keine Geschichte über ein kleines Modell. Es geht darum, wie selektive Kompression ein riesiges MoE-Modell in ein spezialisiertes Werkzeug verwandelt. Die entscheidende offene Frage bleibt: Welche Schwachstellen verschwanden zusammen mit den entfernten Experten?