3 min de lectura

GLM-5.3 se redujo de 1,51 TB a 328 GB para detectar vulnerabilidades

GLM-5.3квантование LLMбезопасность кода

Aikido redujo una versión de GLM-5.3 centrada en seguridad de 1,51 TB a 328 GB, primero con cuantización y después eliminando parte de sus expertos MoE. El modelo resulta más viable para auditorías locales de código en servidores, aunque la configuración oficial sigue exigiendo varias GPU potentes.

Cómo GLM-5.3 se redujo casi cinco veces

Lo interesante aquí es una decisión de ingeniería muy concreta: Aikido comprimió una versión especializada de GLM-5.3 de 1,51 TB a 328 GB sin prometer magia, sino cambiando la representación del modelo. El anuncio de Aikido y la tarjeta del modelo describen un proceso en dos pasos: la cuantización redujo el peso a 488 GB y la poda de expertos MoE eliminó otros 160 GB.

En la configuración final se eliminaron 88 de los 256 expertos enrutados, un 34%, y quedaron 168. Se aplicó compresión W4A16 a esos expertos, mientras que la atención, el experto compartido, las capas densas y la cabeza se conservan en BF16. Es un esquema híbrido, no una conversión indiscriminada de todos los pesos a cuatro bits.

Aquí es donde el tamaño deja de ser una métrica abstracta. Según la tarjeta de Aikido, la versión de 328 GB estaba diseñada en el lanzamiento para ejecutarse con vLLM en cuatro H200; la memoria restante debería bastar para una caché KV de contexto de 128k con tamaños de lote de producción.

Sigue siendo un servidor pesado, no una estación de trabajo bajo el escritorio. Sin embargo, la diferencia entre 1,51 TB y 328 GB lleva la idea de un artefacto casi imposible de transportar a un sistema desplegable para un equipo de seguridad serio.

La tarjeta también indica que Altar-1 se calibró con trazas de ciberseguridad, tareas de programación, llamadas a herramientas, razonamiento e inglés. Es una combinación razonable para auditoría, pero la calibración por sí sola no demuestra calidad ante nuevas clases de vulnerabilidades.

La compresión ayuda, pero no vuelve pequeño al modelo

El cambio práctico es real, pero todavía no lo llamaría democratización. Salen ganando los equipos que necesitan procesar código localmente y ya disponen de un gran servidor GPU: obtienen un modelo más específico sin toda la demanda de hardware de GLM-5.3 original.

El principal riesgo es que eliminar expertos preserve la calidad media de razonamiento, pero perjudique patrones poco frecuentes, precisamente los que suelen importar a un auditor. Yo miraría primero no la puntuación global, sino la cobertura por lenguajes, clases de vulnerabilidades, repositorios largos y escenarios con herramientas.

Por tanto, no es la historia de un modelo pequeño. Es la historia de cómo una compresión selectiva convierte un enorme modelo MoE en un instrumento especializado, mientras persiste la pregunta clave: ¿qué vulnerabilidades desaparecieron junto con los expertos eliminados?

Anteriormente analizamos Pydantic Monty, un intérprete seguro de Python diseñado para restringir la ejecución de código generado por LLM. Su enfoque de aislamiento del comportamiento inseguro complementa la necesidad de modelos especializados que detecten vulnerabilidades con eficiencia.