3 min de lectura

Kimi K3 cabe en un B300 x8, pero no del todo

Kimi K3NVIDIA B300vLLM

Kimi K3, un modelo de 2.8 billones de parámetros, se mostró ejecutándose en un solo nodo NVIDIA B300 x8. La clave está en el formato de pesos: este servidor es suficiente para un checkpoint MXFP4, pero no para BF16 o MXFP8. Esto ofrece una referencia crítica para la inferencia SOTA local.

Lo que realmente cabe en el B300 x8

Kimi K3 en un solo servidor con 8 NVIDIA B300 parece un momento hermoso, pero la palabra clave aquí es MXFP4. En el blog de Fixstars, en el caso Deploying Kimi K3 on Day 0, el enfoque está precisamente en ejecutar un modelo de 2.8 billones de parámetros en un único nodo B300 x8, no en elegir libremente cualquier formato de peso.

Según los materiales de vLLM y los análisis técnicos, un solo nodo B300 x8 maneja el escenario básico para MXFP4. Para BF16 y MXFP8, el panorama es diferente: un servidor B300 ya no puede contener el modelo K3 completo con esa precisión. Ahí es cuando el hype se convierte en contabilidad de memoria de ingeniería.

La verdad dura es simple: el checkpoint MXFP4 para 2.8T parámetros se estima en alrededor de 1.4 TB solo para los pesos. El nodo B300 de 8 GPU analizado cuenta con 2304 GB de HBM3e, por lo que hay margen, pero no es infinito. El KV-cache, las activaciones y los gastos generales no desaparecen.

La receta de vLLM para Kimi K3 también lo dice de manera bastante directa: 8 NVIDIA B300 o 8 AMD MI355X, paralelismo de tensor 8, analizadores específicos de Kimi para tool calling y razonamiento, fastsafetensors, prefix caching. Esto no es una ejecución de juguete en un portátil, sino una distribución cuidadosa de un MoE gigante entre ocho aceleradores.

Por qué esto cambia las reglas del juego

El cambio principal es que la implementación local de un modelo de este tamaño ya no significa automáticamente un rack completo de hardware. Para MXFP4, un solo B300 x8 ya parece un mínimo práctico, no una fantasía de una presentación.

Pero no confundiría cargar el modelo con un buen servicio en producción. No hay un benchmark formal reproducible de tokens por segundo o latencia para Kimi K3 en un solo B300 x8 en las fuentes. Así que, por ahora, lo que está probado es la capacidad y el esquema de lanzamiento básico, no una alta concurrencia cómoda.

Para un ingeniero, la pregunta más aguda no es si el proceso se inicia. Según estos datos, para MXFP4 sí se inicia. La pregunta es cuánto contexto, cuántas solicitudes concurrentes y qué cola de latencia puede soportar esta configuración, especialmente si se habilita un contexto largo como max-model-len 1048576 mencionado en las guías.

El ganador aquí es obvio: el hardware de clase Blackwell con gran HBM obtiene un argumento real para la inferencia local de LLM SOTA. La ilusión de que un modelo de 2.8T se puede simplemente volcar en cualquier servidor moderno de ocho GPU y olvidarse del formato de peso es la perdedora. Kimi K3 en un solo B300 x8 es interesante precisamente porque el límite se ha vuelto visible, no ha desaparecido.

Anteriormente revisamos Rust LocalGPT, un asistente local compacto que se ejecuta completamente en tu hardware. Esto muestra que la tendencia de implementar IA sin nubes abarca tanto modelos pequeños como gigantes.