3 min de lecture

Kimi K3 tient sur un B300 x8, mais pas en entier

Kimi K3NVIDIA B300vLLM

Kimi K3, un modèle de 2,8 billions de paramètres, a été présenté en exécution sur un seul nœud NVIDIA B300 x8. L'essentiel réside dans le format des poids : ce serveur suffit pour un checkpoint MXFP4, mais pas pour BF16 ou MXFP8. Cela offre un repère critique pour l'inférence SOTA locale.

Ce qui tient vraiment sur le B300 x8

Kimi K3 sur un seul serveur avec 8 NVIDIA B300 ressemble à un beau moment, mais le mot clé ici est MXFP4. Dans le blog de Fixstars, dans le cas Deploying Kimi K3 on Day 0, il s'agit précisément de l'exécution d'un modèle de 2,8 billions de paramètres sur un seul nœud B300 x8, pas du libre choix de n'importe quel format de poids.

D'après les documents de vLLM et les analyses techniques, un seul nœud B300 x8 gère le scénario de base pour MXFP4. Pour BF16 et MXFP8, le tableau est différent : un serveur B300 ne peut plus contenir le modèle K3 complet dans cette précision. C'est là que le battage médiatique se transforme en comptabilité mémoire d'ingénierie.

La vérité simple et désagréable : le checkpoint MXFP4 pour 2,8T paramètres est estimé à environ 1,4 To rien que pour les poids. Le nœud B300 à 8 GPU présenté dispose de 2304 Go de HBM3e, il y a donc de la marge, mais elle n'est pas infinie. Le cache KV, les activations et les frais généraux ne disparaissent pas.

La recette vLLM pour Kimi K3 le dit aussi assez clairement : 8 NVIDIA B300 ou 8 AMD MI355X, parallélisme de tenseur 8, analyseurs spécifiques à Kimi pour l'appel d'outils et le raisonnement, fastsafetensors, mise en cache de préfixes. Ce n'est pas une exécution de jouet sur ordinateur portable, mais une distribution soignée d'un MoE géant sur huit accélérateurs.

Pourquoi cela change la donne

Le principal changement est que le déploiement local d'un modèle de cette classe ne signifie plus automatiquement une armoire de matériel. Pour MXFP4, un seul B300 x8 apparaît déjà comme un minimum pratique, pas comme un fantasme de présentation.

Mais je ne confondrais pas le chargement du modèle avec un bon service en production. Il n'y a pas de benchmark formel reproductible en tokens par seconde ou en latence pour Kimi K3 sur un seul B300 x8 dans les sources. Donc, pour l'instant, ce qui est prouvé, c'est la capacité et le schéma de lancement de base, pas une concurrence élevée confortable.

Pour un ingénieur, la question la plus aiguë n'est pas de savoir si le processus démarre. D'après ces données, pour MXFP4, il démarre. La question est de savoir combien de contexte, combien de requêtes simultanées et quelle traîne de latence cette configuration peut supporter, surtout si l'on active un contexte long comme max-model-len 1048576 mentionné dans les guides.

Le gagnant ici est évident : le matériel de classe Blackwell avec une grande HBM obtient un argument réel pour l'inférence locale de LLM SOTA. L'illusion qu'un modèle de 2,8T peut être simplement jeté sur n'importe quel serveur moderne à huit GPU en oubliant le format de poids est la perdante. Kimi K3 sur un seul B300 x8 est intéressante précisément parce que la frontière est devenue visible, pas qu'elle a disparu.

Nous avons précédemment examiné Rust LocalGPT — un assistant local compact qui fonctionne entièrement sur votre matériel. Cela montre que la tendance au déploiement de l'IA sans cloud englobe à la fois les petits et les grands modèles.