2 хв читання

Kimi K3 влізла в один B300 x8, але не вся

Kimi K3NVIDIA B300vLLM

Модель Kimi K3 на 2.8 трильйони параметрів була продемонстрована в сценарії запуску на одному вузлі NVIDIA B300 x8. Ключовий момент у форматі ваг: цей сервер є достатнім для MXFP4-чекпойнта, але недостатнім для BF16 або MXFP8. Це слугує практичним орієнтиром для локального SOTA-інференсу.

Що насправді помістилося на B300 x8

Kimi K3 на одному сервері з 8 NVIDIA B300 виглядає як гарний момент, але ключове слово тут — MXFP4. У блозі Fixstars, у кейсі Deploying Kimi K3 on Day 0, йдеться саме про запуск 2.8-трильйонної моделі на одному вузлі B300 x8, а не про вільний вибір будь-якого формату ваг.

Згідно з матеріалами vLLM та технічними розборами, один вузол B300 x8 справляється з базовим сценарієм для MXFP4. Для BF16 та MXFP8 картина інша: один B300-сервер вже не тримає повну K3-модель у такій точності. Ось тут хайп перетворюється на інженерну бухгалтерію пам'яті.

Цифра проста і неприємна: MXFP4-чекпойнт для 2.8T параметрів оцінюється приблизно в 1.4 ТБ лише під ваги. У 8-GPU B300-вузла, що розглядається, фігурує 2304 ГБ HBM3e, тобто запас є, але він не нескінченний. KV-cache, активації та службові накладні витрати нікуди не зникають.

Рецепт vLLM для Kimi K3 також говорить досить прямо: 8 NVIDIA B300 або 8 AMD MI355X, tensor parallelism 8, Kimi-specific parsers для tool calling і reasoning, fastsafetensors, prefix caching. Це не іграшковий запуск на ноутбуці, а акуратне розподілення одного гігантського MoE по восьми прискорювачах.

Чому це змінює розклад

Головна зміна в тому, що локальний запуск моделі такого класу перестав автоматично означати стійку заліза. Для MXFP4 один B300 x8 вже виглядає як практичний мінімум, а не як фантазія з презентації.

Але я б не плутав завантаження моделі з хорошим продакшн-сервінгом. У джерелах немає формального відтворюваного бенчмарку по токенах за секунду або затримці для Kimi K3 на одному B300 x8. Отже, поки що доведено місткість і базову схему запуску, а не комфортну високу конкурентність.

Для інженера найгостріше питання не в тому, чи стартує процес. За цими даними, для MXFP4 стартує. Питання в тому, скільки контексту, скільки одночасних запитів і який хвіст затримки витримає ця конфігурація, особливо якщо вмикати довгий контекст на кшталт max-model-len 1048576, який згадується в гайдах.

Переможець тут очевидний: залізо класу Blackwell з великим HBM отримує реальний аргумент для локального інференсу SOTA LLM. Програє ілюзія, що 2.8T можна просто закинути на будь-який сучасний восьми-GPU сервер і забути про формат ваг. Kimi K3 на одному B300 x8 цікава саме тим, що межа стала видимою, а не зникла.

Ми раніше розглядали Rust LocalGPT — компактного локального асистента, який повністю працює на вашому обладнанні. Це показує, що тренд розгортання ШІ без хмар охоплює як маленькі, так і гігантські моделі.