Kimi K3 влізла в один B300 x8, але не вся
Kimi K3NVIDIA B300vLLM
Що насправді помістилося на B300 x8
Kimi K3 на одному сервері з 8 NVIDIA B300 виглядає як гарний момент, але ключове слово тут — MXFP4. У блозі Fixstars, у кейсі Deploying Kimi K3 on Day 0, йдеться саме про запуск 2.8-трильйонної моделі на одному вузлі B300 x8, а не про вільний вибір будь-якого формату ваг.
Згідно з матеріалами vLLM та технічними розборами, один вузол B300 x8 справляється з базовим сценарієм для MXFP4. Для BF16 та MXFP8 картина інша: один B300-сервер вже не тримає повну K3-модель у такій точності. Ось тут хайп перетворюється на інженерну бухгалтерію пам'яті.
Цифра проста і неприємна: MXFP4-чекпойнт для 2.8T параметрів оцінюється приблизно в 1.4 ТБ лише під ваги. У 8-GPU B300-вузла, що розглядається, фігурує 2304 ГБ HBM3e, тобто запас є, але він не нескінченний. KV-cache, активації та службові накладні витрати нікуди не зникають.
Рецепт vLLM для Kimi K3 також говорить досить прямо: 8 NVIDIA B300 або 8 AMD MI355X, tensor parallelism 8, Kimi-specific parsers для tool calling і reasoning, fastsafetensors, prefix caching. Це не іграшковий запуск на ноутбуці, а акуратне розподілення одного гігантського MoE по восьми прискорювачах.
Чому це змінює розклад
Головна зміна в тому, що локальний запуск моделі такого класу перестав автоматично означати стійку заліза. Для MXFP4 один B300 x8 вже виглядає як практичний мінімум, а не як фантазія з презентації.
Але я б не плутав завантаження моделі з хорошим продакшн-сервінгом. У джерелах немає формального відтворюваного бенчмарку по токенах за секунду або затримці для Kimi K3 на одному B300 x8. Отже, поки що доведено місткість і базову схему запуску, а не комфортну високу конкурентність.
Для інженера найгостріше питання не в тому, чи стартує процес. За цими даними, для MXFP4 стартує. Питання в тому, скільки контексту, скільки одночасних запитів і який хвіст затримки витримає ця конфігурація, особливо якщо вмикати довгий контекст на кшталт max-model-len 1048576, який згадується в гайдах.
Переможець тут очевидний: залізо класу Blackwell з великим HBM отримує реальний аргумент для локального інференсу SOTA LLM. Програє ілюзія, що 2.8T можна просто закинути на будь-який сучасний восьми-GPU сервер і забути про формат ваг. Kimi K3 на одному B300 x8 цікава саме тим, що межа стала видимою, а не зникла.