Kimi K3 влезла в один B300 x8, но не вся
Kimi K3NVIDIA B300vLLM
Что реально поместилось на B300 x8
Kimi K3 на одном сервере с 8 NVIDIA B300 выглядит как красивый момент, но ключевое слово тут MXFP4. В блоге Fixstars, в кейсе Deploying Kimi K3 on Day 0, речь идет именно о запуске 2.8-триллионной модели на одной ноде B300 x8, а не о свободном выборе любого формата весов.
По данным из сопутствующих материалов vLLM и технических разборов, одиночная нода B300 x8 проходит базовый сценарий для MXFP4. Для BF16 и MXFP8 картина другая: один B300-сервер уже не держит полную K3-модель в таком стиле точности. Вот тут хайп резко становится инженерной бухгалтерией по памяти.
Цифра простая и неприятная: MXFP4-чекпойнт для 2.8T параметров оценивается примерно в 1.4 ТБ только под веса. У 8-GPU B300-узла в приведенном разборе фигурирует 2304 ГБ HBM3e, то есть запас есть, но он не бесконечный. KV-cache, активации и служебные накладные расходы никуда не исчезают.
Рецепт vLLM для Kimi K3 тоже говорит довольно прямо: 8 NVIDIA B300 или 8 AMD MI355X, tensor parallelism 8, Kimi-specific parsers для tool calling и reasoning, fastsafetensors, prefix caching. Это не игрушечный ноутбучный запуск, а аккуратная раскладка одного гигантского MoE по восьми ускорителям.
Почему это меняет расклад
Главное изменение в том, что локальный запуск модели такого класса перестал автоматически означать стойку железа. Для MXFP4 один B300 x8 уже выглядит как практический минимум, а не как фантазия из презентации.
Но я бы не путал загрузку модели с хорошим продакшен-сервингом. В источниках нет формального воспроизводимого бенчмарка по токенам в секунду или задержке для Kimi K3 на одиночном B300 x8. Значит, пока доказана вместимость и базовая схема запуска, а не комфортная высокая конкуррентность.
Для инженера самый острый вопрос не в том, стартует ли процесс. По этим данным, для MXFP4 стартует. Вопрос в том, сколько контекста, сколько одновременных запросов и какой хвост латентности выдержит эта конфигурация, особенно если включать длинный контекст вроде max-model-len 1048576, который упоминается в гайдах.
Победитель здесь очевиден: Blackwell-класс железа с большим HBM получает реальный аргумент для локального инференса SOTA LLM. Проигрывает иллюзия, что 2.8T можно просто закинуть на любой современный восьми-GPU сервер и забыть про формат весов. Kimi K3 на одном B300 x8 интересна именно тем, что граница стала видимой, а не исчезла.