2 мин чтения

Kimi K3 влезла в один B300 x8, но не вся

Kimi K3NVIDIA B300vLLM

Kimi K3, модель на 2.8 трлн параметров, показали в сценарии запуска на одном узле NVIDIA B300 x8. Смысл не в магии, а в формате: такой сервер достаточен для MXFP4-чекпойнта, но не для BF16 или MXFP8. Это важный ориентир для локального SOTA-инференса.

Что реально поместилось на B300 x8

Kimi K3 на одном сервере с 8 NVIDIA B300 выглядит как красивый момент, но ключевое слово тут MXFP4. В блоге Fixstars, в кейсе Deploying Kimi K3 on Day 0, речь идет именно о запуске 2.8-триллионной модели на одной ноде B300 x8, а не о свободном выборе любого формата весов.

По данным из сопутствующих материалов vLLM и технических разборов, одиночная нода B300 x8 проходит базовый сценарий для MXFP4. Для BF16 и MXFP8 картина другая: один B300-сервер уже не держит полную K3-модель в таком стиле точности. Вот тут хайп резко становится инженерной бухгалтерией по памяти.

Цифра простая и неприятная: MXFP4-чекпойнт для 2.8T параметров оценивается примерно в 1.4 ТБ только под веса. У 8-GPU B300-узла в приведенном разборе фигурирует 2304 ГБ HBM3e, то есть запас есть, но он не бесконечный. KV-cache, активации и служебные накладные расходы никуда не исчезают.

Рецепт vLLM для Kimi K3 тоже говорит довольно прямо: 8 NVIDIA B300 или 8 AMD MI355X, tensor parallelism 8, Kimi-specific parsers для tool calling и reasoning, fastsafetensors, prefix caching. Это не игрушечный ноутбучный запуск, а аккуратная раскладка одного гигантского MoE по восьми ускорителям.

Почему это меняет расклад

Главное изменение в том, что локальный запуск модели такого класса перестал автоматически означать стойку железа. Для MXFP4 один B300 x8 уже выглядит как практический минимум, а не как фантазия из презентации.

Но я бы не путал загрузку модели с хорошим продакшен-сервингом. В источниках нет формального воспроизводимого бенчмарка по токенам в секунду или задержке для Kimi K3 на одиночном B300 x8. Значит, пока доказана вместимость и базовая схема запуска, а не комфортная высокая конкуррентность.

Для инженера самый острый вопрос не в том, стартует ли процесс. По этим данным, для MXFP4 стартует. Вопрос в том, сколько контекста, сколько одновременных запросов и какой хвост латентности выдержит эта конфигурация, особенно если включать длинный контекст вроде max-model-len 1048576, который упоминается в гайдах.

Победитель здесь очевиден: Blackwell-класс железа с большим HBM получает реальный аргумент для локального инференса SOTA LLM. Проигрывает иллюзия, что 2.8T можно просто закинуть на любой современный восьми-GPU сервер и забыть про формат весов. Kimi K3 на одном B300 x8 интересна именно тем, что граница стала видимой, а не исчезла.

Мы ранее рассматривали Rust LocalGPT — компактного локального ассистента, который работает полностью на вашем оборудовании. Это показывает, что тренд на развёртывание ИИ без облаков охватывает как маленькие, так и гигантские модели.