3 мин чтения

Kimi K3 на MacBook M1: что тут реально важно

local-llmapple-siliconmoe

На Reddit показали локальный запуск Kimi K3 на MacBook M1: после оптимизаций скорость улучшили примерно с минуты до 16 секунд на токен, а prefill с 2429 до 40 секунд. Это важно как демонстрация того, что узкое место у таких MoE-моделей не только вычисления, но прежде всего память и подача весов.

Локально запустить Kimi K3 смогли, но это история не про комфорт, а про пределы железа

Самый важный факт здесь простой: в посте на Reddit пользователь пишет, что дотащил все 1.45 TB экспертов на локальный диск и улучшил инференс на M1 Mac до 16 секунд на токен вместо примерно минуты. Prefill, по его словам, упал с 2429 секунд до 40. Это уже не "не едет совсем", а вполне наглядная демонстрация, где именно модель упирается в систему.

Источник факта тут не официальный бенчмарк, а именно обновление в посте Reddit из сообщества LocalLLaMA. И это важно держать в голове: я бы не воспринимал эти цифры как норму для Kimi K3, но как инженерный сигнал они отличные. Если после профилирования и возни с подачей данных ускорение такое большое, значит bottleneck сидел не только в матмуле.

Дальше картина сходится с тем, что обычно пишут о Kimi K3 в публичных разборках модели: это MoE на 2.8T параметров, где на токен активны 16 из 896 экспертов. На бумаге это звучит как способ сделать гиганта "дешевле" в инференсе. На практике вес модели никуда не девается, и 1.4 TB класса памяти для загрузки весов остаются главным ограничением.

И вот тут Apple Silicon интересен не магией, а профилем узких мест. Для таких MoE-моделей проблема часто не в том, что чип совсем слабый, а в том, что доставка нужных весов и dispatch экспертов начинают диктовать всё остальное.

Что это меняет для локальных LLM и где заканчивается хайп

Мой вывод короткий: новость важна как proof of pain, а не как proof of practicality. Да, сверхбольшую MoE-модель можно как-то раскочегарить локально даже на M1-классе, но это не делает такой запуск реалистичным рабочим сценарием.

Первое следствие очевидно: оптимизация пайплайна, хранения и prefill может менять порядок величин. Если prefill падает с 2429 до 40 секунд, то инженерная работа вокруг инференса иногда важнее очередного спора про "какой backend быстрее".

Второе менее очевидно: для Apple Silicon разговор о больших MoE всё сильнее сводится к memory bandwidth, expert dispatch и стратегии шардирования, а не к голым FLOPS. Поэтому даже хорошие результаты на MLX-подобных стеках не отменяют базовую проблему, модель слишком велика для нормального локального режима.

И третье, самое трезвое: self-hosting таких моделей остаётся историей про очень специальные эксперименты или кластерный масштаб. Но сам факт, что люди уже выжимают из этого минуты в десятки секунд, показывает направление довольно чётко: будущее локального инференса решат не только новые чипы, а умение агрессивно сокращать движение весов. Именно там сейчас и происходит настоящая магия, без всякой романтики.

Мы уже рассказывали о Rust LocalGPT — локальном ассистенте в одном бинарном файле, который не требует облака и работает прямо на пользовательской машине. Это естественный шаг в ту же сторону, что и эксперимент с Kimi K3 на MacBook.