2 мин чтения

FreeToken ускоряет локальные LLM относительно Ollama

FreeTokenлокальные LLMMoE-инференс

FreeToken ускоряет локальный инференс MoE-моделей за счет адаптивного распределения экспертов между CPU и GPU и семантического кэша между ходами агента. В опубликованном сравнении с Ollama система показывает ускорение decode в 3–4×, а prefill в 6–30×, что особенно важно для больших моделей вне дата-центра.

Что именно ускоряет FreeToken

Меня здесь зацепили заявленные 3–4× по скорости decode и 6–30× по prefill относительно Ollama. Команда FlashML приводит эти результаты в статье FreeToken с идентификатором arXiv 2608.16157 и в документации проекта. Это заявленные бенчмарки на момент публикации, а не мой независимый тест: конкретный выигрыш зависит от модели, оборудования и формы нагрузки.

Главная идея FreeToken не в очередном быстром ядре. Система рассматривает CPU, GPU и оперативную память как единую эластичную платформу для инференса больших MoE-моделей, которые целиком не помещаются в VRAM. Во время работы она измеряет пропускную способность связи между CPU и GPU через PCIe, а также скорость обработки на CPU.

Дальше рантайм решает, что выгоднее для каждого эксперта: держать его в GPU-кэше или выполнить прямо на CPU. Статическое разбиение здесь проигрывает, потому что цена передачи данных и вычислений сильно различается между ноутбуком, настольным компьютером и рабочей станцией. И вот это уже похоже на системную оптимизацию, а не на красивую цифру из одного удачного запуска.

Второй рычаг — семантически-aware кэширование между ходами агента. Когда запросы связаны и меняются постепенно, FreeToken повторно использует полезное состояние, сохраняет востребованных экспертов горячими и сокращает повторную обработку промпта. Поэтому выигрыш в prefill заметно выше, чем в последовательной генерации токенов.

В сводке проекта также заявлено ускорение decode в 1,5–2,3× относительно лучших сравниваемых edge-систем на RTX 5090. Отдельный показательный сценарий: модель на 35B параметров запускается с ноутбучным GPU на 8 ГБ памяти.

Почему это меняет локальный инференс

FreeToken выглядит не как косметическое ускорение, а как попытка исправить базовую архитектуру локального serving-стека. Больше всего выиграют машины с ограниченной VRAM, но достаточной оперативной памятью, а также агентные сценарии с длинной последовательностью связанных запросов.

Я бы первым делом смотрел на холодный старт, хвостовую задержку, давление на RAM и поведение кэша при резкой смене темы. Семантическое повторное использование отлично работает там, где действительно есть повторяемость; на несвязанных запросах его вклад неизбежно будет меньше. Аналогично, баланс CPU и GPU может упереться в конкретную шину PCIe или слабый процессор.

Инженерно идея здравая: сначала измерить реальную машину, затем планировать исполнение, а не навязывать всем одинаковую схему. Главный открытый вопрос теперь не в том, быстрее ли FreeToken в опубликованных тестах, а насколько стабильно этот выигрыш переживает разнообразие моделей, железа и настоящих агентных сессий.

Ранее мы разбирали, как инфраструктура конфиденциальных вычислений может изменить стоимость инференса LLM и компромиссы в области приватности. FreeToken дополняет эту картину производительностью, повышая пропускную способность decode благодаря адаптации к пропускной способности между CPU и GPU.