FreeToken ускоряет локальные LLM относительно Ollama
FreeTokenлокальные LLMMoE-инференс
Что именно ускоряет FreeToken
Меня здесь зацепили заявленные 3–4× по скорости decode и 6–30× по prefill относительно Ollama. Команда FlashML приводит эти результаты в статье FreeToken с идентификатором arXiv 2608.16157 и в документации проекта. Это заявленные бенчмарки на момент публикации, а не мой независимый тест: конкретный выигрыш зависит от модели, оборудования и формы нагрузки.
Главная идея FreeToken не в очередном быстром ядре. Система рассматривает CPU, GPU и оперативную память как единую эластичную платформу для инференса больших MoE-моделей, которые целиком не помещаются в VRAM. Во время работы она измеряет пропускную способность связи между CPU и GPU через PCIe, а также скорость обработки на CPU.
Дальше рантайм решает, что выгоднее для каждого эксперта: держать его в GPU-кэше или выполнить прямо на CPU. Статическое разбиение здесь проигрывает, потому что цена передачи данных и вычислений сильно различается между ноутбуком, настольным компьютером и рабочей станцией. И вот это уже похоже на системную оптимизацию, а не на красивую цифру из одного удачного запуска.
Второй рычаг — семантически-aware кэширование между ходами агента. Когда запросы связаны и меняются постепенно, FreeToken повторно использует полезное состояние, сохраняет востребованных экспертов горячими и сокращает повторную обработку промпта. Поэтому выигрыш в prefill заметно выше, чем в последовательной генерации токенов.
В сводке проекта также заявлено ускорение decode в 1,5–2,3× относительно лучших сравниваемых edge-систем на RTX 5090. Отдельный показательный сценарий: модель на 35B параметров запускается с ноутбучным GPU на 8 ГБ памяти.
Почему это меняет локальный инференс
FreeToken выглядит не как косметическое ускорение, а как попытка исправить базовую архитектуру локального serving-стека. Больше всего выиграют машины с ограниченной VRAM, но достаточной оперативной памятью, а также агентные сценарии с длинной последовательностью связанных запросов.
Я бы первым делом смотрел на холодный старт, хвостовую задержку, давление на RAM и поведение кэша при резкой смене темы. Семантическое повторное использование отлично работает там, где действительно есть повторяемость; на несвязанных запросах его вклад неизбежно будет меньше. Аналогично, баланс CPU и GPU может упереться в конкретную шину PCIe или слабый процессор.
Инженерно идея здравая: сначала измерить реальную машину, затем планировать исполнение, а не навязывать всем одинаковую схему. Главный открытый вопрос теперь не в том, быстрее ли FreeToken в опубликованных тестах, а насколько стабильно этот выигрыш переживает разнообразие моделей, железа и настоящих агентных сессий.