FreeToken запускает Qwen3.6-35B-A3B на RTX 4060 с 8 ГБ
FreeTokenMoEлокальный ИИ
Как FreeToken обходит ограничение VRAM
Для меня главный факт такой: FreeToken превращает GPU, CPU и RAM в общий вычислительный пул, чтобы запускать огромные Mixture-of-Experts-модели без попытки уместить их целиком в видеопамять. Именно так FlashML-org описывает экспериментальный движок в официальном репозитории FreeToken и статье «Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution».
Механика интереснее обычного переноса слоев в оперативную память. При запуске движок оценивает реальную пропускную способность между GPU и CPU, а также вычислительные возможности процессора. На основе этих данных он решает, какие эксперты держать в GPU, какие хранить в RAM и какие задачи дешевле выполнить на CPU, чем гонять через PCIe.
Горячие эксперты получают быстрый доступ к GPU, а более редкие не занимают дефицитную VRAM постоянно. Для MoE это естественный ход: на каждом токене активируется лишь часть экспертов, поэтому размещать всю модель в видеопамяти необязательно. И вот тут архитектурная особенность MoE превращается в практический способ запускать модели, которые формально намного больше доступной VRAM.
На момент публикации в августе 2026 года авторы приводили такие результаты:
- Qwen3.6-35B-A3B на ноутбуке с мобильной RTX 4060 8 ГБ: 39,3 токена/с.
- DeepSeek-V4-Flash 284B на RTX 5090: 22–25 токенов/с.
- GLM-5.2 753B на одной RTX PRO 6000: 14,9 токена/с.
Это показатели из статьи, а не мои замеры. Оценка охватывала три модели, шесть машин и четыре агентных сценария, причем FreeToken сравнивали с llama.cpp, Ollama, KTransformers и MoE-Infinity. Масштаб проверки выглядит содержательно, но заявленные скорости все равно нельзя автоматически переносить на любой промпт, конфигурацию памяти или схему маршрутизации экспертов.
Локальный ИИ упирается уже не только в видеопамять
Это реальный инженерный сдвиг: размер VRAM перестает быть единственным жестким барьером для локальных MoE-моделей. Результат Qwen3.6-35B-A3B особенно показателен, потому что интерактивная скорость получена на ноутбучной RTX 4060 с 8 ГБ, а не на многокарточном сервере.
Но память никуда не исчезла, она просто стала общей системой сообщающихся сосудов. Теперь критичны объем RAM, пропускная способность PCIe, скорость CPU и распределение активности между экспертами. На машине с неудачным балансом этих компонентов адаптивный планировщик может упереться в обмен данными задолго до красивых цифр из таблицы.
Я бы в первую очередь смотрел на задержку первого токена, устойчивую скорость в длинных сессиях и поведение под агентной нагрузкой. Среднее число токенов в секунду показывает потенциал, но не раскрывает паузы при смене экспертов и давление на системную память.
FreeToken не отменяет аппаратные ограничения. Он делает более интересную вещь: перестает считать GPU единственным местом, где вообще может жить локальный инференс.