3 мин чтения

FreeToken запускает Qwen3.6-35B-A3B на RTX 4060 с 8 ГБ

FreeTokenMoEлокальный ИИ

FreeToken объединяет GPU, CPU и RAM в общий адаптивный пул для локального запуска MoE-моделей. FlashML-org сообщает, что Qwen3.6-35B-A3B достигает 39,3 токена/с на ноутбуке с мобильной RTX 4060 на 8 ГБ. Это уменьшает зависимость от VRAM, но делает критичными RAM, CPU и пропускную способность обмена.

Как FreeToken обходит ограничение VRAM

Для меня главный факт такой: FreeToken превращает GPU, CPU и RAM в общий вычислительный пул, чтобы запускать огромные Mixture-of-Experts-модели без попытки уместить их целиком в видеопамять. Именно так FlashML-org описывает экспериментальный движок в официальном репозитории FreeToken и статье «Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution».

Механика интереснее обычного переноса слоев в оперативную память. При запуске движок оценивает реальную пропускную способность между GPU и CPU, а также вычислительные возможности процессора. На основе этих данных он решает, какие эксперты держать в GPU, какие хранить в RAM и какие задачи дешевле выполнить на CPU, чем гонять через PCIe.

Горячие эксперты получают быстрый доступ к GPU, а более редкие не занимают дефицитную VRAM постоянно. Для MoE это естественный ход: на каждом токене активируется лишь часть экспертов, поэтому размещать всю модель в видеопамяти необязательно. И вот тут архитектурная особенность MoE превращается в практический способ запускать модели, которые формально намного больше доступной VRAM.

На момент публикации в августе 2026 года авторы приводили такие результаты:

  • Qwen3.6-35B-A3B на ноутбуке с мобильной RTX 4060 8 ГБ: 39,3 токена/с.
  • DeepSeek-V4-Flash 284B на RTX 5090: 22–25 токенов/с.
  • GLM-5.2 753B на одной RTX PRO 6000: 14,9 токена/с.

Это показатели из статьи, а не мои замеры. Оценка охватывала три модели, шесть машин и четыре агентных сценария, причем FreeToken сравнивали с llama.cpp, Ollama, KTransformers и MoE-Infinity. Масштаб проверки выглядит содержательно, но заявленные скорости все равно нельзя автоматически переносить на любой промпт, конфигурацию памяти или схему маршрутизации экспертов.

Локальный ИИ упирается уже не только в видеопамять

Это реальный инженерный сдвиг: размер VRAM перестает быть единственным жестким барьером для локальных MoE-моделей. Результат Qwen3.6-35B-A3B особенно показателен, потому что интерактивная скорость получена на ноутбучной RTX 4060 с 8 ГБ, а не на многокарточном сервере.

Но память никуда не исчезла, она просто стала общей системой сообщающихся сосудов. Теперь критичны объем RAM, пропускная способность PCIe, скорость CPU и распределение активности между экспертами. На машине с неудачным балансом этих компонентов адаптивный планировщик может упереться в обмен данными задолго до красивых цифр из таблицы.

Я бы в первую очередь смотрел на задержку первого токена, устойчивую скорость в длинных сессиях и поведение под агентной нагрузкой. Среднее число токенов в секунду показывает потенциал, но не раскрывает паузы при смене экспертов и давление на системную память.

FreeToken не отменяет аппаратные ограничения. Он делает более интересную вещь: перестает считать GPU единственным местом, где вообще может жить локальный инференс.

Ранее мы разбирали Pony Alpha в OpenRouter: бесплатный доступ к модели с контекстом 200K для прототипирования и проверки архитектуры. Этот кейс дополняет FreeToken, показывая другой способ экспериментировать с крупными моделями без дорогой инфраструктуры.