3 хв читання

FreeToken запускає Qwen3.6-35B-A3B на RTX 4060 з 8 ГБ

FreeTokenMoEлокальный ИИ

FreeToken об’єднує GPU, CPU та RAM у спільний адаптивний пул для локального запуску MoE-моделей. FlashML-org повідомляє, що Qwen3.6-35B-A3B досягає 39,3 токена за секунду на ноутбуці з мобільною RTX 4060 на 8 ГБ. Залежність від VRAM зменшується, але критичними стають RAM, CPU та пропускна здатність обміну.

Як FreeToken обходить обмеження VRAM

Для мене головний факт такий: FreeToken перетворює GPU, CPU та RAM на спільний обчислювальний пул, щоб запускати величезні Mixture-of-Experts-моделі без спроби повністю вмістити їх у відеопам’ять. Саме так FlashML-org описує експериментальний рушій в офіційному репозиторії FreeToken і статті «Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution».

Механіка цікавіша за звичайне перенесення шарів до оперативної пам’яті. Під час запуску рушій оцінює реальну пропускну здатність між GPU та CPU, а також обчислювальні можливості процесора. На основі цих даних він вирішує, яких експертів тримати на GPU, яких зберігати в RAM і які завдання дешевше виконати на CPU, ніж передавати через PCIe.

Найактивніші експерти отримують швидкий доступ до GPU, а рідше потрібні не займають дефіцитну VRAM постійно. Для MoE це природний підхід: на кожному токені активується лише частина експертів, тому розміщувати всю модель у відеопам’яті необов’язково. Тут архітектурна особливість MoE стає практичним способом запускати моделі, що формально значно більші за доступну VRAM.

На момент публікації у серпні 2026 року автори навели такі результати:

  • Qwen3.6-35B-A3B на ноутбуці з мобільною RTX 4060 8 ГБ: 39,3 токена/с.
  • DeepSeek-V4-Flash 284B на RTX 5090: 22–25 токенів/с.
  • GLM-5.2 753B на одній RTX PRO 6000: 14,9 токена/с.

Це показники зі статті, а не мої вимірювання. Оцінювання охоплювало три моделі, шість машин і чотири агентні сценарії; FreeToken порівнювали з llama.cpp, Ollama, KTransformers і MoE-Infinity. Масштаб перевірки виглядає змістовним, але заявлені швидкості все одно не можна автоматично переносити на кожен промпт, конфігурацію пам’яті чи схему маршрутизації експертів.

Локальний ШІ впирається вже не лише у відеопам’ять

Це реальна інженерна зміна: обсяг VRAM перестає бути єдиним жорстким бар’єром для локальних MoE-моделей. Результат Qwen3.6-35B-A3B особливо показовий, адже інтерактивну швидкість отримано на ноутбучній RTX 4060 з 8 ГБ, а не на багатокартковому сервері.

Але обмеження пам’яті нікуди не зникли — вони стали спільною системою. Тепер критичні обсяг RAM, пропускна здатність PCIe, швидкість CPU та розподіл активності між експертами. На машині з невдалим балансом цих компонентів адаптивний планувальник може впертися в обмін даними задовго до гарних цифр у таблиці.

Я б насамперед дивився на затримку першого токена, стабільну швидкість у довгих сесіях і поведінку під агентним навантаженням. Середня кількість токенів за секунду показує потенціал, але не розкриває пауз під час зміни експертів і тиск на системну пам’ять.

FreeToken не скасовує апаратних обмежень. Він робить цікавішу річ: перестає вважати GPU єдиним місцем, де взагалі може існувати локальний інференс.

Раніше ми розглядали Pony Alpha в OpenRouter: безкоштовний доступ до моделі з контекстом 200K для прототипування та перевірки архітектури. Цей кейс доповнює FreeToken, показуючи інший шлях експериментів із великими моделями без дорогої інфраструктури.