FreeToken запускає Qwen3.6-35B-A3B на RTX 4060 з 8 ГБ
FreeTokenMoEлокальный ИИ
Як FreeToken обходить обмеження VRAM
Для мене головний факт такий: FreeToken перетворює GPU, CPU та RAM на спільний обчислювальний пул, щоб запускати величезні Mixture-of-Experts-моделі без спроби повністю вмістити їх у відеопам’ять. Саме так FlashML-org описує експериментальний рушій в офіційному репозиторії FreeToken і статті «Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution».
Механіка цікавіша за звичайне перенесення шарів до оперативної пам’яті. Під час запуску рушій оцінює реальну пропускну здатність між GPU та CPU, а також обчислювальні можливості процесора. На основі цих даних він вирішує, яких експертів тримати на GPU, яких зберігати в RAM і які завдання дешевше виконати на CPU, ніж передавати через PCIe.
Найактивніші експерти отримують швидкий доступ до GPU, а рідше потрібні не займають дефіцитну VRAM постійно. Для MoE це природний підхід: на кожному токені активується лише частина експертів, тому розміщувати всю модель у відеопам’яті необов’язково. Тут архітектурна особливість MoE стає практичним способом запускати моделі, що формально значно більші за доступну VRAM.
На момент публікації у серпні 2026 року автори навели такі результати:
- Qwen3.6-35B-A3B на ноутбуці з мобільною RTX 4060 8 ГБ: 39,3 токена/с.
- DeepSeek-V4-Flash 284B на RTX 5090: 22–25 токенів/с.
- GLM-5.2 753B на одній RTX PRO 6000: 14,9 токена/с.
Це показники зі статті, а не мої вимірювання. Оцінювання охоплювало три моделі, шість машин і чотири агентні сценарії; FreeToken порівнювали з llama.cpp, Ollama, KTransformers і MoE-Infinity. Масштаб перевірки виглядає змістовним, але заявлені швидкості все одно не можна автоматично переносити на кожен промпт, конфігурацію пам’яті чи схему маршрутизації експертів.
Локальний ШІ впирається вже не лише у відеопам’ять
Це реальна інженерна зміна: обсяг VRAM перестає бути єдиним жорстким бар’єром для локальних MoE-моделей. Результат Qwen3.6-35B-A3B особливо показовий, адже інтерактивну швидкість отримано на ноутбучній RTX 4060 з 8 ГБ, а не на багатокартковому сервері.
Але обмеження пам’яті нікуди не зникли — вони стали спільною системою. Тепер критичні обсяг RAM, пропускна здатність PCIe, швидкість CPU та розподіл активності між експертами. На машині з невдалим балансом цих компонентів адаптивний планувальник може впертися в обмін даними задовго до гарних цифр у таблиці.
Я б насамперед дивився на затримку першого токена, стабільну швидкість у довгих сесіях і поведінку під агентним навантаженням. Середня кількість токенів за секунду показує потенціал, але не розкриває пауз під час зміни експертів і тиск на системну пам’ять.
FreeToken не скасовує апаратних обмежень. Він робить цікавішу річ: перестає вважати GPU єдиним місцем, де взагалі може існувати локальний інференс.