Що насправді розкрив Kimi K3
Найважливіше: Kimi K3 виглядає не як «ще одна велика відкрита модель», а як дуже великий MoE-реліз, який у доступних матеріалах описують як 2.8 трильйона загальних параметрів. І ось тут виплив неприємний для чуток момент: активна частина у неї, згідно з описами, не 50B, а може сягати приблизно 100B залежно від того, як рахувати active-equivalent.
Я б спирався не на перекази в чатах, а на картку моделі на Hugging Face та матеріали Moonshot AI, тому що саме там важливий контекст формулювання. У доступному зведенні фігурують 896 експертів і 16 активних експертів на токен, а це вже пояснює, чому навколо цифри активних параметрів почалася плутанина.
Тобто суперечка не про те, велика модель чи ні. Суперечка про те, який саме еквівалент sparse-активації вважати чесним: близько 50B за однією інтерпретацією чи ближче до 100B за іншою. Для інженерної розмови це не косметика, а різниця в очікуваннях щодо якості, затримки й вимог до інфраструктури.
Ще один важливий факт із доступних матеріалів: моделі приписують контекст 1 048 576 токенів і нативну мультимодальну підтримку. Якщо це справді так у релізі відкритих ваг, то Kimi K3 цікавий не тільки як модель для міркувань, а й як основа для довгих агентних сценаріїв, кодових пайплайнів та безпекової аналітики з великим обсягом вхідних даних.
Чому це змінює розклад
Так, це серйозний зсув. Коли у відкриту екосистему приходить модель такого класу, змінюється не лише доступ до якості, а й сам поріг для автономних систем, які раніше мали сенс майже виключно на закритих API.
Мене тут найбільше цікавлять дві речі. Перша: наскільки стабільно Kimi K3 тримає довгий контекст у реальних агентних робочих процесах, а не в гарній табличці. Друга: що відбувається з безпекою, коли відкриті ваги поєднуються із сильним міркуванням та зовнішніми інструментами без хмарних обмежень провайдера.
Бенчмарки в доступних матеріалах виглядають дуже сильними, зокрема SWE-bench Verified, FrontierSWE і Terminal-Bench 2.1, але я б не робив із цього культ. Для мене головний сигнал простіший: якщо активний масштаб справді ближче до 100B, то це вже не історія про «майже наздогнали», а про те, що відкриті ваги впритул наблизилися до зони, де починають ламатися старі звички щодо розриву між відкритими й закритими моделями.
І ось це вже не чутка. Це архітектурний факт, який доведеться враховувати всім, хто досі оцінював відкриті моделі за вчорашньою шкалою.