Локальний Jev став у 2,4 раза швидшим на DiffusionGemma
DiffusionGemmaJevлокальный инференс
Що показав локальний запуск Jev
Тут привертає увагу простий результат: локальний Jev виявився приблизно у 2,4 раза швидшим за хмарний варіант, якщо врахувати мережеву затримку. У дописі користувача 144406 також зазначено відставання приблизно на 4% у наборі Banking77. Це користувацький тест, а не бенчмарк, підтверджений NVIDIA чи Google.
В основі лежить DiffusionGemma з NVFP4-квантуванням. У картці моделі NVIDIA на Hugging Face вказано 25,2 млрд параметрів загалом і 3,8 млрд активних, тоді як Google в огляді моделі використовує округлені значення 26B total і 4B active. Архітектура MoE дає змогу задіювати лише частину параметрів під час кожного проходу.
DiffusionGemma відрізняється і способом генерації: модель обробляє паралельні блоки по 256 токенів замість звичайного строго послідовного декодування зліва направо. Картка моделі також заявляє контекст 256K, підтримку викликів функцій і налаштовуваний режим міркування. Для локального інференсу варіант NVFP4 підготовлено для vLLM, причому квантуються і ваги, і активації.
Оцінка витрат становить близько $30 на місяць за використання Spark GPU та типового профілю навантаження. На момент обговорення це був сторонній розрахунок, а не офіційний тариф NVIDIA чи Google. Реальна сума залежатиме від навантаження, пакетної обробки та часу роботи обладнання.
Станом на 22 вересня 2026 року я б сприймав ці цифри як сильний попередній сигнал. Для чесного порівняння бракує однакових запитів, конфігурації обладнання, розміру батчу, розподілу затримок і повного опису оцінювання Banking77.
Чому локальний інференс тут справді цікавий
Головна перевага не лише в середній швидкості, а й у вилученні мережі з критичного шляху. Для інтерактивних класифікаторів та агентів це може означати передбачуванішу затримку, контроль над даними й меншу залежність від зовнішнього API.
Втім, NVFP4 не перетворює будь-яку RTX-карту на ідеальну платформу. Нативна перевага формату пов'язана з Blackwell, а старішим RTX може знадобитися інший формат, жорстке керування пам'яттю або компроміс щодо пропускної здатності. Насамперед варто перевірити VRAM, пропускну здатність пам'яті та якість саме на цільовій вибірці.
Відставання приблизно на 4% у Banking77 може бути прийнятним або критичним залежно від помилок в окремих класах. Справжнє питання не в гарному показнику 2,4 раза, а в тому, чи збережеться цей баланс швидкості, вартості та якості поза межами одного користувацького сценарію.