2 хв читання

Локальний Jev став у 2,4 раза швидшим на DiffusionGemma

DiffusionGemmaJevлокальный инференс

Користувацький бенчмарк показав, що локальний Jev на DiffusionGemma працює приблизно у 2,4 раза швидше за хмарний варіант з урахуванням мережевої затримки. Якість на Banking77 відстала приблизно на 4%, а витрати на Spark GPU оцінили в $30 щомісяця. Це обнадійливий, але незалежний результат.

Що показав локальний запуск Jev

Тут привертає увагу простий результат: локальний Jev виявився приблизно у 2,4 раза швидшим за хмарний варіант, якщо врахувати мережеву затримку. У дописі користувача 144406 також зазначено відставання приблизно на 4% у наборі Banking77. Це користувацький тест, а не бенчмарк, підтверджений NVIDIA чи Google.

В основі лежить DiffusionGemma з NVFP4-квантуванням. У картці моделі NVIDIA на Hugging Face вказано 25,2 млрд параметрів загалом і 3,8 млрд активних, тоді як Google в огляді моделі використовує округлені значення 26B total і 4B active. Архітектура MoE дає змогу задіювати лише частину параметрів під час кожного проходу.

DiffusionGemma відрізняється і способом генерації: модель обробляє паралельні блоки по 256 токенів замість звичайного строго послідовного декодування зліва направо. Картка моделі також заявляє контекст 256K, підтримку викликів функцій і налаштовуваний режим міркування. Для локального інференсу варіант NVFP4 підготовлено для vLLM, причому квантуються і ваги, і активації.

Оцінка витрат становить близько $30 на місяць за використання Spark GPU та типового профілю навантаження. На момент обговорення це був сторонній розрахунок, а не офіційний тариф NVIDIA чи Google. Реальна сума залежатиме від навантаження, пакетної обробки та часу роботи обладнання.

Станом на 22 вересня 2026 року я б сприймав ці цифри як сильний попередній сигнал. Для чесного порівняння бракує однакових запитів, конфігурації обладнання, розміру батчу, розподілу затримок і повного опису оцінювання Banking77.

Чому локальний інференс тут справді цікавий

Головна перевага не лише в середній швидкості, а й у вилученні мережі з критичного шляху. Для інтерактивних класифікаторів та агентів це може означати передбачуванішу затримку, контроль над даними й меншу залежність від зовнішнього API.

Втім, NVFP4 не перетворює будь-яку RTX-карту на ідеальну платформу. Нативна перевага формату пов'язана з Blackwell, а старішим RTX може знадобитися інший формат, жорстке керування пам'яттю або компроміс щодо пропускної здатності. Насамперед варто перевірити VRAM, пропускну здатність пам'яті та якість саме на цільовій вибірці.

Відставання приблизно на 4% у Banking77 може бути прийнятним або критичним залежно від помилок в окремих класах. Справжнє питання не в гарному показнику 2,4 раза, а в тому, чи збережеться цей баланс швидкості, вартості та якості поза межами одного користувацького сценарію.

Раніше ми розглядали Rust LocalGPT — локального асистента в одному бінарному файлі для самостійного інференсу з постійною пам'яттю та HTTP API. Його модель розгортання дає корисний контекст для оцінки швидшого локального інференсу на рівні хмарної продуктивності.