Локальный Jev ускорился в 2,4 раза на DiffusionGemma
DiffusionGemmaJevлокальный инференс
Что показал локальный запуск Jev
Меня здесь цепляет простой результат: локальный Jev оказался примерно в 2,4 раза быстрее облачного варианта, если учитывать сетевую задержку. В публикации пользователя 144406 также указано отставание примерно на 4% на наборе Banking77. Это пользовательский тест, а не подтвержденный NVIDIA или Google бенчмарк.
Под капотом работает DiffusionGemma с NVFP4-квантизацией. В карточке модели NVIDIA на Hugging Face указаны 25,2 млрд параметров всего и 3,8 млрд активных, тогда как Google в обзоре модели использует округленную формулировку 26B total и 4B active. Архитектура MoE позволяет задействовать лишь часть параметров на каждом проходе.
DiffusionGemma отличается и способом генерации: модель обрабатывает параллельные блоки по 256 токенов вместо обычного строго последовательного декодирования слева направо. Карточка модели также заявляет контекст 256K, поддержку вызова функций и настраиваемый режим рассуждения. Для локального инференса NVFP4-вариант подготовлен под vLLM, причем квантизованы и веса, и активации.
Оценка расходов составляет около $30 в месяц при использовании Spark GPU и типичном профиле нагрузки. На момент обсуждения это сторонний расчет, а не официальный тариф NVIDIA или Google. Реальная сумма будет зависеть от нагрузки, пакетной обработки и времени работы оборудования.
На 22 сентября 2026 года я бы воспринимал эти цифры именно как сильный предварительный сигнал. Для честного сравнения мне не хватает одинаковых запросов, аппаратной конфигурации, размера батча, распределения задержек и полного описания оценки Banking77.
Почему локальный инференс здесь действительно интересен
Главный выигрыш не только в средней скорости, а в устранении сети из критического пути. Для интерактивных классификаторов и агентов это может дать более предсказуемую задержку, контроль над данными и меньше зависимости от внешнего API.
Но NVFP4 не превращает любую RTX-карту в идеальную платформу. Нативное преимущество формата связано с Blackwell, а более старым RTX могут потребоваться другой формат, жесткое управление памятью или компромисс по пропускной способности. Я бы первым делом смотрел на VRAM, полосу памяти и качество именно на целевой выборке.
Отставание около 4% на Banking77 может быть приемлемым или критичным в зависимости от ошибок по отдельным классам. Поэтому настоящая интрига не в красивых 2,4 раза, а в том, сохранится ли этот баланс скорости, стоимости и качества вне одного пользовательского сценария.