2 мин чтения

Локальный Jev ускорился в 2,4 раза на DiffusionGemma

DiffusionGemmaJevлокальный инференс

Пользовательский бенчмарк показал, что локальный Jev на DiffusionGemma работает примерно в 2,4 раза быстрее облачного варианта с учетом сетевой задержки. На Banking77 качество отстало примерно на 4%, а расходы на Spark GPU оценили в $30 в месяц. Это перспективный, но пока независимый результат.

Что показал локальный запуск Jev

Меня здесь цепляет простой результат: локальный Jev оказался примерно в 2,4 раза быстрее облачного варианта, если учитывать сетевую задержку. В публикации пользователя 144406 также указано отставание примерно на 4% на наборе Banking77. Это пользовательский тест, а не подтвержденный NVIDIA или Google бенчмарк.

Под капотом работает DiffusionGemma с NVFP4-квантизацией. В карточке модели NVIDIA на Hugging Face указаны 25,2 млрд параметров всего и 3,8 млрд активных, тогда как Google в обзоре модели использует округленную формулировку 26B total и 4B active. Архитектура MoE позволяет задействовать лишь часть параметров на каждом проходе.

DiffusionGemma отличается и способом генерации: модель обрабатывает параллельные блоки по 256 токенов вместо обычного строго последовательного декодирования слева направо. Карточка модели также заявляет контекст 256K, поддержку вызова функций и настраиваемый режим рассуждения. Для локального инференса NVFP4-вариант подготовлен под vLLM, причем квантизованы и веса, и активации.

Оценка расходов составляет около $30 в месяц при использовании Spark GPU и типичном профиле нагрузки. На момент обсуждения это сторонний расчет, а не официальный тариф NVIDIA или Google. Реальная сумма будет зависеть от нагрузки, пакетной обработки и времени работы оборудования.

На 22 сентября 2026 года я бы воспринимал эти цифры именно как сильный предварительный сигнал. Для честного сравнения мне не хватает одинаковых запросов, аппаратной конфигурации, размера батча, распределения задержек и полного описания оценки Banking77.

Почему локальный инференс здесь действительно интересен

Главный выигрыш не только в средней скорости, а в устранении сети из критического пути. Для интерактивных классификаторов и агентов это может дать более предсказуемую задержку, контроль над данными и меньше зависимости от внешнего API.

Но NVFP4 не превращает любую RTX-карту в идеальную платформу. Нативное преимущество формата связано с Blackwell, а более старым RTX могут потребоваться другой формат, жесткое управление памятью или компромисс по пропускной способности. Я бы первым делом смотрел на VRAM, полосу памяти и качество именно на целевой выборке.

Отставание около 4% на Banking77 может быть приемлемым или критичным в зависимости от ошибок по отдельным классам. Поэтому настоящая интрига не в красивых 2,4 раза, а в том, сохранится ли этот баланс скорости, стоимости и качества вне одного пользовательского сценария.

Ранее мы разбирали Rust LocalGPT — локального ассистента в одном бинарном файле для самостоятельного инференса с постоянной памятью и HTTP API. Его модель развертывания помогает оценить более быстрый локальный инференс на уровне облачной производительности.