Jev local est 2,4 fois plus rapide avec DiffusionGemma
DiffusionGemmaJevлокальный инференс
Ce qu'a montré l'exécution locale de Jev
Le résultat le plus marquant est simple : Jev en local s'est révélé environ 2,4 fois plus rapide que la variante cloud une fois la latence réseau prise en compte. La publication de l'utilisateur 144406 mentionne aussi un retard d'environ 4% sur le jeu Banking77. Il s'agit d'un test réalisé par un utilisateur, et non d'un benchmark validé par NVIDIA ou Google.
La solution repose sur DiffusionGemma avec quantification NVFP4. La fiche NVIDIA sur Hugging Face indique 25,2 milliards de paramètres au total, dont 3,8 milliards actifs, alors que la présentation de Google utilise les chiffres arrondis de 26B au total et 4B actifs. L'architecture MoE n'active qu'une partie des paramètres à chaque passage.
DiffusionGemma se distingue aussi par son mode de génération : le modèle traite des blocs parallèles de 256 tokens au lieu d'un décodage strictement séquentiel de gauche à droite. Sa fiche annonce également un contexte de 256K, les appels de fonctions et un mode de raisonnement configurable. Pour l'inférence locale, la version NVFP4 est préparée pour vLLM, avec quantification des poids comme des activations.
L'estimation des dépenses est d'environ $30 par mois avec un Spark GPU et un profil de charge typique. Au moment de la discussion, il s'agissait d'un calcul tiers, pas d'un tarif officiel de NVIDIA ou Google. Le montant réel dépendra de la charge, du traitement par lots et du temps de fonctionnement du matériel.
Au 22 septembre 2026, je considérerais ces chiffres comme un signal préliminaire solide. Une comparaison équitable exige encore les mêmes prompts, la configuration matérielle, la taille des lots, la distribution des latences et une description complète de l'évaluation Banking77.
Pourquoi l'inférence locale est réellement intéressante
Le principal gain ne concerne pas seulement la vitesse moyenne : le réseau sort du chemin critique. Pour les classifieurs interactifs et les agents, cela peut offrir une latence plus prévisible, davantage de contrôle sur les données et moins de dépendance envers une API externe.
NVFP4 ne transforme toutefois pas n'importe quelle carte RTX en plateforme idéale. L'avantage natif du format est lié à Blackwell ; les RTX plus anciennes peuvent nécessiter un autre format, une gestion stricte de la mémoire ou un compromis sur le débit. Je vérifierais d'abord la VRAM, la bande passante mémoire et la qualité sur l'échantillon cible.
Un retard d'environ 4% sur Banking77 peut être acceptable ou critique selon les erreurs par classe. Le vrai enjeu n'est donc pas le séduisant chiffre de 2,4x, mais la capacité à préserver cet équilibre entre vitesse, coût et qualité au-delà d'un seul scénario utilisateur.