3 min de lectura

Jev local fue 2,4 veces más rápido con DiffusionGemma

DiffusionGemmaJevлокальный инференс

Un benchmark realizado por un usuario indica que Jev local con DiffusionGemma fue unas 2,4 veces más rápido que una alternativa en la nube al incluir la latencia de red. La calidad en Banking77 quedó cerca de un 4% por detrás y el coste estimado de Spark GPU fue de $30 mensuales.

Qué mostró la ejecución local de Jev

El resultado más llamativo es sencillo: Jev local fue aproximadamente 2,4 veces más rápido que la alternativa en la nube al tener en cuenta la latencia de red. La publicación del usuario 144406 también señala una diferencia de alrededor del 4% en el conjunto Banking77. Es una prueba de usuario, no un benchmark confirmado por NVIDIA o Google.

La base es DiffusionGemma con cuantización NVFP4. La ficha de NVIDIA en Hugging Face indica 25.200 millones de parámetros totales y 3.800 millones activos, mientras que el resumen de Google utiliza las cifras redondeadas de 26B totales y 4B activos. La arquitectura MoE permite activar solo una parte de los parámetros en cada pasada.

DiffusionGemma también se diferencia por su generación: procesa bloques paralelos de 256 tokens en lugar de depender de una decodificación estrictamente secuencial de izquierda a derecha. La ficha del modelo anuncia además un contexto de 256K, llamadas a funciones y un modo de razonamiento configurable. Para inferencia local, la variante NVFP4 está preparada para vLLM y cuantiza tanto los pesos como las activaciones.

La estimación de gasto ronda los $30 mensuales al usar una Spark GPU con un perfil de carga típico. En el momento del debate, era un cálculo independiente y no una tarifa oficial de NVIDIA o Google. El importe real dependerá de la carga, el procesamiento por lotes y el tiempo de funcionamiento del equipo.

A fecha del 22 de septiembre de 2026, tomaría estas cifras como una señal preliminar sólida. Para una comparación justa faltan prompts idénticos, configuración de hardware, tamaño de lote, distribución de latencias y una explicación completa de la evaluación en Banking77.

Por qué la inferencia local resulta interesante

La principal ventaja no es solo la velocidad media, sino eliminar la red de la ruta crítica. Para clasificadores interactivos y agentes, esto puede aportar una latencia más predecible, mayor control de los datos y menor dependencia de una API externa.

Sin embargo, NVFP4 no convierte cualquier tarjeta RTX en una plataforma ideal. La ventaja nativa del formato está vinculada a Blackwell; las RTX más antiguas pueden requerir otro formato, una gestión estricta de memoria o sacrificar rendimiento. Primero revisaría la VRAM, el ancho de banda de memoria y la calidad sobre la muestra objetivo.

Una diferencia cercana al 4% en Banking77 puede ser aceptable o crítica según los errores en clases concretas. La cuestión real no es el atractivo 2,4x, sino si este equilibrio entre velocidad, coste y calidad se mantiene fuera de un único escenario de usuario.

Anteriormente analizamos Rust LocalGPT, un asistente local de un solo binario para inferencia autoalojada, con memoria persistente y una API HTTP. Su modelo de despliegue aporta un contexto útil para evaluar inferencia local más rápida con rendimiento comparable al de la nube.