10 millones de tokens por segundo: ¿récord o métrica engañosa?
инференсLLMбенчмарки
Qué se esconde detrás de 10 millones de tokens por segundo
No llamaría velocidad de un modelo a 10 millones de tokens por segundo hasta saber exactamente qué se midió y cómo. El punto de partida fue una publicación de Rysana en X, citada por User 144406. La discusión generó dudas razonables, y el coste de esa velocidad llegó a compararse con un lingote de oro por millón de tokens.
El problema central no es la cifra enorme, sino el denominador. Puede tratarse del rendimiento agregado de un clúster con procesamiento por lotes, de la velocidad de prefill, del procesamiento de estados en caché o de la decodificación de una sola solicitud. Para el usuario, estos modos son muy distintos, aunque el marketing los agrupe bajo la misma unidad: tokens por segundo.
También hay una confusión ilustrativa con el contexto largo. Lightbits e Inferra anuncian compatibilidad con un contexto de 10 millones de tokens en hardware L40S, pero el resultado citado corresponde al tiempo hasta el primer token: 26 segundos frente a 8,3 horas. Es una gran aceleración de una fase concreta, no la generación de 10 millones de tokens nuevos cada segundo.
Como referencia, la página de benchmarks de NVIDIA indica 1.183.327 tokens por segundo para DeepSeek R1 en un sistema Vera Rubin NVL72. Es una cifra enorme, pero pertenece a un sistema multiprocesador especializado y sigue estando claramente por debajo de los 10 millones discutidos.
Por qué este récord aún dice poco sobre el uso real
Sin la configuración de hardware, el tamaño del lote y la separación entre prefill y decode, este récord no se puede trasladar a una solicitud API normal. A 30 de septiembre de 2026, el contexto disponible no demuestra que un solo modelo produzca 10 millones de tokens de salida por segundo para un usuario.
Desde el punto de vista de ingeniería importan tres aspectos: la latencia hasta el primer token, la velocidad sostenida de generación y el coste de procesamiento. El throughput agregado puede medir muy bien la utilización del clúster y, al mismo tiempo, no decir nada sobre la latencia de una sesión individual. Cuanto mayor es el lote, más espectacular parece la cifra y menos relación tiene con el uso interactivo.
Mi conclusión es sencilla: no tiene por qué ser un resultado falso, pero por ahora es una formulación ambigua. En la carrera de la inferencia no gana quien muestra el número más grande, sino quien etiqueta los ejes del gráfico con más honestidad.