3 min de lecture

10 millions de jetons par seconde : record ou métrique trompeuse ?

инференсLLMбенчмарки

Une annonce de 10 millions de jetons par seconde ne signifie pas qu'un modèle fournit ce flux à un seul utilisateur. Il s'agit plus probablement d'un débit agrégé de cluster, de traitement par lots, de prefill ou d'une confusion avec le contexte long. La méthode, le matériel, la latence et le coût sont essentiels.

Ce qui se cache derrière 10 millions de jetons par seconde

Je ne qualifierais pas 10 millions de jetons par seconde de vitesse d'un modèle tant que l'on ne sait pas précisément ce qui a été mesuré et comment. Le point de départ est une publication de Rysana sur X, citée par User 144406. La discussion a logiquement soulevé des questions, et le coût d'une telle vitesse a même été comparé à un lingot d'or par million de jetons.

Le problème principal n'est pas le grand nombre, mais son dénominateur. Il peut s'agir du débit cumulé d'un cluster avec traitement par lots, de la vitesse de prefill, du traitement d'états mis en cache ou du decode d'une requête unique. Pour l'utilisateur, ces modes sont totalement différents, même si le marketing les résume à une seule unité : les jetons par seconde.

La confusion autour du contexte long est également révélatrice. Lightbits et Inferra annoncent la prise en charge d'un contexte de 10 millions de jetons sur matériel L40S, mais le résultat cité concerne le délai avant le premier jeton : 26 secondes contre 8,3 heures. C'est une accélération importante d'une étape précise, et non la génération de 10 millions de nouveaux jetons chaque seconde.

Pour donner un ordre de grandeur, la page de benchmarks NVIDIA indique 1 183 327 jetons par seconde pour DeepSeek R1 sur un système Vera Rubin NVL72. Le chiffre est immense, mais il concerne un système multiprocesseur spécialisé et reste sensiblement inférieur aux 10 millions évoqués.

Pourquoi ce record dit encore peu de chose sur l'usage réel

Sans configuration matérielle, taille de batch et distinction entre prefill et decode, ce record ne peut pas être transposé à une requête API ordinaire. Au 30 septembre 2026, le contexte disponible ne montre pas qu'un seul modèle génère 10 millions de jetons de sortie par seconde pour un utilisateur.

Sur le plan technique, trois éléments comptent : le délai avant le premier jeton, la vitesse de génération soutenue et le coût de traitement. Le throughput agrégé peut être un excellent indicateur d'utilisation d'un cluster tout en ne disant rien de la latence d'une session individuelle. Plus le batch est grand, plus le chiffre final impressionne et moins il reflète un usage interactif.

Ma conclusion est simple : ce résultat n'est pas forcément faux, mais sa formulation reste clairement ambiguë. Dans la course à l'inférence, le gagnant n'est pas celui qui affiche le plus grand nombre, mais celui qui étiquette le plus honnêtement les axes du graphique.

Nous avons déjà expliqué comment les réseaux de calcul confidentiel transforment les coûts et la capacité de l'inférence IA. Ce contexte aide à comprendre ce qu'exigerait concrètement une promesse de 10 millions de jetons par seconde.