gpt-oss-120B atteint 3 000 tokens/s sur Cerebras
gpt-oss-120BCerebrasинференс LLM
D'où vient le chiffre de 3 000 tokens par seconde
Il faut d'abord distinguer le modèle de la machine : les quelque 3 000 tokens/s sont annoncés pour gpt-oss-120B précisément sur l'infrastructure Cerebras. C'est le résultat d'un déploiement particulier, et non une vitesse que le modèle affichera automatiquement sur n'importe quel serveur. Lors de l'annonce, Cerebras indiquait cette mesure dans sa documentation d'inférence, y compris pour le streaming avec le contexte complet de 128k.
Dans sa publication de lancement, OpenAI décrit gpt-oss-120B comme un modèle MoE de 120 milliards de paramètres. Il compte 36 couches et 128 experts par couche, mais seulement quatre experts sont activés pour un token donné. Cette parcimonie réduit le volume de calcul par rapport à un modèle dense de taille totale comparable.
L'autre partie de l'équation concerne le matériel. Cerebras explique cette accélération par son architecture wafer-scale, qui évite les limites habituelles de bande passante mémoire des GPU et les surcoûts de communication entre accélérateurs. C'est ce qui rend ce chiffre intéressant : il ne s'agit pas seulement d'un checkpoint optimisé, mais d'un modèle associé à une pile d'inférence spécialisée.
À titre de comparaison, des résultats indépendants cités placent la vitesse de pointe de gpt-oss-120B autour de 511 tokens/s sur un H100 et de 849 tokens/s sur un H200. Cette comparaison ne prouve pas une supériorité dans tous les modes, mais montre clairement la dépendance au matériel. Il faut aussi examiner le délai avant le premier token, la longueur d'entrée, les requêtes concurrentes et le débit soutenu plutôt que le seul pic.
Pourquoi les agents ressentiront la différence en premier
Le changement principal est simple : la génération cesse d'être l'étape la plus lente de la boucle agentique. Quand le modèle produit vite un raisonnement ou une commande, l'agent peut passer plus tôt à la recherche, à l'exécution de code ou à l'appel d'outil suivant. L'effet est particulièrement visible dans les longues chaînes, où un petit délai se répète de nombreuses fois.
Cela rend plus réalistes les assistants interactifs de programmation, l'analyse rapide de documents et les chaînes de recherche en plusieurs étapes. Le contexte long devient lui aussi plus exploitable : prendre en charge 128k ne suffit pas si l'utilisateur doit attendre la génération après une entrée volumineuse.
Toutefois, 3 000 tokens/s ne disent rien de la qualité du raisonnement, du coût d'une requête ou du comportement sous charge. Si le délai avant le premier token ou la concurrence entre sessions augmente, un beau chiffre de pointe perd vite son attrait. Le vrai cap n'est pas un record de vitesse, mais la capacité à la maintenir dans une boucle agentique réelle.