Inférence locale : 90 W face aux GPU coûteux
локальный инференсоблачный инференсGPU
Le local permet d'économiser là où on ne l'attend pas
Je ne réduirais pas le choix au seul prix du token. Dans l'exemple décrit, un système local consommait environ 90 W et permettait d'expérimenter sans craindre une facture cloud imprévue. Dans la discussion d'origine, le participant 144406 cite Spark comme exemple de cette configuration.
Il ne faut toutefois pas considérer 90 W comme une valeur universelle pour l'IA locale. Ce chiffre correspond à un mode d'utilisation, un modèle et un matériel précis ; ce n'est pas une référence pour servir de grands modèles. Plus les besoins en mémoire et en performances augmentent, plus l'installation locale passe vite d'un banc économe à une baie coûteuse qui exige aussi du refroidissement.
C'est là que commence le paradoxe de l'écosystème open-weight. Les sorties presque quotidiennes de modèles chinois élargissent le choix, tout en stimulant la demande de GPU dotés de beaucoup de mémoire. Au moment de la discussion, les prix des RTX PRO 6000 étaient passés de 11–13 000 à 16–17 000 dollars.
Le cloud supprime l'investissement initial, mais chaque session active est facturée. Les relevés de prix du milieu de l'année 2026 plaçaient les H200 autour de 4,50–5,50 dollars de l'heure aux tarifs standards et de 1,80–2,80 dollars via certaines offres spot. Pour des traitements lourds mais rares, ce calcul peut être plus pertinent que l'achat d'un accélérateur.
Le contraste apparaît clairement dans l'article d'Anthropic du 28 août 2026, “Automated researchers can reliably mitigate alignment failures”. Des H200 y étaient utilisées pour des chercheurs automatisés : il s'agit déjà d'une catégorie de tâches pour laquelle un mode local compact à 90 W n'est pas une alternative directe.
L'utilisation, et non l'idéologie, détermine désormais le choix
L'inférence locale l'emporte pour une activité continue, des données sensibles et la nécessité de contrôler entièrement l'environnement. Le cloud reste plus adapté aux charges irrégulières, aux pics soudains et aux expérimentations nécessitant temporairement des accélérateurs de la catégorie H200.
Le premier calcul doit aller au-delà de l'électricité et du tarif horaire. Le coût local inclut le prix du GPU, les périodes d'inactivité, le refroidissement, la maintenance et le risque d'obsolescence rapide. Le coût cloud inclut le stockage, le transfert de données et les heures perdues à cause d'un cycle de vie des ressources mal configuré.
La hausse des prix des RTX PRO 6000 montre que les modèles open-weight ne démocratisent pas seulement l'inférence. Ils déplacent la pénurie des API vers le matériel. La question centrale n'est plus de savoir où le modèle s'exécute, mais à quel point l'accélérateur acheté sera réellement utilisé.