Le post d’Alex Wang et la nouvelle pénurie de données
данные для ИИсинтетические данныеScale AI
Ce que l’on peut affirmer avec certitude sur la publication
Je ne prétendrais pas connaître le contenu du post : le texte exact de la publication d’Alex Wang sur X n’est pas disponible dans les éléments fournis. L’entrée indexée est datée du 2 octobre 2026 ; lui attribuer des formulations ou des conclusions précises relèverait donc de l’invention.
Le contexte disponible reste néanmoins très concret. Dans des entretiens connexes et des contenus de Scale AI, Wang évoque régulièrement le passage des données massives issues de l’internet ouvert vers des jeux de données propriétaires d’entreprise, des données produites par des experts pour des tâches avancées et des exemples synthétiques vérifiés par des humains.
Sur le plan technique, cela signifie que le goulot d’étranglement a changé. Il ne suffit pas de générer un nouveau volume de réponses plausibles : il faut des règles de sélection, des spécialistes du domaine, des contrôles d’erreurs et un dispositif d’évaluation qui ne récompense pas un modèle pour des absurdités formulées avec assurance.
L’idée de pipelines hybrides humain-IA ressort particulièrement. Le modèle aide à créer et à mettre les données à l’échelle, tandis que les personnes orientent le processus et vérifient la qualité. Il ne s’agit pas de supprimer l’annotation, mais de l’amener à un niveau plus complexe : évaluer des raisonnements, des réponses spécialisées et le comportement du système, plutôt que de simples étiquettes.
Pourquoi le choix du modèle ne résout plus le problème
La conséquence pratique dépasse un nouveau débat sur les modèles : l’avantage durable se déplace vers les données et les boucles de retour. Un même modèle de base peut produire des résultats profondément différents selon la qualité du corpus, le protocole d’évaluation et la manière dont les erreurs reviennent dans le pipeline.
Pour les équipes de développement, cela change les priorités. Je vérifierais d’abord la provenance des données, la couverture des cas rares, la cohérence des jugements d’experts et les protections contre l’accumulation d’erreurs synthétiques. Ce n’est qu’ensuite qu’il devient pertinent de discuter d’affinage ou de remplacement du modèle.
Pour Scale AI, cette thèse élargit logiquement son rôle, de l’annotation vers l’infrastructure de données et d’évaluation. Mais la tension d’ingénierie centrale demeure : les données synthétiques sont faciles à produire à grande échelle, alors que la confiance qu’on leur accorde l’est beaucoup moins.