Qwen3.8-Flash-Next : 177B paramètres, 6,6B actifs
QwenMixture of ExpertsAI-агенты
Ce que recouvre réellement le chiffre de 177B
Ce qui retient l’attention n’est pas seulement le chiffre de 177B, mais l’écart entre la taille totale et la taille active du modèle. La publication de l’utilisateur 144406 indique que seuls 6,6B paramètres sont utilisés pour chaque jeton, les autres faisant partie du pool partagé d’experts MoE.
Des fiches publiques d’Ollama associent cet ensemble de caractéristiques à Qwen3.8-Flash-Next, de l’équipe Qwen, et présentent le modèle comme destiné au raisonnement, aux appels d’outils, au code et aux scénarios agentiques. Toutefois, les documents disponibles ne contiennent ni fiche officielle du développeur ni tableau de benchmarks. Son identification et les affirmations sur son usage doivent donc être considérées comme provisoires.
Le mécanisme MoE est ici très concret : un routeur sélectionne un nombre limité d’experts pour chaque jeton au lieu de calculer l’intégralité du réseau. Il devient ainsi possible de conserver un vaste ensemble de paramètres sans exécuter les 177B à chaque étape de génération. Mais 6,6B paramètres actifs ne rendent pas le modèle équivalent à tous égards à un modèle dense de cette taille : l’ensemble complet des poids influence toujours les besoins d’hébergement et de déploiement.
Une légère divergence existe sur le contexte. La publication d’origine évoque 256K, tandis que des fiches publiques tierces indiquent 262K tout en le présentant comme un contexte de la classe 256K. Une autre publication comparative situe la sortie en août 2026 ; ces caractéristiques doivent donc être lues comme l’état du modèle au moment de cette annonce.
Pourquoi cette configuration intéresse les agents
L’intérêt pratique de cette architecture réside dans un équilibre potentiellement plus favorable entre spécialisation et calcul. C’est particulièrement important pour les agents IA : planification, génération de code et appels d’outils créent de longues chaînes où le coût et la latence de chaque jeton supplémentaire s’accumulent rapidement.
Avant de retenir le rapport séduisant entre 177B et 6,6B, je vérifierais le débit réel sur long contexte, les besoins en mémoire et la stabilité du routage des experts. Sans résultats officiels, il est impossible d’affirmer que le modèle est plus rapide que ses concurrents ou qu’il écrit mieux le code. L’architecture explique une efficacité possible, mais ne la prouve pas.
Si les propriétés annoncées se confirment, Qwen3.8-Flash-Next sera intéressante non par une taille record, mais par la faible part de cette taille qu’elle doit activer. La grande question ouverte ne porte plus sur le nombre de paramètres, mais sur la qualité des décisions prises par le routeur.