Union Alpha et Laguna en tête d’un test inachevé
AI-моделиLLMтестирование моделей
Ce que le premier essai des modèles a révélé
Je ne parlerais pas encore de classement, mais le premier constat est déjà intéressant : Union Alpha et Laguna-S-2.1 se sont mieux comportés que les autres. La source principale n’est ni une fiche de modèle ni un benchmark standardisé, mais les notes d’un développeur issues d’une discussion publiée sur un essai réel resté inachevé.
Le test réunissait Union Alpha, Nex-N2.5-Pro, Dots-3-Note, Laguna-S-2.1, Cohere North-mini-code, Nemotron-3-Ultra, Gemma-4-31B et GLM-5.2. Ce dernier fonctionnait sans tool calling et avec une fenêtre de contexte de 32K. L’essai a dû être interrompu à cause d’un orage et de la déconnexion des ordinateurs du secteur ; les résultats ne reflètent donc que la situation au moment de l’arrêt.
Union Alpha était lent, mais continuait de fonctionner. Laguna-S-2.1 semblait convaincant sur le plan qualitatif, mais un fournisseur instable lui a fait défaut. Cette distinction est importante : dans un usage concret, un modèle qui répond un peu moins bien mais reste disponible de façon prévisible peut parfois être plus utile qu’un modèle plus puissant derrière une API peu fiable.
Nex-N2.5-Pro a reçu une appréciation prudente de modèle prometteur. Cohere North-mini-code a semblé faible, Dots-3-Note échouait sur les contextes étendus, et aucune conclusion n’a pu être tirée pour Nemotron-3-Ultra en raison de l’instabilité de son fournisseur. Gemma-4-31B et GLM-5.2 ont mal fonctionné durant cet essai, sans que les causes soient analysées séparément.
La discussion a aussi formulé l’hypothèse qu’un autre système, JEV, pourrait reposer sur Qwen 2.5 14B, la fenêtre de 32K étant citée comme indice indirect. Il s’agit d’une reconstruction OSINT, et non d’une architecture confirmée. Le participant n’avait pas encore testé JEV à ce stade.
Pourquoi la stabilité compte plus qu’une belle liste de modèles
La principale leçon pratique est simple : un tel essai ne mesure pas uniquement l’intelligence d’un modèle, mais toute la chaîne qui mène à sa réponse. Le fournisseur, la latence, la conservation d’un contexte long et la disponibilité du tool calling peuvent modifier le résultat plus fortement que les écarts de qualité de génération abstraite.
Union Alpha gagne ce tour préliminaire non par sa vitesse, mais parce qu’il a continué à répondre. Laguna-S-2.1 semble être un candidat solide, mais son accès instable le rend risqué pour de longues tâches agentiques. Dots-3-Note a déjà mis en évidence une limite plus précise : les problèmes apparaissent quand le contexte grandit.
Lors du prochain essai, je commencerais par séparer les erreurs du modèle de celles du fournisseur, puis je répéterais les mêmes tâches avec une longueur de contexte fixe. Sinon, une API faible peut facilement être prise pour une LLM faible, et une bonne réponse isolée pour une qualité durable.
Ce n’est pas un verdict final, mais un instantané utile de la réalité de l’ingénierie : un modèle se choisit dans le cadre d’un système complet, et le nom affiché sur un endpoint en dit souvent moins que son comportement après plusieurs heures de travail.