Thunderbolt 5 et ConnectX-5 Ex atteignent environ 7 µs
Thunderbolt 5ConnectX-5 ExRDMA
Ce qui a réellement fonctionné via Thunderbolt 5
Le résultat principal est frappant : une ConnectX-5 Ex a pu fonctionner dans un OWC Mercury Helios 5S externe, avec une latence annoncée d'environ 7 microsecondes. C'est le chiffre cité par l'auteur ashxhart dans une publication X consacrée au pilote publié.
L'association est inhabituelle, mais elle est techniquement cohérente. Le Mercury Helios 5S transporte le trafic PCIe via Thunderbolt 5 et offre à la carte installée un emplacement PCIe 4.0 x4. OWC annonce jusqu'à 6000 Mo/s de bande passante pour le chemin de la carte connectée.
D'après la documentation NVIDIA sur ConnectX-5, l'adaptateur prend en charge RDMA et RoCE. Ces mécanismes permettent de contourner une large part de la pile réseau classique du système d'exploitation, de réduire les copies de données et de les transférer par DMA. Une latence de l'ordre de la microseconde n'a donc rien de magique, même si la couche supplémentaire de tunnel PCIe via Thunderbolt rend le résultat particulièrement intéressant.
Il ne faut toutefois pas transformer 7 microsecondes en caractéristique du boîtier ou de la carte. Le message d'origine ne précise ni s'il s'agit d'une mesure aller simple ou aller-retour, ni la taille des messages, ni la configuration des nœuds. Le pilote, le processeur, l'affinité des interruptions, le câble, la MTU, le pair réseau et la configuration RDMA influencent tous le résultat.
Je chercherais d'abord une distribution des latences plutôt qu'un seul chiffre séduisant. Pour un système sensible, la médiane, les valeurs de queue et la gigue en charge comptent. Sans protocole de mesure, il s'agit d'un signal d'ingénierie solide, mais pas encore d'une référence reproductible.
Où cette configuration peut réellement changer la donne
L'évolution essentielle est simple : un réseau RDMA de classe microseconde pourrait devenir accessible via un boîtier Thunderbolt 5 externe, sans emplacement PCIe serveur intégré. Cela élargit les possibilités pour les stations de travail compactes et les systèmes où une carte réseau ne peut pas être installée directement.
Pour l'inférence IA, le gain ne se situera peut-être pas dans le calcul du modèle, mais aux frontières du pipeline : livraison des caractéristiques, échanges entre nœuds et transfert des résultats. Si le calcul prend beaucoup plus de temps que la latence réseau, l'effet disparaît. Mais si les requêtes sont courtes, distribuées et sensibles à la gigue, quelques microsecondes supplémentaires comptent déjà.
Le goulot d'étranglement reste le chemin complet, pas Thunderbolt 5 pris isolément. Le véritable test commencera avec une méthode répétable, de la charge et des données sur les latences de queue. Un chiffre impressionne ; sa stabilité décide de tout.