Thunderbolt 5 и ConnectX-5 Ex дали около 7 мкс
Thunderbolt 5ConnectX-5 ExRDMA
Что именно заработало через Thunderbolt 5
Меня здесь цепляет главный результат: ConnectX-5 Ex удалось запустить через внешний OWC Mercury Helios 5S, а заявленная задержка составила около 7 микросекунд. Именно такую цифру автор ashxhart приводит в публикации о выпущенном драйвере в X.
Связка выглядит необычно, но технически она вполне логична. Mercury Helios 5S переносит PCIe-трафик через Thunderbolt 5 и предоставляет установленной карте слот PCIe 4.0 x4. В спецификации OWC для тракта подключённой карты указана пропускная способность до 6000 МБ/с.
Сетевой адаптер ConnectX-5 Ex, согласно документации NVIDIA по ConnectX-5, поддерживает RDMA и RoCE. Эти механизмы позволяют обойти значительную часть обычного сетевого стека операционной системы, сократить копирование данных и передавать их через DMA. Поэтому микросекундная задержка здесь не выглядит магией, хотя дополнительный слой туннелирования PCIe через Thunderbolt делает результат особенно интересным.
Но 7 микросекунд нельзя записывать в характеристики корпуса или карты. В исходном сообщении не уточняется, измерена задержка в одну сторону или туда и обратно, каким был размер сообщения и как настроены узлы. На результат влияют драйвер, процессор, привязка прерываний к ядрам, кабель, MTU, сетевой партнёр и конфигурация RDMA.
Первым делом я бы искал распределение задержек, а не одну красивую цифру. Для чувствительной системы важны медиана, хвостовые значения и джиттер под нагрузкой. Без методики измерения это сильный инженерный сигнал, но ещё не воспроизводимый эталон.
Где такая связка действительно меняет расклад
Главное изменение простое: RDMA-сеть микросекундного класса потенциально становится доступна через внешний Thunderbolt 5-корпус, без встроенного серверного PCIe-слота. Это расширяет варианты для компактных рабочих станций и систем, где сетевую карту нельзя установить напрямую.
Для AI-инференса выигрыш возможен не в вычислении модели, а на границах конвейера: при доставке признаков, обмене между узлами и передаче результатов. Если вычисление занимает намного больше сетевой задержки, эффект растворится. Если же запросы короткие, распределённые и чувствительные к джиттеру, несколько лишних микросекунд уже имеют вес.
Узким местом остаётся весь тракт, а не отдельный Thunderbolt 5. Настоящий тест этой идеи начнётся там, где появятся повторяемая методика, нагрузка и хвостовые задержки. Одна цифра впечатляет; стабильность этой цифры решает всё.