CodingBox Документация

Топологии GPU-фабрик

Сеть кластера ИИ строится слоями, и каждый слой использует свои интерконнекты — и свою оптику. Понимание слоёв объясняет, почему в кластере так много трансиверов и где плохой модуль вредит сильнее всего.

Scale-up и scale-out

Scale-upScale-out
СоединяетGPU внутри сервера или стойкисерверы между собой
Технологияпроприетарные линки GPU–GPU (например, NVLink/NVSwitch)InfiniBand или Ethernet/RoCE
Средамедные бэкплейны и кабели, всё чаще оптика между стойкамисменная оптика: 400G/800G OSFP, QSFP-DD
Полоса на GPUнаивысшаявысокая, разделяемая с фабрикой

Сменные трансиверы живут в основном в слое scale-out — у каждого GPU-сервера несколько портов 400G/800G в сторону фабрики плюс отдельная фронтальная сеть и сеть хранения.

Fat-tree и неблокируемость

Scale-out-фабрика обычно fat-tree (Clos): leaf-коммутаторы подключают серверы, spine соединяют leaf, а аплинков leaf–spine достаточно, чтобы любой сервер говорил с любым на полной скорости (неблокируемость). Большинство оптики кластера — это линки leaf–spine и сервер–leaf: тысячи одинаковых модулей DR4/DR8.

Rail-optimized дизайн

В трафике обучения доминируют коллективные операции между GPU одного ранга на разных серверах. Rail-optimized топология это использует: GPU 0 каждого сервера подключён к leaf 0, GPU 1 — к leaf 1 и так далее, поэтому GPU одного ранга находятся в одном хопе, и коллективы никогда не пересекают spine. Следствие для оптики: сбой на одном «рельсе» затрагивает одну позицию GPU в каждом сервере — паттерн, который стоит узнавать.

Раздельные сети

Кластер обычно держит несколько физически раздельных фабрик:

  • Вычислительная фабрика — GPU–GPU (IB или RoCE), самая большая и оптикоёмкая.
  • Фабрика хранения — к параллельным файловым системам и объектному хранилищу, часто

Ethernet (сети хранения).

  • Фронтальная / управляющая — доступ пользователей, оркестрация, телеметрия.

У каждой свой парк оптики и свои правила валидации вендора.

Почему один плохой линк так важен

Коллективная операция завершается со скоростью самого медленного участника. Один трансивер с деградирующим каналом — больше коррекций FEC, редкие повторы — растягивает хвостовую задержку каждого шага и может стоить измеримой доли пропускной способности всего кластера. Поэтому операторы ИИ ведут тренд поканального DDM по всему парку и меняют оптику проактивно (Трансиверы в кластерах ИИ).

В CodingBox

Квалифицируйте оптику на столе до ввода в рельс: идентификация по CMIS, поканальная база DDM на экране DDM и запись в базе кодов, чтобы история модуля была под рукой, когда рельс начнёт показывать ошибки.