Топологии GPU-фабрик
Сеть кластера ИИ строится слоями, и каждый слой использует свои интерконнекты — и свою оптику. Понимание слоёв объясняет, почему в кластере так много трансиверов и где плохой модуль вредит сильнее всего.
Scale-up и scale-out
| Scale-up | Scale-out | |
|---|---|---|
| Соединяет | GPU внутри сервера или стойки | серверы между собой |
| Технология | проприетарные линки GPU–GPU (например, NVLink/NVSwitch) | InfiniBand или Ethernet/RoCE |
| Среда | медные бэкплейны и кабели, всё чаще оптика между стойками | сменная оптика: 400G/800G OSFP, QSFP-DD |
| Полоса на GPU | наивысшая | высокая, разделяемая с фабрикой |
Сменные трансиверы живут в основном в слое scale-out — у каждого GPU-сервера несколько портов 400G/800G в сторону фабрики плюс отдельная фронтальная сеть и сеть хранения.
Fat-tree и неблокируемость
Scale-out-фабрика обычно fat-tree (Clos): leaf-коммутаторы подключают серверы, spine соединяют leaf, а аплинков leaf–spine достаточно, чтобы любой сервер говорил с любым на полной скорости (неблокируемость). Большинство оптики кластера — это линки leaf–spine и сервер–leaf: тысячи одинаковых модулей DR4/DR8.
Rail-optimized дизайн
В трафике обучения доминируют коллективные операции между GPU одного ранга на разных серверах. Rail-optimized топология это использует: GPU 0 каждого сервера подключён к leaf 0, GPU 1 — к leaf 1 и так далее, поэтому GPU одного ранга находятся в одном хопе, и коллективы никогда не пересекают spine. Следствие для оптики: сбой на одном «рельсе» затрагивает одну позицию GPU в каждом сервере — паттерн, который стоит узнавать.
Раздельные сети
Кластер обычно держит несколько физически раздельных фабрик:
- Вычислительная фабрика — GPU–GPU (IB или RoCE), самая большая и оптикоёмкая.
- Фабрика хранения — к параллельным файловым системам и объектному хранилищу, часто
Ethernet (сети хранения).
- Фронтальная / управляющая — доступ пользователей, оркестрация, телеметрия.
У каждой свой парк оптики и свои правила валидации вендора.
Почему один плохой линк так важен
Коллективная операция завершается со скоростью самого медленного участника. Один трансивер с деградирующим каналом — больше коррекций FEC, редкие повторы — растягивает хвостовую задержку каждого шага и может стоить измеримой доли пропускной способности всего кластера. Поэтому операторы ИИ ведут тренд поканального DDM по всему парку и меняют оптику проактивно (Трансиверы в кластерах ИИ).
В CodingBox
Квалифицируйте оптику на столе до ввода в рельс: идентификация по CMIS, поканальная база DDM на экране DDM и запись в базе кодов, чтобы история модуля была под рукой, когда рельс начнёт показывать ошибки.