CodingBox Документация

Кабелирование AI-кластера: счёт, расстояния, среда, приёмка

GPU-кластер — это в основном кабели. Восемь GPU в узле означают восемь линков scale-out 400G (или 800G) плюс управление и хранение; тысяча GPU означает тысячи оптических концов на двух-трёх ярусах коммутаторов, каждый — потенциальная остановка обучения. Здесь проекты фабрик из GPU-фабрик превращаются в счёт кабелей, классы дальности, выбор разъёмов и чек-лист установки.

Счёт линков

Для типичного узла на 8 GPU с одной NIC 400G на GPU, rail-оптимизированная двухярусная фабрика:

ПозицияФормула1 024 GPU (128 узлов)
Линки GPU → leafGPU × 11 024 × 400G
Линки leaf → spine (неблокирующие)= GPU → leaf1 024 × 400G
Оптические/кабельные концы (по два на линк)линки × 24 096
NIC хранения + управления2–4 на узелещё 256–512 линков
Запасная оптика (3–5 %)150–250

С двухпортовыми модулями коммутаторов NDR (2 × 400G на OSFP) счёт на стороне коммутатора вдвое меньше в модулях, но не в волокнах. Трёхярусные проекты добавляют ещё 1 024 линка spine → core на 1 024 GPU. Каждый из этих концов — трансивер или вилка кабеля с идентификацией и DDM (Надёжность линков и мониторинг).

Расстояния в rail-оптимизированной раскладке

СегментТипичное расстояниеСреда
NIC GPU → leaf, та же стойка≤ 2 мпассивный DAC (400G ≤ 2 м; 800G ≤ 1–1,5 м) — дешевле всего, ноль мощности, тяжёлый
NIC GPU → leaf, соседние стойки (rail-группы тянутся по ряду)3–10 мAEC (≤ 3–5 м) или AOC / SR-трансиверы по MMF
Leaf → spine, тот же зал10–100 мAOC до ~50–100 м; SR4/SR8 / VR на OM4 ≤ 50–100 м; DR4/DR8 на SMF 500 м — DR выигрывает на 400G+
Spine → core / между залами100 м – 2 кмDR4 / FR4 / 2×FR4 одномод
DCI между зданиями2–80 кмLR4, ZR/ZR+ (Когерент и дальняя связь)

Rail-оптимизированное кабелирование ставит GPU i каждого узла на leaf i, так что восемь кабелей узла расходятся к восьми разным leaf — большинство линков GPU → leaf покидают стойку, и доля DAC меньше, чем в классических ToR. Детали: Внутри кабелей.

Выбор разъёмов и волокна

ОптикаРазъёмВолокноПримечания
400G DR4 / 800G DR8MPO-12 APC / MPO-16 APC (или 2 × MPO-12)SMF, Base-8/Base-16APC везде на одномодовой параллельной; модули со штифтами, патч-корды без
400G/800G SR8 / VR8MPO-16 UPCOM4/OM550–100 м; дешевле оптика, дороже волокно за метр
400G FR4 / 2×FR4дуплекс LC / 2 × LCSMFменьше волокон, WDM внутри модуля
Двухпортовый OSFP NDR2 × MPO-12 APCSMFдва логических порта на модуль; сплит-кабели 1:2 / 1:4 (Кабелирование IB)
DAC / AECнетtwinaxидентификация на обоих концах

Полярность метода B от конца до конца для транков MPO; транки Base-8 для 4-канальной оптики (Breakout и кабелирование MPO).

Мощность и тепло одной только оптики

ОптикаМощностьНа 64-портовый коммутатор
400G DR4 QSFP-DD8–12 Вт0,5–0,8 кВт
800G DR8 / 2×FR4 OSFP14–18 Вт0,9–1,2 кВт
Конец AOC 400G3–5 Вт
Конец AEC 800G4–6 Вт
DAC0

Поэтому панелям коммутаторов нужен обдув спереди-назад без препятствий; OSFP с рёбрами в коммутаторах, плоские в NIC; жгуты кабелей не должны перекрывать забор воздуха (Питание и тепло, Температура и напряжение). Линейная оптика (LPO) режет мощность модуля примерно вдвое там, где хост её поддерживает (Модуляция и DSP).

Чек-лист установки и приёмки

  1. Входной контроль каждой оптики и конца кабеля: идентификация, суммы, живой DDM, сохранённая база (Производство и тестирование).
  2. Прогон новой оптики 24–72 ч при рабочей температуре до внедрения.
  3. Осмотр и чистка каждого MPO (наконечники микроскопа APC для APC) при установке; никогда не стыковать неосмотренный разъём.
  4. Маркировка обоих концов: узел/GPU/NIC ↔ leaf/порт; сплит-кабели по веткам.
  5. Радиус изгиба и разгрузка веса — лотки и жгуты для DAC/AEC, сервисные петли для волокна.
  6. Проверка при запуске: каждый линк на полной скорости и ширине, FEC включён, поканальный Rx в пределах 2 дБ от соседей, BER до FEC < 10⁻⁷ в простое (VDM и метрики FEC).
  7. Запись поканального DDM и идентификаций в менеджер фабрики / CMDB как базы.
  8. Запас по классам среды и разъёмам; держать прогнанным.

Частые ошибки установки

ОшибкаПризнак
Патч UPC на DR4 с APCвсе каналы ниже на 3–10 дБ, оба конца
Транк неверной полярностивсе каналы тёмные
Грязный MPOодин-два канала ниже; высокий BER до FEC на них
DAC слишком длинный для хосталинк на пониженной скорости или флапает
Перепутаны ветки сплит-кабеляпорты линкуются с чужими партнёрами; несовпадение топологии в менеджере фабрики
OSFP с рёбрами в плоской клетке (или наоборот)не садится / перегревается

В CodingBox

Входной контроль в таком масштабе — процесс, а не выборочная проверка: CodingBox читает каждый модуль или конец кабеля, проверяет идентификацию и суммы, записывает живой поканальный DDM как базу и хранит его по серийнику в базе кодов, так что модуль, позже снятый с флапающего порта, можно сравнить с его состоянием в первый день.