CodingBox Документация

Обзор сетей для ИИ

Обучение больших ИИ-моделей распределяет работу по множеству GPU на множестве серверов. Скорость обучения кластера часто задаёт сеть между ними, а не отдельный GPU — поэтому ИИ-фабрики опираются на оптические трансиверы с максимальной пропускной способностью.

Почему сеть критична

  • Коллективные операции — GPU постоянно обмениваются градиентами и параметрами по

схеме all-to-all, создавая тяжёлый трафик восток–запад.

  • Важна хвостовая задержка — шаг ждёт самый медленный линк, поэтому нужны

стабильно низкая задержка и доставка без потерь.

  • Масштаб — тысячи GPU означают плотные коммутаторы высокой радиксности и огромное

число оптики.

Два стиля фабрики

  • InfiniBand — давно принят в HPC, с RDMA и управлением потоком без потерь (см.

InfiniBand).

  • Ethernet с RoCE — RDMA over Converged Ethernet, всё чаще применяется для ИИ на

масштабе поверх Ethernet без потерь.

Оптика

Линки ИИ обычно 400G и 800G, на модулях QSFP-DD и OSFP. Конкретный выбор интерконнекта и оптики — в материале Интерконнекты ИИ и оптика.

Действуют те же форм-факторы и управляющая память — CodingBox читает эти высокоскоростные модули, как и любые другие.