Обзор сетей для ИИ
Обучение больших ИИ-моделей распределяет работу по множеству GPU на множестве серверов. Скорость обучения кластера часто задаёт сеть между ними, а не отдельный GPU — поэтому ИИ-фабрики опираются на оптические трансиверы с максимальной пропускной способностью.
Почему сеть критична
- Коллективные операции — GPU постоянно обмениваются градиентами и параметрами по
схеме all-to-all, создавая тяжёлый трафик восток–запад.
- Важна хвостовая задержка — шаг ждёт самый медленный линк, поэтому нужны
стабильно низкая задержка и доставка без потерь.
- Масштаб — тысячи GPU означают плотные коммутаторы высокой радиксности и огромное
число оптики.
Два стиля фабрики
- InfiniBand — давно принят в HPC, с RDMA и управлением потоком без потерь (см.
- Ethernet с RoCE — RDMA over Converged Ethernet, всё чаще применяется для ИИ на
масштабе поверх Ethernet без потерь.
Оптика
Линки ИИ обычно 400G и 800G, на модулях QSFP-DD и OSFP. Конкретный выбор интерконнекта и оптики — в материале Интерконнекты ИИ и оптика.
Действуют те же форм-факторы и управляющая память — CodingBox читает эти высокоскоростные модули, как и любые другие.