Сеть для кластера искусственного интеллекта на коммутаторах Huawei CloudEngine
Фабрика кластера строится без потерь кадров, с равномерным распределением потоков и запасом полосы. Разбираем механизмы управления перегрузкой, расчёт числа коммутаторов и состав поставки.
В кластере для обучения моделей сеть перестаёт быть вспомогательной подсистемой. Вычислительные узлы обмениваются градиентами после каждого шага, и пока обмен не завершён, ускорители простаивают. Потеря даже доли процента кадров вызывает повторную передачу, а вместе с ней — задержку всей группы узлов. Поэтому фабрика для кластера строится иначе, чем обычная сеть дата-центра: без потерь кадров, с равномерным распределением потоков и с запасом полосы на каждом направлении.
Разберём, чем сеть кластера отличается от корпоративной, какие механизмы обеспечивают передачу без потерь, как считается число коммутаторов и портов и какие данные нужны для расчёта фабрики. Оборудование лежит в разделе коммутаторов Huawei CloudEngine.
Чем сеть кластера отличается от обычной сети дата-центра
- Характер трафика. Вместо множества мелких разнонаправленных потоков — редкие, но огромные передачи между всеми узлами одновременно. Пиковая нагрузка приходится на все порты сразу.
- Чувствительность к потерям. Протоколы обмена памятью между узлами рассчитаны на сеть без потерь: повторная передача обходится дороже, чем в обычной сети, потому что останавливает синхронную операцию всей группы.
- Требование к задержке. Значение имеет не средняя задержка, а худшая из наблюдаемых: шаг обучения завершается по самому медленному узлу.
- Распределение потоков. Обычный алгоритм балансировки раскладывает потоки по хеш-функции, и несколько крупных передач попадают на один канал. В кластере это сразу видно как падение производительности.
- Отдельная сеть управления и хранения. Фабрика обмена между ускорителями строится отдельно от сети доступа к серверам и хранилищу.
Механизмы передачи без потерь
| Механизм | Что делает | Что настраивается | Риск при неверной настройке |
|---|---|---|---|
| Управление потоком по классам трафика | приостанавливает передачу класса вместо отбрасывания кадров | классы, пороги буфера, сквозная согласованность на всех участках | распространение остановки по всей фабрике |
| Явное уведомление о перегрузке | просит отправителя снизить темп до переполнения буфера | пороги маркировки, реакция сетевых адаптеров узлов | поздняя реакция и всплески потерь |
| Динамическое распределение буфера | отдаёт память порту, который в данный момент перегружен | доли буфера по классам и портам | нехватка буфера при одновременном пике |
| Балансировка по состоянию каналов | раскладывает крупные потоки с учётом текущей загрузки | режим распределения на коммутаторах фабрики | неравномерная загрузка восходящих каналов |
| Приоритизация классов | отделяет обмен между ускорителями от управления и хранения | разметка на узлах и обработка на коммутаторах | служебный трафик мешает обмену градиентами |
Ключевое требование — сквозная согласованность настроек. Классы трафика и пороги задаются одинаково на сетевых адаптерах узлов и на всех коммутаторах пути. Одно устройство с настройками по умолчанию сводит на нет работу остальных.
Как считается фабрика по числу узлов
- Берётся число ускорителей в узле и число сетевых портов, которые они используют. Обычно каждому ускорителю выделяется отдельный порт фабрики.
- Считается общее число портов доступа: узлы × порты на узел. Это определяет количество коммутаторов нижнего уровня.
- Проверяется соотношение нисходящей и восходящей полосы. Для кластера обучения оно берётся один к одному: сколько полосы приходит от узлов, столько должно уходить наверх.
- Считается верхний уровень фабрики: число коммутаторов определяется требуемой суммарной полосой между группами стоек.
- Отдельно считаются сеть управления, сеть доступа к хранилищу и подключение к корпоративной сети — это ещё один комплект коммутаторов, обычно меньшей скорости.
- Добавляется запас портов на расширение кластера: достраивать фабрику дешевле, если места под будущие узлы заложены сразу.
Что входит в поставку кроме коммутаторов
- Модули и трансиверы под дальность и тип волокна — их число сопоставимо с числом портов и заметно влияет на бюджет.
- Кабели прямого подключения для связей внутри стойки: они дешевле оптики и не требуют отдельных модулей.
- Блоки питания и вентиляторные модули в нужном исполнении по направлению воздушного потока — оно должно совпадать с организацией холодного и горячего коридоров.
- Программное обеспечение и лицензии на функции управления фабрикой и телеметрии.
- Сетевые адаптеры узлов с поддержкой нужного протокола обмена памятью — их характеристики проверяются вместе с коммутаторами.
- При компактном размещении рассматриваются готовые вычислительные комплексы, где сетевая часть уже согласована с узлами.
Что проверяется до закупки
- Поддерживают ли сетевые адаптеры узлов те же механизмы управления перегрузкой, что и коммутаторы.
- Хватает ли электрической мощности стойки: коммутаторы с портами высокой скорости потребляют заметно больше моделей корпоративного класса.
- Совпадает ли направление продува коммутаторов с организацией охлаждения зала.
- Какая длина трасс между стойками — от неё зависит выбор между кабелями прямого подключения и оптикой.
- Есть ли средства наблюдения за очередями и потерями: без телеметрии настройка фабрики ведётся вслепую.
- Предусмотрено ли расширение кластера и до какого размера фабрика масштабируется без перестройки.
Что прислать для расчёта
- Число вычислительных узлов и ускорителей в каждом, планируемый рост.
- Модель сетевых адаптеров узлов и скорость их портов.
- Размещение по стойкам и расстояния между ними.
- Доступная мощность и схема охлаждения стоек.
- Требования к сети хранения и сети управления.
- Действующее сетевое оборудование, если кластер подключается к существующей инфраструктуре.
Частые вопросы
Можно ли собрать фабрику кластера на обычных коммутаторах дата-центра? Можно при небольшом числе узлов, но потребуется модель с достаточным буфером и поддержкой управления потоком по классам. На кластере от нескольких десятков узлов разница между обычным коммутатором и моделью для фабрики видна как прямая потеря производительности обучения.
Обязательно ли соотношение полосы один к одному? Для обучения — да, иначе верхний уровень фабрики становится узким местом на каждом шаге синхронизации. Для инференса допустимо соотношение с сужением: там обмен между узлами гораздо меньше.
Нужна ли отдельная сеть для хранилища? Желательна. Чтение обучающих данных даёт длительные потоки, которые конкурируют с обменом градиентами. Разделение по физическим портам решает вопрос надёжнее, чем разделение по классам трафика.
Сколько портов резервировать на расширение? Обычно закладывается от 20 до 30 % свободных портов на верхнем уровне фабрики. Этого хватает на увеличение кластера в полтора раза без добавления коммутаторов верхнего уровня.
Что делать, если узлы приобретаются позже коммутаторов? До закупки согласуются характеристики сетевых адаптеров: скорость портов, поддерживаемые механизмы управления перегрузкой и тип разъёма. Иначе модули и кабели приходится докупать повторно.
Что мы делаем
Считаем фабрику по числу узлов и ускорителей с соотношением полосы под задачу обучения, подбираем коммутаторы, модули и кабели одним комплектом, проверяем совместимость механизмов управления перегрузкой с сетевыми адаптерами узлов и согласуем исполнение по питанию и охлаждению с параметрами стоек. Поставляем оборудование Huawei из Китая с проверкой комплектности при приёмке.
Пришлите число узлов, модель сетевых адаптеров и размещение по стойкам на sale@huawei.net.ru — рассчитаем схему фабрики, подберём коммутаторы и дадим спецификацию с ценами и сроками поставки.
