NCCL: algbw и busbw — не две скорости GPU
NCCL: algbw и busbw — не две скорости GPU
Факт. В nccl-tests algbw — размер данных, делённый на время операции. busbw — расчётная метрика с поправкой на тип collective и число ranks, а не отдельное измерение физического порта.
Для AllReduce: busbw = algbw × 2 × (n−1) / n, где n — число ranks. При четырёх ranks условные 100 GB/s algbw дают 150 GB/s busbw. Это арифметический пример, не результат теста сервера.
Зачем: перепутав столбцы, можно ошибочно забраковать interconnect или обещать LLM скорость, которой benchmark не измерял.
Как применить 1. Сохраните команду теста, версии NCCL/nccl-tests, число ranks и GPU topology. Сравнивайте одинаковые collective, размеры сообщений, dtype и режим in-place/out-of-place. 2. В отчёте оставьте size | time | algbw | busbw вместе с единицами из заголовка. Не подставляйте algbw в норму, заданную для busbw. 3. Для маленьких сообщений смотрите прежде всего latency; для больших — bandwidth. После проверки обмена измерьте свой LLM workload: benchmark связи не выдаёт tokens/s модели.
Ловушка: busbw не равна сумме рекламных скоростей всех NVLink. У других collective поправка другая; расчёт не заменяет анализ topology и реального узкого места.
Каталог GPU Verum: https://verum-ai.uz — доступность нужной конфигурации уточняйте отдельно.

