DCGM: короткий preflight до запуска GPU-задачи
DCGM: короткий preflight до запуска GPU-задачи
Факт. NVIDIA рекомендует quick suite DCGM как readiness-check до того, как node принимает работу. dcgmi diag -r 1 --json запускает активные проверки deployment и software; level 1 обычно занимает секунды. Medium suite -r 2 предназначен для проверки после упавшей задачи, когда GPU уже свободны.
Почему важно. Ошибка CUDA, доступа к device, PCIe/NVLink или памяти может выглядеть как проблема модели. Preflight отделяет неисправный node от ошибки кода до дорогого inference или fine-tuning.
Как применять: 1. Перед возвратом node в pool: dcgmi diag -r 1 --json. 2. После failed job освободите GPU и выполните dcgmi diag -r 2 --json. 3. Сохраните JSON вместе с GPU UUID, версиями driver/DCGM и job ID; при FAIL изолируйте node до разбора.
Ограничение. Diagnostics создают активную нагрузку на GPU, CPU, memory, power и fabric. Level 2–4 не запускайте рядом с production workload; для GeForce официально поддержан level 1, если документация конкретной модели не говорит иное.
На https://verum-ai.uz сейчас перечислены GPU rental-конфигурации H200, H100, A100, L40S и RTX 4090. Проверяйте readiness перед задачей независимо от класса GPU.

