nemo-mbridge-perf-moe-vlm-training
Официальный skill NVIDIA посвящён обучению мультимодальных MoE VLM в Megatron Bridge и выбору между FSDP и 3D parallel. Он полезен на этапе запуска новой vision-language модели, при расследовании OOM и при сравнении производительности после стабилизации рабочего контура. Материал не обещает универсальную конфигурацию: он собирает практические выводы из экспериментов с классом Qwen3-VL, Qwen3-Next и другими мультимодальными сценариями и предлагает использовать их как ориентир для последовательной настройки. Главная рекомендация — начинать с FSDP, когда нужна самая простая дорога к первому надёжному мультимодальному запуску, когда важнее уложиться в память, когда границы pipeline плохо подходят для разбиения или когда vision-часть временно замораживается. 3D parallel имеет больший потолок после настройки, но предполагает стабильную модель, понятную схему pipeline parallel и время на серию экспериментов. Практический порядок такой: сначала получить воспроизводимый запуск на FSDP, затем стабилизировать real-data input, recompute и память, и только после этого переносить workload на 3D parallel, если дополнительный throughput оправдывает сложность. Источник отдельно предупреждает, что mock-data VLM нельзя считать надёжным proxy для производительности. В описанных наблюдениях image-free mock runs выглядели примерно вдвое быстрее real multimodal input, поэтому итоговые выводы о throughput нужно делать на реальных или реалистичных изображениях. Для небольших мультимодальных MoE-экспериментов отмечены HybridEP как сильный default на системах класса GB200, пользу CUDA graphs с областью TE после стабилизации и чувствительность к MBS, однако это не отменяет профилирование именно своего workload. Для настройки предлагается начинать с полного recompute как с bring-up инструмента, а затем переходить к selective recompute в устойчивом режиме. Размер MBS стоит системно перебирать, потому что vision path меняет соотношение вычислений и накладных расходов. Область CUDA graph лучше сначала держать узкой и расширять только после проверки real-data path; в качестве более безопасного MoE-направления приведён scope attn moe_router moe_preprocess. ETP имеет смысл включать, когда одного EP недостаточно для размещения или топологии, поскольку он добавляет коммуникации и новую поверхность настройки. Карточка помогает принять решение, какие параметры сравнивать: TP, CP, PP, EP, ETP, dispatcher, recompute, MBS и scope CUDA graph. Для GB200 приведён FSDP-first пример с TP=1, CP=1, PP=1 и EP под topology экспертов; для 3D пути допускается modest PP после проверки стабильности. В обоих случаях нельзя сравнивать запуски с разным объёмом полезной работы только по step time: нормализуйте оценку по useful tokens и форме workload. Обязательные ограничения — отдельно профилировать vision encoder, projector и decoder, не принимать mock performance за end-to-end результат и не считать ETP бесплатным ускорителем. Skill не заменяет документацию конкретной версии Megatron Bridge, topology-инвентаризацию, тесты памяти или измерения на целевой GPU-системе; окончательная конфигурация должна подтверждаться собственным real-data benchmark.
Для чего подходит
- Подготовка обучения MoE VLM в Megatron Bridge
- Выбор между FSDP и 3D parallel
- Диагностика OOM и проблем производительности VLM
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/NVIDIA/skills/tree/main/skills/nemo-mbridge-perf-moe-vlm-training