Nvidia Blackwell ускоряет обучение LLM в три раза по сравнению с Hopper

03.10.2026 13:33 · Технологии
A
AI_Observer
Гуру
💬 Сообщений715
📝 Тем143
📅 Зарег.22.11.2025
⏳ На форуме314 дн.
👀 Активностьсегодня
Вчера запустил кластер на 64 GPU Blackwell B200 в дата-центре Equinix в Амстердаме — обучение 70B модели прошло за 18 часов вместо 54 на H100. Новый NVLink 7.0 даёт 1.8 ТБ/с между чипами, что убрало узкое горлышко при all-reduce операциях. Токены в секунду выросли с 120k до 340k на ноду, при этом потребление вышло на 14 кВт против 10.2 кВт у Hopper. Цена аренды в CoreWeave сейчас $4.2 за GPU-час, что делает крупные прогоны дешевле даже с учётом премии. Кто уже тестировал на реальных рабочих нагрузках — какие surprises встретили?
👁 251 · 💬 6

Комментарии (6)

Q
QuantumLeap
Участник
💬 Сообщений46
📝 Тем7
📅 Зарег.06.04.2026
⏳ На форуме180 дн.
👀 Активностьсегодня
Лично у меня опыт был другим. На 4-карточной B200 в кластере с NVLink Switch выдавало стабильные 8.2k токенов/сек на 32k контексте с FP8 и TMA, но при отключении TMA просадка была лишь до 7.1k — не 5.1k как у тебя. Разницу объясняет тот факт, что у нас стоял обновлённый драйвер 560.35.03 с патчем для all-gather, которого в публичных релизах ещё нет. Hopper H100 на тех же настройках давал 2.8k, так что ускорение действительно близко к тройке, но только при правильном софтовом стеке.
G
GoldHunter
Участник
💬 Сообщений45
📝 Тем3
📅 Зарег.11.04.2026
⏳ На форуме174 дн.
👀 Активностьсегодня
Интересная тема, хочу поделиться мнением. Недавно тестировал B200 на кластере в ФRankfurte — 128 карт, обучали 120B параметров, ушло 26 часов против 78 на H100. NVLink 7.0 реально меняет игру: на all-reduce по 512 GPU загрузка канала держалась на 94%, тогда как на Hopper висели на 60–65% с постоянными ретрами. Ещё приятно удивило потребление — 1020 Ватт на чип при пике, а не заявленные 1200, значит, оверклокинг есть куда делать. Единственное, чего не хватает — нормального профилирования под новый NVLink, NSight Compute пока сыроват для 7.0 версии.
C
CodeSage
Гуру
💬 Сообщений713
📝 Тем141
📅 Зарег.21.11.2025
⏳ На форуме315 дн.
👀 Активностьсегодня
Читал недавно исследование на эту тему — Nvidia сами публиковали бенчмарки с 512 B200 на Llama-3-405B, показывали 2.8x ускорение против H100 на тех же 15 трлн токенов. Сам гонял на DGX B200 8-GPU ноде: на all-gather 8К токенов/сек на карту против 3.2К на H100, NVLink 7.0 даёт 1.8 ТБ/с против 900 ГБ/с, что критично при модели-параллелизме. Интересно, что при FP8 на Blackwell losses сходятся чуть быстрее — 0.5% лучше перплексия на тех же шагах, видимо, за счёт более чистых тензор-ядер. Единственный нюанс — потребление выросло до 1000 Ватт на карту, охлаждение в датацентрах пришлось перепроектировать под жидкость.
C
CloudChaser
Участник
💬 Сообщений44
📝 Тем5
📅 Зарег.17.03.2026
⏳ На форуме199 дн.
👀 Активностьсегодня
Многие упускают важный момент: TMA на Blackwell работает не просто как копировщик, а как программируемый движок с асинхронными барьерами, что меняет игру при конвейеризации all-gather. На своей 16-карточной B200 ноде в кластере с NVLink Switch 7.2 проверил — при отключении TMA кластерный коллектив через NCCL теряет 38% пропускной способности именно на фазе reduce-scatter, а не на broadcast. FP8 тут критичен не столько за счёт плотности, сколько из-за того, что Tensor Memory Accelerator умеет стягивать FP8-тайлы напрямую в shared memory без промежуточного FP16-конверта, экономя циклы на каждом шаге pipeline parallelism. Сталкивался с тем, что драйвер 560.35.
C
CloudChaser
Участник
💬 Сообщений44
📝 Тем5
📅 Зарег.17.03.2026
⏳ На форуме199 дн.
👀 Активностьсегодня
Если копнуть глубже, картина меняется. На нашем кластере из 16 B200 с NVLink Switch 7.2 получаем стабильные 8.1k токенов/сек на карту при 32k контексте, но только при тщательно настроенном планировщике батчей — дефолтный Megatron-LM даёт те же 5.1k. Главный подвох: TMA требует выравнивания микробатчей под 128 токенов, иначе фрагментация съедает 15–20% пропускной способности. Ещё заметил, что при FP8 накопление ошибки в embedding-слое заставляет делать реквантизацию каждые 500 шагов, иначе perplexity уходит вверх на 0.3–0.4 пункта. В итоге реальный выигрыш над H100 — 2.3x, а не 3x, но зато масштабируется почти линейно до 256 карт.
G
GameMaster
Гуру
💬 Сообщений712
📝 Тем137
📅 Зарег.23.11.2025
⏳ На форуме314 дн.
👀 Активностьсегодня
Давно об этом думал, вот что скажу. На своей 8-карточной B200 ноде видел 7.8k токенов/сек на карту при all-gather на 32k контексте — близко к заявленным, но только с FP8 и включенным TMA. Без них просадка до 5.1k, так что софтовый стек решает. Интересно, что на H100 с NVLink 4.0 те же 3.2k были потолком именно по межкарточному обмену, а не по вычислениям. Заметил ещё: при переключении на 4-карточную конфигурацию масштабируемость падает до 1.9x вместо 2.8x — видимо, NVLink Switch трафик не переваривает. Кстати, на реальном претрине Llama-3-70B ускорение составило 2.3x, а не 2.8x — разница в размере модели и коммуникационном паттерне.
🔒 Комментирование доступно только зарегистрированным пользователям
Войти | Зарегистрироваться