Когда Rubin с нетерпением ожидается, Nvidia продолжает оптимизировать Blackwell, а энергоэффективность GB200 увеличилась в 4 раза за три месяца.
Nvidia продлевает жизненный цикл платформы Blackwell за счет постоянной оптимизации программного стека, одновременно накапливая ресурсы для масштабного внедрения следующей архитектуры Rubin.
На фоне ускоренного внедрения платформы нового поколения Rubin Nvidia раскрыла, что всего за три месяца удалось увеличить производительность GB200 NVL72 на один мегаватт при запуске модели DeepSeek R1 0528 (TPS/MW) в четыре раза. Этот результат стал возможен благодаря 38 крупным оптимизациям, реализованным Nvidia за четыре месяца и подкрепленным более чем 250 000 симуляций конфигураций и суммарно 1,4 миллионам GPU-часов валидационных испытаний.
Тем временем платформа GB300 "Blackwell Ultra" продолжает устанавливать рекорды в тестах AI-обучения. В конфигурации из 256 карт GB300 NVL72 демонстрирует рекордную производительность — 1648 TFLOPs на GPU в задаче предварительного обучения DeepSeek-V3 671B, что примерно в 3 раза выше, чем у GB200 (606 TFLOPs), причем этот показатель увеличился в 1,5 раза за последние шесть месяцев.
Значительный рост энергоэффективности GB200, оптимизация охватывает более 90% моделей
Nvidia отмечает, что серия оптимизаций для платформы GB200 NVL72 позволила за три месяца увеличить производительность на один мегаватт при запуске DeepSeek R1 0528 (конфигурация 1K вход/1K выход) в четыре раза.

За этим ростом стоят 38 важных итераций оптимизации, завершенные Nvidia за четыре месяца. Они были отобраны с помощью более 250 000 симуляций конфигураций и валидацией на 1,4 миллиона GPU-часов. Особо подчеркивается, что свыше 90% внедренных оптимизаций доступны для повторного использования на других моделях в AI-продуктовой линейке компании, а не заточены только под одну задачу.
Это означает, что существующие клиенты дата-центров могут получить значительную экономию энергопотребления просто за счет обновления программного обеспечения без необходимости менять оборудование — что имеет прямую экономическую ценность для гиперскейл и корпоративных заказчиков, для которых важна стоимость вычислений.
GB300 устанавливает рекорды обучения, рост производительности за шесть месяцев — 1,5 раза
На стороне AI-обучения GB300 NVL72 демонстрирует высокую производительность: при 256-картной конфигурации и обучении модели DeepSeek-V3 671B на фреймворке Megatron Core платформа достигает 1648 TFLOPs на GPU — примерно в три раза больше, чем предыдущий показатель GB200 (606 TFLOPs), и это мировой рекорд для подобной задачи.

Примечательно, что это не предел аппаратных возможностей: производительность GB300 NVL72 на Megatron Core выросла с 1088 TFLOPs/GPU в ноябре 2025 года до 1648 TFLOPs/GPU в июне 2026 года — рост в 1,5 раза за полгода.

Что касается совместной оптимизации с ведущими AI-фреймворками, сотрудничество Nvidia с сообществами PyTorch и JAX также приносит значительные результаты. На TorchTitan (родной обучающий стек PyTorch) GB300 NVL72 улучшил производительность для DeepSeek-V3 671B в шесть раз — с 199 до 1197 TFLOPs/GPU по сравнению с неоптимизированной конфигурацией. Рост с JAX еще более выражен: к июлю 2026 года пропускная способность составила 4082 токена/сек на GPU (1025 TFLOPs/GPU), что примерно в 10 раз выше показателя января 2026 года (418 токенов/сек).

Эффективность масштабирования приближается к теоретическому пределу, ключом служит сеть 800 Gb/s
Масштабируемость в крупных учебных AI-сценариях всегда была ключевой характеристикой AI-инфраструктуры. Nvidia сообщает, что в диапазоне от 256 до 1024 карт GB300 NVL72 во всех трех основных фреймворках достигает объема расширения, близкого к теоретическому пределу: Megatron Core — 98,5%, TorchTitan и JAX — по 97%.
Nvidia объясняет такой результат наличием в стойке NVL72 встроенного сетевого чипа Scale-Out с пропускной способностью 800 Gb/s. Высокоскоростное соединение критически влияет на расходы на коммуникации между машинами, а значит — на эффективность масштабирования в целом, и рассматривается как ключевой компонент инфраструктуры, обеспечивающий такую производительность.

Rubin ускоряет внедрение, но оптимизации Blackwell продолжаются
В момент публикации этих обновлений платформа следующего поколения Vera Rubin уже внедряется по всему миру. Согласно сообщениям, Vera Rubin NVL72 обеспечивает примерно десятикратный рост пропускной способности по токенам по сравнению с Blackwell: GB200 NVL72 — около 80 000 токенов/сек, а Vera Rubin NVL72 при той же мощности в 150 МВт — до 800 000 токенов/сек.
Тем не менее, платформа Blackwell уже внедрена во множестве дата-центров по всему миру. Стратегия Nvidia практически повторяет подход времён линейки Hopper — параллельно с развёртыванием новой платформы компания продолжает раскрывать потенциал уже установленных решений за счёт программной оптимизации. Такой подход не только продлевает срок возврата инвестиций в существующее оборудование для клиентов, но и повышает приверженность экосистеме Nvidia в сфере AI-инфраструктуры. Для рынка это значит, что при одновременном развитии Blackwell и Rubin Nvidia выстраивает программную защиту, которую конкурентам будет крайне сложно преодолеть в короткие сроки.
Дисклеймер: содержание этой статьи отражает исключительно мнение автора и не представляет платформу в каком-либо качестве. Данная статья не должна являться ориентиром при принятии инвестиционных решений.
Вам также может понравиться
Доходность 30-летних казначейских облигаций США достигла максимума с 2007 года, выпуск инвестиционных облигаций в США в августе достиг рекордного уровня для этого периода.
В понедельник доходность 30-летних государственных облигаций США на время превысила 5,31%. Компании в условиях бума искусс твенного интеллекта активно размещают крупные выпуски облигаций, что усугубляет дисбаланс спроса и предложения на рынке долгосрочных бумаг. В августе объем выпуска инвестиционных облигаций в США достиг 145,2 млрд долларов, превысив рекорд августа 2020 года в 136 млрд долларов. Одновременно ежегодный бюджетный дефицит правительства США, близкий к 2 трлн долларов, продолжает увеличивать предложение государственных облигаций.

Выгоднее ли SanDisk, чем DRAM, и действительно ли он так хорош?

Nvidia инвестирует 1,5 миллиарда долларов в SB Energy, обеспечив 8 ГВт AI-мощностей, OpenAI станет единственным арендатором
Nvidia расширяет границы конкуренции от GPU и серверов до земли, электроэнергии и зданий AI-центров обработки данных. Компания сотрудничает с SB Energy для разработки сверхкрупного AI-центра мощностью 8 ГВт в Огайо и инвестирует в него 1,5 миллиарда долларов, предоставляя кредитную поддержку для инфраструктурного финансирования; OpenAI выступает единственным арендатором. Этот шаг означает, что Nvidia выходит за рамки роли поставщика чипов и становится организатором AI-инфраструктуры, заранее закрепляя ресурсы LPS для удовлетворения будущих потребностей в нескольких поколениях GPU.
