Bitget App
交易「智」變
快速買幣市場交易合約理財廣場更多
Rubin備受期待之際,英偉達持續優化Blackwell,GB200能效三個月翻4倍

Rubin備受期待之際,英偉達持續優化Blackwell,GB200能效三個月翻4倍

华尔街见闻华尔街见闻2026/07/22 08:27
顯示原文
作者:华尔街见闻

輝達正以持續的軟體堆疊優化延長Blackwell平台的生命週期,同時為下一代Rubin架構的大規模落地蓄勢待發。

在新一代Rubin平台加速部署的背景下,輝達披露,僅用三個月時間,便將GB200 NVL72於運行DeepSeek R1 0528模型時的每兆瓦算力吞吐量(TPS/MW)提升了4倍。 這一成果來自於輝達在四個月內完成38項重大優化,背後支持則為超過25萬次模擬配置測試與累計140萬GPU小時的優化驗證。

同時,GB300「Blackwell Ultra」平台在AI訓練基準測試中持續刷新記錄。在256卡規模下,GB300 NVL72於DeepSeek-V3 671B預訓練任務中以每GPU 1648 TFLOPs的成績創下歷史最高記錄,相較GB200的606 TFLOPs提升約3倍,且此指標於過去六個月內已累計提升1.5倍。

GB200能效大幅躍升,優化涵蓋90%以上模型

輝達表示,針對GB200 NVL72平台的一系列優化,令其於運行DeepSeek R1 0528(1K輸入/1K輸出配置)時,每兆瓦算力吞吐量於三個月內實現四倍成長。

Rubin備受期待之際,英偉達持續優化Blackwell,GB200能效三個月翻4倍 image 0

支持這一躍進的,是輝達於四個月內完成的38項重大優化迭代。這些優化經由超過25萬次模擬配置篩選,並累計消耗140萬GPU小時進行實測驗證。輝達特別指出,逾九成優化成果可於模型間複用,適用於其AI產品線的其他模型,而非專為單一任務量身訂製。

這意味著,現有數據中心客戶無需更換硬體,即能通過軟體升級獲得顯著的能效效益——對運算能力成本高度敏感的超大規模雲端廠商與企業客戶而言,具直接經濟價值。

GB300刷新訓練紀錄,六個月性能提升1.5倍

於AI訓練端,GB300 NVL72同樣展現強勁表現。在256卡規模下,基於Megatron Core框架對DeepSeek-V3 671B模型進行預訓練,GB300 NVL72實現每GPU 1648 TFLOPs的吞吐量,相較先前GB200的606 TFLOPs提升約3倍,並創下該任務全球最高紀錄。

Rubin備受期待之際,英偉達持續優化Blackwell,GB200能效三個月翻4倍 image 1

值得注意的是,這一數字並非靜態硬體極限。GB300 NVL72於Megatron Core框架下的表現,已從2025年11月的1088 TFLOPs/GPU提升至2026年6月的1648 TFLOPs/GPU,六個月內累計提升約1.5倍。

Rubin備受期待之際,英偉達持續優化Blackwell,GB200能效三個月翻4倍 image 2

在主流AI框架的協同優化方面,輝達與PyTorch及JAX社群的深入合作同樣帶來明顯增益。在TorchTitan(PyTorch原生訓練堆疊)上,GB300 NVL72對DeepSeek-V3 671B的訓練性能,較未調優基線配置提升6倍,從199 TFLOPs/GPU攀升至1197 TFLOPs/GPU。JAX框架下提升幅度更大,截至2026年7月每GPU吞吐量達4082 Tokens/s,對應1025 TFLOPs/GPU,較2026年1月的418 Tokens/s提升約10倍。

Rubin備受期待之際,英偉達持續優化Blackwell,GB200能效三個月翻4倍 image 3

擴展效率接近理論上限,800 Gb/s網路是關鍵

大規模訓練場景的擴展效率,一直是衡量AI基礎建設實用性的核心指標之一。輝達披露,在256至1024卡的擴展區間內,GB300 NVL72於三大主流框架下均維持接近理論上限的擴展效率:Megatron Core達98.5%,TorchTitan及JAX均達97%。

輝達將這一擴展效率歸功於NVL72機架內建的800 Gb/s Scale-Out網路晶片。高速互連直接決定多機訓練的通訊開銷,進而影響整體擴展效率,此網路能力被視為支撐上述跨框架高效能展現的核心基礎設施元件。

Rubin備受期待之際,英偉達持續優化Blackwell,GB200能效三個月翻4倍 image 4

Rubin平台加速落地,Blackwell優化仍在持續

上述優化成果發布之際,輝達次世代Vera Rubin平台已進入全球部署階段。據悉,Vera Rubin NVL72於Token 吞吐量上相較Blackwell實現約10倍提升,GB200 NVL72約為80,000 Tokens/s,而Vera Rubin NVL72於同等150MW功耗下可達800,000 Tokens/s。

然而,Blackwell平台已在全球無數資料中心完成部署,輝達的策略與先前Hopper世代如出一轍——於新平台推進同時,持續通過軟體優化發掘既有硬體潛力。此舉不僅延長現有客戶的硬體投資回收期,也強化了輝達於AI基礎設施生態的系統黏著度。對市場而言,隨著輝達Blackwell、Rubin雙線並進的格局,正逐步築起競爭對手短期難以突破的軟體護城河。

0
0

免責聲明:文章中的所有內容僅代表作者的觀點,與本平台無關。用戶不應以本文作為投資決策的參考。

PoolX: 鎖倉獲得新代幣空投
不要錯過熱門新幣,且APR 高達 10%+
立即參與

您也可能喜歡

從技術故事到資本故事:AI建設週期的下一個主戰場

美國超大規模雲端廠商大幅上調資本支出計劃、公開及私募信貸市場加速介入AI基礎設施融資、融資結構快速演進並向價值鏈更深處延伸——這一切在短短數月內集中發生,速度之快、範圍之廣、創新之多,超出市場預期。大摩認為,AI正逐漸演變為資本市場故事,理解資本流向的重要性將不亞於理解技術創新本身。

华尔街见闻2026/08/18 02:21

「太瘋狂了」!南韓散戶「從首爾轉戰華爾街」:買SK海力士ADR、押注三倍槓桿ETF

數據顯示,韓國散戶7月淨買入美股約45億美元。其中有8.4億美元流向SK海力士ADR,儘管溢價約10%。三倍槓桿半導體ETF SOXL位居韓國投資者最愛榜首,槓桿產品佔十大買入標的四席。分析人士指出,韓國散戶「換場不換注」,仍然押注AI主題,ADR溢價與槓桿盛行是投機過熱的信號,或加劇局部市場波動。

华尔街见闻2026/08/18 02:16

科技巨頭融資洪流屢創紀錄,30年期美債收益率創近20年來新高!AI超級週期邁入「資本即算力」新階段

美國投資級債券銷售額連續第三個月創下歷史新高,繼續保持市場最快的發行速度,人工智能建設支出推動了企業借貸。機構匯編的數據顯示,8 月份高等級債券供應量達到 1452 億美元,超過了 2020 年同期的 1360 億美元總量。

智通财经2026/08/18 01:36
科技巨頭融資洪流屢創紀錄,30年期美債收益率創近20年來新高!AI超級週期邁入「資本即算力」新階段