Bitget App
交易「智」變
快速買幣市場交易合約理財廣場更多
Nvidia:從「一次性訓練」的大模型到「後訓練改進」的Agent,算力需求正在變化

Nvidia:從「一次性訓練」的大模型到「後訓練改進」的Agent,算力需求正在變化

华尔街见闻华尔街见闻2026/07/19 08:56
顯示原文
作者:华尔街见闻

英偉達重塑算力變現邏輯!新一代Vera Rubin平台首推「每美元智能」指標,押注智能體AI。模型後訓練轉變為永不停歇的常態化需求,GPU用量僅需上一代的1/4。巨頭已排隊遷移,算力藍海再迎爆發!

Nvidia 正將其下一代 Vera Rubin 平台的核心價值主張,從推理成本延伸至模型訓練效率,以「每美元智能」(intelligence per dollar)這一新指標,押注智能體 AI 時代持續後訓練將成為最核心的算力需求。

Nvidia 在官方部落格中闡述,隨著智能體 AI(Agentic AI)的興起,模型後訓練已從一次性的收尾步驟演變為持續循環的核心工作負載。與傳統生成式模型不同,智能體模型需要規劃、調用工具並在運行中自主糾錯,其所處環境每週都可能發生變化,這使得後訓練的算力需求持續累積。Nvidia 表示,Vera Rubin 平台專為這一工作負載協同設計,可在訓練最大規模模型時僅需上一代 Blackwell 平台四分之一的 GPU 數量。

這一表述直接關係到 Nvidia 的算力銷售邏輯:後訓練循環永不停止,意味著客戶對 GPU 叢集的需求將從專案制轉向常態化,潛在市場規模隨之擴大。Prime Intellect、Perplexity 及 Together AI 等已在 Nvidia 平台上運行後訓練工作負載的企業,均已表態計劃遷移或擴展至 Vera Rubin 平台。

後訓練成為智能體時代的核心算力驅動力

Nvidia 在部落格中對後訓練的戰略地位作出系統性闡述。預訓練階段賦予模型語言流暢性,而真正的「智能」——包括編寫程式碼、規劃多步驟任務、運用搜尋工具及從錯誤中恢復——則在後訓練階段形成。

Nvidia:從「一次性訓練」的大模型到「後訓練改進」的Agent,算力需求正在變化 image 0

後訓練採用強化學習(RL)技術:模型針對給定任務生成嘗試(前向傳播),該嘗試被評分後更新模型權重(反向傳播),經過數百萬次迭代,模型能力逐步提升。Nvidia 指出,這一過程的算力消耗極為密集,需要數千個環境並行生成 rollout,同時保持加速器滿負荷運轉。

Nvidia 將「每美元智能」定位為高於「每 token 成本」的上層指標:前者衡量推理工廠的營運效率,後者則衡量構建並持續維護一個值得部署的模型所需的投入是否合算。兩者相互嵌套——降低每 token 成本同樣降低了模型智能的構建成本,而更高的模型智能則提升了每個 token 的服務價值。

Nemotron Ultra 提供可驗證的後訓練基準

為支撐上述主張,Nvidia 披露了旗下開放權重模型 Nemotron 3 Ultra 的後訓練細節。該模型參數量達 5500 億,採用混合專家(MoE)架構,後訓練流程完整運行於 NeMo RL 框架之上。

在 SWE-bench Verified 這一真實世界程式設計基準測試中,Nemotron 3 Ultra 得分 71.7%,即在來自開源專案的真實軟體缺陷中,約十個中有七個能夠生成可通過專案自有測試的有效修復方案。Nvidia 表示,該基準測試結果可供驗證,後訓練方案亦完整公開。

Nvidia:從「一次性訓練」的大模型到「後訓練改進」的Agent,算力需求正在變化 image 1

Nvidia 同時指出,Blackwell 平台已通過降低單次運行成本,使智能體時代所需的高頻後訓練在經濟上具備可行性,而 Vera Rubin 平台將進一步延伸這一軌跡——支援更多 rollout、更多並行環境以及永不停止的後訓練週期。

頭部客戶驗證平台能力,遷移計畫浮出水面

多家已在 Nvidia 平台上運行後訓練工作負載的企業,披露了具體技術細節,並表達了向 Vera Rubin 遷移的意向。

Prime Intellect 持續在 Blackwell 平台上對前沿開放模型進行後訓練,並使用 NVIDIA Dynamo 進行推理編排。該公司已將沙箱基礎設施與 NVIDIA Vera CPU 整合,在與 x86 架構的對比測試中,Vera CPU 在真實 RL 沙箱工作負載下平均吞吐量高出 30%。Prime Intellect 計畫借助 Vera Rubin 擴展強化學習環境規模,並加速訓練到推理的迭代循環。

Perplexity 的 RL 後訓練 stack 跨數百塊 Nvidia GPU 非同步運行,其基於 RDMA 的權重傳輸引擎可在兩秒內完成兆億參數模型在訓練節點與推理節點之間的同步。經後訓練的 Qwen3 235B 模型隨後部署於 NVIDIA GB200 NVL72 系統之上。

Together AI 則以服務形式提供後訓練能力,涵蓋監督微調、強化學習及直接偏好優化,通過 API 和 SDK 交付,目前運行於 Nvidia 平台,並表示正尋求接入 Vera Rubin 平台。

0
0

免責聲明:文章中的所有內容僅代表作者的觀點,與本平台無關。用戶不應以本文作為投資決策的參考。

PoolX: 鎖倉獲得新代幣空投
不要錯過熱門新幣,且APR 高達 10%+
立即參與

您也可能喜歡

IPO臨近“彈藥庫”加碼!Anthropic被曝擬將信貸額度擴大至超百億美元

超過100億美元的額度將至少是去年Anthropic獲得信貸額度的四倍。據報導,多家銀行正爭相參與這筆融資,以爭取在Anthropic未來IPO中的承銷角色;按照目前Anthropic的邀約方案,最積極參與該信貸額度的銀行單家承諾放貸約12.5億美元。

华尔街见闻2026/08/18 17:41

Meta「生死官司」今日開審:29州檢察長聯手追責,敗訴或面臨1.4萬億美元「天價」罰款

訴訟指控Facebook與Instagram被刻意設計成「成癮產品」,傷害數千萬未成年用戶。Meta自行估算最高罰款敞口高達1.4萬億美元,逼近其當前市值。祖克柏將親自出庭作證,判決結果或將重塑整個社交媒體行業的商業模式。

华尔街见闻2026/08/18 16:01

美股人力資源股強勢反彈:AI履歷泛濫,招聘公司反而更值錢了!

AI並未顛覆美國招聘行業,反而因為AI生成履歷泛濫,提升了篩選的價值,為人力資源公司創造了新的需求。ManpowerGroup和Robert Half等招聘公司業績超出預期,股價自低點強勁反彈。AI也成為行業效率工具,但在反彈之後估值承壓,長期走勢取決於美國勞動力市場的復甦以及招聘公司能否真正從AI中受益。

华尔街见闻2026/08/18 16:01

華住:扛住壓力,盡顯龍頭本色!

海豚投研2026/08/18 15:00
華住:扛住壓力,盡顯龍頭本色!