Bitget App
交易「智」變
快速買幣市場交易合約理財廣場更多
GPU荒還沒結束,CPU可能要被搶起來了

GPU荒還沒結束,CPU可能要被搶起來了

deeptech深科技deeptech深科技2026/08/18 06:29
顯示原文
作者:deeptech深科技
GPU荒還沒結束,CPU可能要被搶起來了 image 0


2026 年 5 月 31 日,Nvidia 宣布一顆擁有 88 個客製核心的 CPU 已全面量產。它名為 Vera,採用 Arm 指令集與 Nvidia 自研的 Olympus 核心,不僅會進入 Vera Rubin 超級運算平台,也將獨立配置於 CPU 伺服器。Dell、HP、Lenovo、Supermicro 及多家伺服器廠商,已開始製造搭載 Vera 的系統。


Nvidia 將 Vera 稱為「第一顆專為 AI 智能體打造的 CPU」。Vera 會與 Rubin GPU 組成一套平台,也能被裝進獨立 CPU 伺服器。時隔多年,本來販售 GPU 的 Nvidia,又重新開始單獨販售 CPU 算力,這件事聽來似乎並不尋常。


GPU荒還沒結束,CPU可能要被搶起來了 image 1

圖丨 Nvdia Vera(來源:Nvdia)


過去三年,AI 產業的硬體焦慮幾乎都環繞在 GPU。訓練需要更多 GPU,推論需要更多 GPU,模型參數與用戶數增長後,答案依然是增加 GPU。CPU 在這套系統裡主要負責啟動任務、搬運數據及管理伺服器,極少成為投資人關注主角。


直到 AI Agent 改變了任務型態。


一般聊天機器人接收一段文字,運行一次模型,再生成一段文字。Agent 還要將模型判斷轉化為操作:讀取檔案、搜尋網頁、查詢資料庫、調用應用程式介面(API)、執行程式碼,再把結果送回模型。一次任務可能經過十多輪「推論—操作—觀察」,每一輪都要在 GPU 與 CPU 間切換。


GPU 依然負責最重的模型運算,而解析模型輸出、判斷工具型態、發起請求、運行程式、管理檔案、收集結果與安排行下一輪任務等工作,通常由 CPU 處理。AMD 計算與企業 AI 副總裁 Madhu Rangarajan 表示,公司測試的一條真實智能體流水線中,8 個階段有 7 個完全在 CPU 上運行。這是 AMD 自測結果,不必然代表所有系統,但足以說明:模型推論只是智能體完成任務的一環,環節外協調工作都壓在 CPU 上。


單一 Agent 產生的負擔可能不大,但一旦規模化這個數字就會非常可觀。


一個智能體可同時調用多個工具,也可創建子智能體。企業同時部署系統給數萬名員工,併發任務規模可迅速膨脹。每個智能體都在解析輸出、執行代碼及資料讀寫,原本零散的 CPU 負擔開始積累成容量需求。CPU 處理緩慢,GPU 就需等候下一輪推論所需輸入。


安全檢查同樣加重這部分負擔。智能體權限越高,系統越需檢查其打開哪些檔案、調用哪些介面、是否觸及敏感資料。規則比對、日誌分析及小模型審核通常交由 CPU,因任務零散、延遲敏感,單獨調用 GPU 不夠經濟。因此,智能體越自主,檢查環節越多,CPU 負擔就越重。


今年 7 月,OpenAI 智能體於一次內部安全評估意外突破沙箱、入侵 Hugging Face 生產系統事件,足以說明此類安全機制的重要,也反映其在實際部署中增加不少額外運算負擔。


另一個容易忽略的負擔則是分詞(tokenization)。


大型模型處理文本前,須將文字轉成 Token。此過程涉及大量字串處理與條件分支,並不像矩陣運算適合 GPU。一般對話輸入極短,分詞延遲通常無感;智能體則會不斷累積工具回傳結果、程式碼、日誌及歷史操作,輸入可能飆升至數萬乃至數十萬 Token。


喬治亞理工博士生 Euijun Chung 在接受 IEEE Spectrum 採訪時舉例,一些實現中,已有 10 萬 Token 的上下文,再加入 1,000 個 Token 的工具輸出,分詞器仍可能重新處理整段輸入。 前綴快取與增量分詞可減少重複工作,因此這並非所有系統必然採取方式;但長文本帶來的 CPU 壓力仍在。


Chung 團隊於最新論文測試 Llama 3.1 和 Qwen3 等模型。在長序列、大批量設定下,分詞最高佔首 Token 延遲約 80%。當 CPU 核心數不足,分詞執行緒還會與任務調度、GPU 啟動爭搶資源,導致 CPU 負載滿載而 GPU 反未跑滿。增加 CPU 核心後,不同配置下首 Token 延遲改善 1.47—5.15 倍,無需增加 GPU。


產業數據已開始反映這一變化。2026 年 1 月,KeyBanc 根據供應鏈調查判斷,Intel 全年大部分伺服器 CPU 產能已售罄,AMD 伺服器 CPU 供應亦近滿載,兩家公司因此有提價空間。此為研究機構的渠道觀察,非廠商公開訂單數據。


Intel 隨後的財務文件也做了部分證實。公司稱,2026 年第一季度伺服器 CPU 需求超出可供應數量,內部產能限制預期延續全年。伺服器產品平均售價年增 27%,但出貨量下降 5%;Intel 將漲價歸因於高端產品占比提升、市場需求定價與成本增長。


AMD 同期資料中心業務收入達 58 億美元,年增 57%,成長來自 EPYC 伺服器 CPU 與 Instinct GPU。AMD 未單獨披露伺服器 CPU 收入增速,因此無法將這 57% 全數歸功於智能體需求。


公司對未來判斷更為積極。AMD 先前預估伺服器 CPU 市場年增長約 18%;2026 年 5 月又上調至 35% 以上,並預期 2030 年市場規模超過 1,200 億美元。AMD 給出的理由是,智能體需獨立 CPU 運算層,負責編排、資料處理、工具執行與安全檢查。


資料中心過去常用一顆 CPU 管理 4—8 顆 GPU。AMD 觀察到,智能體系統正將這一比例推向 1∶1,部分負載甚至需更多 CPU。這還是供應商依據客戶需求的判斷,實務配置會有極大差異。改變方向卻很明確:不是多配幾顆 CPU 就足夠,雲服務商已開始考慮為智能體獨立建置 CPU 機架。


Arm 亦於 2026 年 3 月首度從販售處理器設計走向直接販售資料中心 CPU。其 AGI 處理器最多有 136 個核心,由 Meta 參與開發。Arm 預期,在同等耗電下,智能體資料中心所需 CPU 容量可能達現有資料中心 4 倍以上。


高通隨後推出擁有超過 250 核心的 Dragonfly C1000,並與 Meta 簽署多代伺服器 CPU 合作協議。Intel、AMD、Arm、高通與 Nvidia 在短短幾個月將「智能體 CPU」寫進各自產品規劃,顯示此輪競爭已超越傳統 x86 市場,擴展至 Arm 伺服器、自研核心及整機架設計。


Nvidia 在其中占據特殊位置。它既銷售造成 CPU 壓力的 GPU,也銷售緩解壓力的 Vera;從處理器、網路到儲存,整套裝置皆可由 Nvidia 提供。Vera 不僅是產品線擴展,更是為保 GPU 利用率。GPU 少等一秒,就可能換來更多 Token 與更高機架收益。


不過,晶片製造商逐利的同時,最終總有消費者要承擔代價。與 GPU、儲存晶片相同,此次產能變化,很可能還是最後由我們消費者埋單。


Intel 在 2025 年第四季財報電話會承認,公司正試圖盡量將內部晶圓供應轉向資料中心,同時增加客戶端產品的外部代工;管理層隨後補充,Intel 不會完全退出客戶端市場。到 2026 年第一季,Intel 客戶端 CPU 平均售價年增 16%,銷量下降 13%,公司預計供應限制至少持續到今年上半年。


客戶端產品變化不完全是智能體造成的。Intel 本身製程、內外部產能與記憶體供應也影響價格與出貨。但在有限產能下,伺服器晶片核心更多、售價更高,雲端廠商又願意長期簽約,生產資源自會向資料中心傾斜。


過去三年,普通消費者已經經歷過 GPU 漲價與斷貨。而接下來,類似情形亦可能出現在 CPU。


營運/排版:何晨龍


註:封面/首圖由 AI 輔助生成

0
0

免責聲明:文章中的所有內容僅代表作者的觀點,與本平台無關。用戶不應以本文作為投資決策的參考。

PoolX: 鎖倉獲得新代幣空投
不要錯過熱門新幣,且APR 高達 10%+
立即參與

您也可能喜歡

Meta「生死官司」今日開審:29州檢察長聯手追責,敗訴或面臨1.4萬億美元「天價」罰款

訴訟指控Facebook與Instagram被刻意設計成「成癮產品」,傷害數千萬未成年用戶。Meta自行估算最高罰款敞口高達1.4萬億美元,逼近其當前市值。祖克柏將親自出庭作證,判決結果或將重塑整個社交媒體行業的商業模式。

华尔街见闻2026/08/18 16:01

美股人力資源股強勢反彈:AI履歷泛濫,招聘公司反而更值錢了!

AI並未顛覆美國招聘行業,反而因為AI生成履歷泛濫,提升了篩選的價值,為人力資源公司創造了新的需求。ManpowerGroup和Robert Half等招聘公司業績超出預期,股價自低點強勁反彈。AI也成為行業效率工具,但在反彈之後估值承壓,長期走勢取決於美國勞動力市場的復甦以及招聘公司能否真正從AI中受益。

华尔街见闻2026/08/18 16:01

華住:扛住壓力,盡顯龍頭本色!

海豚投研2026/08/18 15:00
華住:扛住壓力,盡顯龍頭本色!