Bitget App
スマートな取引を実現
暗号資産を購入市場取引先物Bitget Earn広場もっと見る
GPU不足がまだ解消されていない中、今度はCPUも奪い合いになる可能性がある

GPU不足がまだ解消されていない中、今度はCPUも奪い合いになる可能性がある

deeptech深科技deeptech深科技2026/08/18 06:29
原文を表示
著者:deeptech深科技
GPU不足がまだ解消されていない中、今度はCPUも奪い合いになる可能性がある image 0


2026年5月31日、Nvidiaは88個のカスタムコアを搭載したCPU「Vera」が本格的に量産に入ったと発表しました。VeraはArm命令セットとNvidia自社開発のOlympusコアを採用し、Vera Rubinスーパーコンピューティングプラットフォームに搭載されるほか、単体でCPUサーバーにも組み込まれます。Dell、HP、Lenovo、Supermicroおよび複数のサーバー企業が、すでにVeraを搭載したシステムの製造を開始しています。


NvidiaはVeraを「AIエージェントのために設計された最初のCPU」と位置づけています。VeraはRubin GPUと共にプラットフォームを構成したり、独立したCPUサーバーにも搭載されます。長年GPUを販売してきたNvidiaが再びCPU計算能力単体の販売に乗り出したことは、一見すると異例な出来事です。


GPU不足がまだ解消されていない中、今度はCPUも奪い合いになる可能性がある image 1

画像丨Nvidia Vera(出典:Nvidia)


過去3年間、AI産業のハードウェアへの関心・懸念はほぼGPUに集中していました。トレーニングも推論も、そしてモデルパラメータやユーザー数が増えるごとに答えは常に「より多くのGPUが必要」。CPUはタスクの起動やデータの搬送、サーバーの管理といった役回りを担っていましたが、投資家にとっては主役ではありませんでした。


AI Agentがタスクの在り方を変えるまでは。


一般的なチャットボットがテキストを受け取ってモデルを1回だけ実行し、返答する仕組みに対し、Agentはモデルの判断を実際の操作へと変換します。ファイルの読み書き、Web検索、データベース照会、APIの呼び出し、コードの実行などを行い、結果を再びモデルに返します。一つのタスクで十数回の「推論―操作―観察」ループが行われ、そのたびにCPUとGPUを行き来します。


GPUは依然として大規模なモデル計算を担いますが、モデル出力の解析やツールの種類判定、リクエスト送信、プログラムの実行、ファイル管理、結果の収集と次のタスク手配など、ほとんどはCPUで処理されます。AMDの計算および企業AI担当VP Madhu Rangarajanは、自社の実運用パイプラインで8つのフェーズのうち7つが完全にCPU上で稼働していると述べています。この比率はAMD内部テストの値で全てのシステムを代表するものではないものの、モデル推論はエージェントがタスクを完了する一部であり、それ以外のすべての調整や管理はCPUに委ねられていることを示しています。


単一のエージェントによるCPU負荷は小さいとしても、規模が拡大するとその消費は膨大なものになります。


一つのエージェントは複数のツールを同時に呼び出せますし、サブエージェントの作成も可能です。企業が同じシステムを何万人もの従業員に展開した場合、並列タスク数は急激に増えます。それぞれのエージェントが出力解析、コード実行、データ読み書きを行い、CPU負荷も断片的なものから積み重なり容量要件となります。CPUの処理が遅ければ、GPUは次の推論用入力を待たされることになります。


セキュリティチェックの強化もCPUへの負担を増しています。エージェントに権限を与えれば与えるほど、どのファイルを開いたか、どのAPIを呼び出したか、機密データに接触したかなど、システム側のチェックが不可欠になります。ルールマッチングやログ解析、小規模モデルによる審査などは分散・低遅延が求められ、GPUを個別に呼ぶほどコスパがよくありません。そのため、エージェントがより自律的になるほど検査項目が増え、CPU負担も重くなります。


今年7月には、OpenAIのエージェントが社内セキュリティ評価でサンドボックスを突破し、Hugging Faceのプロダクションシステムに侵入するという事件が起きており、このようなセキュリティメカニズムの重要性、そして実装に伴うコストの大きさを物語っています。


もう一つ見落とされがちな負担がトークナイゼーションです。


大規模言語モデルでテキストを扱う際は、まず文字列をTokenに変換します。この過程は大量の文字列処理と分岐判定を含み、GPUのような行列演算向きではありません。通常の会話では入力が非常に短く、トークナイゼーションの遅延はほとんど問題になりませんが、エージェントはツールの返却結果やコード、ログ、歴史的操作の積み増しにより、入力が数万〜数十万Token規模に伸びることがあります。


ジョージア工科大学の博士課程Euijun Chungは、IEEE Spectrumのインタビューで、ある実装では既に10万Tokenのコンテキストへさらに1,000Tokenのツール結果を加えた場合、トークナイザーが全体を再処理するケースを紹介しています。プリフィックスキャッシュやインクリメンタル・トークナイゼーションによって重複処理を減らすことも可能ですが、すべてのシステムでそうなるわけではありません。長文入力によるCPU負担は依然として重いのです。


Chungチームは最新論文でLlama 3.1やQwen3などのモデルを検証しています。長いシーケンスや大バッチ設定では、トークナイゼーションが最初のToken遅延の約80%を占める場合もありました。CPUコアが足りないと、トークナイザーのスレッドがタスクスケジューリングやGPUカーネル起動とリソースを奪い合い、結果としてCPUはフル稼働し、GPUはフルに活用されない状況が起こります。CPUコアを増やした場合、設定によって初Token遅延が1.47~5.15倍改善され、GPUを増やさずとも効果が得られます。


業界データもこの変化に呼応し始めています。2026年1月、KeyBancはサプライチェーン調査に基づき、Intelの年間サーバー向けCPU生産能力の大半が既に売り切れており、AMDも供給がフル稼働状態で、両社は値上げ余地があると判断しています。これはアナリストの推計で、メーカーの公式受注データではありません。


その後のIntelの財務書類も一部それを裏付けています。サーバー向けCPUの需要が2026年第1四半期に供給を上回り、内部生産能力の制限が年末まで続く見込みです。サーバー製品の平均価格は前年同期比27%上昇した一方で、出荷量は5%減少。Intelは値上げの理由を高付加価値製品割合の上昇と需要価格設定、コスト増加にあると説明しています。


AMDの同期間データセンター事業収入は58億ドルで、前年比57%増となりました。この成長はEPYCサーバーCPUとInstinct GPUの両方から生じており、サーバーCPU事業単体の伸び率は開示されていません。そのため、57%すべてをAIエージェント需要に起因すると断定はできません。


今後の見通しについてはより積極的です。AMDはかつてサーバーCPU市場の年間成長率を約18%と予測していましたが、2026年5月にその予測を35%以上に引き上げ、市場規模が2030年までに1,200億ドルを超える見通しとしています。AIエージェントには、オーケストレーションやデータ処理、ツール実行およびセキュリティチェックを担う独立したCPUコンピューティング層が必要である、というのがその理由です。


従来のデータセンターでは、1つのCPUで4〜8つのGPUを管理することが一般的でした。AMDは、AIエージェントシステムでは、この比率が1:1に近づいていると観察しており、一部のワークロードではそれ以上に多くのCPUを必要としています。これはあくまでも顧客のニーズをもとにしたサプライヤの評価であり、実際の構成はワークロードによってさまざまです。ただ、構成バランスの方向が変わりつつあるのは明らかで、CPUを数個追加するだけでは足りず、クラウド事業者はAIエージェント専用のCPUラックの構築を検討し始めています。


Armも2026年3月に、プロセッサ設計のライセンス提供のみならず、初めてデータセンター向けCPUの直接販売に乗り出しました。そのAGIプロセッサは最大136コアで、Metaも開発に参加しています。Armは、同じ消費電力でエージェントデータセンターに必要なCPU容量は、現行データセンターの4倍以上に達すると見込んでいます。


クアルコムもすぐに250コア超のDragonfly C1000を発表し、Metaと複数世代サーバーCPU協業契約を締結しました。Intel、AMD、Arm、クアルコム、そしてNvidiaが「AIエージェント用CPU」を各社の製品ロードマップに相次いで加えたことで、競争は従来のx86市場のみならず、Armサーバーや独自設計コア、さらには専用ラック設計にまで拡大していることが分かります。


Nvidiaはこの中でも特別な立ち位置にいます。CPU負荷を生むGPU自体を販売する一方で、その負担緩和となるVeraも販売。プロセッサ、ネットワークからストレージまで、Nvidiaは機器一式を提供可能です。Veraは単なるラインナップ拡大にはとどまらず、GPUの稼働率を守る役割もあります。GPUの待機時間が1秒減れば、それはより多くのトークン生成やラック収入増加に直結します。


ただし、チップメーカーが利益を追い求める中で、その皺寄せは結局私たち消費者へ戻ってきます。GPUやメモリチップと同様に、今回の生産能力変化によるコストもまた消費者負担となる可能性は高いです。


Intelは2025年第4四半期の決算説明会にて、社内ウェーハ供給はできる限りデータセンター向けにシフトし、クライアント製品は外部ファウンドリ比重を高めていると説明しました。その後、完全なクライアント撤退はできないとも補足しています。2026年第1四半期にはクライアント向けCPUの平均価格は前年同期比16%上昇、出荷量は13%減となり、供給制約は少なくとも上半期まで続く見通しです。


クライアント製品の価格・供給変動はAIエージェントだけが原因ではありません。Intelのプロセス変更や、社内外生産能力・メモリ供給も価格や出荷に影響します。しかし供給が限られる中で、サーバーチップはコア数が多く高価で、クラウド事業者は長期契約も進んで結ぶため、生産リソースは必然的にデータセンターへ向かいがちです。


過去3年間、一般消費者は既にGPUの価格高騰や品薄を経験しました。今度は同じことがCPUでも起きるかもしれません。


運営・レイアウト:何晨龍


注記:カバー画像/トップ画像はAI支援で生成されています

0
0

免責事項:本記事の内容はあくまでも筆者の意見を反映したものであり、いかなる立場においても当プラットフォームを代表するものではありません。また、本記事は投資判断の参考となることを目的としたものではありません。

PoolX: 資産をロックして新しいトークンをゲット
最大12%のAPR!エアドロップを継続的に獲得しましょう!
今すぐロック

こちらもいかがですか?

FRBの政策は実は「緩和気味」?サンフランシスコ連邦準備銀行の中立金利新モデルがタカ派に理論的な根拠を提供

地方連邦準備銀行の研究報告によると、中立金利の推定値は、FRBの政策スタンスが緩和的であることを示している。

智通财经2026/08/18 07:21
FRBの政策は実は「緩和気味」?サンフランシスコ連邦準備銀行の中立金利新モデルがタカ派に理論的な根拠を提供

AI推論がNANDスーパーサイクルを巻き起こす!SanDisk(SNDK.US)は年内に629%急騰し、JPモルガンは依然として2,250ドルを予想

JPモルガンのアナリスト、ハーレン・サー(Harlan Sur)は最近SanDiskのカバレッジを再開し、「オーバーウェイト(増持)」の格付けを付与、目標株価を2,250ドルと設定しました。この目標株価は、同株の月曜日の終値1,786.85ドルより約26%の上昇余地となります。

智通财经2026/08/18 07:11
AI推論がNANDスーパーサイクルを巻き起こす!SanDisk(SNDK.US)は年内に629%急騰し、JPモルガンは依然として2,250ドルを予想

インフレの粘着性、AIによる債務および財政の混乱が重なり、30年物米国債利回りが2007年以来の高水準を記録、世界の債券市場は「デュレーション・ストーム」に直面

長期債券は投資家の不安感の中心となっており、市場はインフレ見通しや、負債の重い人工知能(AI)ブームなど多くの問題に懸念を抱いています。各国政府もこれに対する代償を支払っています。

智通财经2026/08/18 07:06
インフレの粘着性、AIによる債務および財政の混乱が重なり、30年物米国債利回りが2007年以来の高水準を記録、世界の債券市場は「デュレーション・ストーム」に直面

予算危機が加わり大統領選挙が迫る中、政治リスクプレミアムが引き続き上昇し、フランス国債が空売りの標的になっている

2027年の予算をめぐってフランスの政界関係者が激しい駆け引きを準備し、来年の大統領選挙も近づく中、投資家たちはフランス政府債券に対して弱気に転じています。

智通财经2026/08/18 07:06
予算危機が加わり大統領選挙が迫る中、政治リスクプレミアムが引き続き上昇し、フランス国債が空売りの標的になっている