Дефіцит GPU ще не закінчився, а тепер, ймовірно, почнуть скуповувати CPU
31 травня 2026 року Nvidia оголосила про початок масового виробництва CPU з 88 кастомними ядрами. Його назвали Vera, він базується на інструкціях Arm та власних ядрах Olympus від Nvidia, і буде інтегрований у платформу суперкомп'ютера Vera Rubin, а також використовуватиметься в окремих CPU-серверах. Dell, HP, Lenovo, Supermicro та інші виробники серверів вже почали виготовляти системи, оснащені Vera.
Nvidia називає Vera "першим CPU, створеним для AI-агентів".Vera буде працювати разом із Rubin GPU як єдина платформа, а також використовуватиметься у самостійних CPU-серверах.Після багатьох років продажу GPU, Nvidia знову починає продавати обчислювальну потужність CPU окремо – це, здається, досить незвично.
Зображення丨 Nvdia Vera (джерело: Nvdia)
Протягом останніх трьох років апаратна тривога AI-індустрії майже завжди була навколо GPU. Для тренування потрібні додаткові GPU, для інференсу — більше GPU, а зі зростанням кількості параметрів моделей та користувачів відповідь залишається тією ж: додати GPU. У цій системі CPU запускає завдання, переносить дані та керує сервером, і рідко виступає в ролі головного героя, що цікавить інвесторів.
Зміна форми завдання сталася з появою AI-агентів.
Звичайний чат-бот отримує текст, запускає модель і генерує відповідь. Агент повинен перетворити рішення моделі на дію: читати файли, шукати у вебі, запитувати базу даних, викликати API, виконувати код та передавати результат назад у модель. Одна задача може включати десятки циклів "інференс — дія — спостереження", і кожен із них передбачає перемикання між GPU та CPU.
GPU все ще відповідає за найскладніші обчислення моделей, а розбір виходу моделей, визначення типу інструментів, ініціалізація запитів, запуск програм, управління файлами, збір результатів та організація наступної фази роботи зазвичай здійснюється CPU. За словами віцепрезидента AMD з обчислень та корпоративного AI Madhu Rangarajan, у реальному конвеєрі агентів компанії 7 з 8 етапів повністю виконувались на CPU. Це співвідношення базується на внутрішньому тестуванні AMD і не обов'язково є універсальним для усіх систем, але воно достатньо показове:інференс моделі — лише одна ланка в циклі виконання завдання агентом, а всі координаційні роботи поза межами моделі лягають на CPU.
Витрати на одного агента можуть бути невеликими, але при масштабуванні ці цифри стають вражаючими.
Один агент може одночасно використовувати кілька інструментів або створювати під-агентів. Якщо компанія розгортає одну й ту ж систему для десятків тисяч співробітників, кількість паралельних завдань може швидко зрости. Кожен агент розбирає результати, виконує код, читає та записує дані — раніше розрізнене навантаження на CPU починає накопичуватися до рівня потреби у додаткових потужностях. Якщо CPU обробляє повільно, GPU змушений чекати на введення для наступної фази інференсу.
Зростає і навантаження від перевірок безпеки. Чим більше прав має агент, тим більше системних перевірок щодо доступу до файлів, виклику API, взаємодії з чутливими даними. Відповідність правилам, аналіз журналів і невеликі моделі для перевірки зазвичай виконуються на CPU — завдання розпорошені, чутливі до затримки, окремий виклик GPU може бути невиправданим. Таким чином, чим більше автономії у агента — тим більше перевірок, тим більше навантаження на CPU.
У липні цього року агент OpenAI під час внутрішньої перевірки безпеки несподівано обійшов sandbox та проник у виробничу систему Hugging Face — це інцидент ілюструє важливість таких механізмів безпеки, а також ті додаткові обчислювальні витрати, які вони вимагають у реальних розгортаннях.
Ще одне навантаження, яке часто не помічають — токенізація.
Перед обробкою тексту великою моделлю, його треба перетворити на Token. Це передбачає багато роботи зі строками та розгалужень, що не так ефективно на GPU як матричні обчислення. Вхід у звичайній бесіді короткий, затримки токенізації малопомітні; агент накопичує результати інструментів, код, журнали й історію операцій — вхід може зростати до десятків тисяч Token чи навіть більше.
Аспірант Georgia Institute of Technology Euijun Chung у інтерв'ю IEEE Spectrum навів приклад: у деяких реалізаціях при додавання 1000 Token до контексту із 100 000 Token токенізатор може обробляти весь об'єм заново.Кешування префіксу і інкрементна токенізація можуть зменшити повторну роботу, тому це не обов'язково для кожної системи; однак навантаження на CPU від довгих текстів зберігається.
Команда Chung у нових дослідженнях тестувала моделі Llama 3.1 та Qwen3. У довгих послідовностях та налаштуваннях великого батчу токенізація становила до 80% затримки першого Token. При нестачі ядер CPU потоки токенізації конкурують за ресурси із планувальниками завдань та запуском ядер GPU, через що CPU максимально завантажується, тоді як GPU не використовується повністю. Збільшення кількості ядер CPU дозволило покращити затримку першого Token від 1,47 до 5,15 разів для різних налаштувань без збільшення GPU.
Дані індустрії вже реагують на ці зміни. У січні 2026 року KeyBanc, на основі дослідження ланцюгів поставок, зробила висновок, що більша частина серверних CPU Intel була продана на рік уперед, а поставки серверних CPU AMD майже повністю зайняті, тож обидві компанії мають можливість підвищити ціни. Це заключення аналітиків, а не офіційні дані постачальників.
Подальші фінансові документи Intel підтвердили це частково. Компанія заявила, що у першому кварталі 2026 року попит на серверні CPU перевищив можливості постачання, і внутрішнє обмеження потужностей триватиме до кінця року. Середня ціна серверної продукції зросла на 27% (рік у рік), але відвантаження знизилось на 5%; Intel пов'язує зростання ціни зі збільшенням частки високопродуктивної продукції, ціноутворенням під попит та зростанням витрат.
Дохід AMD у сегменті дата-центрів за той же період склав 5,8 млрд доларів, зі зростанням 57% у порівнянні з минулим роком; це зростання отримано як від EPYC серверних CPU, так і від Instinct GPU. AMD не розділяє дані за серверними CPU окремо, тому не можна віднести всі 57% зростання лише до потреб агентів.
Прогнози компаній ще більш амбіційні. AMD раніше оцінювала річне зростання серверного ринку CPU у 18%, а в травні 2026 року підняла очікування до понад 35%, прогнозуючи, що ринок до 2030 року перевищить 120 мільярдів доларів.Як пояснює AMD, агенти потребують окремого CPU-шару для координації, обробки даних, виконання інструментів та забезпечення перевірок безпеки.
Раніше у дата-центрі один CPU управляв 4–8 GPU. AMD відзначає, що агенти змінили ці пропорції до 1:1, а в деяких навантаженнях CPU використовується ще більше. Це висновок постачальників на основі потреб клієнтів, і реальні конфігурації можуть бути дуже різними, але напрямок змін зрозумілий: кілька додаткових CPU вже не вирішують проблему, провайдери хмар почали розглядати будівництво окремих CPU-стійок для агентів.
Arm у березні 2026 вперше перейшла від продажу дизайн-процесорів до прямої реалізації дата-центричних CPU. Його AGI-процесор має до 136 ядер і створений за участю Meta. Arm оцінює, що за ті ж енергоспоживання потужності CPU для дата-центрів агентів можуть бути більш ніж у чотири рази більшими, ніж у традиційних дата-центрах.
Згодом Qualcomm випустив Dragonfly C1000 із понад 250 ядрами та підписав із Meta багаторічну угоду щодо серверних CPU. Intel, AMD, Arm, Qualcomm і Nvidia вписали "CPU для агентів" до своїх продуктових планів за кілька місяців, вказуючи, що ця конкуренція вже вийшла за межі традиційного x86-ринку, розповсюджуючись на сервери Arm, власнорозроблені ядра та дизайн цілих стійок.
Nvidia займає тут особливе місце. Вона одночасно продає GPU, що створюють навантаження на CPU, та Vera, що його зменшує; від процесорів і мережі до зберігання даних — весь комплект обладнання може бути від Nvidia.Тому Vera — не просто розширення лінійки, вона повинна захищати ефективність GPU. Кожна секунда, яку GPU не проводить у очікуванні, може перетворитися на більше Token і вищий дохід із стійки.
Втім, коли виробники чіпів слідують за грошем, хтось завжди платить ціну. Як і у випадку GPU та чипів пам'яті, тепер зміни потужностей, скоріш за все, знову доведеться оплачувати нам, споживачам.
На квартальному звіті за четвертий квартал 2025 року Intel визнала: компанія намагається перевести внутрішнє постачання пластин на дата-центри, збільшуючи частку клієнтських продуктів у зовнішньому виробництві; керівництво додало, що Intel не може повністю залишити клієнтський ринок. У першому кварталі 2026 року середня ціна клієнтських CPU зросла на 16% (рік у рік), а обсяги продажу впали на 13%; компанія очікує, що обмеження потужностей триватимуть як мінімум до середини року.
Зміни у клієнтських продуктах не можна повністю пояснити лише агентами. Власні переходи Intel щодо техпроцесу, зовнішні/внутрішні потужності та постачання пам'яті також впливають на ціну та відвантаження. Але за обмеженої потужності серверні чипи мають більше ядер та вищу ціну, провайдери хмар готові укладати довгострокові контракти — і виробничі ресурси закономірно перерозподіляються на користь дата-центрів.
За останні три роки звичайні споживачі вже відчули на собі підвищення цін та дефіцит GPU. Тепер схоже, ця ж історія може повторитися для CPU.
Розробка/верстка: Хе Ченьлун
Примітка: обкладинка/головне зображення створено за допомогою AI
Відмова від відповідальності: зміст цієї статті відображає виключно думку автора і не представляє платформу в будь-якій якості. Ця стаття не повинна бути орієнтиром під час прийняття інвестиційних рішень.
Вас також може зацікавити
Чи стала політика Федеральної резервної системи насправді "досить м'якою"? Нову модель нейтральної ставки Федерального резервного банку Сан-Франциско використали як теоретичний аргумент для яструбів
Згідно з дослідженням місцевої резе рвної системи, оцінка нейтральної процентної ставки свідчить про те, що політика Федеральної резервної системи є м’якою.

AI-інференс запускає суперцикл NAND! Sandisk (SNDK.US) злетіла на 629% цього року, але JPMorgan як і раніше оцінює цільову ціну в 2250 доларів
Аналітик JPMorgan Харлан Сур нещодавно відновив покриття SanDisk, надав рейтинг "купувати" і встановив ціл ьову ціну в 2250 доларів США. Ця цільова ціна передбачає майже 26% зростання від понеділкової ціни закриття акцій у 1786,85 доларів США.

Інфляційна інерція, борги штучного інтелекту та фіскальний хаос спричиняють потрійний тиск: прибутковість 30-річних казначейських облігацій США досягла найвищого рівня з 2007 року, глобальний ринок облігацій зустрічає «шторм тривалості».
Довгострокові облігації стають епіцентром занепокоєння інвесторів — саме на них концентруються побоювання щодо перспектив інфляції, боргового навантаження штучного інтелекту (AI) та інших проблем, і саме за це уряди різних країн змушені платити ціну.

Бюджетна криза накладається на наближення виборів! Премія політичного ризику продовжує зростати, державні облігації Франції під атакою шортів
Оскільки французькі політики готуються до запеклих дебатів щодо бюджету на 2027 рік, а президентські вибори наступного року наближаються, інвестори починають займати короткі позиції щодо державних облігацій Франції.

