Дефицит GPU еще не закончился, теперь возможен ажиотаж на CPU
31 мая 2026 года Nvidia объявила о полномасштабном запуске в массовое производство CPU с 88 настраиваемыми ядрами. Процессор получил название Vera, использует архитектуру Arm и фирменные ядра Olympus от Nvidia, будет интегрироваться как в платформу суперкомпьютера Vera Rubin, так и устанавливаться в отдельные серверы CPU. Такие производители как Dell, HP, Lenovo, Supermicro и другие уже начали производство систем, оснащённых Vera.
Nvidia называет Vera “первым CPU, созданным специально для AI-агентов”.Vera будет частью единой платформы с GPU Rubin, а также устанавливаться в отдельные серверы CPU.Спустя долгие годы Nvidia, известная как продавец GPU, снова выходит на рынок вычислительных CPU, что выглядит весьма необычно.
Изображение | Nvdia Vera (Источник: Nvdia)
Последние три года всё аппаратное беспокойство в AI-индустрии крутилось вокруг GPU. Для обучения требовалось всё больше GPU, для инференса — снова больше GPU, при увеличении параметров моделей и числа пользователей ответом опять было наращивание GPU. CPU выполняли запуск задач, передачу данных и администрирование серверов, редко оказывались в центре внимания инвесторов.
Так было до тех пор, пока AI-агенты не изменили структуру задач.
Обычный чат-бот получает текст, пропускает через модель, генерирует новый текст. Агент же должен превратить решения модели в действия: читать файлы, искать в интернете, опрашивать базы данных, вызывать API, запускать код и возвращать результаты обратно модели. Одна задача способна пройти десятки циклов “инференс — действие — наблюдение”, каждый раз переключаясь между GPU и CPU.
GPU по-прежнему выполняет самую тяжёлую часть вычислений, а разбор вывода модели, определение типа инструмента, отправка запросов, запуск программ, управление файлами, сбор результатов и подготовка следующей итерации задачи — всё это обычно обрабатывается CPU. Вице-президент AMD по вычислениям и корпоративному AI Мадху Рангараджан отмечал: в одной из реальных конвейерных линий для интеллектуального агента 7 из 8 этапов полностью выполнялись на CPU. Эта статистика — внутренняя оценка AMD и не отражает всех систем, но достаточно показательна:инференс модели — лишь одна часть работы агента, все сопутствующие задачи ложатся на CPU.
Ресурсы, требуемые одним агентом, могут быть незначительными, но при масштабировании это число становится пугающим.
Один агент может параллельно вызывать несколько инструментов и даже создавать дочерние агенты. После внедрения такой системы тысячам сотрудников предприятия количество одновременных задач может быстро вырасти. Каждый агент разбирает вывод, исполняет код, работает с данными — разрозненная нагрузка на CPU накапливается до серьёзных масштабов. Если CPU обрабатывает задачи медленно, GPU ждёт следующего итерационного ввода для инференса.
Безопасность тоже увеличивает нагрузку на эту часть системы. Чем шире права у агента, тем тщательнее система должна проверять, что он открывает, какие API использует, обращается ли к конфиденциальным данным. Совпадение с правилами, анализ логов и ревью малыми моделями обычно проводят на CPU — задачи разнесены, чувствительны к задержкам и использование GPU не всегда рационально. Поэтому, чем больше автономии у агентов, тем выше нагрузка на CPU из-за проверки их действий.
Инцидент в июле этого года, когда агент OpenAI неожиданно прорвался из песочницы и получил доступ к производственной системе Hugging Face во время внутренней оценки безопасности, наглядно демонстрирует значимость подобного рода механизмов и ту вычислительную нагрузку, которую они могут породить при реальном развёртывании.
Ещё одна часто игнорируемая нагрузка — токенизация.
Для обработки текста крупной моделью сначала его разбивают на токены. Это требует больших усилий по обработке строк и ветвлений, не столь хорошо подходит для GPU, как матричные вычисления. При обычном коротком диалоге задержка токенизации незаметна. Но агент постоянно агрегирует результаты инструментов, код, логи, историю, и размер входа растёт до десятков или даже сотен тысяч токенов.
Аспирант Технологического института Джорджии Юиджун Чун в интервью IEEE Spectrum отмечал: в некоторых реализациях добавление 1000 токенов результата к уже имеющемуся контексту из 100 000 токенов может привести к повторной токенизации всего входа.Кэширование префикса и инкрементная токенизация позволяют уменьшить дублирующую работу — потому это не универсальный сценарий, но всё же долгое сообщение приводит к высокой нагрузке на CPU.
Команда Чунга в последней работе тестировала модели Llama 3.1 и Qwen3. При длинных последовательностях и больших батчах токенизация формировала до 80% задержки первого токена. Если ядер CPU не хватает, потоки токенизации конкурируют за ресурсы с планировщиком задач и запуском ядер GPU, из-за чего CPU оказывается перегруженным, а GPU простаивает. Увеличение числа ядер CPU ускоряет задержку по первому токену в 1,47—5,15 раза без добавления дополнительных GPU.
Индустриальные данные уже начинают откликаться на эти изменения. В январе 2026 года KeyBanc на базе анализа цепочек поставок сделал вывод, что у Intel большая часть годовой серверной мощности CPU уже распродана, а у AMD серверные CPU почти на предельной нагрузке, что даёт обеим компаниям пространство для повышения цен. Это не публичные данные о заказах, а лишь аналитическая оценка по каналам.
Дальнейшие финансовые документы Intel частично подтвердили это. Компания отметила, что в первом квартале 2026 года спрос на серверные CPU превысил объёмы предложения, а внутренние ограничения по мощности сохранятся до конца года. Средняя цена серверных продуктов выросла на 27% по сравнению с прошлым годом, при этом объёмы поставок снизились на 5%. Intel объясняет это ростом доли премиальных продуктов, ценообразованием по спросу и увеличением издержек.
Доход AMD от центров обработки данных за тот же период составил 5,8 млрд долларов при росте на 57% год к году, увеличение принесло как серверные CPU EPYC, так и GPU Instinct. AMD не выделяла отдельно темпы роста выручки по серверным CPU, поэтому нельзя всю долю приписывать исключительно спросу на агентов.
Прогнозы компаний становятся ещё смелее. Ранее AMD ожидала среднегодовой рост серверного рынка CPU около 18%. В мае 2026 года ожидаемый рост увеличен до 35% и более, с прогнозом, что к 2030 году рынок превысит 120 миллиардов долларов.Причина по AMD — агентам необходим отдельный слой вычислений CPU для оркестрации, обработки данных, выполнения инструментов и безопасности.
Ранее в дата-центрах обычно одна CPU управляла 4—8 GPU. Как отмечает AMD, агентные системы сдвигают пропорцию к 1:1, для некоторых нагрузок используется даже больше CPU. Это экспертная оценка поставщиков по клиентским задачам, на практике конфигурации будут очень разными. Но направление сдвига очевидно: просто добавить ещё несколько CPU недостаточно — облачные провайдеры начинают проектировать отдельные CPU-стеллажи для агентов.
В марте 2026 года Arm впервые перешла от продажи архитектурных лицензий к прямым продажам CPU для дата-центров. Его AGI-процессоры имеют до 136 ядер, разрабатывались с участием Meta. Arm оценивает, что при том же энергопотреблении объёмы CPU, необходимых для агентных дата-центров, могут превышать обычные в четыре раза.
Вскоре Qualcomm анонсировала Dragonfly C1000 с более чем 250 ядрами и заключила с Meta многолетний контракт на серверные CPU. Intel, AMD, Arm, Qualcomm и Nvidia за считанные месяцы прописали “агентные CPU” в свои продуктовые дорожные карты, что говорит о выходе конкуренции за пределы x86, в сторону Arm-серверов, собственных ядер и дизайнов серверных стеллажей.
Nvidia занимает в этом новом раскладе особое положение. Компания продаёт как GPU, создающие нагрузку на CPU, так и Vera, снимающую эту нагрузку; вся инфраструктура — от процессоров до сетей и хранения — может быть реализована средствами Nvidia.Vera — не просто расширение продуктовой линейки, а инструмент для защиты загрузки GPU: каждая секунда, на которой GPU не простаивает в ожидании, приносит больше токенов и выручки с каждого серверного стеллажа.
Однако когда чипмейкеры следуют за деньгами, издержки в итоге ложатся на кого-то другого. Как и с GPU и чипами памяти, вероятно, именно потребителям придётся платить за очередной виток изменений мощностей.
В ходе отчёта за IV квартал 2025 года Intel признала, что старается переориентировать внутренние фабрики пластин на серверное производство, наращивая внешнее производство клиентских продуктов; при этом руководство подчёркивает, что полностью уходить с клиентского рынка не планирует. В первом квартале 2026 года средняя цена CPU для клиентов у Intel выросла на 16%, объёмы — снизились на 13%. Компания рассчитывает, что ограничения по поставкам будут сохраняться по меньшей мере до середины года.
Изменения на клиентском рынке нельзя полностью списывать на агентов. Сам Intel переходит на новые техпроцессы, внешние и внутренние мощности, а также поставки памяти, что также влияет на цену и объёмы поставок. Но при ограниченных возможностях выпуска серверные чипы обладают большей численностью ядер и ценой, облачные провайдеры готовы подписывать долгосрочные контракты — поэтому ресурсы производства плавно перетекают в сторону дата-центров.
За последние три года обычные потребители уже испытали на себе рост цен и дефицит GPU. В ближайшее время похожий сценарий вполне вероятен и для CPU.
Операционная деятельность/верстка: Хэ Чэньлун
Примечание: Обложка/первая иллюстрация сгенерирована с помощью AI
Дисклеймер: содержание этой статьи отражает исключительно мнение автора и не представляет платформу в каком-либо качестве. Данная статья не должна являться ориентиром при принятии инвестиционных решений.
Вам также может понравиться
Является ли политика ФРС уже «достаточно мягкой»? Новый нейтральный процентный модель Федерального резервного банка Сан-Франциско предоставила ястребам теоретические аргументы
Согласно исследовательскому докладу одного из региональных отделений Федеральной резервной системы, оценка нейтральной процентной ставки указывает на то, что текущая политика Федеральной резервной системы является мягкой.

ИИ-инференция запускает суперцикл NAND! SanDisk (SNDK.US) с начала года выросла на 629%, и JPMorgan все еще оценивает ее в 2250 долларов
Аналитик JPMorgan Харлен Сур недавно возобновил покрытие SanDisk, присвоив рейтинг "покупать" с целевой ценой 2250 долларов. Эта целевая цена примерно на 26% выше закрытия акций в понедельник на уровне 1786,85 долларов.

Упорная инфляция, долговая нагрузка из-за AI и фискальный хаос: доходность 30-летних американских облигаций достигла максимума с 2007 года, мировые долговые рынки переживают «шторм дюрации»
Долгосрочные облигации становятся эпицентром тревоги инвесторов — все опасения рынка по поводу перспектив инфляции, тяжёлого долгового бремени и ажиотажа вокруг искусственного и нтеллекта (AI) сосредотачиваются именно на этом, и правительства разных стран платят за это цену.

Бюджетный кризис усугубляется на фоне приближающихся выборов! Премия за политические риски продолжает расти, французские государственные облигации становятся целью для "медведей"
По мере того как французские политики готовятся к ожесточённой борьбе вокруг бюджета н а 2027 год, а президентские выборы приближаются, инвесторы начинают занимать медвежьи позиции по государственным облигациям Франции.

