Meta заказала специальную версию AMD MI450 с вдвое меньшей вычислительной мощностью и значительно уменьшенной памятью. SemiAnalysis: это трагедия корпоративной культуры Meta.
Потеря миллиардов долларов! У Meta произошли "катастрофические" ошибки в инфраструктуре ИИ: компания принудила AMD к урезанию своих мощнейших чипов, а сделка по покупке за 2,5 миллиарда закончилась провалом. Институты резко критикуют, что культура краткосрочной результативности и чрезмерная кастомизация убивают синергию между программным и аппаратным обеспечением. Этот глубокий организационный кризис дорого обходится Meta.
Череда ошибочных решений Meta в сфере AI-инфраструктуры раскрывает глубокие проблемы организационной культуры компании, стоящие миллиарды долларов.
Согласно последней информации от аналитического агентства полупроводниковой индустрии SemiAnalysis, Meta требует от AMD разработать для неё кастомизированную, значительно урезанную версию чипа MI450X — число вычислительных ядер должно быть уменьшено вдвое, количество стэков HBM-памяти сокращено с 12 до 8, а объем памяти уменьшен практически на две трети. SemiAnalysis напрямую называет это решение "катастрофическим" и публично призывает AMD обойти инфокоманду Meta и выйти на прямой контакт с суперлабораторией Meta TBD Lab для продвижения стандартной версии MI450X.
Этот случай не является изолированным. SemiAnalysis отмечает, что от поглощения Rivos за более чем 2,5 миллиарда долларов, через кастомные серверы H100 Grand Teton и до кастомного решения GB200 Ariel — для инфраструктурной команды Meta характерны чрезмерная усложненность инженерных решений, отсутствие координации между аппаратными и программными разработками и преобладание краткосрочных политических интересов над долгосрочной технической целесообразностью. "Команде инфраструктуры Meta необходим перезапуск культуры", — пишет SemiAnalysis.

Лучший чип AMD лишают потенциала, GenAI-вычисления серьезно страдают
AMD MI450X — один из самых амбициозных в плане характеристики GPU на рынке: он изготовлен по 2-нм техпроцессу, использует гибридное компоновочное крепление, 12 HBM4-слоёв и самую крупную фотошаблонную пластину CoWoS, что отражает высший уровень современной упаковки и плотности памяти.
Однако, по данным SemiAnalysis, для Meta изготавливается кастомная версия чипа — с вдвое меньшей площадью вычислительного кристалла и уменьшением HBM-стэков с 12-Hi до 8-Hi, в результате чего одновременно сокращаются и вычислительная мощность, и пропускная способность памяти. Инфраструктурная команда Meta мотивировала это требование тем, что конфигурация ориентирована на рабочие нагрузки рекомендательных систем (RecSys) и должна выровнять баланс CPU и GPU.
Проблема в том, что это решение было принято до создания TBD Lab — ключевой команды Meta по исследованию больших языковых моделей, которой данный чип оказался совершенно неинтересен. SemiAnalysis прямо утверждает, что, по сравнению с Vera Rubin от Nvidia, урезанный MI450 совершенно не привлекателен для TBD Lab — "TBD отдадут сильнейшее предпочтение Rubin". Это означает, что поставки AMD для Meta будут существенно тормозиться из-за этого решения.
В своем отчете SemiAnalysis в необычно прямой форме обращается к AMD: "AMD следует проявить инициативу и напрямую сотрудничать с командой TBD, чтобы они получили нормальный MI450, а не этот обрезанный вариант, не имеющий никакой ценности для GenAI."
Поглощение Rivos: более 2,5 млрд долларов ради разочарования
Еще одним ярким примером ошибочных решений инфраструктурной команды Meta стало поглощение Rivos в 2024 году за более чем 2,5 миллиарда долларов.
По данным SemiAnalysis, мало кто из внутреннего чипового подразделения Meta по-настоящему понимал стратегическую логику этой сделки, а лоббировавшие ее люди в дальнейшем ушли в тень. Распространённая точка зрения: у Meta много денег, индивидуальная разработка чипов набирает обороты, к тому же ранее уже были лицензии на интеллектуальную собственность Rivos, и менеджмент предпочёл купить весь бизнес целиком.
Однако структура самой сделки скрывала потенциальные проблемы. Основатели Rivos настояли на полной продаже всего коллектива, и Meta пришлось приобрести всю компанию, после чего она радикально сократила ненужные отделы. По словам бывших сотрудников Meta, ключевым инициатором сделки был глава отделения чипов Meta Yee Jiun Song, который столкнулся с внутренней оппозицией, но после завершения поглощения быстро терял к событию интерес. В результате нынешнее руководство чип-команды расценивает инженеров Rivos как "бесплатную рабочую силу", распределяя их по своим подразделениям, и исходная структура быстро развалилась.
С технической точки зрения основная ценность сделки — GPU IP-архитектура SIMT компании Rivos — стала бессмысленной после отмены проекта чипа "Olympus", который должен был её использовать. Замена — проект "Phoebe" — ожидается к шансе выпуска только в 2028 году, и, как отмечает SemiAnalysis, перспективы реализации видятся внутри компании весьма сомнительными.
Уход специалистов также поражает масштабами. По данным SemiAnalysis, около 30% сотрудников Rivos уволились после недавних сокращений, один из сооснователей, Mark Hayter, уже ушёл, а ещё часть бывших работников Rivos после первого начисления RSU в мае 2024-го примкнула к чиповой стартап-компании Nuvacore, основанной Gerard Williams. Также SemiAnalysis сообщает, что генеральный директор и сооснователь Rivos Puneet Kumar, возможно, уйдёт из компании в течение ближайших года-двух после полной передачи ему акций Meta.
Grand Teton и Ariel: повторяющиеся ошибки кастомных дизайнов
Страсть к радикальной кастомизации — не новое явление для Meta. Так, серверы H100 Grand Teton имели по сравнению с типичными HGX-серверами дополнительную плату со свитчами, четыре чипа Broadcom PCIe-свитча, 16 SSD дисков и восемь сетевых карт — чтобы увеличить прямое подключение к хранилищу для чекпоинтов обучения моделей.
Однако когда серверы поступили в производство, оказалось, что команда моделей использует дополнительное хранилище гораздо меньше, чем планировалось, из-за чего эта опция была отвергнута. По мнению SemiAnalysis, это классический случай отсутствия взаимодействия между аппаратными и программными инженерами — инфраструктурная команда оплатила повышенные расходы на комплектующие и энергопотребление ради недостаточно востребованной функции, при этом увеличившись зависимостью от Broadcom, что противоречило курсу Meta на снижение зависимости от сетевого оборудования Nvidia.
В эпоху Blackwell сценарий повторяется: кастомная конфигурация "Ariel" основана на той же логике. В стандартной версии GB200 на каждый процессор Grace приходится два GPU B200, а в Ariel установлена конфигурация "один к одному" — количество GPU сокращено вдвое, также под предлогом оптимизации RecSys-нагрузок и увеличения доли CPU.

По расчетам SemiAnalysis, общая стоимость владения (TCO) для Ariel NVL36x2 на 14% выше, чем для стандартного GB200 NVL72, и при этом дополнительные ресурсы CPU и DRAM совершенно не востребованы командой больших языковых моделей. Из-за необходимости компенсировать сокращение GPU межстеллажными сетевыми соединениями возникли дополнительные проблемы с задержками и надежностью, а изначально считавшаяся нестабильной бэкплейн-плата NVL72 теперь уже вполне зрелая технология — так что Meta ошиблась в оценке рисков.
По сообщениям SemiAnalysis, серверы Meta GB300 вернулись к стандартной конфигурации, что само по себе является признанием неудачи Ariel.
Корни культуры: краткосрочные KPI вытесняют долгосрочную стратегию
SemiAnalysis объясняет перечисленные проблемы особенностями организационной культуры инфраструктурной команды Meta.
Аналитики отмечают, что шестимесячный цикл оценки результатов работы, при котором увольняется 10–15% худших сотрудников, заставляет людей фокусироваться на достижении быстрых и наглядных успехов, а не на строительстве долгосрочного технологического фундамента. Некоторые менеджеры озабочены проектами с громким эффектом и быстрой отдачей — сразу после реализации они меняют вектор, а такой подход внутри компании называют "window washing" ("потёмкинские деревни"). Более того, редкий сотрудник осмеливается возражать руководству, из-за чего ошибки долго остаются неисправленными.
У цепочки поставок мало влияния на проектные решения, что лишь усугубляет описанные проблемы. SemiAnalysis подчеркивает: некоторые поставщики уже занизили приоритет для новых проектов Meta из-за её непоследовательности и предпочитают в первую очередь обеспечивать Amazon или Google.
Аналитики сравнивают это с историей расширения Reality Labs внутри Meta — до массовых сокращений десятки миллиардов долларов вливались в огромные инженерные команды и НИР. Теперь, когда Meta начинает продавать вычислительные мощности внешним клиентам, издержки внутренней культуры будут особенно явно проявляться на рынке.
Дисклеймер: содержание этой статьи отражает исключительно мнение автора и не представляет платформу в каком-либо качестве. Данная статья не должна являться ориентиром при принятии инвестиционных решений.
Вам также может понравиться
Доходность 30-летних казначейских облигаций США достигла максимума с 2007 года, выпуск инвестиционных облигаций в США в августе достиг рекордного уровня для этого периода.
В понедельник доходность 30-летних государственных облигаций США на время превысила 5,31%. Компании в условиях бума искусс твенного интеллекта активно размещают крупные выпуски облигаций, что усугубляет дисбаланс спроса и предложения на рынке долгосрочных бумаг. В августе объем выпуска инвестиционных облигаций в США достиг 145,2 млрд долларов, превысив рекорд августа 2020 года в 136 млрд долларов. Одновременно ежегодный бюджетный дефицит правительства США, близкий к 2 трлн долларов, продолжает увеличивать предложение государственных облигаций.

Выгоднее ли SanDisk, чем DRAM, и действительно ли он так хорош?

Nvidia инвестирует 1,5 миллиарда долларов в SB Energy, обеспечив 8 ГВт AI-мощностей, OpenAI станет единственным арендатором
Nvidia расширяет границы конкуренции от GPU и серверов до земли, электроэнергии и зданий AI-центров обработки данных. Компания сотрудничает с SB Energy для разработки сверхкрупного AI-центра мощностью 8 ГВт в Огайо и инвестирует в него 1,5 миллиарда долларов, предоставляя кредитную поддержку для инфраструктурного финансирования; OpenAI выступает единственным арендатором. Этот шаг означает, что Nvidia выходит за рамки роли поставщика чипов и становится организатором AI-инфраструктуры, заранее закрепляя ресурсы LPS для удовлетворения будущих потребностей в нескольких поколениях GPU.
