Спеціальна версія чипа AMD MI450 від Meta має вдвічі меншу потужність обчислень і значно скорочену пам’ять, SemiAnalysis: Це сумний наслідок корпоративної культури Meta
Мільярди доларів витрачені даремно! У Meta під час створення інфраструктури для ШІ постійно виникають “катастрофічні” помилки: компанія наполягала на обмеженні найпотужніших чипів AMD, а угода з придбанням на 2,5 мільярда перетворилась на хаос. Інститути рішуче критикують, що короткозорість у досягненні показників ефективності та надмірна кастомізація знищують синергію між програмним і апаратним забезпеченням. Ця глибока організаційна криза дуже дорого коштує Meta.
Серія помилок Meta у сфері інфраструктури AI демонструє глибокі проблеми організаційної культури компанії, ціною в десятки мільярдів доларів.
За останніми даними дослідницької організації чипів SemiAnalysis, Meta вимагає від AMD розробити для неї кастомізований чип MI450X зі значно зниженими характеристиками — кількість обчислювальних блоків скоротиться вполовину, кількість стеків HBM пам’яті зменшується з 12 шарів до 8, обсяг пам’яті зменшується майже на дві третини. SemiAnalysis прямо називає це рішення “катастрофічним” та публічно закликає AMD обійти команду Meta з інфраструктури і напряму співпрацювати з лабораторією TBD Lab Meta, щоб просувати стандартну версію MI450X.
Цей випадок не є поодиноким. SemiAnalysis зазначає, що від понад 2,5 мільярдів доларів на купівлю Rivos, через кастомізовані сервери H100 Grand Teton до кастомізованих схем GB200 Ariel — рішення команди інфраструктури Meta характеризуються постійними перебільшеннями інженерних підходів, відсутністю синхронізації апаратного й програмного забезпечення та домінування короткострокових політичних інтересів над стратегічними технічними аргументами. “Команда інфраструктури Meta потребує культурного перезавантаження,” — пише SemiAnalysis.

Найпотужніший чип AMD “обрізано”, продуктивність GenAI критично постраждала
AMD MI450X — один із найбільш радикальних GPU за специфікаціями: використовує 2-нанометровий техпроцес, технологію змішаного з’єднання, 12 стеків HBM4 пам’яті, а також найбільшу на ринку маску CoWoS, що встановлює максимально можливу щільність упаковки та зберігання. 
Однак, за інформацією SemiAnalysis, кастомізована версія, яку замовила Meta, має вдвічі меншу кремнієву площу та зменшує стек HBM з 12-Hi до 8-Hi, що одночасно знижує ключові показники обчислювальної потужності та пропускної здатності пам’яті. Команда інфраструктури Meta обґрунтовує рішення тим, що ця конфігурація призначена для навантаження рекомендованих систем (RecSys), щоб підвищити співвідношення обчислень CPU і GPU.
Проблема в тому, що рішення ухвалене до створення TBD Lab — основного дослідницького відділу Meta з великих моделей, які абсолютно не зацікавлені в цьому чипі. SemiAnalysis прямо заявляє: порівняно з Vera Rubin від Nvidia, “обрізаний” MI450 не цікавий TBD Lab, “TBD обере Rubin.” Це означає, що поставки AMD для Meta суттєво постраждають через це рішення.
SemiAnalysis у звіті прямо звертається до AMD: “AMD має вийти наперед і напряму співпрацювати із командою TBD, щоб вони отримали стандартний чип MI450, а не варіант, що не має жодної користі для GenAI.
Поглинання Rivos: понад 2,5 мільярдів доларів — і провал
Ще один типовий приклад невдалих рішень з боку Meta — завершення поглинання Rivos у 2024 році за понад 2,5 мільярдів доларів.
За даними SemiAnalysis, небагато з внутрішньої команди Meta чипів дійсно розуміли стратегічну логіку цієї купівлі, а ті, хто просував цю угоду, надалі стали менш активними. Основна думка: Meta має достатньо коштів, кастомізація чипів зростає, до того ж вже були ліцензійні угоди з Rivos, тому менеджмент вирішив приєднати всю компанію.
Проте структура угоди вже містила критичні проблеми. Команда засновників Rivos наполягала на продажі всієї компанії, тому Meta була змушена купити все, а потім скоротила непотрібні відділи. Колишній співробітник чипів Meta зазначає, що угодою керував керівник кремнієвого департаменту Meta Yee Jiun Song, з опором усередині, але після завершення його інтерес до проекту згас. Дійсний управлінець чипової команди розглядає інженерів Rivos як “безкоштовну робочу силу”, приєднує їх до своїх підрозділів — оригінальна структура була зруйнована.
З технологічної точки зору основна цінність — SIMT-архітектура GPU IP від Rivos — була втрачена разом із відміною проекту Olympus, який планувався для цієї технології. В якості альтернативу був запропонований проект Phoebe, і SemiAnalysis відзначає, що перша можливість виробництва очікується не раніше 2028 року, але скептицизм всередині компанії щодо його перспектив великий.
Втрати персоналу також вражаючі. За даними SemiAnalysis, близько 30% співробітників Rivos покинули компанію під час останніх скорочень, співзасновник Mark Hayter вже пішов, багато колишніх працівників Rivos після першої хвилі RSU у травні 2024 перейшли до Nuvacore — чипового стартапу, заснованого Gerard Williams. SemiAnalysis також повідомляє, що генеральний директор та співзасновник Rivos Puneet Kumar, ймовірно, піде через один-два роки після повного отримання акцій Meta.
Grand Teton та Ariel: повторювані конструкційні помилки
Пристрасть Meta до кастомізації не виникла нещодавно. Кастомізований сервер H100 Grand Teton, порівняно зі стандартним HGX-сервером, містить додатковий лоток комутатора, чотири Broadcom PCIe-комутатори, 16 SSD та вісім мережевих карт — щоб забезпечити більше прямого з’єднання для зберігання даних кожного сервера, переважно для збереження checkpoint-моделей.
Однак після введення в експлуатацію, команда моделювання використовувала це сховище набагато менше, ніж очікувалося, і дизайн згодом було відкинуто. SemiAnalysis зазначає, що це типовий приклад відсутності спільної розробки апаратного і програмного забезпечення у Meta — інфраструктурна команда витратила більше ресурсів та енергії на функції, які не використовувалися, а також збільшила залежність від Broadcom, що суперечить початковій ідеї зменшити залежність від мережевих пристроїв Nvidia.
У Blackwell-епоху Meta впроваджує подібну логіку в кастомізовану схему Ariel. Стандарт GB200 передбачає два B200 GPU на кожен Grace CPU, але Ariel змінює це на конфігурацію один до одного — кількість GPU скорочується вдвічі. Обґрунтування таке ж: підвищити частку CPU для навантаження RecSys.

За розрахунками SemiAnalysis, загальна вартість володіння (TCO) для схеми Ariel NVL36x2 на 14% вища, ніж стандартний GB200 NVL72, при цьому додаткові CPU і DRAM отримує команда великих моделей, яким ці ресурси не потрібні. Для компенсації скорочення GPU використовується міжстелажний зв’язок — це призводить до затримок у мережі і зниження надійності. Тим часом, спочатку нестабільний NVL72 бекплейн поступово вдосконалюється, й оцінка ризику цієї технології з боку Meta виявилася хибною.
SemiAnalysis підтверджує: сервери Meta GB300 повернулись до стандартної конфігурації — це фактично відмова від підходу Ariel.
Культурні корені: короткострокові оцінки переважають над стратегічними рішеннями
SemiAnalysis вбачає причину проблем у культурі інфраструктурної команди Meta.
За даними організації, шестимісячний цикл оцінки ефективності Meta передбачає звільнення останніх 10-15% співробітників кожного разу, що змушує команду фокусуватися на короткострокових помітних результатах замість довгострокових технологічних інвестицій. Деякі менеджери активно просувають проекти з високою медійною вагою, але швидкими дедлайнами, і відразу переходять до наступних, що називається “window washing” — декоративне показове оновлення. До того ж, майже ніхто відкрито не заперечує рішення керівництва, помилки не виправляються оперативно.
Команда постачання має слабке слово при прийнятті інженерних рішень, що погіршує ситуацію. SemiAnalysis також повідомляє, що деякі постачальники знизили пріоритетність нових проектів Meta через часті зміни напрямів, надаючи перевагу Amazon чи Google.
SemiAnalysis порівнює цю ситуацію з історією розвитку Reality Labs Meta — до масових скорочень десятки мільярдів доларів вкладалися у величезні інженерні команди та дослідження. Тепер, коли Meta прагне продавати обчислювальні потужності зовнішнім клієнтам, вартість внутрішньої культури стала більш очевидною для ринку.
Відмова від відповідальності: зміст цієї статті відображає виключно думку автора і не представляє платформу в будь-якій якості. Ця стаття не повинна бути орієнтиром під час прийняття інвестиційних рішень.
Вас також може зацікавити
Доходність 30-річних держоблігацій США досягла найвищого рівня з 2007 року, а випуск інвестиційного класу облігацій у США в серпні досяг рекордного показника для цього періоду.
У понеділок прибутковість 30-річних державних облігацій США на деякий час перевищила 5,31%. Компанії масово випускають облігації для підтримки AI-активності, що погіршує дисбаланс попиту і пропозиції на ринку облігацій з довгим терміном погашення; у серпні обсяг випуску інвестиційних облігацій у США сягнув 145,2 млрд доларів, перевищивши місячний рекорд у 136 млрд доларів, встановлений у серпні 2020-го. До того ж, майже 2 трлн доларів щорічного бюджетного дефіциту уряду США продовжують підвищувати пропозицію державних облігацій.

Чи дійсно SanDisk настільки вигідний, навіть порівняно з DRAM?

Nvidia інвестує 1,5 мільярда доларів у SB Energy, забезпечує 8 ГВт потужності для AI, OpenAI стане єдиним орендарем
Nvidia розширює межі конкуренції з GPU та серверів до земель, електроенергії та будівництва центрів даних AI. Компанія співпрацює з SB Energy, розробляючи в Огайо надмасштабний дата-центр AI на 8 ГВт, і інвестує в нього 1,5 мільярда доларів, забезпечуючи кредитну підтримку фінансування інфраструктури; OpenAI виступає єдиним орендарем. Цей крок означає, що Nvidia переходить від постачальника чипів до організатора AI-інфраструктури, заздалегідь закріплюючи ресурси LPS для забезпечення майбутнього попиту на багато поколінь GPU.
