Meta na custom-made na AMD MI450 chip nabawasan ang computing power, malaking bawas sa memorya, SemiAnalysis: Ito ay isang trahedya ng Meta company culture
Bilyun-bilyong dolyar ang nasayang! Paulit-ulit na nagkakamali ang Meta sa AI infrastructure: pinilit ang AMD na putulin ang pinakamalakas nilang chip, at napasubo nang $2.5 bilyon sa isang pagbili na nauwi sa wala. Matindi ang batikos mula sa mga institusyon—sinisisi ang makitid na kultura ng performance at sobrang pag-customize na pumapatay sa magandang ugnayan ng hardware at software. Dahil sa malalim na krisis sa organisasyon, napakalaki ng nawawala ngayon sa Meta.
Ang sunod-sunod na maling desisyon ng Meta sa larangan ng AI infrastructure ay nagbubunga na ngayon ng sampu-sampung bilyong dolyar na gastos at tumatambad ang malalim na suliranin sa kultura ng kanilang organisasyon.
Ayon sa pinakahuling ulat ng chip industry research institute na SemiAnalysis, hinihiling ng Meta sa AMD na mag-customize ng MI450X chip na malaki ang pagbabawas sa mga detalye—ang compute units ay kalahati, ang bilang ng HBM memory stacks mula 12 layer pababa ng 8 layer, at halos dalawang-katlong bahagi ng original na kapasidad ang nabawas. Direktang inilalarawan ng SemiAnalysis ang desisyong ito bilang "kalunos-lunos" at hayagan nilang hinihikayat ang AMD na iwasan ang Meta infrastructure team at dumiretso sa Meta’s super intelligence laboratory na TBD Lab upang isulong ang procurement ng standard na MI450X.
Hindi ito isang isolated na pangyayari. Itinuturo ng SemiAnalysis na mula sa mahigit $2.5 bilyong acquisition ng Rivos, sa custom H100 server na Grand Teton, hanggang sa GB200 custom solution na Ariel—ang paraan ng pagpapasya ng Meta infrastructure team ay may pattern ng labis na engineering, kakulangan ng coordinated na hardware-software design, at nangingibabaw ang panandaliang pulitikal na motibo laban sa pangmatagalang teknikal na rasyonalidad. "Kailangan ng Meta infrastructure team ng cultural reset," ayon sa SemiAnalysis.

Ang pinakamalakas na chip ng AMD, "pinigil", malubhang naapektuhan ang GenAI performance
Ang AMD MI450X ay isa sa mga pinakaagresibong GPU sa merkado ngayon pagdating sa silicon engineering: gumagamit ng 2nm process, hybrid bonding packaging technology, 12-layer HBM4 memory stacks, at pinakamalaking CoWoS photomask size sa merkado—sumasalamin sa pinaka-advance na packaging at storage density sa kasalukuyan.
Ngunit ayon sa SemiAnalysis, ang custom version na inorder ng Meta ay may kalahating compute silicon area lang, at mula 12-Hi ay bumaba sa 8-Hi ang HBM stack, na sabay na nagpapaliit sa parehong computing at memory bandwidth core indicators. Ayon sa Meta infrastructure team, ang configuration na ito ay para sa recommendation system (RecSys) workload, na layuning pataasin ang CPU-GPU compute ratio.
Ang problema, ginawa ang desisyon bago pa man itinatag ang TBD Lab, na siyang pangunahing research team ng Meta para sa large model, ngunit hindi interesado sa chip na ito. Tuwirang binigyang-diin ng SemiAnalysis na kumpara sa Nvidia’s Vera Rubin, ang tinapyasang MI450 ay hindi mapang-akit sa TBD Lab—"Malaki ang magiging pagkiling ng TBD sa Rubin". Ibig sabihin, ang shipment ng AMD sa Meta ay malubhang maaapektuhan dahil sa desisyong ito.
Hindi pangkaraniwan, hayagang nanawagan ang SemiAnalysis sa AMD sa kanilang report: "Kinakailangan ng AMD na tumindig, direktang makipag-collaborate sa TBD team, at tiyaking makukuha nila ang regular na MI450, at hindi 'yung useless na tinapyas para sa GenAI."
Rivos acquisition: Higit $2.5 bilyong nauwi sa wala
Isa pang tipikal na halimbawa ng maling desisyon ng Meta infrastructure ay ang mahigit $2.5 bilyong acquisition ng Rivos noong 2024.
Ayon sa SemiAnalysis, kakaunti sa internal chip department ng Meta ang tunay na nakakaalam ng strategy logic ng acquisition na ito, at yaong mga nagtulak ng transaction noon ay nanahimik na. Mainstream view: may sapat na pera ang Meta, umiinit ang custom chip track, at nakapagle-license na rin ng Rivos IP noon, kaya naisip ng leadership na mas mabuting bilhin na lang lahat.
Ngunit sa mismong transaction structure pa lang ay may dagok na. Ipinilit ng Rivos founding team na ensemble selling ang lahat ng empleyado, kaya napilitang bilhin ng Meta ang buong kumpanya at saka nagsi-mass layoff sa mga di kailangan na department. Ayon sa dating chip employee ng Meta, ang acquisition ay pinangunahan ni Yee Jiun Song na head ng Meta silicon, at kahit may internal opposition, kumalma agad ang interes niya pagkaraan ng deal. Ang natitirang managers ng chip team ay itinuring ang Rivos engineers na "libreng manpower", inilipat sa kani-kanilang teams, at agad nagkawatak-watak ang original Rivos teams.
Sa technical perspective, ang core value sana ng acquisition—ang Rivos SIMT architecture GPU IP—ay nawala nang makansela ang original na "Olympus" chip project na dapat gagamit nito. Ang kapalit na "Phoebe" project ay inaasahang earliest 2028 pa magta-tape out, ngunit ayon sa SemiAnalysis, hindi sigurado ang internal team na matutupad pa ito.
Kita rin ang pagkawala ng mga tao. Ayon sa SemiAnalysis, mga 30% ng Rivos employees ang nag-resign kasunod ng mass layoff, umalis na si co-founder Mark Hayter, at ilang dating Rivos staff ay lumipat sa Nuvacore—ang startup ni Gerard Williams—pagka-vest ng unang batch ng RSU nitong Mayo 2024. Dagdag pa, iniulat ng SemiAnalysis na posibleng umalis din ang CEO at co-founder na si Puneet Kumar kapag na-vest na lahat ng shares niya sa Meta, sa isa o dalawang taon mula ngayon.
Grand Teton at Ariel: Paulit-ulit na kabayaran sa disenyong mali
Hindi bagong bagay ang pagiging obsessed ng Meta sa custom. Ang H100 custom server nilang Grand Teton, base sa standard HGX server, ay dinagdagan ng extra switch tray, nilagyan ng apat na Broadcom PCIe switches, 16 na SSDs, at walong network card, para magsupply ng mas maraming direktang storage kada server, na intended para sa model training checkpoint save.
Ngunit nang na-deploy ito, kaunti pala ang paggamit ng model team sa storage, kaya tinanggal din ang design. Sabi ng SemiAnalysis, resulta ito ng kakulangan ng collaboration sa design sa pagitan ng hardware at software ng Meta—gumastos ng mas mataas na material cost at power consumption ang infrastructure team para sa features na halos hindi nagamit, at lalo pang umasa sa Broadcom, kasalungat ng layunin nilang bawasan ang dependence sa Nvidia network device.
Sa panahon ng Blackwell, ganito pa rin ang custom logic ng Meta sa proyektong "Ariel". Ang standard GB200 config ay may bawat Grace CPU kasamang dalawang B200 GPUs, ngunit ginawa ni Ariel na one-to-one ang CPU-GPU—kalahati ng GPU count. Ganun din ang dahilan: para mapalakas ang CPU ratio sa RecSys workloads.

Ayon sa estimate ng SemiAnalysis, 14% mas mataas ang total cost of ownership (TCO) ng Ariel NVL36x2 kaysa standard GB200 NVL72, at ang dagdag na gastos ay nagpro-provide ng more CPU at DRAM na di naman kailangan ng large model team. Dahil sa cross-rack connectivity para punan ang kakulangan sa GPU at networking, tumataas ang latency at bumababa ang reliability. Samantala, ang nagtataasang risk noon sa NVL72 backplane ay unti-unti nang naresolba, kaya mali ang risk judgment ng Meta sa hulihan.
Ayon sa SemiAnalysis, bumalik na sa standard config ang GB300 servers ng Meta—na nagpapahiwatig ng pagkabigo ng Ariel scheme.
Kulturang ugat: Panandaliang evaluation ang umiiral kaysa pangmatagalang estratehiya
Itinuturong dahilan ng SemiAnalysis sa lahat ng ito ay ang kulturang umiiral sa Meta infrastructure team.
Inilahad ng institusyon na tuwing anim na buwang performance evaluation sa Meta, ang bottom 10% hanggang 15% na empleyado ay natatanggal, kaya nagiging focus ng team ang agarang napapamalas na resulta sa halip na long-term technical development. Ilang managers ay mas gusto ang high-profile at mabilis matapos na proyekto, at tuwing na-deliver na ay agad naglilipat, tinatawag itong "window washing" sa loob. Napakakaunti rin ang tahasang pumupuna sa desisyon ng nakakataas, kaya mahirap maitama kaagad ang mga pagkakamali.
Mababa rin ang papel ng supply chain team sa engineering decisions, na nagpapatindi pa lalo ng problema. May mga supplier na raw ang mas binibigyan ng prayoridad ang Amazon at Google kaysa sa mga bagong proyekto ng Meta dahil sa madalas nilang pagbabago ng direksyon, ayon sa SemiAnalysis.
Ikinukumpara ng SemiAnalysis ang situasyong ito sa expansion ng Reality Labs ng Meta—bago pa sumiklab ang malawakang layoffs, sampu-sampung bilyong dolyar na ang nilaan sa malaking engineering teams at R&D projects. Ngayon, habang sinimulan ng Meta ang pagbenta ng computer power sa external clients, mas tuwiran nang makikita sa merkado ang kapalit ng ganitong organizational culture.
Disclaimer: Ang nilalaman ng artikulong ito ay sumasalamin lamang sa opinyon ng author at hindi kumakatawan sa platform sa anumang kapasidad. Ang artikulong ito ay hindi nilayon na magsilbi bilang isang sanggunian para sa paggawa ng mga desisyon sa investment.
Baka magustuhan mo rin
Mga pahiwatig mula sa ulat ng chip manufacturer para sa ikalawang quarter: Mas malakas ang demand kaysa tatlong buwan na ang nakalipas, nagsisimula nang "kumalat" ang pagtaas ng presyo
Ayon sa JPMorgan, malinaw ang positibong signal na inilalabas ng global semiconductor industry sa kanilang second quarter reports: Una, mas mataas sa inaasahan ang demand, kaya't pinaigting ng mga higanteng wafer tulad ng TSMC ang kanilang capital expenditures upang pabilisin ang pagpapalawak ng produksyon; Pangalawa, ang epekto ng pagtaas ng presyo ay aktuwal na “kumakalat” sa mga kagamitan at materyales, at ginagamit ito ng mga equipment supplier upang taasan ang gross profit margin; Pangatlo, ang mga nangungunang kumpanya sa storage ay gumagamit ng mga long-term contract at malaking advance payment upang maagang masiguro ang napakataas na profit floor para sa mga susunod na taon.

Nagulat ang ekonomiya ng Japan na "tumapak sa preno"! GDP sa ikalawang quarter ay tumaas lamang ng 1.1%, ngunit ang 10-year na bond yield ng Japan ay umabot sa pinakamataas na antas sa loob ng 30 taon
Ang paglago ng ekonomiya ng Japan ay hindi inaasahang bumagal sa loob ng tatlong buwan na nagtapos noong Hunyo, at maaaring gawing mas kumplikado nito ang komunikasyon ng polisiya ng Bank of Japan habang pinag-aaralan nila ang susunod na tamang panahon para magtaas ng interest rate.

