Bitget App
Giao dịch thông minh hơn
Mua CryptoThị trườngGiao dịchFutures‌EarnQuảng trườngThêm
Đằng sau sự thu hẹp của Rubin, huyền thoại CUDA của Nvidia đang dần lung lay

Đằng sau sự thu hẹp của Rubin, huyền thoại CUDA của Nvidia đang dần lung lay

华尔街见闻华尔街见闻2026/06/30 03:08
Hiển thị bản gốc
Theo:华尔街见闻

Hai tin tức tưởng như không liên quan đã lần lượt xảy ra trong tuần cuối tháng 6.

Ngày 25 tháng 6, OpenAI ra mắt con chip AI inference tự nghiên cứu đầu tiên - Jalapeño, hợp tác với Broadcom chỉ mất 9 tháng từ thiết kế tới tape-out – khách hàng GPU lớn nhất thế giới nay đã tự sản xuất chip.

Ngày 30 tháng 6, tổ chức nghiên cứu bán dẫn SemiAnalysis công bố trên nền tảng xã hội: Phiên bản gốc chip 4 Rubin Ultra của Nvidia đã bị huỷ bỏ chỉ sau ba tháng ra mắt tại GTC 2026, hiệu năng phiên bản mới giảm gần một nửa. “Tất cả diễn ra trong bối cảnh,” SemiAnalysis bổ sung, “thị phần của Nvidia đang bị xói mòn.”

Thực tế, từ năm ngoái, báo chí đã tiết lộ doanh thu hàng năm của Anthropic đã tiến gần mốc 7 tỷ USD, Claude Code chỉ sau 2 tháng ra mắt đã tạo ra 500 triệu USD doanh thu hàng năm. Nền tảng tính toán vận hành tất cả những điều này, không còn chỉ có Nvidia – Google TPU chịu trách nhiệm huấn luyện, Amazon Trainium phục vụ inference, Nvidia GPU lùi về thành lựa chọn “nghiên cứu khám phá” thứ ba.

Ba tin tức này đều chỉ vào một vấn đề chung: Hào lũy CUDA – rào cản cạnh tranh vững chắc nhất và cũng được thần thoại nhất của Nvidia – đang xuất hiện vết nứt.

Từ 87% xuống 75%, “không thể thay thế” của Nvidia đang sụp đổ

Xem một số liệu.

Theo ước tính của Silicon Analysts dựa trên báo cáo tài chính Nvidia/AMD và dữ liệu phân bổ sản lượng của TSMC, quỹ đạo thị phần của Nvidia trên thị trường AI accelerator (tính theo doanh thu) như sau:

Đằng sau sự thu hẹp của Rubin, huyền thoại CUDA của Nvidia đang dần lung lay image 0

Có thể thấy, doanh thu của Nvidia vẫn tăng – từ 15 tỷ lên 150 tỷ, tăng gấp 10 lần trong 4 năm. Nhưng thị phần từ đỉnh cao 87% trượt xuống 75%, đồng nghĩa ngày càng nhiều miếng bánh thị trường tăng trưởng bị chia cắt.

Miếng bánh này không bị lấy đi bởi một đối thủ cụ thể, mà bị cạnh tranh từ mọi hướng: Google TPU, Amazon Trainium, Microsoft Maia, Meta MTIA, Broadcom XPU tuỳ chỉnh – và “tân binh” OpenAI.

CEO Broadcom, Chen Fuyang, tiết lộ trong cuộc họp Q1 năm tài chính 2026: Doanh thu bán dẫn AI của Broadcom đã đạt 8,4 tỷ USD theo tỷ lệ năm hóa, tăng trưởng 1068,4 tỷ tỷ lệ năm hóa, tăng trưởng 106 mục tiêu chạy đua tới 40-50 tỷ USD/năm. Họ đã có hợp đồng chip AI tuỳ chỉnh với 6 khách hàng siêu lớn, OpenAI là khách hàng thứ sáu.

Nói cách khác, các công ty điện toán đám mây và AI lớn nhất thế giới tình cờ chọn chung một hướng: tự thiết kế chip.

Lựa chọn của Anthropic

Nếu thị phần thị trường là con số khô cứng, thì câu chuyện Anthropic là ví dụ sống động về “khử Nvidia”.

Anthropic là một trong những công ty AI tăng trưởng nhanh nhất thế giới hiện nay. Doanh thu hàng năm tiến gần 7 tỷ USD (2025 chỉ khoảng 1 tỷ), phục vụ hơn 300.000 khách hàng doanh nghiệp, số lượng khách hàng lớn tăng gần 7 lần mỗi năm. Claude Code chỉ sau hai tháng ra mắt đã tạo 500 triệu USD doanh thu hàng năm, Anthropic gọi đây là “sản phẩm tăng trưởng nhanh nhất lịch sử”.

Nền tảng tính toán duy trì tất cả này, là kiến trúc ba nền tảng được CFO Krishna Rao của Anthropic gọi là “chiến lược tính toán độc đáo”:

Đằng sau sự thu hẹp của Rubin, huyền thoại CUDA của Nvidia đang dần lung lay image 1

Chú ý cột cuối. Nvidia GPU xếp thứ ba, không đồng hạng, không là “tuỳ chọn dư bị”, mà là nền tảng nhỏ nhất trong danh sách ba lựa chọn.

Đây không phải công ty nhỏ thiếu tiền chọn giải pháp rẻ tiền. Đây là công ty AI lớn thứ hai thế giới, dùng chip phi Nvidia để vận hành sản phẩm tăng trưởng nhanh nhất của mình trong môi trường sản xuất thực tế.

SemiAnalysis trong bài đăng ngày 30 tháng 6 đặc biệt nhấn mạnh: “Một phần đáng kể inference của Claude Code vận hành trên Trainium, việc huấn luyện Claude được hoàn thành bằng TPU. Chỉ một năm trước, quy mô phát triển TPU và Trainium đến thế này đồng thời hào lũy CUDA bị xói mòn còn rất khó tưởng tượng.”

Tại sao Anthropic làm vậy? Không phải vì TPU và Trainium mạnh hơn H100 – về tuyệt đối có thể chúng còn thua kém. Mà vì ở ngữ cảnh nhất định, chip chuyên dụng có tỷ lệ giá hiệu suất vượt trội so với GPU đa dụng. Đào tạo dùng TPU vì Google ký hợp đồng trăm tỷ đô và cam kết cung cấp hàng triệu chip. Inference dùng Trainium vì AWS là nhà cung cấp dịch vụ điện toán chính, đầu tư 8 tỷ USD, cụm siêu máy tính Project Rainier hoàn toàn chạy trên Trainium 2, không bị “phí premium” của GPU.

Amazon đặt cược rất lớn vào Trainium. Theo báo cáo quý 1 năm tài chính 2026, dòng sản phẩm Trainium đã nhận hơn 225 tỷ USD cam kết doanh thu, khách hàng có cả OpenAI lẫn Anthropic. Doanh thu AI của AWS đạt vận tốc hơn 15 tỷ USD, đa số dịch vụ inference Bedrock chạy trên Trainium.

Ở đây từ khoá không phải là “hiệu suất”, mà là “chi phí”. Inference là thứ đốt tiền mỗi ngày. Mỗi lần ChatGPT trả lời, mỗi lần API trả về code, phía sau đều là GPU đang tiêu điện. Anthropic thay GPU bằng Trainium để inference không phải chạy nhanh hơn mà là cùng một đô la làm được nhiều hơn.

Ba lỗ hổng xâm thực: hào lũy CUDA rạn nứt từ đâu

CUDA được xem là hào lũy vững chắc của Nvidia vì nó xây dựng nên một hệ sinh thái khép kín “phần cứng – phần mềm – nhà phát triển”:

  • 20 năm tích luỹ, hơn 4 triệu nhà phát triển
  • Tất cả framework ML chính đều ưu tiên tối ưu cho CUDA
  • Thư viện tối ưu hoá chuyên sâu như cuDNN, TensorRT, NCCL
  • Chi phí chuyển đổi tính bằng năm và hàng trăm triệu USD

Nhưng cạnh tranh AI chip năm 2026 không còn là “làm GPU nhanh hơn H100 10%” – đó là tấn công chính diện không ai thắng nổi. Xói mòn xuất phát từ ba chiều:

Xâm thực 1: ASIC tự nghiên cứu – không chơi trận địa diện rộng, chỉ cắt miếng bánh inference béo nhất

Đây là mối đe doạ trí mạng. Logic ở đây không phải “tôi làm tốt hơn Nvidia”, mà là “tôi không cần hết chức năng của GPU, tôi chỉ cần inference”.

Một Nvidia H100 phải làm: đồ họa, tính toán khoa học, huấn luyện AI, inference AI, mã hóa/giải mã video... Một Jalapeño chỉ làm duy nhất một việc: inference mô hình riêng cho OpenAI. Một bên là dao đa năng Thụy Sĩ, bên còn lại là rìu chỉ bổ loại gỗ nhất định – ở nhiệm vụ đặc thù, rìu tốt hơn dao đa năng, lại rẻ hơn nhiều.

Định vị của Jalapeño cực kỳ chuẩn xác: không so đa năng với Nvidia, chỉ tập trung vào inference – bối cảnh nhiều tỷ API mỗi ngày, tiêu tốn hàng trăm triệu USD/năm. Mục tiêu chính thức của OpenAI là cắt giảm 30-50% chi phí inference. Với mức đốt vài triệu USD/ngày cho inference, mỗi năm tiết kiệm được hàng trăm triệu USD lợi nhuận thực sự.

Hơn nữa, OpenAI không phải người đầu tiên. Microsoft Maia 200 (công bố tháng 1/2026), Google TPU Ironwood (thế hệ thứ 7, lần đầu chỉ làm inference), Amazon Trainium 3 – cả bốn đại gia cloud đều đã có chip inference tự thiết kế. Thêm Meta MTIA và chip tuỳ chỉnh của Apple, 7 công ty công nghệ lớn nhất thế giới chỉ còn một bên duy nhất chỉ “mua không tự làm” – và họ cũng đang đi hướng đó.

Xâm thực 2: AMD – từ “có mặt” lên thành “thay thế đáng tin”

Doanh thu GPU AI của AMD từ dưới 1 tỷ USD năm 2022 vọt lên trên 15 tỷ USD dự kiến năm 2026, tăng hơn 15 lần trong 4 năm.

Bước ngoặt trọng yếu phía sau là series MI400. Dựa trên kiến trúc CDNA5, bộ nhớ HBM4 dung lượng 432GB, băng thông 19,6 TB/s, dự kiến sản xuất hàng loạt nửa cuối năm 2026. S&P Global dự đoán riêng dòng MI400 sẽ đóng góp 7,2 tỷ USD, chiếm 25% doanh thu trung tâm dữ liệu của AMD.

Tín hiệu quan trọng hơn là từ khách hàng. Meta đã ký cam kết mua hàng tới 6 GW – đây không chỉ là đơn hàng chip AI lớn nhất lịch sử AMD mà còn là tín hiệu rõ: khách hàng siêu lớn đang đa dạng hóa nhà cung cấp.

Giới hạn của AMD cũng rõ ràng: chỉ chiếm khoảng 11% sản lượng CoWoS của TSMC, Nvidia trên 60%. Giới hạn sản lượng ngắn hạn khiến AMD không thể đe dọa số lượng của Nvidia. Nhưng vị thế “nhà cung ứng thứ hai đáng tin” đã phá vỡ tường rào “phải dùng Nvidia”.

Xâm thực 3: Tách rời lớp phần mềm – Triton, JAX và tương lai “không phụ thuộc CUDA”

Đây là đường dễ bị bỏ qua nhưng nguy hiểm nhất về lâu dài.

Việc gắn kết CUDA dựa trên thực tế đơn giản: nhà nghiên cứu AI viết code bằng PyTorch, phần lõi chạy trên CUDA. Nhưng nếu lõi PyTorch không còn phụ thuộc CUDA nữa?

Nó đang diễn ra. Đội ngũ PyTorch đã xác nhận compilers Triton làm được inference “không CUDA” – Llama 3 chạy trên H100 hoặc A100, throughput token nhân bởi kernel Triton có thể sánh ngang CUDA. Tháng 2/2026, Triton hỗ trợ backend đa dạng, cùng bộ code dễ dàng compile cho các phần cứng khác nhau – GPU của AMD, Intel, hoặc nhiều loại ASIC.

Framework JAX của Google còn tiến xa hơn. Thiết kế từ đầu là không phụ thuộc phần cứng – cùng một bộ code chạy được trên TPU, GPU, hoặc even CPU. Anthropic dùng TPU huấn luyện phần lớn nhờ JAX giúp họ chuyển đổi nền tảng tính toán mà không cần viết lại code mô hình.

Tách rời phần mềm nghĩa là gì? Nghĩa là một thế hệ nhà nghiên cứu AI mới có thể huấn luyện mô hình tối tân mà chưa từng viết dòng code CUDA nào. Khi nhà phát triển không bị khoá trong hệ sinh thái CUDA, “phải mua Nvidia” từ luật cứng thành lựa chọn mềm “có thể mua Nvidia”.

Rubin Ultra huỷ bỏ: điểm phân ly giới hạn vật lý

Trở lại tin đầu bài. Phiên bản chip 4 Rubin Ultra bị huỷ chỉ sau ba tháng là bằng chứng cho thấy “vấn đề ở tầng thực thi sản xuất khiến Nvidia mất thêm thị phần,” theo SemiAnalysis.

Lý do kỹ thuật không phức tạp. Rubin Ultra nguyên bản ghép 4 chip tính toán + 16 cụm bộ nhớ HBM4E vào một package duy nhất trên công nghệ TSMC CoWoS-L. Nhưng theo Global Semi Research, cấu hình 4 chip dính lỗi cong mạch – phần nền bị bẻ về nhiều hướng, khiến chip không thể tiếp xúc hoàn toàn. Truyền tín hiệu thất bại, chip không thể hoạt động.

Phương án CoPoS (panel-level packaging) của TSMC đến cuối 2028 mới sản xuất hàng loạt. Nvidia không thể đợi – buộc thay đổi Rubin Ultra thành chip 2, hiệu năng giảm gần nửa.

Việc này ý nghĩa biểu tượng lớn hơn ảnh hưởng thực tế.

Nvidia vẫn sẽ bán hết số Rubin Ultra sản xuất được. Nhưng “từ 4 chip lùi lại 2 chip” phơi bày vấn đề sâu hơn: Tốc độ lên sản phẩm mới của Nvidia đang đụng trần tường vật lý. Chip to hơn → đóng gói phức tạp hơn → tỷ lệ lỗi cao hơn → hoặc chậm hoặc giảm hiệu năng. Đó là đường cong không thể kéo dài mãi.

Đồng thời, đối thủ đang chọn cách khác: không làm chip lớn hơn, mà làm chip chuyên biệt hơn.

Vết nứt định giá

Phần thực sự không thể lay động của hào lũy Nvidia là phía sản xuất, không phải hệ sinh thái phần mềm CUDA. 60% công suất xử lý đóng gói tiên tiến CoWoS của TSMC nằm trong tay Nvidia. Đó là rào cao về vật lý, không phải phần mềm. Đối thủ có thể lập framework tốt hơn, thiết kế ASIC hiệu quả hơn – nhưng muốn chạy đua số lượng với Nvidia, phải vượt được ải TSMC.

Nhưng vấn đề cũng nằm ở đây: rào cản sản xuất phụ thuộc vào một fab bên thứ ba. Đó không phải tài sản Nvidia tự kiểm soát.

Biên lợi nhuận 88% của Nvidia – H100 giá thành 3.320 USD, bán 28.000 USD – dựa trên giả định khách hàng không thể rời bỏ nó. Nếu tiền đề từ “không thể rời bỏ” thành “lựa chọn hiệu quả chi phí nhất”, thì quyền định giá không còn tuyệt đối nữa.

Anthropic chứng minh con đường khác: không chạy theo chip tốt nhất, mà chọn chip phù hợp nhất. Huấn luyện dùng TPU thay vì GPU, không phải vì TPU nhanh hơn, mà là Google cam kết chip và giá tốt đủ. Inference dùng Trainium thay vì GPU, không tại Trainium mạnh hơn mà AWS là cổ đông chiến lược, Project Rainier né khỏi premium GPU.

Khi công ty AI lớn thứ hai thế giới đưa GPU trở thành nền tảng tính toán nhỏ nhất trong ba lựa chọn, “phải mua Nvidia” không còn là tuyệt đối.

Nvidia vẫn tốt nhất. Chưa công ty AI nào dứt bỏ Nvidia – Anthropic vẫn giữ một phần GPU cho “nghiên cứu tiên tiến”, Jalapeño của OpenAI chỉ làm inference không huấn luyện, MTIA của Meta chỉ phủ hệ khuyến nghị và kiểm duyệt nội dung.

Nhưng từ “chỉ có Nvidia” đến “Nvidia đắt nhất, dùng loại rẻ trước”, khoảng chênh này chính là sự mất mát quyền định giá.

Thị trường đã bắt đầu định giá lại khả năng này. Năm nay, mỗi báo cáo tiêu cực của SemiAnalysis đều làm rung chuyển nhóm cổ phiếu liên quan: đầu tháng 6 tin SOCAMM cắt giảm khiến Micron giảm 13% trong một ngày, ngày 10/6 tranh cãi trì hoãn CPO buộc lãnh đạo Nvidia phải lên tiếng, ngày 30/6 Rubin Ultra bị huỷ lại bùng nổ thảo luận.

Phía sau biến động này, là thị trường đang khó khăn trả lời một câu hỏi lẽ ra không cần trả lời: Nếu CUDA không vô đối, Nvidia đáng giá bao nhiêu.

0
0

Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.

PoolX: Khóa để nhận token mới.
APR lên đến 12%. Luôn hoạt động, luôn nhận airdrop.
Khóa ngay!

Bạn cũng có thể thích

Từ mua yên Nhật đến tăng giao dịch repo trái phiếu chính phủ Mỹ, Bà Janet Yellen trở thành Bộ trưởng Tài chính Mỹ can thiệp thị trường tích cực nhất trong nhiều thập kỷ qua

Trong vòng một tháng qua, Besant đã dẫn đầu các động thái mua vào yên Nhật tại Mỹ lần đầu tiên trong ba mươi năm, ám chỉ việc cắt giảm quy mô phát hành trái phiếu dài hạn, đồng thời tuyên bố sẽ "ít nhất tăng gấp đôi" việc mua lại trái phiếu kho bạc Mỹ kỳ hạn từ 10 năm đến 30 năm. Chuỗi hành động này đã khiến thị trường khó có thể bỏ qua ý đồ chính sách đằng sau đó. Các nhà phân tích nhận định, Besant ít nhất là Bộ trưởng Tài chính có sự can thiệp mạnh mẽ nhất kể từ đầu những năm 2000, với mục tiêu ngăn chặn lợi suất tăng là điều vô cùng rõ ràng.

华尔街见闻2026/08/20 18:31

Bescent tuyên bố có thể tăng cường mua lại trái phiếu Mỹ, mỗi lần có thể vượt 4 tỷ đô, chiến tranh kinh tế với Iran có thể thay thế hành động quân sự.

Theo Besant, Bộ Tài chính sở hữu bộ công cụ mạnh mẽ, lợi suất trái phiếu dài hạn không phản ánh các yếu tố cơ bản, thanh khoản của trái phiếu kỳ hạn 30 năm đặc biệt thấp, quy mô mua lại sẽ được điều chỉnh theo điều kiện; đầu tư AI khiến doanh nghiệp gần như không nhạy cảm với lợi suất khi phát hành trái phiếu; vào thứ Hai tuần tới sẽ tổ chức họp báo để trình bày kế hoạch hành động đối với Iran, Mỹ sẽ áp dụng các biện pháp trừng phạt "nghiêm khắc nhất trong lịch sử" đối với Iran, trong quá trình gây sức ép kinh tế, phía Mỹ không nhất thiết phải khởi động một cuộc tấn công quân sự quy mô lớn đối với Iran. Ông nhấn mạnh lại chính sách đồng đô la mạnh, cho biết đồng đô la đang trở lại mức của hai tháng trước, không lý giải được đà tăng giá dầu vào thứ Năm.

华尔街见闻2026/08/20 17:51

"Hoạt động xoắn" của Bessent thực sự có thể kìm hãm lãi suất dài hạn không? Goldman Sachs: Vấn đề tài khóa mới là gốc rễ, phí hạn mức có thể tồn tại lâu dài.

Goldman Sachs chỉ ra rằng thâm hụt ngân sách của Hoa Kỳ, sự không chắc chắn về lạm phát, việc phát hành trái phiếu quy mô lớn liên quan đến AI và lo ngại của thị trường về việc tăng lãi suất thực cân bằng là những yếu tố thúc đẩy lợi suất trái phiếu dài hạn của Mỹ tăng trong đợt này, trong khi nghiệp vụ repo trái phiếu quốc gia và việc điều chỉnh cơ cấu phát hành không ảnh hưởng đến các yếu tố trên. Do đó, Goldman Sachs cho rằng can thiệp lần này chỉ tạm thời làm dịu áp lực, nhưng không thể thay đổi xu hướng của lợi suất trái phiếu dài hạn.

华尔街见闻2026/08/20 15:36