Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng
Nvidia đang kéo dài vòng đời của nền tảng Blackwell thông qua việc tối ưu hóa liên tục ngăn xếp phần mềm, đồng thời chuẩn bị cho việc triển khai quy mô lớn kiến trúc Rubin thế hệ tiếp theo.
Trong bối cảnh triển khai nhanh chóng nền tảng Rubin thế hệ mới, Nvidia tiết lộ rằng chỉ trong ba tháng, TPS/MW (hiệu suất thông lượng tính toán trên mỗi megawatt) của GB200 NVL72 khi chạy mô hình DeepSeek R1 0528 đã tăng gấp 4 lần. Thành tựu này có được nhờ Nvidia thực hiện 38 tối ưu hóa lớn trong bốn tháng, dựa trên hơn 250.000 lần kiểm thử cấu hình mô phỏng cùng tổng cộng 1,4 triệu giờ kiểm chứng tối ưu hóa với GPU.
Đồng thời, nền tảng GB300 "Blackwell Ultra" liên tục phá vỡ các kỷ lục mới trong bài kiểm tra chuẩn huấn luyện AI. Ở quy mô 256 card, GB300 NVL72 thiết lập kỷ lục thế giới khi đạt 1648 TFLOPs/GPU trong nhiệm vụ huấn luyện trước DeepSeek-V3 671B, tăng khoảng 3 lần so với 606 TFLOPs của GB200, và chỉ số này đã tăng tổng cộng 1,5 lần trong 6 tháng qua.
Hiệu suất năng lượng GB200 tăng vọt, tối ưu hóa áp dụng cho hơn 90% mô hình
Nvidia cho biết, chuỗi tối ưu hóa cho nền tảng GB200 NVL72 đã giúp TPS/MW của hệ thống chạy DeepSeek R1 0528 (cấu hình 1K đầu vào/1K đầu ra) tăng 4 lần chỉ trong vòng ba tháng.

Nền tảng của sự tăng trưởng này là 38 vòng lặp tối ưu hóa lớn mà Nvidia thực hiện trong bốn tháng, được kiểm thử qua hơn 250.000 cấu hình mô phỏng và tổng cộng 1,4 triệu giờ thử nghiệm trên GPU. Nvidia nhấn mạnh hơn 90% kết quả tối ưu hóa này có thể tái sử dụng trên nhiều mô hình khác nhau trong danh mục AI của họ, thay vì chỉ thiết kế riêng cho một nhiệm vụ duy nhất.
Điều này đồng nghĩa với việc khách hàng trung tâm dữ liệu hiện tại có thể nhận giá trị gia tăng rõ rệt về hiệu suất năng lượng chỉ qua cập nhật phần mềm mà không cần thay phần cứng — với các doanh nghiệp và nhà cung cấp dịch vụ đám mây quy mô lớn cực kỳ nhạy cảm về chi phí tính toán, đây là giá trị kinh tế trực tiếp.
GB300 tiếp tục lập kỷ lục huấn luyện, hiệu suất tăng 1,5 lần trong 6 tháng
Ở phía huấn luyện AI, GB300 NVL72 cũng cho thấy sức mạnh vượt trội. Ở quy mô 256 card, sử dụng framework Megatron Core để huấn luyện trước mô hình DeepSeek-V3 671B, GB300 NVL72 đạt thông lượng 1648 TFLOPs/GPU — cao hơn khoảng 3 lần so với 606 TFLOPs của GB200 trước đó, lập kỷ lục thế giới mới cho nhiệm vụ này.

Điều đáng chú ý là con số này không phải giới hạn tối đa của phần cứng. Hiệu suất của GB300 NVL72 trên framework Megatron Core đã tăng từ 1088 TFLOPs/GPU vào tháng 11/2025 lên 1648 TFLOPs/GPU vào tháng 6/2026 — tăng tổng cộng 1,5 lần trong 6 tháng.

Ở góc độ phối hợp tối ưu framework AI chính, sự hợp tác sâu giữa Nvidia với cộng đồng PyTorch và JAX cũng mang lại lợi ích rõ rệt. Trên TorchTitan (ngăn xếp huấn luyện bản địa PyTorch), hiệu năng huấn luyện DeepSeek-V3 671B của GB300 NVL72 tăng 6 lần so với cấu hình gốc chưa tối ưu, từ 199 TFLOPs/GPU lên 1197 TFLOPs/GPU. Trên JAX, mức tăng còn mạnh hơn — đến tháng 7/2026, thông lượng mỗi GPU đạt 4082 Tokens/s (tương ứng 1025 TFLOPs/GPU), tăng khoảng 10 lần so với 418 Tokens/s vào tháng 1/2026.

Hiệu quả mở rộng gần với giới hạn lý thuyết, mạng 800 Gb/s là chìa khóa
Ở môi trường huấn luyện quy mô lớn, hiệu quả mở rộng luôn là chỉ số then chốt đánh giá tính thực tiễn của hạ tầng AI. Nvidia tiết lộ, trong dải mở rộng từ 256 đến 1024 card, GB300 NVL72 đều duy trì hiệu suất gần mức lý thuyết tối đa ở cả ba framework chính: Megatron Core đạt 98,5%, TorchTitan và JAX đều đạt 97%.
Nvidia cho rằng, thành tích tuyệt vời này nhờ vào chip mạng Scale-Out tích hợp trong rack NVL72 với tốc độ 800 Gb/s. Kết nối tốc độ cao trực tiếp quyết định chi phí truyền thông trong huấn luyện đa máy, góp phần đảm bảo hiệu suất mở rộng tổng thể và được xem là thành phần hạ tầng cốt lõi giúp duy trì hiệu quả đa framework như trên.

Nền tảng Rubin tăng tốc triển khai, tối ưu Blackwell vẫn tiếp tục
Khi những cải tiến vừa được công bố, nền tảng Vera Rubin NVL72 thế hệ tiếp theo của Nvidia cũng bắt đầu triển khai trên toàn cầu. Theo báo cáo, hiệu suất thông lượng Token của Vera Rubin NVL72 cao gấp khoảng 10 lần so với Blackwell — GB200 NVL72 đạt khoảng 80.000 Tokens/s, trong khi Vera Rubin NVL72 có thể đạt 800.000 Tokens/s ở cùng mức công suất 150MW.
Tuy nhiên, nền tảng Blackwell đã được triển khai rộng khắp trong nhiều trung tâm dữ liệu toàn cầu, và chiến lược của Nvidia y hệt như thời Hopper trước đây — song song với nền tảng mới, tiếp tục khai thác tiềm lực phần cứng hiện tại bằng tối ưu phần mềm liên tục. Cách làm này không chỉ kéo dài chu kỳ thu hồi vốn đầu tư phần cứng cho khách hàng hiện hữu mà còn củng cố độ gắn kết hệ sinh thái hạ tầng AI với nền tảng Nvidia. Với thị trường, Nvidia đang từng bước xây dựng hàng rào phần mềm bất khả xâm phạm trong ngắn hạn với chiến lược song hành Blackwell và Rubin, tạo lợi thế cạnh tranh mà đối thủ khó có thể sớm vượt qua.
Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.
Bạn cũng có thể thích
29 bang cùng liên kết khởi kiện! Meta (META.US) bị cáo buộc "dụ dỗ gây nghiện", đối mặt với nguy cơ bị phạt lên tới 1,4 nghìn tỷ USD
Meta đang phải đối mặt với phiên tòa bồi thẩm đoàn tại tòa án liên bang do bị cáo buộc cố tình thiết kế Facebook và Instagram nhằm khuyến khích người dùng trẻ tuổi nghiện sử dụng.

Dưới áp lực từ giá dầu tăng và căng thẳng tài khóa, trái phiếu chính phủ Mỹ kỳ hạn dài bị bán tháo, lợi suất kỳ hạn 30 năm lên mức cao nhất gần 20 năm.
Lợi suất trái phiếu chính phủ Mỹ đồng loạt tăng vào thứ Hai, khi giá dầu quốc tế tiếp tục tăng, nhà đầu tư lo ngại về lạm phát kéo dài, thâm hụt ngân sách Mỹ gia tăng và nguồn cung nợ công tăng lên.

Chứng khoán Mỹ qua đêm | Trung Quốc, Nhật Bản, Anh đều giảm nắm giữ trái phiếu Mỹ trong tháng 6 Ba chỉ số chính giảm điểm Sandisk (SNDK.US) tăng gần 9%
Kết thúc phiên giao dịch, chỉ số Dow Jones giảm 272,39 điểm, tương đương 0,51%, đóng cửa ở mức 53.460,02 điểm; chỉ số S&P 500 giảm 40,39 điểm, tương đương 0,52%, đóng cửa ở mức 7.745,37 điểm; chỉ số Nasdaq Composite giảm 84,25 điểm, tương đương 0,32%, đóng cửa ở mức 26.644,91 điểm.

Lợi suất trái phiếu kho bạc Mỹ kỳ hạn 30 năm đạt mức cao nhất kể từ năm 2007, phát hành trái phiếu đầu tư cấp của Mỹ trong tháng 8 đạt mức cao nhất trong cùng kỳ.
Lợi suất trái phiếu kho bạc Mỹ kỳ hạn 30 năm đã từng vượt mốc 5,31% vào thứ Hai. Các doanh nghiệp phát hành trái phiếu quy mô lớn để hỗ trợ cơn sốt AI, làm trầm trọng thêm sự mất cân đối cung cầu trên thị trường trái phiếu kỳ hạn dài. Lượng phát hành trái phiếu doanh nghiệp xếp hạng đầu tư tại Mỹ trong tháng 8 đã đạt 145,2 tỷ USD, vượt kỷ lục hàng tháng 136 tỷ USD được thiết lập vào tháng 8 năm 2020. Đồng thời, thâm hụt ngân sách hàng năm gần 2 nghìn tỷ USD của chính phủ Mỹ tiếp tục đẩy mạnh nguồn cung trái phiếu chính phủ.
