Trang tin tài chính Zhihui nhận được tin, công ty chip AI – Cerebras Systems (CBRS.US) đã chính thức ra mắt hệ thống AI thế hệ mới cấp rack Cerebras CS-4 tại sự kiện SUPERNOVA tổ chức tại San Francisco, tuyên bố đây là “bộ tăng tốc AI nhanh nhất ngành công nghiệp”. Hệ thống này nhắm trực tiếp vào thị trường AI suy luận, cạnh tranh trực diện với các sản phẩm máy chủ GPU của Nvidia (NVDA.US). Dự kiến, CS-4 sẽ bắt đầu xuất hàng trong quý này (quý 3/2026), hiện đang được một số ít khách hàng thử nghiệm mẫu.
Thông số kỹ thuật: Ba vi xử lý wafer-scale tạo nên sức mạnh tính toán 750 PFLOPs
CS-4 là sản phẩm đầu tiên của nền tảng rack Nexus thế hệ mới của Cerebras, được điều khiển bởi ba bộ xử lý wafer-scale mới – Wafer Scale Engine 3 Turbo (WSE-3T). WSE-3T là bộ xử lý AI lớn nhất hiện nay, mỗi chip tích hợp 4 nghìn tỷ transistor và 900 nghìn lõi được tối ưu hóa AI, phủ diện tích silicon lên tới 46.225 mm², tích hợp 44GB SRAM.
Hệ thống CS-4 cung cấp sức mạnh tính toán AI lên tới 750 PFLOPs, băng thông bộ nhớ 129,6 PB mỗi giây cùng thông lượng I/O đạt 7,2 Tbps mỗi giây. So với thế hệ trước CS-3, CS-4 nhanh gấp hai lần, hiệu suất throughput trên mỗi watt tăng gấp 10 lần, đáng kể cải thiện hiệu quả kinh tế trung tâm dữ liệu. So với WSE-3 thế hệ trước, WSE-3T tăng sức mạnh AI trên một wafer từ 125 PFLOPS lên gấp đôi 250 PFLOPS, băng thông bộ nhớ từ 21,6 PB/s lên 43,2 PB/s. Công suất một chip cũng tăng từ 15 kW lên khoảng 33 kW.
Về thiết kế kiến trúc, CS-4 áp dụng mô hình nền tảng Nexus dạng mô-đun, tách biệt các thành phần tính toán, nguồn điện và I/O. Mô-đun chuyển đổi nguồn được thu nhỏ từ vị trí cách bộ xử lý khoảng 50mm trên card GPU truyền thống, xuống chỉ còn 0,5mm, gần như loại bỏ thất thoát điện năng ở cấp bảng mạch. Thiết kế dạng “balô cắm rời” tích hợp chuyển đổi nguồn, làm mát bằng chất lỏng và điều khiển điện tử, rút ngắn thời gian triển khai từ vài ngày xuống chỉ vài giờ.
Đột phá hiệu năng: Hơn 4.400 Token mỗi giây mỗi người dùng trong thử nghiệm GPT-OSS-120B
Cerebras tuyên bố CS-4 thiết lập một tiêu chuẩn tốc độ mới cho AI suy luận. Trong thử nghiệm so sánh trực tiếp trên mô hình GPT-OSS-120B, CS-4 có thể tạo ra hơn 4.400 Token/giây/người dùng, cao nhất gấp 30 lần phương án dùng GPU. Hệ thống hỗ trợ mô hình lên tới hơn 50 nghìn tỷ tham số.
Ông Sean Lie, đồng sáng lập kiêm CTO của Cerebras chia sẻ: “Nhanh hơn 30 lần không chỉ giúp phản hồi mượt mà hơn, mà còn cho phép hệ thống AI có thêm hơn một bậc không gian để suy nghĩ, kiểm nghiệm hoặc gọi công cụ trong cùng khoảng thời gian thực tế.” CEO Andrew Feldman của Cerebras nhận định: “Trong lịch sử, để suy luận nhanh hơn, luôn phải dùng mô hình nhỏ hơn và ít khả năng hơn. CS-4 đạt tốc độ dẫn đầu ngành trên các mô hình tiên tiến nhất, thay đổi hoàn toàn lối mòn này.”
Về hiệu suất năng lượng, throughput trên mỗi watt của CS-4 cao hơn CS-3 tối đa 10 lần, cải thiện rõ rệt hiệu quả kinh tế cho trung tâm dữ liệu. Ông Andrew Feldman nhấn mạnh, Token sinh ra nhanh có giá trị cao hơn Token chậm, CS-4 không chỉ tạo nhiều Token mà còn chất lượng hơn trong giới hạn công suất cho phép, “thay đổi hoàn toàn định hình cũ”.
CS-4 còn áp dụng thiết kế giảm 50% số lượng linh kiện, giúp khách hàng triển khai dễ dàng và nhanh chóng. Về kiến trúc, nền tảng Nexus mới tách tính toán, nguồn và I/O thành các thành phần mô-đun – chuyển đổi điện nguồn từ vị trí cách bộ xử lý truyền thống trên card GPU 50mm, giảm xuống còn 0,5mm, giảm mạnh tổn hao năng lượng bảng mạch và cho phép tần số hoạt động cao hơn. Thiết kế “balô cắm rời” tích hợp chuyển đổi nguồn, làm mát bằng chất lỏng và điều khiển điện tử vào một khối độc lập, cắt ngắn thời gian triển khai từ vài ngày xuống chỉ vài giờ.
Đáng chú ý, hệ thống wafer-scale của Cerebras sử dụng bộ nhớ tĩnh SRAM thay vì DRAM phổ thông ngành. SRAM nhanh vượt trội DRAM nhưng kích thước lớn và chi phí cao – tấm wafer kích cỡ đĩa ăn của Cerebras cung cấp đủ không gian vật lý để khai thác ưu điểm của SRAM. Thiết kế chip đơn còn rút ngắn cự ly truyền tải dữ liệu so với hệ đa chip của Nvidia hoặc AMD.
Hợp tác sinh thái: Kết hợp AMD Helios, hướng đến nâng hiệu suất gấp 5 lần
Hệ thống I/O lập trình được của CS-4 hỗ trợ tiêu chuẩn RoCE v2 RDMA trên nền Ethernet, có thể tích hợp với hệ thống dị thể. Cerebras đã hợp tác với AMD (AMD.US) về kiến trúc này, kết hợp giải pháp rack cấp Helios của AMD với WSE, số lượng Token sinh ra trên mỗi watt mỗi giây cao hơn cấu hình thuần Cerebras tới 5 lần. AWS Trainium cũng là đối tác hợp tác.
Ông Dylan Patel, nhà sáng lập kiêm CEO SemiAnalysis đánh giá, cải tiến về triển khai và năng lực mạng của CS-4 giúp nó mở rộng sang các mô hình quy mô lớn hơn, xây dựng “nhà máy Token quy mô vĩ đại”.
Bối cảnh thị trường: Giá cổ phiếu giảm 35% từ đỉnh sau khi niêm yết, CS-4 thành bước ngoặt then chốt
Cerebras lên sàn Nasdaq ngày 14/5/2026 với giá IPO 185 USD/cổ phiếu, mở cửa phiên đầu ở 350 USD và đóng cửa ở 311,07 USD, tăng 68%. Tuy nhiên sau đó giá cổ phiếu liên tục sụt giảm, thứ Ba giao dịch quanh 220 USD, thấp hơn đỉnh khoảng 35%.
Báo cáo tài chính quý II của công ty có cả điểm sáng lẫn tối: Doanh thu cốt lõi đạt 2,099 tỷ USD, tăng 103% so với cùng kỳ; tuy nhiên lỗ ròng trên mỗi cổ phiếu là 2,98 USD, trong khi cùng kỳ năm ngoái lãi 1,91 USD. Dù kỳ vọng doanh thu cốt lõi tăng gấp 3 lần năm 2027 và triển vọng Q3 vượt dự báo, công ty vẫn chưa thuyết phục hoàn toàn nhà đầu tư. Tuy nhiên, nghĩa vụ thực hiện hợp đồng còn lại của công ty đạt 25,4 tỷ USD, đảm bảo triển vọng doanh thu tương lai vững chắc.
Ý nghĩa ngành: Cục diện thị trường AI suy luận đối mặt tái cấu trúc
CS-4 ra mắt đúng giai đoạn nhu cầu AI suy luận tăng vọt. Khi các mô hình lớn chuyển từ đào tạo sang triển khai quy mô lớn, hiệu suất suy luận đang trở thành yếu tố cạnh tranh then chốt của hạ tầng AI. Nếu lợi thế tốc độ 30 lần của Cerebras được xác nhận qua kiểm chuẩn độc lập, điều này có thể thay đổi chiến lược mua sắm của các nhà điều hành siêu trung tâm dữ liệu.
Sự ra mắt của Cerebras CS-4 đánh dấu cuộc cạnh tranh chip AI đang chuyển trọng tâm từ huấn luyện sang thị trường suy luận. Việc hệ thống này có thể thực sự rung chuyển vị thế thống trị của Nvidia ở AI suy luận hay không sẽ phụ thuộc vào việc các tuyên bố hiệu năng có được kiểm chứng độc lập và liệu CS-4 có đủ năng lực sản xuất ở quy mô lớn, giao hàng nhanh để đáp ứng nhu cầu tạo Token tốc độ cao ngày càng cấp bách từ các nhà vận hành trung tâm dữ liệu quy mô siêu lớn.
Dịch vụ cloud inference của Cerebras đã tăng trưởng 287% trong quý II, đạt doanh thu cốt lõi 1,277 tỷ USD. Việc CS-4 ra mắt đánh dấu Cerebras chuyển đổi mô hình kinh doanh từ bán phần cứng sang cho thuê hiệu năng suy luận sang giai đoạn mới.