Cơn khan hiếm GPU chưa kết thúc, giờ đến lượt CPU có thể bị săn lùng
Ngày 31/5/2026, Nvidia thông báo CPU sở hữu 88 nhân tùy chỉnh đã bắt đầu sản xuất hàng loạt. Con chip có tên là Vera, sử dụng kiến trúc lệnh Arm và nhân Olympus do Nvidia tự phát triển, sẽ được tích hợp vào nền tảng siêu máy tính Vera Rubin và cũng được lắp riêng trong các máy chủ CPU. Dell, HP, Lenovo, Supermicro cùng nhiều hãng sản xuất máy chủ đã bắt đầu chế tạo hệ thống tích hợp Vera.
Nvidia gọi Vera là “CPU đầu tiên được tạo ra cho AI Agent”.Vera sẽ kết hợp cùng GPU Rubin thành một nền tảng và cũng được lắp vào máy chủ CPU độc lập.Sau nhiều năm chỉ bán GPU, Nvidia lại bắt đầu bán riêng năng lực tính toán CPU, điều này nghe có vẻ không bình thường.
Hình | Nvidia Vera (nguồn: Nvidia)
Ba năm trở lại đây, lo lắng về phần cứng của ngành AI gần như xoay quanh GPU. Việc huấn luyện cần nhiều GPU hơn, suy luận cần nhiều GPU hơn, khi số lượng tham số mô hình và người dùng tăng lên thì câu trả lời vẫn là thêm GPU. CPU trong hệ thống này chủ yếu đảm nhận việc khởi động nhiệm vụ, di chuyển dữ liệu và quản lý máy chủ, hiếm khi trở thành đối tượng quan tâm của nhà đầu tư.
Cho đến khi AI Agent thay đổi hình thái nhiệm vụ.
Bot trò chuyện thông thường nhận đoạn văn bản, chạy một lần mô hình, sau đó sinh ra một đoạn văn bản. Agent còn phải chuyển quyết định của mô hình thành hành động: đọc file, tìm kiếm web, truy xuất cơ sở dữ liệu, gọi API, thực thi code rồi trả về kết quả cho mô hình. Một tác vụ có thể trải qua hàng chục vòng “suy luận – thao tác – quan sát”, mỗi vòng phải chuyển đổi qua lại giữa GPU và CPU.
GPU vẫn đảm nhận việc tính toán mô hình nặng nhất, còn các tác vụ như phân tích đầu ra mô hình, xác định loại công cụ, gửi yêu cầu, chạy chương trình, quản lý tệp, thu thập kết quả và sắp xếp vòng nhiệm vụ tiếp theo thường được CPU xử lý. Madhu Rangarajan, Phó Chủ tịch về Tính toán & Enterprise AI của AMD, cho biết trong một pipeline agent thực tế mà công ty thử nghiệm, 7 trong 8 giai đoạn hoàn toàn chạy trên CPU. Tỷ lệ này do AMD tự đo, không nhất thiết đại diện cho mọi hệ thống, nhưng cũng đủ nói lên rằng:Suy luận mô hình chỉ là một phần để agent hoàn thành nhiệm vụ, còn mọi phối hợp ngoài phần đó đều đè nặng lên CPU.
Chi phí gây ra bởi một Agent có thể không lớn, nhưng khi mở rộng quy mô con số này sẽ trở nên rất lớn.
Một agent có thể đồng thời gọi nhiều công cụ và tạo ra các agent con. Khi doanh nghiệp triển khai cùng một hệ thống cho hàng chục nghìn nhân viên, số lượng tác vụ đồng thời sẽ tăng chóng mặt. Mỗi agent đều phân tích đầu ra, thực thi code và đọc ghi dữ liệu, chi phí CPU ban đầu phân tán sẽ tích tụ thành yêu cầu về dung lượng. Nếu CPU xử lý chậm, GPU sẽ phải chờ đầu vào cho vòng suy luận tiếp theo.
Kiểm tra bảo mật cũng đang làm tăng gánh nặng này. Agent càng nhiều quyền hạn, hệ thống càng cần kiểm tra agent đã mở file nào, gọi API nào, có đụng đến dữ liệu nhạy cảm không. Việc đối chiếu quy tắc, phân tích log và kiểm duyệt bằng các mô hình nhỏ thường để cho CPU vì tác vụ phân tán, nhạy cảm về độ trễ, gọi GPU riêng lẻ chưa chắc đã hợp lý. Vậy nên, agent càng tự chủ, khâu kiểm tra càng nhiều, CPU càng tải nặng.
Vào tháng 7 năm nay, AI Agent của OpenAI trong một đánh giá an ninh nội bộ đã vô tình vượt sandbox, truy cập vào hệ thống sản xuất của Hugging Face, minh chứng cho tầm quan trọng của các cơ chế an toàn này và lượng tải tính toán tăng thêm khi triển khai thực tế.
Một gánh nặng dễ bị bỏ qua nữa là việc tách từ (tokenization).
Trước khi xử lý văn bản, mô hình lớn phải chuyển văn bản thành các token. Quá trình này gồm rất nhiều thao tác chuỗi và rẽ nhánh điều kiện, không phù hợp với GPU như biến đổi ma trận. Đầu vào hội thoại thường ngắn, độ trễ tách từ gần như không cảm nhận được; nhưng agent liên tục tích lũy kết quả trả về của công cụ, mã code, log và lịch sử thao tác, đầu vào có thể lên đến hàng chục nghìn, thậm chí hàng trăm nghìn token.
Nghiên cứu sinh Euijun Chung của Viện Công nghệ Georgia, trong một cuộc phỏng vấn với IEEE Spectrum, cho biết trong một số hiện thực, ngữ cảnh đã có 100.000 token khi thêm kết quả công cụ 1.000 token, bộ tách từ vẫn có thể xử lý lại toàn bộ đầu vào.Bộ nhớ đệm tiền tố và tách từ tăng dần giúp giảm lặp lại công việc, do đó không phải hệ thống nào cũng làm vậy; nhưng áp lực CPU từ văn bản dài vẫn tồn tại.
Nhóm Chung trong nghiên cứu mới nhất đã kiểm thử các mô hình như Llama 3.1 và Qwen3. Khi chuỗi dài và batch lớn, việc tách từ chiếm đến 80% độ trễ token đầu tiên. Nếu số lõi CPU không đủ, các luồng tách từ sẽ tranh tài nguyên với tác vụ lập lịch và khởi động nhân GPU, dẫn đến CPU full load nhưng GPU lại chưa đầy tải. Sau khi bổ sung số lõi CPU, độ trễ token đầu tiên ở các cấu hình khác nhau cải thiện được 1,47–5,15 lần mà không phải thêm GPU.
Dữ liệu ngành đã bắt đầu phản ánh sự thay đổi này. Tháng 1/2026, KeyBanc dựa trên khảo sát chuỗi cung ứng cho rằng, phần lớn năng lực CPU máy chủ của Intel cả năm đã bán hết, nguồn cung CPU máy chủ của AMD cũng gần như sử dụng hết, nhờ vậy cả hai công ty có cơ hội tăng giá. Đây là ước tính từ kênh phân tích, không phải dữ liệu đơn đặt hàng do doanh nghiệp công bố.
Tài liệu tài chính của Intel sau đó phần nào đã xác nhận điều này. Công ty cho biết, nhu cầu CPU máy chủ quý I/2026 vượt quá khả năng cung ứng, dự báo hạn chế về sản lượng nội bộ sẽ kéo dài đến cuối năm. Giá trung bình sản phẩm máy chủ tăng 27% so với cùng kỳ, lượng xuất xưởng lại giảm 5%; Intel cho rằng nguyên nhân tăng giá do tỷ lệ sản phẩm cao cấp tăng, chiến lược định giá theo nhu cầu và chi phí gia tăng.
Doanh thu mảng trung tâm dữ liệu của AMD cùng kỳ đạt 5,8 tỷ USD, tăng 57% so với năm trước, tăng trưởng đồng thời đến từ CPU EPYC máy chủ và GPU Instinct. AMD không công bố tốc độ tăng trưởng riêng của CPU máy chủ nên chưa thể kết luận mức tăng 57% này hoàn toàn do nhu cầu của agent.
Dự báo của công ty về tương lai còn mạnh mẽ hơn. Trước đó AMD dự đoán thị trường CPU máy chủ tăng trưởng bình quân 18%/năm; đến tháng 5/2026 lại nâng dự báo lên trên 35%, dự kiến quy mô thị trường vượt mức 120 tỷ USD vào năm 2030.Lý do phía AMD đưa ra là agent cần một tầng tính toán CPU độc lập để đảm trách điều phối, xử lý dữ liệu, thực hiện công cụ và kiểm tra an ninh.
Trước đây, trong data center thường dùng một CPU để quản lý 4–8 GPU. AMD nhận thấy hệ thống agent đang thúc đẩy tỷ lệ này về gần 1:1, thậm chí nhiều CPU hơn đối với một số tải. Nhận định này dựa trên nhu cầu khách hàng, cấu hình thực tế sẽ thay đổi tùy theo công việc. Tuy nhiên, xu hướng rất rõ: Tăng thêm vài CPU không còn đủ, các hãng cloud bắt đầu xây dựng riêng các rack CPU cho agent.
Arm cũng lần đầu tiên chuyển từ bán thiết kế vi xử lý sang bán CPU data center trực tiếp vào tháng 3/2026. Dòng sản phẩm AGI của họ sở hữu tối đa 136 nhân, được phát triển cùng với Meta. Arm dự đoán, với cùng mức tiêu thụ điện, dung lượng CPU cần cho data center agent có thể gấp 4 lần so với data center truyền thống.
Qualcomm sau đó đã ra mắt Dragonfly C1000 với hơn 250 nhân, đồng thời ký hợp tác cung cấp nhiều thế hệ CPU máy chủ với Meta. Intel, AMD, Arm, Qualcomm và Nvidia trong vài tháng đã đều bổ sung “CPU cho agent” vào lộ trình sản phẩm, cho thấy cuộc cạnh tranh này đã vượt khỏi thị trường x86 truyền thống, mở rộng sang server Arm, nhân tự phát triển và thiết kế trọn rack.
Nvidia giữ một vị trí đặc biệt trong trường hợp này. Họ vừa bán GPU gây áp lực cho CPU, lại vừa bán Vera để giảm tải cho CPU; từ vi xử lý, mạng đến lưu trữ, toàn bộ thiết bị có thể do Nvidia cung cấp.Vera do đó không chỉ là mở rộng dòng sản phẩm, mà còn nhằm bảo vệ tỷ lệ sử dụng GPU. Mỗi giây GPU giảm chờ đợi có thể chuyển thành nhiều token hơn và tăng thu nhập rack máy chủ.
Tuy nhiên, khi các hãng chip chạy theo tiền thì cuối cùng vẫn là người tiêu dùng phải chịu. Giống GPU, chip lưu trữ, biến động nguồn cung lần này khả năng cao lại là do chúng ta gánh.
Intel đã thừa nhận trong cuộc họp báo cáo tài chính Q4/2025 rằng công ty đang chuyển hướng nguồn wafer nội bộ tối đa cho data center, đồng thời thuê thêm gia công cho sản phẩm khách hàng; ban lãnh đạo bổ sung là Intel sẽ không thể rời bỏ hoàn toàn thị trường khách hàng. Đến Q1/2026, giá trung bình CPU khách hàng Intel tăng 16% so với cùng kỳ, nhưng doanh số lại giảm 13%, công ty dự đoán hạn chế cung ứng ít nhất kéo dài đến hết nửa đầu năm.
Biến động của sản phẩm khách hàng không thể đổ hết cho agent. Bản thân Intel cũng chuyển đổi quy trình, thay đổi năng lực nội-ngoại bộ và nguồn cung RAM đều ảnh hưởng đến giá xuất xưởng. Tuy nhiên, với năng lực hạn chế, chip máy chủ lõi nhiều, giá bán cao, nhà cung cấp cloud lại sẵn sàng ký hợp đồng dài hạn, tài nguyên sản xuất sẽ được ưu tiên cho data center.
Ba năm trở lại đây, người dùng bình thường đã quen với chuyện GPU tăng giá và khan hàng. Sắp tới, điều tương tự có thể xảy ra với CPU.
Vận hành/trình bày: Hà Thần Long
Lưu ý: Ảnh bìa/ảnh đầu được AI hỗ trợ tạo ra
Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.
Bạn cũng có thể thích
Chính sách của Fed thực chất đã "hơi nới lỏng"? Mô hình lãi suất trung lập mới của Fed San Francisco cung cấp lý luận cho phe diều hâu
Một báo cáo nghiên cứu của ngân hàng dự trữ địa phương cho biết, một ước tính về lãi suất trung lập cho thấy lập trường chính sách của Fed là nới lỏng.

Suy luận AI khởi động chu kỳ siêu NAND! Sau khi Sandisk (SNDK.US) tăng mạnh 629% trong năm, JPMorgan vẫn nâng giá mục tiêu lên 2250 USD
Nhà phân tích Harlan Sur của JPMorgan gần đây đã nối lại việc theo dõi SanDisk, đưa ra đánh giá "tăng tỷ trọng" với giá mục tiêu là 2.250 USD, cao hơn gần 26% so với giá đóng cửa 1.786,85 USD của cổ phiếu này vào thứ Hai.

Áp lực lạm phát dai dẳng, nợ AI và tình trạng tài chính hỗn loạn siết chặt cùng lúc, lợi suất trái phiếu kho bạc Mỹ kỳ hạn 30 năm đạt mức cao nhất kể từ năm 2007, thị trường trái phiếu toàn cầu đối mặt với “cơn bão thời hạn đáo hạn”
Trái phiếu dài hạn đang trở thành tâm điểm của nỗi lo lắng của nhà đầu tư – những lo ngại về triển vọng lạm phát, làn sóng AI với gánh nặng nợ nần lớn cùng nhiều vấn đề khác đều tập trung ở đây, và các chính phủ các quốc gia đang phải trả giá cho điều này.

Khủng hoảng ngân sách cùng với cuộc bầu cử sắp đến! Phí bảo hiểm rủi ro chính trị tiếp tục tăng, trái phiếu chính phủ Pháp bị phe bán khống săn đuổi
Khi các chính trị gia Pháp chuẩn bị cho cuộc tranh luận gay gắt về ngân sách năm 2027, và cuộc bầu cử tổng thống năm tới đang đến gần, các nhà đầu tư đang chuyển sang xu hướng bán khống trái phiếu chính phủ Pháp.

