Zgodnie z informacjami z aplikacji Przewidywania Finansowe, firma produkująca chipy AI Cerebras Systems (CBRS.US) oficjalnie zaprezentowała podczas wydarzenia SUPERNOVA w San Francisco nowej generacji system rackowy AI – Cerebras CS-4, określając go jako „najszybszy akcelerator AI na rynku”. System ten jest przeznaczony do obszaru inferencji AI i bezpośrednio konkuruje z serwerowymi produktami GPU firmy Nvidia (NVDA.US). CS-4 planowany jest do rozpoczęcia wysyłki w tym kwartale (trzeci kwartał 2026 roku), obecnie próbki testują wybrani klienci.
Specyfikacja techniczna: Trzy procesory na poziomie wafla generują moc obliczeniową 750 PFLOPs
CS-4 jest pierwszym produktem nowej generacji rackowej platformy Nexus firmy Cerebras, napędzanym przez trzy zupełnie nowe procesory Wafer Scale Engine 3 Turbo (WSE-3T). WSE-3T to obecnie największy na świecie procesor AI, każdy chip integruje 4 biliony tranzystorów i 900 tysięcy rdzeni zoptymalizowanych pod AI, zajmuje 46 225 mm² powierzchni krzemowej i posiada 44 GB wbudowanego SRAM.
System CS-4 zapewnia moc obliczeniową 750 PFLOPs dla AI, przepustowość pamięci 129,6 PB na sekundę oraz przepustowość I/O 7,2 Tbps na sekundę. W porównaniu z poprzednią generacją CS-3, CS-4 jest dwa razy szybszy i oferuje 10-krotnie wyższą przepustowość na wat, co znacząco poprawia efektywność ekonomiczną data center. WSE-3T podwaja wydajność pojedynczego wafla AI z 125 PFLOPS do 250 PFLOPS, a przepustowość pamięci z 21,6 PB/s do 43,2 PB/s. Zużycie energii pojedynczego chipu wzrosło z 15 kW do około 33 kW.
W zakresie architektury, CS-4 wykorzystuje modułową platformę Nexus, oddzielając elementy obliczeniowe, zasilające i I/O w niezależne komponenty. Moduł konwersji zasilania, wcześniej umieszczony na tradycyjnych kartach GPU około 50 mm od procesora, został skrócony do około 0,5 mm, niemal całkowicie eliminując straty energii na poziomie płytki. Wymienna konstrukcja „plecaka” integruje konwersję zasilania, chłodzenie cieczą oraz elektronikę sterującą, umożliwiając wdrożenie systemu w kilka godzin zamiast kilku dni.
Przełom wydajnościowy: test GPT-OSS-120B – ponad 4400 Tokenów na sekundę na użytkownika
Cerebras deklaruje, że CS-4 ustanawia nowy standard szybkości inferencji. W bezpośrednim teście na modelu GPT-OSS-120B, system generował ponad 4400 tokenów na sekundę na użytkownika, co stanowi nawet 30-krotną przewagę nad rozwiązaniami GPU. System obsługuje modele z ponad 50 bilionami parametrów.
Szef technologii i współzałożyciel Cerebras, Sean Lie, powiedział: „30-krotna szybkość to nie tylko płynniejsze odczucia – daje systemom agentowym znacznie więcej czasu na inferencję, weryfikację lub wywołanie narzędzi w tym samym rzeczywistym czasie”. CEO Cerebras, Andrew Feldman, podkreślił: „Dotychczas szybka inferencja oznaczała pracę z mniejszymi, słabszymi modelami. CS-4 umożliwia rekordową szybkość przy największych modelach, fundamentalnie zmieniając ten paradygmat”.
Pod względem efektywności energetycznej, CS-4 oferuje do 10 razy większą przepustowość na wat w porównaniu z CS-3, co znacząco poprawia ekonomię operacji data center. Andrew Feldman dodał, że szybkie tokeny mają większą wartość niż wolne tokeny, a CS-4 przy danym zużyciu energii generuje więcej wysokiej jakości i ogólnie tokenów, „fundamentalnie zmieniając paradygmat”.
CS-4 cechuje się także redukcją liczby komponentów o 50%, uproszczając i przyspieszając wdrażanie przez klientów. Nowa architektura Nexus oddziela komponenty obliczeniowe, zasilające i I/O jako moduły – konwersja zasilania zamiast 50 mm od procesora została skrócona do około 0,5 mm, radykalnie obniżając straty energii i wspierając wyższe częstotliwości pracy. Wymienna konstrukcja „plecaka” łączy konwersję zasilania, chłodzenie cieczą i elektronikę sterującą w jednym niezależnym module, skracając wdrożenie z kilku dni do kilku godzin.
Warto zauważyć, że systemy na poziomie wafla Cerebras wykorzystują statyczną pamięć z dostępem swobodnym (SRAM), a nie powszechnie stosowaną DRAM. SRAM jest znacznie szybszy od DRAM, ale większy i droższy – wielkość wafla Cerebras umożliwia fizyczne wykorzystanie SRAM. Ponadto, pojedynczy chip umożliwia znacznie krótszy dystans przesyłu danych niż wielochipowe systemy Nvidia lub AMD.
Współpraca ekosystemowa: partnerstwo z AMD Helios, cel – 5-krotna poprawa efektywności
Programowalny subsystem I/O CS-4 obsługuje standard RoCE v2 RDMA oparty na Ethernet, co umożliwia integrację z heterogenicznymi systemami. Cerebras rozpoczął współpracę z AMD (AMD.US) nad tą architekturą, łącząc rozwiązanie rackowe Helios z WSE, uzyskując nawet 5 razy więcej tokenów generowanych na wat i sekundę niż w konfiguracji wyłącznie z Cerebras. AWS Trainium został także wymieniony wśród partnerów.
Założyciel i CEO SemiAnalysis, Dylan Patel, ocenił, że poprawa wdrażalności i funkcji sieciowych CS-4 pozwala na rozszerzenie obsługi na jeszcze większe modele i tworzenie „wielkoskalowych fabryk tokenów”.
Tło rynkowe: po debiucie cena akcji spadła 35%, CS-4 kluczowym punktem zwrotnym
Cerebras weszła na Nasdaq 14 maja 2026 roku, sprzedając akcje po 185 dolarów, z otwarciem na 350 dolarów i zamknięciem na 311,07 dolarów – wzrost o 68%. Jednak od tego czasu cena akcji systematycznie spadała, osiągając we wtorek około 220 dolarów, czyli spadek o około 35% względem szczytu.
Raport finansowy za II kwartał był mieszany: podstawowe przychody wyniosły 209,9 mln dolarów, wzrost o 103% rok do roku; jednak strata na akcję wyniosła 2,98 dolara, podczas gdy rok temu firma miała zysk 1,91 dolara na akcję. Prognoza wzrostu podstawowych przychodów trzykrotnie w 2027 roku i lepsza niż oczekiwano perspektywa Q3 nie przekonały w pełni inwestorów. Jednak zobowiązania umowne firmy wynoszą 25,4 mld dolarów, zapewniając duże możliwości przewidywania przyszłych przychodów.
Znaczenie branżowe: rynek inferencji AI czeka rewolucja
Premiera CS-4 zbiegła się z eksplozją popytu na inferencję AI. Wraz z przejściem dużych modeli z etapu treningu do szerokiej implementacji, efektywność inferencji staje się kluczowym czynnikiem konkurencyjności infrastruktury AI. Jeżeli deklarowana 30-krotna przewaga wydajności zostanie potwierdzona niezależnymi testami, może wpłynąć na decyzje zakupowe operatorów hiperskalowych centrów danych.
Wprowadzenie Cerebras CS-4 oznacza, że konkurencja wśród chipów AI przyspiesza przejście z obszaru treningu do rynku inferencji. Czy system rzeczywiście zagrozi dominacji Nvidia w tej dziedzinie, zależy od potwierdzenia parametrów w niezależnych testach – a także od tego, czy CS-4 zostanie dostarczony w odpowiedniej skali i tempie, by zaspokoić rosnący popyt operatorów hiperskalowych data center na szybkie generowanie tokenów.
Cloudowa działalność inferencyjna Cerebras odnotowała w II kwartale wzrost o 287% rok do roku, osiągając podstawowy przychód 127,7 mln dolarów. Premiera CS-4 oznacza przejście Cerebras z modelu sprzedaży hardware do modelu wynajmu mocy inferencyjnej, otwierając nowy etap rozwoju.