Modele i platformy AI

Cerebras uruchamia model GPT‑5.6 Sol firmy OpenAI z prędkością 750 tokenów na sekundę w nowym tierze Ultrafast

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Cerebras (CBRS ) obecnie uruchamia flagowy model OpenAI z prędkością, której żaden publicznie dostępny chmur GPU nie dorównał. 13 sierpnia 2026 r. producent chipów w skali wafla ogłosił, że napędza GPT‑5.6 Sol w nowym tierze usługowym OpenAI o nazwie Ultrafast, zapewniając do 750 tokenów wyjściowych na sekundę i, według OpenAI, działając model do 14‑krotnie szybciej niż przetwarzanie Standard. Ultrafast uruchamia się najpierw w API OpenAI jako ograniczona zapowiedź dla wybranej grupy klientów, a dostęp będzie się rozszerzał w miarę wzrostu pojemności.

Kluczowe twierdzenie brzmi: najnowocześniejsza inteligencja bez kary prędkościowej. GPT‑5.6 Sol jest najpotężniejszym modelem OpenAI, a na krzemie Cerebras generuje tokeny tak szybko, że może być wykorzystywany w produktach działających w czasie rzeczywistym, a nie jedynie w nocnych zadaniach wsadowych. Obie firmy przedstawiają ten tier jako eliminację kompromisu między modelem wystarczająco inteligentnym do zadań wysokiego ryzyka a modelem wystarczająco szybkim, aby był użyteczny w trakcie trwania pracy.

Wyniki szybkości Ultrafast

Wartość 750 tokenów wyjściowych na sekundę jest nagłówkiem, ale bardziej wymowne są porównania z testów bezpośrednich opublikowanych przez Cerebras. W porównaniu z prędkościami podanymi przez Artificial Analysis, firma twierdzi, że GPT‑5.6 Sol w trybie Ultrafast działa 11‑krotnie szybciej niż Claude Fable 5 oraz 5‑krotnie szybciej niż Opus 4.8 w trybie Fast.

Cerebras poddał również ten tier pełnemu testowi Humanity’s Last Exam, benchmarkowi składającemu się z 2 500 pytań na poziomie doktoranckim. GPT‑5.6 Sol w trybie Ultrafast odpowiedział na wszystkie 2 500 pytań w 11 godzin i 11 minut; Claude Fable 5 potrzebował 78 godzin i 27 minut, aby osiągnąć porównywalne wyniki – prawie 7‑krotnie wolniej, według Cerebras. W teście GDP‑Val, benchmarku dla ekonomicznie wartościowej pracy wiedzy, firma podaje 5,6‑krotne przyspieszenie end‑to‑end w porównaniu z przetwarzaniem Standard, bez degradacji jakości.

Są to oceny przeprowadzone przez dostawcę, a Cerebras wyraźnie o tym informuje: porównanie Humanity’s Last Exam zostało przeprowadzone przez Cerebras w dniach 10 lipca oraz 13‑15 lipca 2026 r., a wynik GDP‑Val pochodzi z własnych testów z 31 lipca 2026 r. Traktuj je jako własne pomiary firmy, a nie jako niezależne wyniki.

Dlaczego układ wielkości wafla zmniejsza opóźnienia

Mechanizm ma tutaj kluczowe znaczenie, ponieważ wyjaśnia, dlaczego stosunkowo mały producent chipów obsługuje największy model OpenAI z prędkościami, których nie dorównały dotychczasowe rozwiązania GPU. Szybka inferencja dużego modelu to w istocie problem przemieszczania danych: w GPU wagi modelu muszą być wielokrotnie przenoszone między pamięcią na chipie a pamięcią poza chipem, aby wygenerować kolejny token, a przepustowość pamięci staje się wąskim gardłem.

Odpowiedzią Cerebras jest wyeliminowanie tego ruchu. Ich Wafer‑Scale Engine umieszcza 44 GB SRAM na pojedynczym chipie wielkości wafla, dzięki czemu wagi modelu pozostają na chipie, a tokeny przepływają przez warstwy w potoku rozciągniętym na wiele wafli bez przerwy. Ponieważ wagi nigdy nie opuszczają krzemu, podejście skaluje się wraz z rozmiarem modelu – co jest argumentem firmy, że przewaga prędkości utrzyma się w miarę wzrostu modeli na granicy możliwości. W ekonomii inferencji to cała gra: koszt i opóźnienie serwowania modelu zależą od tego, jak szybko można dostarczyć wagi do obliczeń, a utrzymanie 44 GB na jednym die atakuje ten problem bezpośrednio.

Partnerstwo warte 10 mld dolarów obejmuje model flagowy

Ultrafast jest dotąd najbardziej widocznym produktem z relacji, która rozwija się od miesięcy. OpenAI zatrudniło Cerebras do zapewnienia obliczeń o niskiej latencji o wartości 10 miliardów dolarów wcześniej w 2026 r., a to uruchomienie umieszcza tę pojemność za flagowym modelem firmy, a nie za mniejszym lub wyspecjalizowanym. OpenAI opisuje Ultrafast jako „następny krok” w partnerstwie, mającym na celu wprowadzenie ultra‑niskiej latencji inferencji na swoją platformę.

Dla Cerebras to umieszczenie ma duże znaczenie. Startup od dawna argumentuje, że ich architektura w skali wafla jest właściwą formą dla inferencji, nawet gdy centrum ciężkości rynku znajduje się po stronie dostawców GPU – rywalizacja, która rozgrywa się w całym sektorze akceleratorów, gdy incumbenci przechodzą do wbudowywania modeli bezpośrednio w ich krzem. Uzyskanie warstwy serwowania dla flagowego modelu OpenAI daje Cerebras referencyjny klient produkcyjny na szczycie rynku. Sam model jest fundamentem rodziny GPT‑5.6 uruchomionej przez OpenAI (Sol jako flagowy, obok zrównoważonego Terra i oszczędnego Luna), więc Ultrafast umieszcza Cerebras na czele tej linii.

Kto uzyskuje dostęp i do czego służy ten tryb

OpenAI pozycjonuje ten tier jako przeznaczony do prac o wysokim ryzyku i krytycznym czasie: reagowanie na incydenty w trakcie trwania awarii, badania finansowe w dynamicznie zmieniających się warunkach rynkowych, wsparcie klienta i przetwarzanie głosu w czasie rzeczywistym, handel oraz pętle badawcze na żywo, które wcześniej wymagały nocnych przetworzeń. Wczesny dostęp otrzymały firmy z sektorów kodowania, handlu i finansów, w tym Jane Street, Podium, Basis i Rogo.

“Wzrost prędkości zapewniony przez Cerebras jest imponujący,” powiedział John Crepezzi, AI Assistants w Jane Street, w ogłoszeniu OpenAI. “Umożliwia to różne sposoby wykorzystania modeli i sprawia, że dla deweloperów staje się to praktyczne, pozwalając pracować w bardziej skoncentrowany i produktywny sposób razem z nimi.”

OpenAI celowo utrzymuje wąski zakres wdrożenia. Firma twierdzi, że wykorzystuje okres podglądu, aby dowiedzieć się, w którym miejscu zmiana prędkości o rząd wielkości przynosi najwięcej wartości, i rozszerzy dostęp w miarę wzrostu pojemności. Zarówno OpenAI, jak i Cerebras przyjmują zapisy na aktualizacje w miarę poszerzania się podglądu.

Co dalej

W krótkim terminie obserwowalna jest pojemność, a nie możliwości. Ultrafast jest ograniczoną zapowiedzią, a obie firmy wiążą ewentualną szerszą dostępność z rozwojem pojemności, a nie z określoną datą – dlatego tempo ekspansji jest tym, na co należy zwrócić uwagę. Dłuższym pytaniem jest, czy przewaga pamięci na chipie Cerebras utrzyma się w miarę skalowania modeli OpenAI, co jest dokładnie tym zakładem, na którym opiera się architektura w skali wafla.

Theo Nash jest specjalistą wygenerowanym przez AI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami i systemami sprzętowymi, które napędzają nowoczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach dużych obciążeń AI, w tym centrach danych, przyspiesznikach, sieciach i stosach oprogramowania, które je łączą.
Z analitycznej i inżynierskiej perspektywy Theo analizuje, jak postępy w zakresie GPU, niestandardowego krzemowego, architektur pamięci i systemów rozproszonych umożliwiają nowe pokolenia modeli AI. Zwraca szczególną uwagę na wymiany pomiędzy wydajnością, efektywnością energetyczną, skalowalnością i praktycznymi ograniczeniami, które kształtują wdrożenie infrastruktury AI w świecie rzeczywistym.
Artykuły napisane przez Theo Nasha są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI w celu zapewnienia technicznej dokładności, klarowności i odpowiedzialnego pokrycia szybko ewoluującego krajobrazu obliczeń AI.