Modele i platformy AI

Cerebras Uruchamia OpenAI’s GPT-5.6 Sol z Prędkością 750 Tokenów na Sekundę w Nowym Poziomie Ultrafast

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Cerebras jest teraz w stanie uruchamiać flagowy model OpenAI z prędkością, której nie osiągnęła jeszcze żadna chmura GPU. 13 sierpnia 2026 r. producent chipów wafer-scale ogłosił, że uruchamia GPT-5.6 Sol na nowym poziomie usług OpenAI o nazwie Ultrafast, który dostarcza do 750 tokenów wyjściowych na sekundę, a według relacji OpenAI, uruchamia model do 14× szybciej niż przetwarzanie standardowe. Poziom Ultrafast jest uruchamiany najpierw w API OpenAI jako podgląd ograniczony dla wybranej grupy klientów, z dostępem rozszerzanym wraz ze wzrostem pojemności.

Centralne twierdzenie jest konkretnym: inteligencja graniczna bez kary za prędkość. GPT-5.6 Sol to najbardziej zaawansowany model OpenAI, a na chipie Cerebras generuje tokeny wystarczająco szybko, aby umieścić je w produktach w czasie rzeczywistym, a nie za pomocą nocnej partii wsadowej. Obie firmy przedstawiają ten poziom jako usuwanie kompromisu między modelem wystarczająco inteligentnym do pracy o wysokich stawkach a modelem wystarczająco szybkim do użycia, gdy praca jest jeszcze w toku.

Liczby Prędkości za Ultrafast

Liczba 750 tokenów wyjściowych na sekundę to nagłówek, ale bardziej wymowne porównania to bezpośrednie przebiegi opublikowane przez Cerebras. W porównaniu z prędkościami wyjściowymi raportowanymi przez Artificial Analysis, firma twierdzi, że GPT-5.6 Sol na Ultrafast działa 11× szybciej niż Claude Fable 5 i 5× szybciej niż Opus 4.8 w trybie Fast.

Cerebras również przeprowadził pełny przebieg Humanity’s Last Exam, benchmarku składającego się z 2500 pytań o poziomie PhD. GPT-5.6 Sol na Ultrafast odpowiedział na wszystkie 2500 pytań w ciągu 11 godzin i 11 minut; Claude Fable 5 potrzebował 78 godzin i 27 minut, aby osiągnąć porównywalne wnioski: prawie 7× wolniej, według Cerebras. Na GDP-Val, benchmarku dla pracy wiedzy o wysokiej wartości ekonomicznej, firma raportuje 5,6-krotny wzrost szybkości końcowej w porównaniu z przetwarzaniem standardowym bez pogorszenia jakości.

Są to oceny przeprowadzane przez dostawcę, a Cerebras jest w tym przypadku wyraźny: porównanie z Humanity’s Last Exam zostało pobrane przez Cerebras w dniach 10 i 13-15 lipca 2026 r., a wynik GDP-Val pochodzi z własnych badań z 31 lipca 2026 r. Traktuj je jako własne pomiary firmy, a nie wyniki niezależne.

Dlaczego Chip Wafer-Scale Wygrywa na Opóźnieniu

Mechanizm ma tu znaczenie, ponieważ wyjaśnia, dlaczego stosunkowo mały producent chipów może obsługiwać największy model OpenAI z prędkością, której nie osiągnęły dotąd GPU. Szybka inferencja na dużym modelu jest podstawowo problemem przenoszenia danych: na GPU ważne modele muszą być przesyłane wielokrotnie między pamięcią na chipie a magazynem poza chipem, aby wygenerować każdy kolejny token, a przepustowość pamięci staje się wąskim gardłem.

Odpowiedź Cerebras polega na wyeliminowaniu tego ruchu. Jego Silnik Wafer-Scale umieszcza 44 GB pamięci SRAM na jednym chipie o wielkości wafla, dzięki czemu ważne modele pozostają na chipie, a tokeny płyną przez warstwy pipelined na waflach bez przerw. Ponieważ ważne modele nigdy nie opuszczają krzemu, podejście skaluje się z rozmiarem modelu — co jest argumentem firmy, że przewaga szybkości jest zachowywana, gdy modele graniczne rosną. Dla ekonomiki inferencji jest to cała gra: koszt i opóźnienie obsługi modelu są dominowane przez to, jak szybko można karmić ważne modele, a utrzymanie 44 GB na jednym die atakuje to bezpośrednio.

10-Miliardowy Partnerstwo Dociera do Flagowca

Ultrafast to najbardziej widoczny produkt dotąd związku, który budowany jest od miesięcy. OpenAI wybrał Cerebras na 10 miliardów dolarów w niskiej latencji obliczeń wcześniej w 2026 r., a ten start umieszcza tę pojemność za flagowym modelem, a nie mniejszym lub specjalistycznym. OpenAI opisuje Ultrafast jako “następny krok” w partnerstwie, aby przynieść ultra-niską latencję inferencji do swojej platformy.

Dla Cerebras umieszczenie jest znaczące. Startup od dawna twierdzi, że jego architektura wafer-scale jest odpowiednim kształtem dla inferencji, nawet gdy środek ciężkości rynku leży po stronie dostawców GPU — co jest sporem, który rozgrywa się w całym biznesie przyspieszaczy, gdy incumbenci przechodzą do wbudowania modeli bezpośrednio w swój krzem. Umieszczenie warstwy serwisowej dla flagowego modelu OpenAI daje Cerebrasowi konto referencyjne w produkcji na szczycie rynku. Sam model kotwiczy rodzinę GPT-5.6 OpenAI (Sol jako flagowiec, obok zbalansowanego Terra i efektywnego kosztowo Luna), więc Ultrafast łączy Cerebras z przodu tej linii.

Kto To Otrzymuje i Dla Czego Jest To

OpenAI ukierunkowuje ten poziom na pracę wrażliwą na czas, o wysokich stawkach: odpowiedź na incydent, gdy awaria jest jeszcze w toku, badania finansowe, gdy warunki rynkowe się zmieniają, wsparcie klienta w czasie rzeczywistym i głos, handel i pętle badawcze, które dawniej działały przez noc. Wczesny dostęp został udzielony firmom z kodowania, handlu i finansów, w tym Jane Street, Podium, Basis i Rogo.

> “Wzrost prędkości dzięki Cerebras jest imponujący”, powiedział John Crepezzi, Asystenci AI w Jane Street, w ogłoszeniu OpenAI. “Umożliwia różne sposoby korzystania z modeli i sprawia, że jest to praktyczne dla deweloperów, aby pracować w sposób bardziej skupiony i produktywny obok nich.”

OpenAI utrzymuje wdrożenie wąskie celowo. Firma twierdzi, że używa okresu podglądu, aby nauczyć się, gdzie zmiana prędkości o rząd wielkości tworzy największą wartość, i będzie rozszerzać dostęp wraz ze wzrostem pojemności. Zarówno OpenAI, jak i Cerebras przyjmują zapisy na aktualizacje, gdy podgląd się rozszerza.

Co Następuje

Najbliższa obserwowalna rzecz to pojemność, a nie zdolność. Ultrafast to ograniczony podgląd, a obie firmy wiążą szerszą dostępność z wzrostem pojemności, a nie z określoną datą — więc tempo rozszerzania jest tym, co się obserwuje. Dłuższe pytanie brzmi, czy przewaga pamięci na chipie Cerebras jest zachowywana, gdy modele OpenAI rosną, co jest właśnie zakładem, na którym zbudowana jest architektura wafer-scale.

Theo Nash jest specjalistą wygenerowanym przez AI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami i systemami sprzętowymi, które napędzają nowoczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach dużych obciążeń AI, w tym centrach danych, przyspiesznikach, sieciach i stosach oprogramowania, które je łączą.
Z analitycznej i inżynierskiej perspektywy Theo analizuje, jak postępy w zakresie GPU, niestandardowego krzemowego, architektur pamięci i systemów rozproszonych umożliwiają nowe pokolenia modeli AI. Zwraca szczególną uwagę na wymiany pomiędzy wydajnością, efektywnością energetyczną, skalowalnością i praktycznymi ograniczeniami, które kształtują wdrożenie infrastruktury AI w świecie rzeczywistym.
Artykuły napisane przez Theo Nasha są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI w celu zapewnienia technicznej dokładności, klarowności i odpowiedzialnego pokrycia szybko ewoluującego krajobrazu obliczeń AI.