Modely a platformy AI

Cerebras Spustí OpenAI’s GPT-5.6 Sol s 750 Tokeny za Sekundu v Novém Ultrafast Tieru

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Cerebras nyní běží OpenAI’s vlajkový model na rychlosti, kterou dosud žádný GPU cloud veřejně nezveřejnil. Dne 13. srpna 2026 společnost oznámila, že její wafer-scale čip pohání GPT-5.6 Sol na nové úrovni OpenAI nazvané Ultrafast, která poskytuje až 750 výstupních tokenů za sekundu a podle OpenAI běží model až 14× rychleji než standardní zpracování. Ultrafast se nejdříve spustí v OpenAI API jako omezená verze pro vybranou skupinu zákazníků, přičemž přístup se rozšíří, jakmile poroste kapacita.

Centrální tvrzení je konkrétní: hraní inteligence bez pokuty za rychlost. GPT-5.6 Sol je nejvýkonnějším modelem OpenAI a na čipu Cerebras generuje tokeny dostatečně rychle, aby se mohly použít v reálných produktech, nikoli pouze v nočních dávkových úlohách. Obě společnosti prezentují Ultrafast jako odstranění kompromisu mezi modelem dostatečně inteligentním pro náročné úkoly a dostatečně rychlým pro použití v reálném čase.

Rychlostní Čísla Za Ultrafast

Číslo 750 výstupních tokenů za sekundu je hlavním bodem, ale srovnání, která Cerebras zveřejnila, jsou ještě více vypovídající. Při srovnání s výstupními rychlostmi uvedenými v Artificial Analysis společnost uvádí, že GPT-5.6 Sol na Ultrafast běží 11× rychleji než Claude Fable 5 a 5× rychleji než Opus 4.8 v režimu Fast.

Cerebras také provedla plný průběh Humanity’s Last Exam, 2 500 otázek zaměřených na PhD-level obtížnost. GPT-5.6 Sol na Ultrafast odpověděla na všechny 2 500 otázek za 11 hodin a 11 minut; Claude Fable 5 potřebovala 78 hodin a 27 minut, aby dosáhla srovnatelných závěrů: téměř 7× pomaleji, podle Cerebras.

These jsou hodnocení provedená dodavatelem, a Cerebras je explicitně označuje jako svá vlastní měření, nikoli nezávislé výsledky.

Proč Wafer-Škálový Čip Vítězí na Latenci

Mechanizmus zde záleží, protože vysvětluje, proč relativně malá čipová společnost poskytuje OpenAI’s největší model na rychlostech, které dosud žádný GPU cloud nezveřejnil. Rychlá inferencia na velkém modelu je fundamentálně problémem pohybu dat: na GPU musí být modelová váha opakovaně přenášena mezi čipovou pamětí a vnější úložiště, aby se vygeneroval každý následující token, a šířka paměti se stává úzkým místem.

Odpověď Cerebras spočívá v odstranění tohoto pohybu. Jejich Wafer-Scale Engine obsahuje 44 GB SRAM na jednom čipu velikosti waferu, takže modelová váha zůstává na čipu a tokeny protékají vrstvami bez přerušení. Protože váha nikdy neopouští čip, přístup škáluje s velikostí modelu — což je argument společnosti, že výhoda rychlosti zůstává, jakmile se budou modely dále rozšiřovat.

10 Miliardový Partnerství Dosahuje Vlajkové Lodi

Ultrafast je nejviditelnějším produktem dosud ze vztahu, který se buduje již měsíce. OpenAI vybrala Cerebras pro 10 miliard dolarů v nízké latenci výpočtu na začátku roku 2026, a tento spuštění umístí tuto kapacitu za vlajkový model OpenAI místo menšího nebo specializovaného.

Pro Cerebras je toto umístění významné. Startup dlouhodobě argumentuje, že jeho wafer-škálová architektura je správným tvarem pro inferenci, i když se trh pohybuje kolem dodavatelů GPU — soutěž, která se odehrává napříč akcelerátorovým byznysem, zatímco zavedené společnosti se snaží zahustit modely přímo do svého křemíku.

Kdo To Získá a Pro Co To Je

OpenAI cílí Ultrafast na časově citlivé, vysoce rizikové práce: reakce na incidenty, zatímco výpadek stále probíhá, finanční výzkum, zatímco se mění tržní podmínky, reálná zákaznická podpora a hlas, obchod a živé výzkumné smyčky, které dříve běžely přes noc.

> “Zvýšení rychlosti, které Cerebras přináší, je působivé,” řekl John Crepezzi, AI Assistants at Jane Street, v oznámení OpenAI. “Povoluje různé způsoby použití modelů a dělá to praktické pro vývojáře pracovat v soustředěném a produktivním způsobem spolu s nimi.”

Co Se Stane Dále

Blízká budoucnost je pozorovatelná z hlediska kapacity, nikoli schopností. Ultrafast je omezená verze a obě společnosti spojují širší dostupnost s růstem kapacity, nikoli s pevným datem — takže tempo expanze je tím, co je třeba sledovat. Dlouhodobější otázka je, zda výhoda Cerebras na čipové paměti zůstává, jakmile se modely OpenAI dále rozšiřují, což je přesně sázka, na které je postavena wafer-škálová architektura.

Theo Nash je specialista na umělou inteligenci vygenerovaný v Unite.AI, který se zabývá infrastrukturou umělé inteligence, výpočetními systémy a hardwarovými systémy, které pohánějí moderní umělou inteligenci. Jeho práce se zaměřuje na technické základy velkých AI úloh, včetně datových center, akcelerátorů, sítí a softwarových balíčků, které je spojují.
S analytickým a inženýrským přístupem Theo zkoumá, jak pokroky v oblasti GPU, vlastních polovodičových součástek, architektur paměti a distribuovaných systémů umožňují nové generace AI modelů. Zvláštní pozornost věnuje obchodním kompromisům, energetické eficienci, škálovatelnosti a praktickým omezením, které formují reálné nasazení AI infrastruktury.
Články napsané Theo Nashem jsou vygenerovány umělou inteligencí a recenzovány redakčním týmem Unite.AI, aby zajistily technickou přesnost, srozumitelnost a zodpovědné pokrytí rychle se vyvíjejícího AI výpočetního prostředí.