Modely a platformy AI

Cerebras spouští model GPT-5.6 Sol od OpenAI rychlostí 750 tokenů za sekundu v nové úrovni Ultrafast

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Cerebras (CBRS ) nyní provozuje vlajkový model OpenAI rychlostí, kterou žádný veřejně dostupný GPU cloud nedokázal překonat. Dne 13. srpna 2026 oznámil, že napájí GPT-5.6 Sol na nové úrovni služby OpenAI nazvané Ultrafast, poskytující až 750 výstupních tokenů za sekundu a podle podle OpenAI běží model až 14‑krát rychleji než standardní zpracování. Ultrafast je nejprve spuštěn v OpenAI API jako omezený náhled pro vybranou skupinu zákazníků, přičemž přístup se bude rozšiřovat s růstem kapacity.

Tvrzení v jádru je konkrétní: špičková inteligence bez penalizace rychlosti. GPT-5.6 Sol je nejvýkonnější model OpenAI a na silikonovém čipu Cerebras generuje tokeny tak rychle, že může fungovat v reálném čase místo zpracování v noční dávce. Obě společnosti prezentují tuto úroveň jako odstranění kompromisu mezi modelem dostatečně chytrým pro kritické úkoly a modelem dostatečně rychlým pro použití během samotné práce.

Čísla rychlosti za Ultrafast

Číslo 750 výstupních tokenů za sekundu je hlavní titulek, ale podstatnější jsou srovnávací testy, které Cerebras zveřejnil. Ve srovnání s rychlostmi výstupu uvedenými společností Artificial Analysis společnost uvádí, že GPT-5.6 Sol na Ultrafast běží 11‑krát rychleji než Claude Fable 5 a 5‑krát rychleji než Opus 4.8 v režimu Fast.

Cerebras také podrobil tuto úroveň kompletnímu testu Humanity’s Last Exam, benchmarku s 2 500 otázkami na úrovni PhD. GPT-5.6 Sol na Ultrafast zodpověděl všech 2 500 otázek za 11 hodin a 11 minut; Claude Fable 5 potřeboval 78 hodin a 27 minut k dosažení srovnatelných závěrů: téměř 7‑krát pomaleji, podle Cerebras. V benchmarku GDP‑Val, který měří ekonomicky hodnotnou znalostní práci, společnost uvádí 5,6‑násobné zrychlení od konce do konce oproti standardnímu zpracování bez ztráty kvality.

Jedná se o hodnocení provedená dodavatelem a Cerebras to explicitně uvádí: srovnání Humanity’s Last Exam bylo benchmarkováno společností Cerebras 10. července a 13.–15. července 2026 a údaj z GDP‑Val pochází z vlastního testování 31. července 2026. Považujte je za interní měření společnosti, nikoli za nezávislé výsledky.

Proč wafer‑scale čip vítězí v latenci

Mechanismus je zde důležitý, protože vysvětluje, proč relativně malý výrobce čipů poskytuje největší model OpenAI rychlostmi, které GPU konkurenti nedokázali dosáhnout. Rychlé inferování velkého modelu je v podstatě problém přenosu dat: na GPU se váhy modelu musí opakovaně přesouvat mezi pamětí na čipu a úložištěm mimo čip, aby se vygeneroval každý následující token, a šířka pásma paměti se tak stává úzkým hrdlem.

Odpovědí Cerebras je eliminovat tento pohyb. Jejich Wafer‑Scale Engine umisťuje 44 GB SRAM na jediný čip velikosti waferu, takže váhy modelu zůstávají na čipu a tokeny procházejí vrstvami v pipeline napříč wafery bez přerušení. Protože váhy nikdy neopouštějí křemík, přístup se škáluje s velikostí modelu – což je argument společnosti, že výhodu rychlosti si modely špičkové úrovně udrží i při jejich růstu. Z hlediska ekonomiky inferování je to celé: náklady a latence poskytování modelu jsou určeny tím, jak rychle můžete váhy dodat výpočetní jednotce, a udržení 44 GB na jednom die to řeší přímo.

10‑miliardové partnerství dosahuje vlajkového modelu

Ultrafast je nejviditelnějším produktem dosud z partnerství, které se budovalo měsíce. OpenAI vybralo Cerebras pro 10 miliard dolarů na výpočet s nízkou latencí na začátku roku 2026 a toto spuštění umisťuje tuto kapacitu za nejvyšší model společnosti místo menšího či specializovaného. OpenAI popisuje Ultrafast jako „další krok“ v partnerství, který má přinést ultra‑nízkou latenci inferování na svou platformu.

Pro Cerebras je toto umístění významné. Startup dlouho argumentuje, že jeho wafer‑scale architektura je ideální pro inferování, i když se střed těžiště trhu přesouvá k dodavatelům GPU – soutěž, která probíhá v celém akceleračním odvětví, když etablované firmy přecházejí na vkládání modelů přímo do svého silikonu. Získání vrstvy poskytování pro vlajkový model OpenAI dává Cerebras referenční zákazníka v produkci na špici trhu. Samotný model je kotvou rodiny GPT‑5.6, kterou OpenAI spustilo (Sol jako vlajkový, vedle vyváženého Terra a nákladově efektivního Luna), takže Ultrafast připojuje Cerebras k čela této řady.

Kdo to získá a k čemu je určeno

OpenAI tuto úroveň zaměřuje na časově citlivé, vysoce rizikové úkoly: reakci na incidenty během probíhajícího výpadku, finanční výzkum během měnících se tržních podmínek, podporu zákazníků a hlas v reálném čase, obchod a živé výzkumné smyčky, které dříve probíhaly přes noc. Raný přístup získaly společnosti z oblastí kódování, obchodu a financí, včetně Jane Street, Podium, Basis a Rogo.

“Zvýšení rychlosti, které Cerebras přineslo, je impozantní,” řekl John Crepezzi, AI Assistants ve společnosti Jane Street, v oznámení OpenAI. “Umožňuje různé způsoby využití modelů a činí je praktickými pro vývojáře, aby mohli pracovat soustředěněji a produktivněji vedle nich.”

OpenAI úmyslně omezuje rozšíření. Společnost uvádí, že využívá období náhledu k zjištění, kde změna rychlosti řádu řádů přináší největší hodnotu, a přístup rozšíří s růstem kapacity. Jak OpenAI, tak Cerebras přijímají přihlášky na aktualizace, jak se náhled rozšiřuje.

Co bude dál

V blízké budoucnosti je pozorovatelná spíše kapacita než schopnosti. Ultrafast je omezený náhled a obě společnosti spojují širší dostupnost s růstem kapacity místo pevného data – takže tempo rozšiřování je to, na co je třeba se zaměřit. Dlouhodobější otázkou je, zda výhoda on‑chip paměti Cerebras přetrvá, když se modely OpenAI rozšiřují, což je přesně sázka, na které je wafer‑scale architektura postavena.

Theo Nash je AI-generovaný specialista ve společnosti Unite.AI, který se zabývá AI infrastrukturou, výpočetní technikou a hardwarovými systémy, které pohánějí moderní umělou inteligenci. Jeho práce se soustředí na technické základy velkých AI pracovních zátěží, včetně datových center, akcelerátorů, sítí a softwarových vrstev, které je spojují.

S analytickým a inženýrsky orientovaným pohledem Theo zkoumá, jak pokroky v GPU, vlastním silikonu, paměťových architekturách a distribuovaných systémech umožňují nové generace AI modelů. Věnuje zvláštní pozornost kompromisům výkonu, energetické účinnosti, škálovatelnosti a praktickým omezením, která formují nasazení AI infrastruktury v reálném světě.

Články napsané Theo Nash jsou AI-generované a jsou kontrolovány redakčním týmem Unite.AI, aby zajistily technickou přesnost, srozumitelnost a odpovědné pokrytí rychle se vyvíjejícího prostředí AI výpočtů.