Modele și platforme AI
Cerebras Rulează OpenAI’s GPT-5.6 Sol la 750 de tokeni pe secundă în noul nivel Ultrafast

Cerebras rulează acum modelul emblematic al OpenAI la o viteză pe care niciun cloud de GPU nu a egalat-o public. Pe 13 august 2026, producătorul de cipuri la scară de wafer a anunțat că rulează GPT-5.6 Sol pe un nou nivel de servicii OpenAI numit Ultrafast, oferind până la 750 de tokeni de ieșire pe secundă și, potrivit relatării OpenAI, rulează modelul de până la 14 ori mai rapid decât procesarea standard. Ultrafast se lansează mai întâi în API-ul OpenAI ca o previzualizare limitată pentru un grup select de clienți, cu acces extins pe măsură ce crește capacitatea.
Afirmarea din centrul acestui anunț este una specifică: inteligență de frontieră fără penalizarea vitezei. GPT-5.6 Sol este cel mai capabil model al OpenAI, iar pe cipul Cerebras generează tokeni suficient de rapid pentru a fi integrat în produse în timp real, și nu în spatele unui job de procesare peste noapte. Ambele companii prezintă nivelul Ultrafast ca o soluție care elimină compromisul între un model suficient de inteligent pentru lucrări de înaltă prioritate și unul suficient de rapid pentru a fi utilizat în timp ce lucrarea este în desfășurare.
Numerele de viteză din spatele nivelului Ultrafast
Cifra de 750 de tokeni de ieșire pe secundă este titlul, dar comparațiile mai relevante sunt rulările head-to-head publicate de Cerebras. În comparație cu vitezele de ieșire raportate de Artificial Analysis, compania afirmă că GPT-5.6 Sol pe Ultrafast rulează de 11 ori mai rapid decât Claude Fable 5 și de 5 ori mai rapid decât Opus 4.8 în modul Fast.
Cerebras a supus, de asemenea, nivelul la o rundă completă a examenului Humanity’s Last Exam, o benchmark de 2.500 de întrebări la nivel de doctorat. GPT-5.6 Sol pe Ultrafast a răspuns la toate cele 2.500 de întrebări în 11 ore și 11 minute; Claude Fable 5 a necesitat 78 de ore și 27 de minute pentru a ajunge la concluzii comparabile: aproape de 7 ori mai lent, potrivit Cerebras. Pe GDP-Val, o benchmark pentru lucrări de cunoaștere economică valoroasă, compania raportează o accelerare de 5,6 ori a vitezei de la capăt la capăt față de procesarea standard, fără degradare a calității.
Acestea sunt evaluări efectuate de furnizor, iar Cerebras este explicit în acest sens: comparația cu Humanity’s Last Exam a fost benchmarkată de Cerebras în zilele de 10 și 13-15 iulie 2026, iar figura GDP-Val provine din testarea proprie din 31 iulie 2026. Tratați-le ca măsurători ale companiei, nu ca rezultate independente.
De ce cipul la scară de wafer câștigă la latență
Mecanismul contează aici, deoarece explică de ce un producător de cipuri relativ mic servește modelul cel mai mare al OpenAI la viteze pe care incumbenții GPU nu le-au egalat. Inferența rapidă a unui model mare este, în esență, o problemă de mișcare a datelor: pe GPU-urile, greutățile modelului trebuie transportate repetat între memoria de pe cip și stocarea de pe cip pentru a genera fiecare token succesor, iar lățimea de bandă a memoriei devine gâtul de sticlă.
Răspunsul Cerebras este să elimine acea mișcare. Motorul său la scară de wafer încorporează 44 GB de SRAM pe un singur cip de dimensiunea unui wafer, astfel încât greutățile modelului rămân pe cip și tokenii curg prin straturi pipelinate pe wafer fără întrerupere. Deoarece greutățile nu părăsesc niciodată siliciul, abordarea se extinde odată cu dimensiunea modelului — care este argumentul companiei că avantajul vitezei se menține pe măsură ce modelele de frontieră cresc. Pentru economia inferenței, acesta este jocul întreg: costul și latența servirii unui model sunt dominate de cât de rapid puteți alimenta greutățile cu calcul, iar menținerea a 44 GB rezidente pe un singur die atacă direct acest aspect.
Un parteneriat de 10 miliarde de dolari ajunge la nivelul flagship
Ultrafast este cel mai vizibil produs al unei relații care s-a construit de luni de zile. OpenAI a ales Cerebras pentru 10 miliarde de dolari în computație cu latență scăzută la începutul anului 2026, iar acest lansare pune această capacitate în spatele modelului său de top, și nu a unuia mai mic sau specializat. OpenAI descrie Ultrafast ca “următorul pas” în parteneriat pentru a aduce inferență cu latență foarte scăzută pe platforma sa.
Pentru Cerebras, plasarea este semnificativă. Start-up-ul a susținut de mult timp că arhitectura sa la scară de wafer este forma potrivită pentru inferență, chiar și pe măsură ce centrul de greutate al pieței se află cu furnizorii de GPU — un concurs care se desfășoară în întreaga afacere de acceleratoare pe măsură ce incumbenții se îndreaptă spre integrarea directă a modelelor în siliciul lor. Plasarea stratului de servire pentru modelul emblematic al OpenAI oferă Cerebras un cont de referință de producție la vârful pieței. Modelul în sine este ancora liniei GPT-5.6 lansate de OpenAI (Sol ca model emblematic, alături de Terra echilibrat și Luna eficientă din punct de vedere al costurilor), astfel încât Ultrafast atașează Cerebras la începutul acestei linii.
Cine primește și pentru ce este
OpenAI poziționează nivelul Ultrafast pentru lucrări sensibile la timp, cu miză ridicată: răspuns la incidente în timp ce întreruperea este încă în desfășurare, cercetare financiară în timp ce condițiile de piață se mișcă, suport clienți în timp real și voce, comerț și bucle de cercetare live care au rulat peste noapte. Accesul timpuriu a fost oferit companiilor din domeniul codificării, comerțului și finanțelor, incluzând Jane Street, Podium, Basis și Rogo.
> “Creșterea vitezei adusă de Cerebras este impresionantă”, a spus John Crepezzi, Asistenți AI la Jane Street, în anunțul OpenAI. “Permite modalități diferite de utilizare a modelelor și face ca dezvoltatorii să poată lucra într-un mod mai concentrat și productiv alături de ele.”
OpenAI menține lansarea îngustă în mod intenționat. Compania afirmă că utilizează perioada de previzualizare pentru a învăța unde o schimbare de ordinul de mărime a vitezei creează cea mai mare valoare și va extinde accesul pe măsură ce crește capacitatea. Atât OpenAI, cât și Cerebras primesc înscrieri pentru actualizări pe măsură ce previzualizarea se extinde.
Ce urmează
Observabilul din proximitate este capacitatea, nu capacitatea. Ultrafast este o previzualizare limitată, iar ambele companii leagă disponibilitatea mai largă de creșterea capacității, și nu de o dată fixă — deci ritmul extinderii este aspectul de urmărit. Întrebarea mai lungă este dacă avantajul de memorie pe cip al Cerebras se menține pe măsură ce modelele OpenAI se extind, ceea ce este exact pariu pe care se bazează arhitectura la scară de wafer.












