Modele și platforme AI
Cerebras rulează GPT-5.6 Sol de la OpenAI la 750 de tokeni pe secundă în noul nivel Ultrafast

Cerebras (CBRS ) rulează acum modelul emblematic al OpenAI la o viteză pe care niciun cloud cu GPU nu a egalat public. Pe 13 august 2026, producătorul de cipuri pe scară de wafer a anunțat că alimentează GPT-5.6 Sol pe un nou nivel de serviciu OpenAI numit Ultrafast, oferind până la 750 de tokeni de ieșire pe secundă și, conform contului OpenAI, rulează modelul cu până la 14× mai repede decât procesarea Standard. Ultrafast este lansat inițial în API-ul OpenAI ca o previzualizare limitată pentru un grup select de clienți, cu acces care se extinde pe măsură ce capacitatea crește.
Afirmația centrală este precisă: inteligență de frontieră fără penalizarea vitezei. GPT-5.6 Sol este cel mai capabil model OpenAI, iar pe cipurile Cerebras generează tokenuri suficient de repede pentru a fi integrat în produse în timp real, în loc să ruleze în loturi peste noapte. Ambele companii prezintă nivelul ca pe eliminarea compromisului dintre un model suficient de inteligent pentru sarcini cu miză mare și unul suficient de rapid pentru a fi folosit cât timp activitatea este încă în desfășurare.
Numerele de viteză din spatele Ultrafast
Cifra de 750 de tokenuri de ieșire pe secundă atrage atenția, dar comparațiile directe publicate de Cerebras sunt mai relevante. Raportându-se la vitezele de generare comunicate de Artificial Analysis, compania afirmă că GPT-5.6 Sol pe Ultrafast este de 11 ori mai rapid decât Claude Fable 5 și de cinci ori mai rapid decât Opus 4.8 în modul Fast.
Cerebras a supus, de asemenea, nivelul unui test complet al Humanity’s Last Exam, un benchmark de 2.500 de întrebări cu dificultate la nivel de doctorat. GPT-5.6 Sol pe Ultrafast a răspuns la toate cele 2.500 de întrebări în 11 ore și 11 minute; Claude Fable 5 a necesitat 78 de ore și 27 de minute pentru a ajunge la concluzii comparabile: aproape de 7× mai lent, în conformitate cu Cerebras. Pe GDP-Val, un benchmark pentru muncă de cunoaștere cu valoare economică, compania raportează o accelerare de 5.6× de la cap la cap față de procesarea Standard, fără degradarea calității.
Aceste evaluări sunt realizate de furnizor, iar Cerebras precizează explicit acest lucru: comparația Humanity’s Last Exam a fost testată de companie pe 10 iulie și în perioada 13–15 iulie 2026, iar cifra GDP-Val provine din testele sale din 31 iulie 2026. Ele trebuie privite ca măsurători proprii ale companiei, nu ca rezultate independente.
De ce cipul pe scară de wafer câștigă în latență
Mecanismul este important aici, deoarece explică de ce un producător de cipuri relativ mic rulează cel mai mare model OpenAI la viteze pe care furnizorii consacrați de GPU-uri nu le-au egalat. Inferența rapidă pe un model mare este, în esență, o problemă de transfer al datelor: pe GPU-uri, ponderile modelului trebuie mutate repetat între memoria de pe cip și stocarea externă pentru a genera fiecare token succesiv, iar lățimea de bandă a memoriei devine factorul limitativ.
Răspunsul Cerebras este eliminarea acestui transfer. Wafer-Scale Engine integrează 44 GB de SRAM pe un singur cip de dimensiunea unei plachete de siliciu. Astfel, ponderile modelului rămân pe cip, iar tokenurile trec neîntrerupt prin straturi organizate într-un flux de procesare pe mai multe plachete. Deoarece ponderile nu părăsesc siliciul, abordarea se extinde odată cu dimensiunea modelului — argumentul companiei că avantajul de viteză se păstrează pe măsură ce modelele de vârf cresc. Pentru economia inferenței, acesta este aspectul esențial: costul și latența rulării unui model depind în mare măsură de viteza cu care ponderile pot fi furnizate unităților de calcul, iar păstrarea a 44 GB pe un singur cip abordează direct această problemă.
Un parteneriat de 10 miliarde de dolari atinge modelul emblematic
Ultrafast este cel mai vizibil produs de până acum al unei relații dezvoltate de mai multe luni. OpenAI a ales Cerebras pentru 10 miliarde de dolari în calcul cu latență scăzută mai devreme în 2026, iar această lansare pune capacitatea respectivă în slujba modelului de vârf al companiei, nu a unuia mai mic sau specializat. OpenAI descrie Ultrafast drept „următorul pas” în parteneriatul menit să aducă inferența cu latență extrem de redusă pe platforma sa.
Pentru Cerebras, această poziționare este importantă. Startupul susține de mult timp că arhitectura sa la scara unei plachete de siliciu este potrivită pentru inferență, chiar dacă centrul de greutate al pieței rămâne la furnizorii de GPU-uri. Competiția se desfășoară în întregul sector al acceleratoarelor, în timp ce jucătorii consacrați încearcă să integreze modelele direct în siliciu. Preluarea execuției modelului principal OpenAI îi oferă Cerebras un client de referință în producție la vârful pieței. Modelul însuși se află în centrul familiei GPT-5.6 lansate de OpenAI — cu Sol ca model principal, alături de Terra, varianta echilibrată, și Luna, varianta economică — astfel că Ultrafast leagă Cerebras de vârful acestei game.
Cine îl primește și pentru ce este destinat
OpenAI poziționează acest nivel pentru activități cu miză mare, sensibile la timp: răspuns la incidente în timpul unei întreruperi, cercetare financiară în timp ce condițiile pieței se schimbă, asistență pentru clienți și voce în timp real, comerț și cicluri de cercetare live care înainte rulau peste noapte. Accesul inițial a fost acordat unor companii din programare, comerț și finanțe, inclusiv Jane Street, Podium, Basis și Rogo.
„Creșterea vitezei adusă de Cerebras este impresionantă”, a declarat John Crepezzi, AI Assistants la Jane Street, în anunțul OpenAI. „Permite diferite moduri de utilizare a modelelor și le face practice pentru dezvoltatori să lucreze într-un mod mai concentrat și productiv alături de ele.”
OpenAI limitează intenționat lansarea. Compania spune că folosește perioada de acces preliminar pentru a afla unde o schimbare de viteză de un ordin de mărime creează cea mai mare valoare și că va extinde accesul pe măsură ce crește capacitatea. Atât OpenAI, cât și Cerebras acceptă înscrieri pentru noutăți despre extinderea accesului preliminar.
Ce se întâmplă în continuare
Pe termen scurt, indicatorul de urmărit este capacitatea disponibilă, nu o nouă capabilitate a modelului. Ultrafast are acces preliminar limitat, iar ambele companii leagă disponibilitatea mai largă de creșterea capacității, nu de o dată fixă; ritmul extinderii este, așadar, ceea ce trebuie urmărit. Pe termen lung, întrebarea este dacă avantajul memoriei integrate a Cerebras se menține pe măsură ce modelele OpenAI cresc — exact pariul pe care se bazează arhitectura la scara unui disc de siliciu.












