AI-mallit ja alustat
Cerebras ajaa OpenAI:n GPT-5.6 Sol -mallia 750 tokenia sekunnissa uudessa Ultrafast‑tasossa

Cerebras (CBRS ) ajaa nyt OpenAI:n lippulaivamallia nopeudella, jota mikään GPU‑pilvipalvelu ei ole julkisesti saavuttanut. 13. elokuuta 2026 wafer‑skaalaista sirua valmistava yritys julkaisi, että se tehostaa GPT-5.6 Sol -mallia uudessa OpenAI:n palvelutason nimeltä Ultrafast, jonka avulla voidaan tuottaa jopa 750 tokenia sekunnissa ja OpenAI:n mukaan malli toimii jopa 14‑kerran nopeammin kuin Standard‑käsittely. Ultrafast lanseerataan aluksi OpenAI API:ssa rajoitettuna esikatseluna valitulle asiakasryhmälle, ja käyttö laajenee kapasiteetin kasvaessa.
Keskellä oleva väite on tarkka: rajatietämys ilman nopeuspenaltyä. GPT-5.6 Sol on OpenAI:n kyvykkain malli, ja Cerebras‑siruilla se tuottaa tokeneita riittävän nopeasti, jotta se voidaan integroida reaaliaikaisiin tuotteisiin sen sijaan, että se toimisi yön yli suoritettavana erätyönä. Molemmat yritykset esittelevät tason poistavan kompromissin älykkään, korkean riskin työn vaatiman mallin ja riittävän nopean mallin välillä, jota voi käyttää työn ollessa käynnissä.
Ultrafastin taustalla olevat nopeuslukemat
750 tokenia sekunnissa -luku on otsikko, mutta merkityksellisemmät vertailut ovat Cerebras:n julkaisemia suoraa suorituksia. Artificial Analysisin raportoimiin tuotantonopeuksiin verrattuna yritys toteaa, että GPT-5.6 Sol Ultrafast -tasolla on 11‑kertaisesti nopeampi kuin Claude Fable 5 ja 5‑kertaisesti nopeampi kuin Opus 4.8 Fast‑tilassa.
Cerebras testasi myös tason läpikäymällä kokonaan Humanity’s Last Exam -testin, 2 500 kysymyksen mittapuun, joka on suunniteltu tohtorin‑tason vaikeustasolle. GPT-5.6 Sol Ultrafast -tasolla vastasi kaikkiin 2 500 kysymykseen 11 tunnissa ja 11 minuutissa; Claude Fable 5 tarvitsi 78 tuntia ja 27 minuuttia saavuttaakseen vastaavat johtopäätökset: lähes 7‑kertaisesti hitaampi, Cerebrasin mukaan. GDP‑Val‑testissä, joka mittaa taloudellisesti arvokasta tietotyötä, yritys raportoi 5,6‑kertaisen kokonaisnopeusparannuksen Standard‑käsittelyyn verrattuna ilman laadun heikkenemistä.
Nämä ovat toimittajapohjaisia arvioita, ja Cerebras on tästä täsmällinen: Humanity’s Last Exam -vertailu benchmarkattiin Cerebrasin toimesta 10. heinäkuuta sekä 13.–15. heinäkuuta 2026, ja GDP‑Val‑luku perustuu sen omaan 31. heinäkuuta 2026 tehtyyn testiin. Kohtele niitä yrityksen omina mittauksinaan, ei itsenäisinä tuloksina.
Miksi wafer‑skaala siru voittaa latenssissa
Mechanismi on merkityksellinen, koska se selittää, miksi suhteellisen pieni siruvalmistaja pystyy tarjoamaan OpenAI:n suurimman mallin nopeuksilla, joita GPU‑kilpailijat eivät ole saavuttaneet. Nopea inferenssi suuressa mallissa on pohjimmiltaan datansiirtotehtävä: GPU:illa mallin painot täytyy siirtää toistuvasti sirun sisäisen muistin ja sirun ulkopuolisen tallennuksen välillä jokaisen peräkkäisen tokenin tuottamiseksi, ja muistikaista on pullonkaula.
Cerebrasin ratkaisu on poistaa tämä siirto. Sen Wafer‑Scale Engine pakkaa 44 GB SRAMia yhteen wafer‑kokoiseen siruun, jolloin mallin painot pysyvät sirussa ja tokenit kulkevat kerrosten läpi putkitetusti waferien yli ilman keskeytystä. Koska painot eivät koskaan poistu piisirusta, lähestymistapa skaalautuu mallin koon mukana — mikä on yrityksen väite, että nopeusetu säilyy, kun rajamallit kasvavat. Inferenssin taloustieteessä tämä on koko peli: mallin tarjoamisen kustannus ja latenssi määräytyvät sen mukaan, kuinka nopeasti painot voidaan syöttää laskentaan, ja 44 GB:n pitäminen yhdessä sirussa hyökkää suoraan tähän.
10 miljardia dollaria kestävä kumppanuus saavuttaa lippulaivan
Ultrafast on tähän mennessä näkyvin tuote monien kuukausien ajan kehittyneestä suhteesta. OpenAI valitsi Cerebrasin 10 miljardia dollaria arvoiseen matalan latenssin laskentaan aiemmin vuonna 2026, ja tämä lanseeraus asettaa kyseisen kapasiteetin yrityksen huippumallin taakse sen sijaan, että se olisi pienempi tai erikoistunut. OpenAI kuvaa Ultrafastia “seuraavaksi askeleeksi” kumppanuudessa, jonka tavoitteena on tuoda äärimmäisen matalan latenssin inferenssi alustalleen.
Cerebrasin kannalta sijoittelu on merkittävä. Startup on pitkään väittänyt, että sen wafer‑skaala arkkitehtuuri on oikea muoto inferenssiin, vaikka markkinoiden painopiste on GPU‑toimittajilla — kilpailu käydään kiihdyttimien alalla, kun vakiintuneet toimijat siirtyvät sisällyttämään mallit suoraan omaan piisiruun. OpenAI:n lippulaivan palvelukerroksen hallinta antaa Cerebrasile tuotantoviitteen markkinoiden huipulta. Malli itse toimii GPT‑5.6‑perheen ytimessä, jonka OpenAI on lanseerannut (Sol lippulaivana, tasapainoisena Terrana ja kustannustehokkaana Lunana), joten Ultrafast liittää Cerebrasin tähän sarjaan.
Kuka saa sen ja mihin se on tarkoitettu
OpenAI asettaa tason aikakriittiseen, korkean riskin työhön: tapahtumavasteeseen, kun häiriö on vielä käynnissä, rahoitustutkimukseen markkinatilanteen muuttuessa, reaaliaikaiseen asiakastukeen ja puheeseen, kaupankäyntiin sekä elävien tutkimussilmukoiden toteuttamiseen, jotka aikaisemmin ajettiin yön yli. Varhainen pääsy on myönnetty yrityksille koodauksen, kaupankäynnin ja rahoituksen aloilta, kuten Jane Street, Podium, Basis ja Rogo.
“Cerebrasin tuoma nopeuden kasvu on vaikuttava,” sanoi John Crepezzi, AI Assistants Jane Streetiltä, OpenAI:n ilmoituksessa. “Se mahdollistaa erilaisia tapoja käyttää malleja, ja tekee kehittäjille käytännölliseksi työskennellä niiden rinnalla keskittyneemmin ja tuottavammin.”
OpenAI pitää käyttöönoton tahallaan rajoitettuna. Yritys kertoo käyttävänsä esikatseluaikaan oppiakseen, missä kymmenkertainen nopeuden muutos tuottaa eniten arvoa, ja laajentaa pääsyä kapasiteetin kasvaessa. Sekä OpenAI että Cerebras ottavat vastaan ilmoittautumisia päivityksiä varten esikatselun laajentuessa.
Mitä tapahtuu seuraavaksi
Lähitulevaisuuden havaittava tekijä on kapasiteetti, ei kyvykkyys. Ultrafast on rajoitettu esikatselu, ja molemmat yritykset sitovat laajemman saatavuuden kapasiteetin kasvuun kiinteän päivämäärän sijaan — joten laajenemisen tahtia on seurattava. Pidempi kysymys on, säilyykö Cerebrasin sirun sisäinen muisti‑etu OpenAI:n mallien skaalautuessa, mikä on juuri se vedonlyönti, jonka wafer‑skaala arkkitehtuuri perustuu.












