AI-mallit ja alustat

Cerebras Suorittaa OpenAI:n GPT-5.6 Sol:n 750 Tokenia Sekunnissa Uudessa Ultrafast-Tierissä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Cerebras suorittaa nyt OpenAI:n lippulaivamallin nopeudella, jota mikään GPU-pilvi ei ole julkisesti vastannut. 13. elokuuta 2026 wafer-asteen piirinvalmistaja ilmoitti, että se tuottaa GPT-5.6 Sol:in uudella OpenAI-palvelutasolla nimeltä Ultrafast, joka tarjoaa jopa 750 output-toknia sekunnissa, ja OpenAI:n mukaan suorittaa mallin jopa 14-kertaisella nopeudella verrattuna Standard-mallin suorituskykyyn. Ultrafast käynnistyy ensin OpenAI API:ssa rajoitettuna esikatseluna valitulle asiakasryhmälle, ja pääsy laajenee kapasiteetin kasvaessa.

Väite keskellä on tarkka: eturintamainnovaatiota ilman nopeuspenaalta. GPT-5.6 Sol on OpenAI:n kyvykkäin malli, ja Cerebras-piirillä se tuottaa tokenia tarpeeksi nopeasti voidakseen istua reaaliaikaisissa tuotteissa eikä vain yöllisessä erätyössä. Molemmat yritykset kuvaavat tason poistavan kompromissin mallin ja nopeuden välillä, joka on tarpeeksi älykäs korkean panoksen työhön ja tarpeeksi nopea käytettäväksi työn aikana.

Ultrafastin Nopeuslukuja

750 output-toknin sekunnissa luku on otsikko, mutta vertailu on Cerebras-julkaisemien head-to-head-suoritusten kautta. Artificial Analysis -yhtiön ilmoittamiin tuloksiin verrattuna Cerebras sanoo, että GPT-5.6 Sol Ultrafast-suorittaa 11-kertaisella nopeudella Claude Fable 5:ää ja 5-kertaisella nopeudella Opus 4.8:aa Fast-tilassa.

Cerebras suoritti myös täydellisen läpiajon Humanity’s Last Exam -kokeen, joka on 2 500 kysymyksen benchmark, joka on suunniteltu tohtorin tutkintotason vaikeudelle. GPT-5.6 Sol Ultrafast vastasi kaikkiin 2 500 kysymykseen 11 tunnissa ja 11 minuutissa; Claude Fable 5 tarvitsi 78 tuntia ja 27 minuuttia saavuttaakseen samanlaiset johtopäätökset: lähes 7-kertaisesti hitaampi, Cerebrasin mukaan. GDP-Val-benchmarkissa, joka on taloudellisesti arvokkaan tiedon työn benchmark, yhtiö ilmoittaa 5,6-kertaisen loppupään nopeuden Standard-käsittelyyn verrattuna ilman laadun heikentymistä.

Nämä ovat valmistajan suorittamat arviot, ja Cerebras on selkeä siitä: Humanity’s Last Exam -vertailu tehtiin Cerebrasilla 10. ja 13.-15. heinäkuuta 2026, ja GDP-Val-luku tulee yhtiön omasta 31. heinäkuuta 2026 testauksesta. Käsittele niitä yhtiön omina mittauksina, eikä riippumattomina tuloksina.

Miksi Wafer-Asteen Piiri Voittaa Viiveessä

Mekanismi on tärkeä, koska se selittää, miksi suhteellisen pieni piirinvalmistaja palvelee OpenAI:n suurinta mallia nopeudella, jota GPU-konkari ei ole vastannut. Nopea inference suurella mallilla on perustavanlaatuinen data-liikenteen ongelma: GPU:illa mallipainot on siirrettävä toistuvasti piirin sisäisestä muistista ulkoiseen tallennukseen jokaisen seuraavan tokenin luomiseksi, ja muistin kaistanleveys muodostaa pullonkaulan.

Cerebrasin vastaus on poistaa liike. Sen Wafer-Scale Engine -piiri pakkaa 44 GB SRAM:ia yhdelle wafer-kokoiselle piirille, joten mallipainot pysyvät piirillä ja tokenit virtaavat kerrosten läpi piirien yli ilman keskeytyksiä. Koska painot eivät koskaan jätä piiriä, lähestymistapa skaalautuu mallin koossa — mikä on yhtiön argumentti, että nopeus-etu säilyy, kun eturintamallit kasvavat. Inference-taloudelle tämä on koko peli: mallin käsittelyyn liittyvät kustannukset ja viiveet määräytyvät siitä, kuinka nopeasti voit syöttää painoja laskentaan, ja 44 GB:n säilyttäminen yhdellä piirillä hyökkää suoraan siihen.

10 Miljardin Dollarin Yhteistyö Saavuttaa Lippulaivan

Ultrafast on näkyvin tuote, joka on kehittynyt kuukausien ajan. OpenAI valitsi Cerebrasin 10 miljardin dollarin arvoiselle matalan viiveen laskentaan aiemmin vuonna 2026, ja tämä käynnistys asettaa kyseisen kapasiteetin OpenAI:n huipputasolle eikä pienemmälle tai erikoistuneemmalle mallille. OpenAI kuvailee Ultrafastia “seuraavaksi askeliksi” yhteistyössä, jonka tavoitteena on tuoda ultra-matala viive inference OpenAI:n alustalle.

Cerebrasille asettaminen on merkittävä. Startup-yritys on pitkään väittänyt, että sen wafer-asteen arkkitehtuuri on oikea muoto inferenssille, vaikka markkinoiden painopiste on GPU-toimittajilla — kilpailu, joka käydään kiihkeästi kiihdyttäjäliiketoiminnassa, kun vanhat toimijat siirtävät malleja suoraan piireihinsä. OpenAI:n lippulaivamallin asettaminen tuotantoon antaa Cerebrasille tuotantoon viittaavan asiakastilin markkinoiden huipulla. Itse malli on ankkuri GPT-5.6-perheelle, jonka OpenAI lanseerasi (Sol lippulaivana, Terra tasapainotettuna ja Luna kustannustehokkaana), joten Ultrafast liittää Cerebrasin eturintamaan.

Kuka Saatavilla ja Miksi

OpenAI asettaa tason aikakriittisiin, korkean panoksen töihin: häiriötilanteeseen vastaamiseen häiriön aikana, taloudelliseen tutkimukseen, kun markkinatilanne on muuttumassa, reaaliaikaiseen asiakastukeen ja ääneen, kauppaan ja live-tutkimuskiertoihin, jotka aiemmin suoritettiin yöllä. Varhainen pääsy on myönnetty yrityksille koodauksen, kaupan ja rahoituksen aloilla, mukaan lukien Jane Street, Podium, Basis ja Rogo.

> “Cerebrasin tuoma nopeuden lisäys on vaikuttava,” sanoi John Crepezzi, AI-apulaiset Jane Streetillä, OpenAI:n ilmoituksessa. “Se mahdollistaa eri tavoin mallien käytön ja tekee siitä käytännöllistä kehittäjille työskennellä keskittyneemmin ja tuottavammin niiden rinnalla.”

OpenAI pitää käynnistystä kapeana tarkoituksella. Yritys sanoo, että se käyttää esikatseluaikaan oppimaan, missä kymmenkertaista nopeuden muutosta luodaan eniten arvoa, ja laajentaa pääsyä kapasiteetin kasvaessa. Sekä OpenAI että Cerebras ottavat vastaan ilmoittautumisia päivityksistä, kun esikatselu laajenee.

Mitä Seuraa

Lähiajan havaittavissa oleva asia on kapasiteetti, ei kyky. Ultrafast on rajoitettu esikatselu, ja molemmat yritykset sitoutuvat laajemman saatavuuden kapasiteetin kasvuun eikä kiinteään päivämäärään — joten laajenemisen vauhti on se, mitä tarkkaillaan. Pitkäaikainen kysymys on, säilyykö Cerebrasin piirin muistin etu, kun OpenAI:n mallit kasvavat, mikä on täsmälleen se veto, jolle wafer-asteen arkkitehtuuri perustuu.

Theo Nash on tekoälygeneroitu asiantuntija Unite.AI:ssa, joka kattaa tekoälyinfrastruktuurin, laskennan ja modernin tekoälyä voimistavat laitteistojärjestelmät. Hänen työnsä keskittyy suurten tekoälykuormien taustalla oleviin teknisiin perusteisiin, mukaan lukien datakeskukset, kiihdyttimet, verkkotiet ja ohjelmistopinot, jotka sitoutuvat niihin.
Analyytisesta ja insinöörijohtoisesta näkökulmasta Theo tarkastelee, miten GPU:n, mukautetun piirin, muistiarkkitehtuurien ja hajautettujen järjestelmien edistysaskeleet mahdollistavat uusia tekoälymallien sukupolvia. Hän kiinnittää erityistä huomiota suorituskyky-yhteyksiin, energiatehokkuuteen, skaalautuvuuteen ja käytännön rajoituksiin, jotka muokkaavat tekoälyinfrastruktuurin todellista käyttöönottoa.
Artikkelit, joita Theo Nash on kirjoittanut, on tekoälygeneroitu ja Unite.AI:n toimittajatiimi on tarkastanut ne varmistaakseen teknisen tarkkuuden, selkeyden ja vastuullisen kattavuuden nopeasti kehittyvässä tekoälylaskennan maisemassa.