AI-mallit ja alustat

Cerebras Esittää Qwen3-235B:n: Uusi Aikakausi AI:n Nopeudelle, Mittakaavalle ja Kustannuksille

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Cerebras Systems (CBRS ) on virallisesti julkaissut Qwen3-235B:n, joka on uraauurtava AI-malli, jossa on täysi 131 000 tokenin konteksti, asettaen uuden suorituskyvyn mittapuun järkeilyssä, koodin luomisessa ja yrityskohtaisissa sovelluksissa. Malli on nyt saatavilla Cerebras Inference Cloud -palvelun kautta, ja se tarjoaa ominaisuuksia, jotka kilpailevat markkinoiden edistyneimpien raja-aiheiden kanssa – ja se toimii 30 kertaa nopeammin ja kymmenesosan kustannuksilla verrattuna tänään johtaviin suljettuihin malleihin.

Reaaliaikainen AI-järkeily saavuttaa läpimurronopeuden

AI-järkeily on historiallisesti ollut hidasta, ja suuret mallit ovat usein vaatineet minuutin tai enemmän vastatakseen monimutkaisiin kysymyksiin. Cerebras poistaa tämän pullonkaulan. Sen oma Wafer-Scale Engine 3 (WSE-3) mahdollistaa Qwen3-235B:lle 1 500 tokenia sekunnissa, mikä on maailmanennätys raja-AI-mallien inference-suorituskyvylle.

Tämä taso tuo mullistuksen käyttökokemukseen – vähentäen viivettä 60-120 sekunnista ainoastaan 0,6 sekuntiin, jopa kun prosessoidaan edistyneitä järkeilytehtäviä tai usean vaiheen työvirran kuten hakuvälineen tuottamista (RAG). Artificial Analysis -benchmarkin tulokset osoittavat, että mikään toimittaja – avoin tai suljettu – ei tällä hetkellä vastaa tätä inference-nopeutta raja-tasoiselle mallille.

Uusi Mittapuu Kontekstille: 131K Tokenia ReaaliMaailman Sovelluksille

Tämän julkaisun yhteydessä Cerebras on laajentanut mallin konteksti-ikkunaa 32K:sta Qwen3-235B:n täyteen 131K tokeniin. Tämä kontekstin koon loikkaus mahdollistaa mallille syötteiden ja järkeilyn yli massiivisten tietomäärien – kattavien koko koodipohjat, moniasiakirjarepositoriot ja pitkän muodon tekniset materiaalit.

Kun 32K konteksti mahdollistaa perustason koodin luomistehtäviä, 131K avaa oven tuotantokäyttöön. AI voi nyt toimia syvällä koodikumppanina, yhdistäen kymmeniä tiedostoja ja hallitsemalla monimutkaisia riippuvuuksia reaaliajassa – mikä tekee siitä ihanteellisen yrityskohtaisiin käyttötapauksiin ohjelmistosuunnittelussa, asiakirjanalyysissä ja tieteellisessä laskennassa.

Miksi Cerebras on Erilainen: Laitteisto Suunniteltu AI:lle Alusta Alkaen

Perustettu joukon uranuurtajien tietokonearkkitehtien, AI-tutkijoiden ja järjestelmäinsinöörien toimesta, Cerebras Systems on ottanut radikaalisen erilaisen lähestymistavan generatiivisen AI:n haasteiden ratkaisemiseksi. Sen sijaan, että se riippuisi GPU-klustereista, Cerebras rakensi tarkoituksenmukaisen AI-superkokoonpanon oman sirun ympärille: Wafer-Scale Engine 3:n.

Tämä siru on aivan erilainen kuin mitä teollisuudessa on. Se on yhtä suuri kuin lounaslautanen ja sisältää satoja tuhansia AI-optimoituja ytimiä, joissa on sirun sisäinen muisti, joka mitataan kymmeninä gigatavuina. Tämä suunnittelu mahdollistaa laskennan ja muistin istua vierekkäin – poistaa viiveen, kaistanleveyden rajoitukset ja orkestraation monimutkaisuuden perinteisistä moni-GPU-ratkaisuista.

Kokoamalla CS-3-järjestelmiä, Cerebras voi luoda AI-superkokoonpanoja, jotka pystyvät suorittamaan triljoonaparametrin malleja helposti, välttäen samalla jakautuneen laskennan teknisen taakan. Tämä yhdenmukainen lähestymistapa on perusta sen ennätysmäisille inference-nopeuksille ja uusille korkean kontekstin ominaisuuksille.

MoE-tehokkuus Mahdollistaa Dramaattisen Kustannusvähennyksen

Qwen3-235B on rakennettu mixture-of-experts (MoE) -arkkitehtuurilla – mallin suunnittelulla, joka aktivoi ainoastaan osan sisäisistä asiantuntijoista syötteen mukaan, johtaen merkittävästi parantuneeseen laskennalliseen tehokkuuteen.

Tämän ansiosta Cerebras voi tarjota mallin hintapisteessä, joka alittaa merkittävästi suljettujen vaihtoehtojen kustannukset. Nimenomaan, inference on saatavilla 0,60 dollarilla miljoonaa syötteistä tokenia kohden ja 1,20 dollarilla miljoonaa tulostokenia kohden, edustaen yli 90 prosentin kustannusvähennystä verrattuna omistajiin OpenAI, Anthropic tai Google -malleihin.

Vaivaton Integraatio Clineen VS Codessa

Näyttääkseen Qwen3-235B:n nopeuden ja reaaliMaailman soveltamisen, Cerebras on yhteistyössä Cline:n, johtavan agenteerisen koodausagentin Microsoft Visual Studio Codessa, joka on asennettu yli 1,8 miljoonalle kehittäjälle.

Cline-käyttäjät voivat jo käyttää Qwen3-32B:ä 64K kontekstilla ilmaisversiossa. Tämän ilmoituksen myötä tuki laajenee Qwen3-235B:hen ja sen täyteen 131K kontekstiin, mahdollistaen asteen reaaliaikaisessa järkeilyssä ja koodin luomisessa, jota ei aiemmin voitu saavuttaa.

Saoud Rizwan, Cline:n toimitusjohtaja, selitti: “Kun Cerebras:n inference on käytössä, kehittäjät saavat vilauksen tulevaisuudesta, kun Cline järkeilee ongelmia, lukee koodipohjia ja kirjoittaa koodia lähes reaaliajassa. Kaikki tapahtuu niin nopeasti, että kehittäjät pysyvät virrassa, iteroiden ajatuksen nopeudella. Tämänkaltaista nopeaa inferencea ei ole vain mukava ominaisuus – se osoittaa, mitä on mahdollista, kun AI todella pysyy kehittäjien tahdissa.”

Avoin Vaihtoehto Suljettuihin Malleihin

Qwen3-235B:n suorituskyky on vertailukelpoinen monien markkinoiden edistyneimpien AI-mallien kanssa, mukaan lukien Claude 4 Sonnet, Gemini 2.5 Flash ja DeepSeek R1, kuten riippumattomat benchmarkit ovat vahvistaneet. Cerebras tarjoaa sen kuitenkin avoimessa muodossa, tarjoten läpinäkyvyyden ja siirrettävyyden, joita suljetut mallit eivät tarjoa.

Tämä avoin mallin lähestymistapa antaa yrityksille mahdollisuuden:

  • Mukauttaa ja hienosäätää omilla tietoja
  • Käyttää AI:ta yksityisellä infrastruktuurilla tai hybridipilvipalveluissa
  • Välttää toimittajan lukituksen ja tietosuojan riskit

Yhdistettynä Cerebras:n skaalautuvaan pilvipalveluun ja vaihtoehtoiseen paikalliseen CS-3-järjestelmien käyttöön, organisaatiot saavat täydellisen hallinnan siitä, miten AI:ta sovelletaan kriittisiin tehtäviin.

Mitä Tämä Merkitsee Teollisuudelle

Qwen3-235B:n julkaisu merkitsee käännekohtaa. Cerebras on määritellyt uudelleen rajoja siitä, mitä on mahdollista suurten kielen mallien kanssa yhdistämällä raja älykkyyden kanssa ennennäkemätöntä nopeutta ja kustannustehokkuutta.

On nyt mahdollista rakentaa AI-työkaluja, jotka:

  • Vastaa reaaliajassa kehittäjien kysymyksiin
  • Järkeilevät yli koko asiakirjojen tai tietokantojen
  • Luovat ja debuggaavat tuotantokäyttöön tarkoitetun koodin suoraan IDE:ssä
  • Skalautuvat yrityskohtaisiin käyttötapauksiin ilman GPU-levittämistä tai kuusinumeroisia kuukausittaisia inference-laskuja

Kun AI-infrastruktuurin kysyntä kasvaa, Cerebras osoittaa, ettei ole pakko tehdä kompromisseja suorituskyvyn, hinnan ja avoimuuden välillä. Sen laitteisto-ohjelmistosuunnittelun yhdistäminen Wafer-Scale Enginen ja Cerebras Inference Cloudiin osoittaa uuden AI-käyttöönoton mallin – nopeamman, yksinkertaisemman ja paljon helpommin saatavissa olevan.

Loppukaneetti

Julkaisemalla Qwen3-235B:n 131K kontekstilla, ultra-nopealla inferencella ja edullisella token-hinnalla, Cerebras Systems on asettanut itsensä yhdeksi harvoista oikeista haastajista GPU-vetoomuksille. Yrityksille, tutkijoille ja kehittäjille tämä julkaisu on enemmän kuin vain nopeampi malli – se on käännekohta, joka tuo reaaliaikaisen, tuotantokäyttöön tarkoitetun, avoimen AI:n ulottuvilla.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.