Partnerschappen

OpenAI maakt overeenkomst met Cerebras voor 10 miljard dollar in lage-latentieberekeningen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

OpenAI heeft een overeenkomst voor meerdere jaren gesloten met chip-startup Cerebras Systems (CBRS ), waardoor 750 megawatt aan dedicated AI-rekenkracht beschikbaar komt voor de maker van ChatGPT, in wat beide bedrijven beschrijven als de grootste high-speed-inferentie-implementatie ooit geprobeerd.

De overeenkomst, die volgens bronnen die bekend zijn met de voorwaarden meer dan 10 miljard dollar waard is, markeert de belangrijkste infrastructuurinzet van OpenAI buiten zijn primaire relatie met Microsoft (MSFT ). Cerebras zal de systemen in fasen bouwen en hosten tot 2028, met de eerste capaciteit die dit jaar online komt.

De samenwerking richt zich op een specifiek probleem: snelheid. Terwijl OpenAI ChatGPT heeft geschaald naar 800 miljoen wekelijkse gebruikers, staat het bedrijf voor rekenkrachtbeperkingen die responstijden vertragen – vooral voor veeleisende workloads zoals codegeneratie, agenttaken en real-time spraakinteractie.

“Cerebras voegt een dedicated low-latentie-inferentieoplossing toe aan ons platform”, zei Sachin Katti, die de rekenstrategie van OpenAI leidt. “Dat betekent snellere antwoorden, meer natuurlijke interacties en een sterker fundament om real-time AI te schalen naar veel meer mensen.”

Waarom wafer-schaal silicium ertoe doet

De pitch van Cerebras draait om zijn wafer-schaalprocessors – chips ter grootte van een dinertafel die de communicatievertragingen elimineren die inherent zijn aan systemen die zijn samengesteld uit veel kleinere GPUs. Het bedrijf beweert dat zijn architectuur inferentiesnelheden oplevert die tot 15 keer sneller zijn dan GPU-gebaseerde alternatieven, met modellen zoals GPT-OSS-120B die ongeveer 3.000 tokens per seconde draaien.

Voor OpenAI vertaalt die snelheid zich rechtstreeks naar de gebruikerservaring. Wanneer AI in real-time reageert – zonder de latentie die gesprekken kunstmatig laat aanvoelen – gaan gebruikers dieper in interactie en bereiken ze meer. Het bedrijf heeft de silicium van Cerebras getest met zijn open-gewichtmodellen voor Thanksgiving, en technische gesprekken tussen de teams escaleerden snel naar een ondertekend contract, volgens Cerebras-CEO Andrew Feldman.

“Net zoals breedband het internet transformeerde, zal real-time-inferentie AI transformeren”, zei Feldman. “Dit maakt het mogelijk om AI-modellen op geheel nieuwe manieren te bouwen en te gebruiken.”

De vergelijking is geen hyperbool. Vroeg dial-up-internet ondersteunde e-mail en basisbrowseren; breedband maakte streamingvideo, spraakgesprekken en uiteindelijk de smartphone-app-economie mogelijk. OpenAI lijkt te wedden dat voldoende snelle inferentie soortgelijke toepassingen zal ontgrendelen die momenteel onpraktisch zijn vanwege de latentie – vooral voor AI-agents die meerdere operaties moeten ketenen zonder dat de menselijke geduld opraakt.

De infrastructuurwedloop versnelt

De overeenkomst met Cerebras komt op een moment dat AI-infrastructuurwaarderingen zijn geëxplodeerd, met Databricks die onlangs 134 miljard dollar ophaalde en Cerebras zelf naar verluidt in onderhandeling is over verse financiering tegen een waardering van 22 miljard dollar. De rekenkrachteisen van frontier-AI-modellen laten geen tekenen zien van afvlakking, en bedrijven proberen capaciteit te vergaren voordat concurrenten dat doen.

Voor Cerebras lost de samenwerking met OpenAI een probleem van bedrijfsconcentratie op. De Verenigde Arabische Emiraten G42 vertegenwoordigde 87% van de omzet van Cerebras in de eerste helft van 2024 – een klantconcentratie die beleggers nerveus maakte. Het toevoegen van OpenAI als een belangrijke klant vóór een potentiële beursgang de-risiceert het bedrijf aanzienlijk.

Voor OpenAI diversificeert de overeenkomst zijn AI-infrastructuur buiten de Azure-cloud van Microsoft. Terwijl Microsoft nog steeds de primaire rekenkrachtleverancier van OpenAI is, geeft de samenwerking met Cerebras OpenAI dedicated low-latentiecapaciteit die specifiek is geoptimaliseerd voor inferentie – een andere workload dan de trainingsruns die de infrastructuur van Microsoft afhandelt.

De timing is ook belangrijk. OpenAI heeft onlangs GPT-5.2 uitgebracht te midden van een verscherpte concurrentie van Google’s Gemini. Terwijl modellen krachtiger worden, ontdekken de bedrijven die ze implementeren dat pure intelligentie niet genoeg is – gebruikers verwachten ook bijna-onmiddellijke antwoorden. Een briljante AI die tien seconden nodig heeft om te antwoorden, voelt kapot; dezelfde AI die in minder dan een seconde antwoordt, voelt

Sam Altman, de CEO van OpenAI, is al een investeerder in Cerebras, en OpenAI heeft ooit overwogen om het bedrijf rechtstreeks over te nemen. Deze overeenkomst suggereert dat de relatie evolueert naar iets meer strategisch: een partnerschap waarin het lot van beide bedrijven verweven raakt in de race om AI echt conversational te maken.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.