Partenariats
OpenAI choisit Cerebras pour 10 milliards de dollars en calcul à faible latence

OpenAI a annoncé un accord pluriannuel avec le startup de puces Cerebras Systems (CBRS ) qui livrera 750 mégawatts de calcul dédié à l’IA au fabricant de ChatGPT, dans ce que les deux entreprises décrivent comme le plus grand déploiement d’inférence à haute vitesse jamais tenté.
L’accord, évalué à plus de 10 milliards de dollars selon des sources familières avec les termes, constitue le pari le plus important d’OpenAI en matière d’infrastructure en dehors de sa relation principale avec Microsoft (MSFT ). Cerebras construira et hébergera les systèmes par phases jusqu’en 2028, avec la première capacité en ligne cette année.
Le partenariat vise un problème spécifique : la vitesse. Alors qu’OpenAI a étendu ChatGPT à 800 millions d’utilisateurs par semaine, l’entreprise est confrontée à des contraintes de calcul qui ralentissent les temps de réponse – en particulier pour les charges de travail exigeantes comme la génération de code, les tâches d’agent et l’interaction vocale en temps réel.
“Cerebras ajoute une solution d’inférence à faible latence dédiée à notre plateforme”, a déclaré Sachin Katti, qui dirige la stratégie de calcul d’OpenAI. “Cela signifie des réponses plus rapides, des interactions plus naturelles et une base solide pour étendre l’IA en temps réel à davantage de personnes.”
Pourquoi le silicium à l’échelle de la plaquette est important
Le pitch de Cerebras est centré sur ses processeurs à l’échelle de la plaquette – des puces de la taille d’assiettes qui éliminent les retards de communication inhérents aux systèmes assemblés à partir de nombreuses petites GPU. L’entreprise affirme que son architecture livre des vitesses d’inférence jusqu’à 15 fois plus rapides que les alternatives basées sur les GPU, avec des modèles comme GPT-OSS-120B fonctionnant à environ 3 000 jetons par seconde.
Pour OpenAI, cette vitesse se traduit directement par l’expérience utilisateur. Lorsque l’IA répond en temps réel – sans la latence qui rend les conversations artificielles – les utilisateurs s’engagent plus profondément et réalisent plus. L’entreprise a testé le silicium de Cerebras avec ses modèles à poids ouvert avant Thanksgiving, et les conversations techniques entre les équipes se sont rapidement intensifiées jusqu’à un accord de terme signé, selon le PDG de Cerebras, Andrew Feldman.
“Juste comme le haut débit a transformé Internet, l’inférence en temps réel transformera l’IA”, a déclaré Feldman. “Cela permet des moyens entièrement nouveaux de construire et d’interagir avec les modèles d’IA.”
La comparaison n’est pas exagérée. Les débuts de l’Internet à accès téléphonique ont pris en charge le courrier électronique et la navigation de base ; le haut débit a permis la diffusion de vidéos, les appels vocaux et finalement l’économie des applications pour smartphones. OpenAI semble parier que l’inférence suffisamment rapide débloquera des applications que la latence actuelle rend impraticables – en particulier pour les agents d’IA qui doivent enchaîner plusieurs opérations sans que la patience humaine s’épuise.
La course aux armements de l’infrastructure s’intensifie
L’accord avec Cerebras intervient alors que les évaluations de l’infrastructure d’IA ont explosé, avec Databricks ayant récemment levé des fonds à 134 milliards de dollars et Cerebras lui-même étant en pourparlers pour un financement frais à une évaluation de 22 milliards de dollars. Les demandes de calcul des modèles d’IA de pointe ne montrent aucun signe de ralentissement, et les entreprises se précipitent pour verrouiller la capacité avant que les concurrents ne le fassent.
Pour Cerebras, le partenariat avec OpenAI résout un problème de concentration commerciale. Les Émirats arabes unis de G42 représentaient 87 % du chiffre d’affaires de Cerebras au premier semestre 2024 – une concentration de clients qui rendait les investisseurs nerveux. L’ajout d’OpenAI en tant que client important avant un éventuel IPO dérisque considérablement l’entreprise.
Pour OpenAI, l’accord diversifie son infrastructure d’IA au-delà du cloud Azure de Microsoft. Alors que Microsoft reste le principal fournisseur de calcul d’OpenAI, le partenariat avec Cerebras donne à OpenAI une capacité dédiée à faible latence optimisée spécifiquement pour l’inférence – une charge de travail différente de celle des exécutions d’entraînement que l’infrastructure de Microsoft gère.
Le timing est également important. OpenAI a récemment publié GPT-5.2 au milieu d’une concurrence accrue de la part de Google Gemini. Alors que les modèles deviennent plus capables, les entreprises qui les déployer découvrent que l’intelligence brute ne suffit pas – les utilisateurs s’attendent également à des réponses quasi instantanées. Un AI brillant qui prend dix secondes pour répondre semble cassé ; le même AI répondant en moins d’une seconde semble magical.
Sam Altman, le PDG d’OpenAI, est déjà un investisseur dans Cerebras, et OpenAI a un jour considéré l’acquisition de l’entreprise en totalité. Cet accord suggère que la relation évolue en quelque chose de plus stratégique : un partenariat où les destins des deux entreprises deviennent étroitement liés dans la course pour rendre l’IA vraiment conversationnelle.












