Modèles et plateformes d’IA

Cerebras exécute GPT-5.6 Sol d’OpenAI à 750 jetons par seconde dans le nouveau niveau Ultrafast

mm
Ajouter Unite.AI à vos sources préférées sur Google

Cerebras exécute maintenant le modèle phare d’OpenAI à une vitesse que aucun cloud de GPU n’a publiquement égalée. Le 13 août 2026, le fabricant de puces au niveau de la wafer a annoncé qu’il alimente GPT-5.6 Sol sur un nouveau niveau de service OpenAI appelé Ultrafast, délivrant jusqu’à 750 jetons de sortie par seconde et, selon le compte d’OpenAI, exécutant le modèle jusqu’à 14 fois plus vite que le traitement standard. Ultrafast est lancé en premier dans l’API OpenAI en tant que version préliminaire limitée pour un groupe sélectionné de clients, avec un accès élargi à mesure que la capacité augmente.

L’affirmation au centre est spécifique : l’intelligence de pointe sans pénalité de vitesse. GPT-5.6 Sol est le modèle le plus capable d’OpenAI, et sur la silice de Cerebras, il génère des jetons suffisamment rapidement pour être intégré à des produits en temps réel plutôt qu’à des tâches par lots nocturnes. Les deux sociétés présentent le niveau comme supprimant le compromis entre un modèle suffisamment intelligent pour des travaux à haut risque et un modèle suffisamment rapide pour être utilisé pendant que le travail est en cours.

Les chiffres de vitesse derrière Ultrafast

Le chiffre de 750 jetons de sortie par seconde est le titre, mais les comparaisons les plus révélatrices sont les courses tête-à-tête publiées par Cerebras. Contre les vitesses de sortie signalées par Artificial Analysis, la société affirme que GPT-5.6 Sol sur Ultrafast s’exécute 11 fois plus vite que Claude Fable 5 et 5 fois plus vite que Opus 4.8 en mode rapide.

Cerebras a également soumis le niveau à un passage complet de l’examen final de l’humanité, un benchmark de 2 500 questions à un niveau de difficulté de doctorat. GPT-5.6 Sol sur Ultrafast a répondu aux 2 500 questions en 11 heures et 11 minutes ; Claude Fable 5 a nécessité 78 heures et 27 minutes pour atteindre des conclusions comparables : près de 7 fois plus lent, selon Cerebras. Sur GDP-Val, un benchmark pour les travaux de connaissance économiquement valables, la société signale une accélération de fin à fin de 5,6 fois par rapport au traitement standard sans dégradation de la qualité.

Ces évaluations sont effectuées par le fournisseur, et Cerebras est explicite à ce sujet : la comparaison de l’examen final de l’humanité a été benchmarkée par Cerebras les 10 et 13-15 juillet 2026, et le chiffre de GDP-Val provient de ses propres tests du 31 juillet 2026. Traitez-les comme les mesures propres de la société, et non comme des résultats indépendants.

Pourquoi la puce au niveau de la wafer gagne sur la latence

Le mécanisme est important ici, car il explique pourquoi un fabricant de puces relativement petit sert le plus grand modèle d’OpenAI à des vitesses que les géants du GPU n’ont pas égalées. L’inférence rapide sur un grand modèle est fondamentalement un problème de déplacement de données : sur les GPU, les poids du modèle doivent être déplacés à plusieurs reprises entre la mémoire sur puce et le stockage hors puce pour générer chaque jeton successif, et la bande passante de la mémoire devient le goulet d’étranglement.

La réponse de Cerebras est d’éliminer ce déplacement. Son moteur au niveau de la wafer intègre 44 Go de SRAM sur une puce de la taille d’une wafer, de sorte que les poids du modèle restent sur la silice et les jetons s’écoulent à travers les couches pipelinées sur les wafers sans interruption. Puisque les poids ne quittent jamais la silice, l’approche s’adapte à la taille du modèle — ce qui est l’argument de la société selon lequel l’avantage de vitesse se maintient à mesure que les modèles de pointe grandissent. Pour l’économie de l’inférence, c’est le jeu : le coût et la latence du service d’un modèle sont dominés par la vitesse à laquelle vous pouvez alimenter les poids en calcul, et garder 44 Go résidents sur un seul die attaque directement cela.

Un partenariat de 10 milliards de dollars atteint le navire amiral

Ultrafast est le produit le plus visible à ce jour d’une relation qui se construit depuis des mois. OpenAI a choisi Cerebras pour 10 milliards de dollars de calcul à faible latence plus tôt en 2026, et ce lancement place cette capacité derrière le modèle phare de la société plutôt qu’un modèle plus petit ou spécialisé. OpenAI décrit Ultrafast comme “l’étape suivante” du partenariat pour apporter une inférence à ultra-faible latence à sa plateforme.

Pour Cerebras, le placement est important. Le startup a longtemps argumenté que son architecture au niveau de la wafer est la bonne forme pour l’inférence, même si le centre de gravité du marché se situe avec les fournisseurs de GPU — un conflit qui se joue dans tout l’entreprise d’accélérateur à mesure que les sociétés établies intègrent des modèles directement dans leur silice. L’obtention de la couche de service pour le modèle phare d’OpenAI donne à Cerebras un compte de référence de production au sommet du marché. Le modèle lui-même ancre la famille GPT-5.6 d’OpenAI (Sol en tant que navire amiral, aux côtés du Terra équilibré et du Luna à faible coût), donc Ultrafast attache Cerebras à l’avant de cette ligne.

Qui l’obtient et à quoi ça sert

OpenAI positionne le niveau pour des travaux sensibles au temps et à haut risque : réponse aux incidents pendant qu’une panne est toujours en cours, recherche financière pendant que les conditions de marché sont en mouvement, support client en temps réel et voix, commerce et boucles de recherche en direct qui fonctionnaient auparavant la nuit. Un accès anticipé a été accordé à des sociétés dans le codage, le commerce et la finance, notamment Jane Street, Podium, Basis et Rogo.

> “L’augmentation de vitesse apportée par Cerebras est impressionnante”, a déclaré John Crepezzi, assistants d’IA chez Jane Street, dans l’annonce d’OpenAI. “Cela permet des moyens différents d’utiliser les modèles, et rend-il pratique pour les développeurs de travailler de manière plus ciblée et productive avec eux.”

OpenAI maintient le lancement étroit à dessein. La société déclare qu’elle utilise la période de préversion pour apprendre où un changement de vitesse d’un ordre de grandeur crée la plus grande valeur, et élargira l’accès à mesure que la capacité augmente. OpenAI et Cerebras prennent des inscriptions pour des mises à jour à mesure que la préversion s’élargit.

Qu’est-ce qui se passe ensuite

L’observable à court terme est la capacité, et non la capacité. Ultrafast est une version préliminaire limitée, et les deux sociétés lient une disponibilité plus large à la croissance de la capacité plutôt qu’à une date fixe — donc le rythme de l’expansion est la chose à surveiller. La question plus longue est de savoir si l’avantage de mémoire sur puce de Cerebras se maintient à mesure que les modèles d’OpenAI grandissent, ce qui est exactement le pari que l’architecture au niveau de la wafer est construite.

Théo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l'infrastructure IA, le calcul et les systèmes matériels qui alimentent l'intelligence artificielle moderne. Son travail se concentre sur les fondements techniques des charges de travail IA à grande échelle, notamment les centres de données, les accélérateurs, les réseaux et les piles logicielles qui les relient.
Avec une perspective analytique et axée sur l'ingénierie, Théo examine comment les progrès des GPU, du silicium personnalisé, des architectures de mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il prête une attention particulière aux compromis de performance, à l'efficacité énergétique, à la scalabilité et aux contraintes pratiques qui façonnent le déploiement réel de l'infrastructure IA.
Les articles rédigés par Théo Nash sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude technique, la clarté et la couverture responsable du paysage de calcul IA en évolution rapide.