Modèles et plateformes d’IA

Cerebras exécute le GPT-5.6 Sol d’OpenAI à 750 jetons par seconde dans la nouvelle catégorie Ultrafast

mm
Ajouter Unite.AI à vos sources préférées sur Google

Cerebras (CBRS ) exécute désormais le modèle phare d’OpenAI à une vitesse qu’aucun service cloud GPU n’a jamais égalée publiquement. Le 13 août 2026, le fabricant de puces à l’échelle de wafer a annoncé qu’il alimente GPT-5.6 Sol sur une nouvelle catégorie de service OpenAI appelée Ultrafast, offrant jusqu’à 750 jetons de sortie par seconde et, selon le compte d’OpenAI, exécutant le modèle jusqu’à 14 × plus rapidement que le traitement Standard. Ultrafast est d’abord lancé dans l’API OpenAI en tant qu’aperçu limité pour un groupe sélectionné de clients, l’accès s’étendant à mesure que la capacité augmente.

L’affirmation centrale est précise : une intelligence de pointe sans pénalité de vitesse. GPT-5.6 Sol est le modèle le plus performant d’OpenAI et, sur le silicium de Cerebras, il génère des jetons assez rapidement pour être intégré à des produits en temps réel plutôt que relégué à un traitement par lots nocturne. Les deux entreprises présentent cette catégorie comme éliminant le compromis entre un modèle suffisamment intelligent pour des tâches à enjeux élevés et un modèle assez rapide pour être utilisé pendant que le travail se déroule.

Les chiffres de vitesse derrière Ultrafast

Le chiffre de 750 jetons de sortie par seconde constitue le titre, mais les comparaisons les plus révélatrices sont les tests comparatifs publiés par Cerebras. Face aux vitesses de sortie rapportées par Artificial Analysis, l’entreprise affirme que GPT-5.6 Sol sur Ultrafast est 11 × plus rapide que Claude Fable 5 et 5 × plus rapide que Opus 4.8 en mode Fast.

Cerebras a également soumis la catégorie à un passage complet du Humanity’s Last Exam, un benchmark de 2 500 questions au niveau de difficulté de doctorat. GPT-5.6 Sol sur Ultrafast a répondu aux 2 500 questions en 11 heures et 11 minutes ; Claude Fable 5 a mis 78 heures et 27 minutes pour atteindre des conclusions comparables : près de 7 × plus lent, selon Cerebras. Sur le benchmark GDP‑Val, dédié aux travaux de connaissance à forte valeur économique, l’entreprise indique un gain de vitesse de bout en bout de 5,6 × par rapport au traitement Standard, sans aucune dégradation de qualité.

Il s’agit d’évaluations réalisées par le fournisseur, et Cerebras le précise clairement : la comparaison Humanity’s Last Exam a été benchmarkée par Cerebras les 10 juillet ainsi que du 13 au 15 juillet 2026, et le chiffre GDP‑Val provient de ses propres tests du 31 juillet 2026. Considérez‑les comme les mesures internes de l’entreprise, et non comme des résultats indépendants.

Pourquoi la puce à l’échelle d’une tranche réduit la latence

Le mécanisme est crucial ici, car il explique pourquoi un fabricant de puces relativement petit fournit le plus grand modèle d’OpenAI à des vitesses que les GPU incumbents n’ont pas pu atteindre. L’inférence rapide sur un grand modèle est fondamentalement un problème de déplacement de données : sur les GPU, les poids du modèle doivent être transportés à plusieurs reprises entre la mémoire intégrée et le stockage externe pour générer chaque jeton successif, et la bande passante mémoire devient le goulot d’étranglement.

La réponse de Cerebras consiste à éliminer ce déplacement. Son Wafer‑Scale Engine intègre 44 Go de SRAM sur une seule puce de la taille d’un wafer, de sorte que les poids du modèle restent sur la puce et que les jetons circulent à travers les couches en pipeline sur les wafers sans interruption. Parce que les poids ne quittent jamais le silicium, l’approche évolue avec la taille du modèle — c’est l’argument de l’entreprise selon lequel l’avantage de vitesse persistera à mesure que les modèles de pointe grandissent. Pour l’économie de l’inférence, c’est tout le jeu : le coût et la latence du service d’un modèle sont dominés par la rapidité avec laquelle on peut alimenter les poids au calcul, et garder 44 Go résidents sur une seule puce s’attaque directement à ce problème.

Un partenariat de 10 milliards de dollars atteint le modèle phare

Ultrafast est le produit le plus visible à ce jour d’une relation qui se construit depuis plusieurs mois. OpenAI a sollicité Cerebras pour 10 milliards de dollars de calcul à faible latence au début de 2026, et ce lancement place cette capacité derrière le modèle phare de l’entreprise plutôt que derrière un modèle plus petit ou spécialisé. OpenAI décrit Ultrafast comme « la prochaine étape » du partenariat visant à apporter une inférence ultra‑faible latence à sa plateforme.

Pour Cerebras, ce positionnement est significatif. La startup soutient depuis longtemps que son architecture à l’échelle de wafer est la forme adéquate pour l’inférence, même si le centre de gravité du marché penche vers les fournisseurs de GPU — un concours qui se joue dans le secteur des accélérateurs alors que les acteurs incumbents intègrent les modèles directement dans leur silicium (intégrer les modèles directement dans leurs puces). Obtenir la couche de service pour le modèle phare d’OpenAI donne à Cerebras une référence de production au sommet du marché. Le modèle lui‑même ancre la famille GPT‑5.6 lancée par OpenAI (Sol comme modèle phare, aux côtés du modèle équilibré Terra et du modèle économique Luna), de sorte qu’Ultrafast place Cerebras à l’avant‑garde de cette gamme.

Qui y a accès et pour quels usages

OpenAI positionne cette catégorie pour des travaux sensibles au temps et à forts enjeux : réponses aux incidents pendant qu’une panne se poursuit, recherche financière alors que les conditions du marché évoluent, support client et voix en temps réel, commerce, et boucles de recherche en direct qui s’exécutaient auparavant pendant la nuit. L’accès anticipé a été accordé à des entreprises dans les domaines du codage, du commerce et de la finance, notamment Jane Street, Podium, Basis et Rogo.

“L’augmentation de vitesse apportée par Cerebras est impressionnante”, a déclaré John Crepezzi, AI Assistants chez Jane Street, dans l’annonce d’OpenAI. “Elle permet d’explorer de nouvelles manières d’utiliser les modèles, et rend leur utilisation pratique pour les développeurs, qui peuvent travailler de façon plus ciblée et productive à leurs côtés.”

OpenAI maintient délibérément le déploiement restreint. L’entreprise indique qu’elle utilise la période d’aperçu pour identifier où un gain de vitesse d’un ordre de grandeur crée le plus de valeur, et élargira l’accès à mesure que la capacité augmentera. OpenAI et Cerebras acceptent les inscriptions pour recevoir des mises à jour à mesure que l’aperçu s’élargit.

Les prochaines étapes

L’observable à court terme est la capacité, pas la fonctionnalité. Ultrafast est un aperçu limité, et les deux entreprises lient toute disponibilité plus large à la croissance de la capacité plutôt qu’à une date fixe — ainsi, le rythme d’expansion est le facteur à surveiller. La question plus profonde reste de savoir si l’avantage de mémoire intégrée de Cerebras tiendra la route à mesure que les modèles d’OpenAI s’étendent, ce qui constitue exactement le pari sur lequel repose l’architecture à l’échelle de wafer.

Theo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l’infrastructure IA, le calcul, et les systèmes matériels qui alimentent l’intelligence artificielle moderne. Son travail se concentre sur les fondations techniques des charges de travail IA à grande échelle, y compris les centres de données, les accélérateurs, le réseau et les piles logicielles qui les relient.

Avec une perspective analytique et axée sur l’ingénierie, Theo examine comment les avancées des GPU, du silicium personnalisé, des architectures mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il porte une attention particulière aux compromis de performance, à l’efficacité énergétique, à l’évolutivité et aux contraintes pratiques qui façonnent le déploiement réel de l’infrastructure IA.

Les articles rédigés par Theo Nash sont générés par IA et revus par l’équipe éditoriale de Unite.AI afin d’assurer une précision technique, une clarté et une couverture responsable du paysage du calcul IA en évolution rapide.