Modèles et plateformes d’IA

Cerebras rapporte un gain de débit d’inférence de 5X grâce à la désagrégation

mm
Ajouter Unite.AI à vos sources préférées sur Google

Cerebras Systems a déclaré le 1 octobre 2026 qu’elle avait augmenté le débit d’inférence de 5 fois dans des résultats préliminaires en utilisant une technique appelée désagrégation, avec le même nombre de systèmes Cerebras et aucune perte de vitesse de génération de jetons. Cette information a été publiée dans Inférence désagrégée depuis le départ, un article de blog d’entreprise rédigé par Isaac Tai et Zhenwei Gao qui ouvre une série prévue sur le sujet.

L’article présente la série aux lecteurs qui ont entendu le terme désagrégation, ou l’affirmation selon laquelle le préremplissage est limité par le calcul et le décodage par la mémoire, et se demandent ce que cela signifie réellement. Il construit l’explication depuis le départ, en commençant par la façon dont les accélérateurs équilibrent les opérations arithmétiques et les déplacements de données.

Le préremplissage et le décodage imposent des exigences différentes au matériel

L’article définit l’intensité arithmétique comme le nombre d’opérations en virgule flottante divisé par le nombre d’octets transférés entre la mémoire et les unités de calcul d’un accélérateur. Dans l’un de ses exemples, l’addition de deux matrices effectue 1 FLOP pour chaque 6 octets déplacés, soit une intensité arithmétique de 0,167 FLOP par octet, et ce rapport reste constant à mesure que les matrices grossissent. La multiplication de matrices se comporte différemment : chaque valeur de sortie est construite à partir d’une ligne entière d’une entrée et d’une colonne entière de l’autre, de sorte que les valeurs chargées contribuent à davantage de sorties et que l’intensité arithmétique augmente avec la taille de l’entrée.

L’article explique que l’inférence est une chaîne de telles multiplications de matrices entre les poids fixes d’un modèle et ses jetons d’entrée, et qu’elle s’exécute en deux phases avec des profils d’intensité différents. Lors du préremplissage, l’ensemble de l’invite est traité en parallèle comme une grande opération matricielle, et les invites réelles peuvent contenir des milliers, voire des centaines de milliers de jetons. Lors du décodage, les jetons sont générés un à un, et le modèle s’appuie sur le cache KV, qui stocke les clés et valeurs calculées pour les jetons précédents afin qu’elles soient réutilisées plutôt que recomputées.

Les deux phases doivent néanmoins déplacer l’ensemble des poids du modèle, potentiellement des centaines de gigaoctets ou téraoctets, vers les unités de calcul pour chaque jeton généré. L’article montre que le déplacement de mémoire reste presque constant tandis que l’intensité arithmétique chute après le préremplissage, et il cite cet écart comme la raison pour laquelle l’ajout de capacité de calcul brute n’accélère pas nécessairement l’arrivée des jetons pendant le décodage.

La désagrégation sépare l’inférence en pools distincts

En production, un serveur d’inférence gère généralement de nombreuses requêtes simultanément, et lorsque le préremplissage et le décodage s’exécutent sur le même matériel, le préremplissage gourmand en calcul peut bloquer les requêtes de décodage actives. Les planificateurs doivent alors choisir entre faire parvenir rapidement le premier jeton aux nouvelles requêtes, maintenir un flux continu des réponses actives, et maximiser le débit total. Le regroupement permet aux requêtes concurrentes de partager le travail de lecture des poids du modèle, mais des lots plus importants peuvent rallonger chaque étape de décodage, de sorte que le débit total peut augmenter tandis que chaque utilisateur reçoit les jetons plus lentement.

L’article décrit la désagrégation comme un modèle de conception système qui exécute les deux phases dans des pools matériels séparés. Une fois les étapes séparées, les opérateurs peuvent allouer du matériel, définir des politiques de regroupement, et prioriser la latence ou le débit pour chaque phase de façon indépendante : un système avec des objectifs stricts de temps jusqu’au premier jeton peut réserver davantage de capacité au préremplissage, tandis qu’un système axé sur un flux continu peut attribuer au décodage un pool plus grand ou plus rigoureusement planifié. Les pools peuvent également être mis à l’échelle individuellement.

La séparation introduit une nouvelle exigence. Après le préremplissage, le cache KV, propre à chaque requête, doit être transféré vers le pool de décodage, où il est chargé en mémoire avant que la génération ne puisse reprendre, tandis que les poids du modèle sont déjà chargés dans les deux pools. L’article indique que ce transfert ajoute une surcharge réseau et de coordination, que chaque pool peut rester inactif si les capacités ne correspondent pas à la demande, et que la latence supplémentaire dépend du fait que le cache se déplace entre des machines co‑localisées ou entre des régions. Il soutient que la désagrégation est la plus convaincante à grande échelle, où les gains obtenus en dimensionnant et en planifiant indépendamment les pools peuvent compenser les coûts de transfert et d’exploitation, et qu’elle modifie l’interface de contrôle du système de service plutôt que de simplement lisser le flux.

Matériel hétérogène, premiers résultats et partenariats

Cerebras a indiqué qu’elle menait le développement de la désagrégation hétérogène, combinant plusieurs types de puces dans un même système d’inférence et attribuant du matériel différent aux segments limités par la mémoire ou par le calcul. L’article oppose la conception à l’échelle de plaquette de l’entreprise, qui répartit la SRAM avec le calcul sur l’ensemble de la plaquette, aux GPU, qui préparent les données du modèle depuis la mémoire à bande passante élevée vers des mémoires et caches plus petits intégrés.

Un graphique de bande passante mémoire maximale publié dans l’article, daté du 10 septembre 2026, indique la SRAM intégrée du Cerebras WSE‑3 à 21 000 TB/s par plaquette, aux côtés d’un accélérateur SRAM intégré non nommé à 150 TB/s et de GPU HBM4 à 23,3 et 22 TB/s. Le graphique précise que les valeurs de SRAM additionnent la bande passante mémoire locale d’un processeur, tandis que les valeurs HBM mesurent le trafic depuis la mémoire hors puce, de sorte que les chiffres décrivent des niveaux de mémoire différents plutôt que des vitesses de jetons mesurées.

Le post reproduit également les données d’Artificial Analysis du 10 septembre 2026 pour GPT-oss-120B exécutant un raisonnement élevé avec 10 000 jetons d’entrée. Il indique Cerebras à 1 669 jetons de sortie par seconde, SambaNova à 708, Groq à 475, Microsoft Azure à 319, Nebius à 294 et Baseten à 293.

Cerebras a déclaré que, dans un système agrégé traditionnel, augmenter la capacité signifiait déployer davantage de matériel, et qu’en tirant parti des accélérateurs partenaires pour gérer le traitement des invites, elle a augmenté la capacité de 5 fois lors de premiers tests avec la même empreinte WSE. L’entreprise a indiqué avoir annoncé des partenariats avec plusieurs partenaires matériels pour mettre sur le marché davantage de jetons ultra‑rapides, et un diagramme dans le post montre les systèmes AWS Trainium et AMD Helios Instinct GPU parmi les options matérielles de préremplissage alimentant un pool de décodage Cerebras.

Le post identifie les applications agentiques comme un cas d’utilisation convaincant pour la désagrégation hétérogène, car elles impliquent souvent des flux de travail longs et à multiples tours dans lesquels le contexte augmente à chaque appel de modèle et les retards à chaque étape s’accumulent. Cerebras a déclaré que les prochains épisodes couvriront les piles matérielles et logicielles impliquées ainsi que les compromis économiques du déploiement de inférence désagrégée à grande échelle.

Theo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l’infrastructure IA, le calcul, et les systèmes matériels qui alimentent l’intelligence artificielle moderne. Son travail se concentre sur les fondations techniques des charges de travail IA à grande échelle, y compris les centres de données, les accélérateurs, le réseau et les piles logicielles qui les relient.

Avec une perspective analytique et axée sur l’ingénierie, Theo examine comment les avancées des GPU, du silicium personnalisé, des architectures mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il porte une attention particulière aux compromis de performance, à l’efficacité énergétique, à l’évolutivité et aux contraintes pratiques qui façonnent le déploiement réel de l’infrastructure IA.

Les articles rédigés par Theo Nash sont générés par IA et revus par l’équipe éditoriale de Unite.AI afin d’assurer une précision technique, une clarté et une couverture responsable du paysage du calcul IA en évolution rapide.