Modèles et plateformes d’IA
Cerebras dévoile Qwen3-235B : une nouvelle ère pour la vitesse, l’échelle et le coût de l’IA

Cerebras Systems (CBRS ) a officiellement lancé Qwen3-235B, un modèle d’IA de pointe avec une prise en charge de contexte de 131 000 jetons, établissant un nouveau standard de performance pour la raisonnement, la génération de code et les applications d’IA à grande échelle. Maintenant disponible via le Cerebras Inference Cloud, le modèle offre des capacités qui rivalisent avec les systèmes les plus avancés de frontière – tout en fonctionnant 30 fois plus vite et à un dixième du coût des modèles fermés les plus avancés d’aujourd’hui.
La raisonnement en temps réel de l’IA atteint une vitesse de rupture
La raisonnement de l’IA a historiquement été lente, avec de grands modèles prenant souvent une minute ou plus pour répondre à des requêtes complexes. Cerebras élimine ce goulet d’étranglement. Propulsé par son moteur Wafer-Scale Engine 3 (WSE-3) propriétaire, Qwen3-235B atteint 1 500 jetons par seconde, un record du monde pour l’inférence d’IA de frontière.
Ce niveau de performance transforme l’expérience utilisateur – en réduisant la latence de 60 à 120 secondes à seulement 0,6 seconde, même lors du traitement de tâches de raisonnement avancées ou de flux de travail à plusieurs étapes comme la génération augmentée de récupération (RAG). Selon les résultats des benchmarks d’Analyse artificielle, aucun autre fournisseur – ouvert ou fermé – ne correspond actuellement à cette vitesse d’inférence pour un modèle de frontière.
Un nouveau standard de contexte : 131 K de jetons pour les applications du monde réel
Conjointement avec ce lancement, Cerebras a étendu la fenêtre de contexte de son modèle de 32 K à 131 K de jetons pris en charge par Qwen3-235B. Ce bond en taille de contexte permet au modèle d’ingérer et de raisonner sur des volumes massifs de données – englobant des bases de code complètes, des référentiels de documents multiples et du matériel technique à longue forme.
Alors que 32 K de contexte permettent des tâches de génération de base, 131 K ouvrent la porte à un développement de production de grade. L’IA peut maintenant fonctionner comme un collaborateur de code profond, synthétisant des dizaines de fichiers et gérant des dépendances complexes en temps réel – ce qui en fait un outil idéal pour les cas d’utilisation d’entreprise dans l’ingénierie logicielle, l’analyse de documents et le calcul scientifique.
Pourquoi Cerebras est différent : un matériel conçu pour l’IA dès le départ
Fondé par une équipe de pionniers de l’architecture informatique, de chercheurs en IA et d’ingénieurs de systèmes, Cerebras Systems a adopté une approche radicalement différente pour résoudre les défis de mise à l’échelle de l’IA générative. Au lieu de s’appuyer sur des grappes de GPU, Cerebras a construit un supercalculateur d’IA spécifique autour de son propre processeur : le Wafer-Scale Engine 3.
Ce processeur est unique dans l’industrie. Il s’étend sur la taille d’un plat de dîner et abrite des centaines de milliers de cœurs d’IA optimisés avec une mémoire sur puce mesurée en dizaines de gigaoctets. Cette conception permet au calcul et à la mémoire de se situer côte à côte – en éliminant la latence, les contraintes de bande passante et la complexité d’orchestration des solutions multi-GPU traditionnelles.
En regroupant ses systèmes CS-3, Cerebras peut créer des supercalculateurs d’IA capables de faire tourner des modèles à trillion de paramètres avec facilité, tout en évitant la charge technique de l’informatique distribuée. Cette approche unifiée est le fondement de ses vitesses d’inférence records et de ses nouvelles capacités de contexte élevé.
L’efficacité MoE permet une réduction drastique des coûts
Qwen3-235B est construit à l’aide d’une architecture de mélange d’experts (MoE) – un design de modèle qui active uniquement un sous-ensemble d’experts internes en fonction de l’entrée, aboutissant à une efficacité de calcul considérablement améliorée.
En raison de cela, Cerebras peut proposer le modèle à un point de prix qui sous-estime considérablement les alternatives à code fermé. Plus précisément, l’inférence est disponible à 0,60 $ par million de jetons d’entrée et à 1,20 $ par million de jetons de sortie, représentant plus de 90 % de réduction du coût par rapport aux modèles propriétaires d’OpenAI, d’Anthropic ou de Google.
Intégration transparente avec Cline dans VS Code
Pour mettre en valeur la vitesse et l’application réelle de Qwen3-235B, Cerebras a collaboré avec Cline, l’agent de codage agentic de pointe à l’intérieur de Microsoft Visual Studio Code, actuellement installé par plus de 1,8 million de développeurs.
Les utilisateurs de Cline peuvent déjà accéder à Qwen3-32B avec 64 K de contexte dans le cadre du niveau gratuit. Avec l’annonce d’aujourd’hui, le support s’étendra pour inclure Qwen3-235B et son contexte complet de 131 K, permettant un niveau de raisonnement et de génération de code en éditeur en temps réel précédemment inatteignable.
Saoud Rizwan, PDG de Cline, a expliqué : « Avec l’inférence de Cerebras, les développeurs utilisant Cline ont un aperçu de l’avenir, car Cline raisonne à travers les problèmes, lit les bases de code et écrit du code en quasi-temps réel. Tout se passe si vite que les développeurs restent dans le flux, itérant à la vitesse de la pensée. Ce type d’inférence rapide n’est pas seulement agréable à avoir – cela nous montre ce qui est possible lorsque l’IA suit réellement le rythme des développeurs. »
Une alternative ouverte aux modèles fermés
Les performances de Qwen3-235B sont à la hauteur de certaines des modèles d’IA les plus sophistiqués sur le marché aujourd’hui, y compris Claude 4 Sonnet, Gemini 2.5 Flash et DeepSeek R1, comme validé par des benchmarks indépendants. Pourtant, Cerebras le livre dans un format d’accès ouvert, offrant de la transparence et de la portabilité que les modèles fermés ne possèdent pas.
Cette approche de modèle ouvert permet aux entreprises de :
- Personnaliser et affiner sur des données propriétaires
- Déployer l’IA sur une infrastructure privée ou dans des environnements de cloud hybrides
- Éviter le verrouillage du fournisseur et les risques de confidentialité des données
Combiné avec la plate-forme cloud évolutives de Cerebras et le déploiement facultatif sur site des systèmes CS-3, les organisations ont un contrôle total sur la manière dont l’IA est appliquée aux tâches critiques de mission.
Ce que cela signifie pour l’industrie
Le lancement de Qwen3-235B marque un tournant. Cerebras a redéfini les limites de ce qui est possible avec les grands modèles de langage en combinant l’intelligence de frontière avec une vitesse et une efficacité de coût sans précédent.
Il est maintenant possible de construire des outils d’IA qui :
- Répondent en temps réel aux requêtes des développeurs
- Raisonnent sur la documentation complète ou les bases de connaissances
- Génèrent et déboguent du code de production en temps réel à l’intérieur de l’IDE
- Évoluent vers des cas d’utilisation d’entreprise sans dispersion de GPU ou factures d’inférence mensuelles à six chiffres
Alors que la demande d’infrastructures d’IA augmente, Cerebras démontre qu’il n’est pas nécessaire de compromettre entre les performances, le prix et l’ouverture. Sa conception matériel-logiciel, du Wafer-Scale Engine au Cerebras Inference Cloud, pointe vers un nouveau modèle de déploiement d’IA – plus rapide, plus simple et beaucoup plus accessible.
Pensée finale
En lançant Qwen3-235B avec 131 K de contexte, une inférence ultra-rapide et un prix de jeton abordable, Cerebras Systems s’est positionné comme l’un des seuls véritables challengers des acteurs établis basés sur les GPU. Pour les entreprises, les chercheurs et les développeurs, ce lancement est plus qu’un modèle plus rapide – c’est un point d’inflexion qui amène l’IA en temps réel, de production et ouverte à portée de main.












