Modèles et plateformes d’IA

Cerebras Présente la Solution d’Inférence IA la Plus Rapide au Monde : 20 Fois Plus Rapide à un Coût Fractionné

mm
Ajouter Unite.AI à vos sources préférées sur Google

Cerebras Systems (CBRS ), un pionnier de l’informatique haute performance IA, a présenté une solution révolutionnaire qui va changer le paysage de l’inférence IA. Le 27 août 2024, l’entreprise a annoncé le lancement de Cerebras Inference, le service d’inférence IA le plus rapide au monde. Avec des métriques de performance qui éclipsent celles des systèmes basés sur GPU traditionnels, Cerebras Inference offre 20 fois la vitesse à un coût fractionné, établissant un nouveau standard dans l’informatique IA.

Une Vitesse et une Efficacité Coût sans Précédent

Cerebras Inference est conçu pour offrir des performances exceptionnelles sur divers modèles IA, en particulier dans le segment en pleine évolution des modèles de langage grandeur nature (LLM). Par exemple, il traite 1 800 jetons par seconde pour le modèle Llama 3.1 8B et 450 jetons par seconde pour le modèle Llama 3.1 70B. Cette performance est non seulement 20 fois plus rapide que celle des solutions basées sur GPU NVIDIA (NVDA ), mais elle est également proposée à un coût significativement plus bas. Cerebras propose ce service à partir de 10 centimes par million de jetons pour le modèle Llama 3.1 8B et 60 centimes par million de jetons pour le modèle Llama 3.1 70B, ce qui représente une amélioration de 100 fois en termes de prix-performance par rapport aux offres basées sur GPU existantes.

Maintenir la Précision tout en Poussant les Limites de la Vitesse

L’un des aspects les plus impressionnants de Cerebras Inference est sa capacité à maintenir une précision de pointe tout en offrant une vitesse inégalée. Contrairement à d’autres approches qui sacrifient la précision pour la vitesse, la solution de Cerebras reste dans le domaine 16 bits pour l’ensemble de l’exécution de l’inférence. Cela garantit que les gains de performance ne se font pas au détriment de la qualité des sorties des modèles IA, un facteur crucial pour les développeurs axés sur la précision.

Micah Hill-Smith, co-fondateur et PDG d’Artificial Analysis, a souligné l’importance de cette réalisation : « Cerebras offre des vitesses d’un ordre de grandeur supérieur à celles des solutions basées sur GPU pour les modèles IA Llama 3.1 8B et 70B de Meta. Nous mesurons des vitesses supérieures à 1 800 jetons de sortie par seconde sur Llama 3.1 8B et supérieures à 446 jetons de sortie par seconde sur Llama 3.1 70B – un nouveau record dans ces benchmarks. »

L’Importance Croissante de l’Inférence IA

L’inférence IA est le segment à la croissance la plus rapide de l’informatique IA, représentant environ 40 % du marché total du matériel IA. L’avènement de l’inférence IA à haute vitesse, telle que celle proposée par Cerebras, est comparable à l’introduction de l’internet à large bande – débloquant de nouvelles opportunités et marquant le début d’une nouvelle ère pour les applications IA. Avec Cerebras Inference, les développeurs peuvent désormais créer des applications IA de nouvelle génération qui nécessitent des performances complexes et en temps réel, telles que des agents IA et des systèmes intelligents.

Andrew Ng, fondateur de DeepLearning.AI, a souligné l’importance de la vitesse dans le développement IA : « DeepLearning.AI a plusieurs flux de travail agents qui nécessitent de solliciter un LLM à plusieurs reprises pour obtenir un résultat. Cerebras a construit une capacité d’inférence impressionnément rapide qui sera très utile pour ces flux de travail. »

Soutien Industriel Étendu et Partenariats Stratégiques

Cerebras a recueilli un soutien solide de la part des leaders de l’industrie et a formé des partenariats stratégiques pour accélérer le développement des applications IA. Kim Branson, SVP de l’IA/ML chez GlaxoSmithKline, un client précoce de Cerebras, a souligné le potentiel de transformation de cette technologie : « La vitesse et l’échelle changent tout. »

D’autres entreprises, telles que LiveKit, Perplexity et Meter, ont également exprimé leur enthousiasme pour l’impact que Cerebras Inference aura sur leurs opérations. Ces entreprises utilisent la puissance des capacités de calcul de Cerebras pour créer des expériences IA plus réactives et plus humaines, améliorer l’interaction utilisateur dans les moteurs de recherche et renforcer les systèmes de gestion de réseau.

Cerebras Inference : Niveaux et Accessibilité

Cerebras Inference est disponible sur trois niveaux compétitivement tarifés : Gratuit, Développeur et Entreprise. Le niveau gratuit propose un accès à l’API gratuit avec des limites d’utilisation généreuses, le rendant accessible à un large éventail d’utilisateurs. Le niveau Développeur offre une option de déploiement serveurless flexible, avec des modèles Llama 3.1 facturés à 10 centimes et 60 centimes par million de jetons. Le niveau Entreprise est conçu pour les organisations ayant des charges de travail soutenues, offrant des modèles personnalisés, des accords de niveau de service personnalisés et un support dédié, avec des tarifs disponibles sur demande.

Alimentation de Cerebras Inference : Le Moteur Wafer Scale Engine 3 (WSE-3)

Au cœur de Cerebras Inference se trouve le système Cerebras CS-3, alimenté par le processeur IA de pointe Wafer Scale Engine 3 (WSE-3). Ce processeur est inégalé en termes de taille et de vitesse, offrant 7 000 fois plus de bande passante de mémoire que le NVIDIA H100. La grande échelle du WSE-3 permet de gérer de nombreux utilisateurs concurrents, garantissant des vitesses fulgurantes sans compromettre les performances. Cette architecture permet à Cerebras de contourner les compromis qui caractérisent généralement les systèmes basés sur GPU, offrant des performances de classe mondiale pour les charges de travail IA.

Intégration Transparente et API Conviviale pour les Développeurs

Cerebras Inference est conçu avec les développeurs en tête. Il propose une API entièrement compatible avec l’API OpenAI Chat Completions, permettant une migration facile avec des modifications de code minimales. Cette approche conviviale pour les développeurs garantit que l’intégration de Cerebras Inference dans les flux de travail existants est aussi transparente que possible, permettant un déploiement rapide d’applications IA à haute performance.

Cerebras Systems : Impulsant l’Innovation à Travers les Industries

Cerebras Systems n’est pas seulement un leader de l’informatique IA, mais également un acteur clé dans diverses industries, notamment les soins de santé, l’énergie, le gouvernement, le calcul scientifique et les services financiers. Les solutions de l’entreprise ont été instrumentales dans la conduite de percées dans des institutions telles que les Laboratoires nationaux, Aleph Alpha, The Mayo Clinic et GlaxoSmithKline.

En offrant une vitesse, une scalabilité et une précision inégalées, Cerebras permet aux organisations dans ces secteurs de résoudre certains des problèmes les plus complexes de l’IA et au-delà. Que ce soit l’accélération de la découverte de médicaments dans les soins de santé ou l’amélioration des capacités de calcul dans la recherche scientifique, Cerebras est à la pointe de l’innovation.

Conclusion : Une Nouvelle Ère pour l’Inférence IA

Cerebras Systems établit un nouveau standard pour l’inférence IA avec le lancement de Cerebras Inference. En offrant 20 fois la vitesse des systèmes basés sur GPU traditionnels à un coût fractionné, Cerebras ne rend pas seulement l’IA plus accessible, mais ouvre également la voie à la prochaine génération d’applications IA. Avec sa technologie de pointe, ses partenariats stratégiques et son engagement en faveur de l’innovation, Cerebras est prêt à diriger l’industrie IA vers une nouvelle ère de performances et de scalabilité sans précédent.

Pour plus d’informations sur Cerebras Systems et pour essayer Cerebras Inference, visitez www.cerebras.ai.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.