Modèles et plateformes d’IA
Exploiter le silicium : Comment les puces conçues en interne façonnent l’avenir de l’IA
L’intelligence artificielle, comme tout logiciel, repose sur deux composants fondamentaux : les programmes d’IA, souvent appelés modèles, et les matériels de calcul, ou puces, qui alimentent ces programmes. Jusqu’à présent, l’attention portée au développement de l’IA a été axée sur l’amélioration des modèles, tandis que les matériels étaient généralement considérés comme des composants standard fournis par des fournisseurs tiers. Cependant, cette approche a commencé à changer récemment. Les grandes entreprises d’IA, telles que Google (GOOGL ), Meta et Amazon (AMZN ), ont commencé à développer leurs propres puces d’IA. Le développement en interne de puces d’IA personnalisées annonce une nouvelle ère dans le progrès de l’IA. Cet article explorera les raisons derrière ce changement d’approche et mettra en évidence les derniers développements dans ce domaine en évolution.
Pourquoi le développement de puces d’IA en interne ?
Le passage au développement en interne de puces d’IA personnalisées est motivé par plusieurs facteurs critiques, qui incluent :
La demande croissante de puces d’IA
La création et l’utilisation de modèles d’IA nécessitent des ressources de calcul importantes pour gérer efficacement de grands volumes de données et générer des prédictions ou des connaissances précises. Les puces d’ordinateurs traditionnelles sont incapables de gérer les exigences de calcul lors de la formation sur des milliards de points de données. Cette limitation a conduit à la création de puces d’IA de pointe spécifiquement conçues pour répondre aux exigences élevées de performance et d’efficacité des applications d’IA modernes. À mesure que la recherche et le développement de l’IA continuent de croître, la demande pour ces puces spécialisées augmente également.
Nvidia (NVDA ), leader dans la production de puces d’IA avancées et bien en avance sur ses concurrents, est confronté à des défis car la demande dépasse considérablement sa capacité de production. Cette situation a conduit à l’allongement de la liste d’attente pour les puces d’IA de Nvidia à plusieurs mois, un retard qui continue de croître à mesure que la demande pour leurs puces d’IA augmente. De plus, le marché des puces, qui comprend des acteurs majeurs comme Nvidia et Intel (INTC ), rencontre des défis dans la production de puces. Ce problème découle de leur dépendance à l’égard du fabricant taïwanais TSMC pour l’assemblage des puces. Cette dépendance à l’égard d’un seul fabricant entraîne des délais de production prolongés pour ces puces avancées.
Rendre le calcul d’IA économe en énergie et durable
La génération actuelle de puces d’IA, conçue pour des tâches de calcul lourdes, tend à consommer beaucoup de puissance et à générer une quantité importante de chaleur. Cela a des implications environnementales considérables pour la formation et l’utilisation de modèles d’IA. Les chercheurs d’OpenAI notent que, depuis 2012, la puissance de calcul nécessaire pour former des modèles d’IA avancés a doublé tous les 3,4 mois, ce qui suggère que, d’ici 2040, les émissions du secteur des technologies de l’information et de la communication (TIC) pourraient représenter 14 % des émissions mondiales. Une autre étude a montré que la formation d’un seul modèle de langage à grande échelle peut émettre jusqu’à 284 000 kg de CO2, ce qui est approximativement équivalent à la consommation d’énergie de cinq voitures pendant leur durée de vie. De plus, il est estimé que la consommation d’énergie des centres de données augmentera de 28 % d’ici 2030. Ces constats soulignent la nécessité de trouver un équilibre entre le développement de l’IA et la responsabilité environnementale. En réponse, de nombreuses entreprises d’IA investissent désormais dans le développement de puces plus économes en énergie, visant à rendre la formation et l’utilisation de l’IA plus durables et respectueuses de l’environnement.
Personnaliser les puces pour des tâches spécialisées
Les différents processus d’IA ont des exigences de calcul variables. Par exemple, la formation de modèles d’apprentissage profond nécessite une puissance de calcul importante et un débit élevé pour gérer de grands ensembles de données et exécuter des calculs complexes rapidement. Les puces conçues pour la formation sont optimisées pour améliorer ces opérations, améliorant ainsi la vitesse et l’efficacité. D’un autre côté, le processus d’inférence, où un modèle applique ses connaissances acquises pour faire des prédictions, nécessite un traitement rapide avec une utilisation minimale d’énergie, en particulier dans les appareils périphériques tels que les smartphones et les appareils IoT. Les puces conçues pour l’inférence sont conçues pour optimiser les performances par watt, garantissant ainsi une réactivité rapide et une conservation de la batterie. Cette personnalisation des conceptions de puces pour les tâches de formation et d’inférence permet à chaque puce d’être ajustée avec précision pour son rôle prévu, améliorant ainsi les performances sur différents appareils et applications. Ce type de spécialisation ne soutient pas seulement des fonctionnalités d’IA plus robustes, mais favorise également une plus grande efficacité énergétique et rentabilité globale.
Réduire les fardeaux financiers
Le fardeau financier du calcul pour la formation et l’utilisation de modèles d’IA reste considérable. OpenAI, par exemple, utilise un supercalculateur créé par Microsoft (MSFT ) pour la formation et l’inférence depuis 2020. Il en a coûté à OpenAI environ 12 millions de dollars pour former son modèle GPT-3, et le coût a augmenté à 100 millions de dollars pour former le modèle GPT-4. Selon un rapport de SemiAnalysis, OpenAI a besoin d’environ 3 617 serveurs HGX A100, totalisant 28 936 GPU, pour prendre en charge ChatGPT, ce qui porte le coût moyen par requête à environ 0,36 dollar. Avec ces coûts élevés en tête, Sam Altman, PDG d’OpenAI, cherche à obtenir des investissements importants pour construire un réseau mondial d’usines de production de puces d’IA, selon un rapport de Bloomberg.
Maîtriser le contrôle et l’innovation
Les puces d’IA tierces sont souvent limitées. Les entreprises qui s’appuient sur ces puces peuvent se retrouver contraintes par des solutions standard qui ne correspondent pas entièrement à leurs modèles ou applications d’IA uniques. Le développement de puces en interne permet une personnalisation adaptée à des cas d’utilisation spécifiques. Que ce soit pour les voitures autonomes ou les appareils mobiles, le contrôle du matériel permet aux entreprises de tirer pleinement parti de leurs algorithmes d’IA. Les puces personnalisées peuvent améliorer des tâches spécifiques, réduire la latence et améliorer les performances globales.
Les dernières avancées dans le développement de puces d’IA
Cette section se penche sur les derniers progrès réalisés par Google, Meta et Amazon dans le développement de la technologie de puce d’IA.
Les processeurs Axion de Google
Google a progressé de manière constante dans le domaine de la technologie de puce d’IA depuis l’introduction de l’unité de traitement de tenseurs (TPU) en 2015. En s’appuyant sur cette base, Google a récemment lancé les processeurs Axion, ses premiers processeurs personnalisés spécifiquement conçus pour les centres de données et les charges de travail d’IA. Ces processeurs sont basés sur l’architecture Arm, connue pour son efficacité et sa conception compacte. Les processeurs Axion visent à améliorer l’efficacité de la formation et de l’inférence basées sur les CPU tout en maintenant l’efficacité énergétique. Cette avancée marque également une amélioration significative des performances pour diverses charges de travail générales, y compris les serveurs web et les applications, les microservices conteneurisés, les bases de données open source, les caches en mémoire, les moteurs d’analyse de données, le traitement des médias et bien plus encore.
Le MTIA de Meta
Meta fait des progrès dans la technologie de puce d’IA avec son accélérateur de formation et d’inférence Meta (MTIA). Cet outil est conçu pour améliorer l’efficacité de la formation et des processus d’inférence, en particulier pour les algorithmes de classement et de recommandation. Récemment, Meta a expliqué comment le MTIA fait partie intégrante de sa stratégie pour renforcer son infrastructure d’IA au-delà des GPU. Initialement prévu pour être lancé en 2025, Meta a déjà mis les deux versions du MTIA en production, montrant un rythme plus rapide dans ses plans de développement de puces. Alors que le MTIA se concentre actuellement sur la formation de certains types d’algorithmes, Meta vise à élargir son utilisation pour inclure la formation pour l’IA générative, comme ses modèles de langage Llama.
Les puces Trainium et Inferentia d’Amazon
Depuis l’introduction de sa puce personnalisée Nitro en 2013, Amazon a considérablement élargi son développement de puces d’IA. La société a récemment dévoilé deux puces d’IA innovantes, Trainium et Inferentia. Trainium est spécifiquement conçu pour améliorer la formation de modèles d’IA et doit être intégré aux clusters UltraClusters EC2. Ces clusters, capables d’héberger jusqu’à 100 000 puces, sont optimisés pour la formation de modèles fondamentaux et de grands modèles de langage de manière économe en énergie. Inferentia, en revanche, est conçu pour les tâches d’inférence où les modèles d’IA sont activement appliqués, en se concentrant sur la réduction de la latence et des coûts pendant l’inférence pour mieux répondre aux besoins de millions d’utilisateurs qui interagissent avec des services alimentés par l’IA.
En résumé
Le mouvement vers le développement en interne de puces d’IA personnalisées par des entreprises comme Google, Microsoft et Amazon reflète un changement stratégique pour répondre aux besoins de calcul croissants des technologies d’IA. Cette tendance met en évidence la nécessité de solutions spécifiquement conçues pour soutenir efficacement les modèles d’IA, en répondant aux exigences uniques de ces systèmes avancés. À mesure que la demande de puces d’IA continue de croître, les leaders du secteur comme Nvidia sont susceptibles de voir une augmentation significative de leur valorisation sur le marché, soulignant le rôle vital que jouent les puces personnalisées dans l’innovation de l’IA. En créant leurs propres puces, ces géants de la technologie améliorent non seulement les performances et l’efficacité de leurs systèmes d’IA, mais favorisent également un avenir plus durable et rentable. Cette évolution définit de nouvelles normes dans l’industrie, impulsant le progrès technologique et l’avantage concurrentiel dans un marché mondial en constante évolution.












