Fondamentaux de l’IA

Unités de traitement neuronales (NPU) : le moteur de l’intelligence artificielle et de l’informatique de nouvelle génération

mm
Ajouter Unite.AI à vos sources préférées sur Google

Juste comme les GPU ont éclipsé les CPU pour les charges de travail d’IA, les Unités de traitement neuronales (NPU) sont sur le point de défier les GPU en offrant des performances encore plus rapides et plus efficaces, en particulier pour l’intelligence artificielle générative, où un traitement massif en temps réel doit se produire à une vitesse fulgurante et à un coût réduit.

La question est de savoir comment les NPU fonctionnent et pourquoi ils dépassent leurs prédécesseurs GPU pour les tâches d’IA modernes, et ce qui les rend indispensables pour tout, des infrastructures de données robustes aux appareils grand public. Que vous planifiiez votre prochaine grande déploiement d’IA ou que vous soyez simplement curieux de la pointe de la technologie, il est important de comprendre pourquoi les NPU pourraient être la percée qui redéfinit l’IA – et la prochaine génération d’informatique.

Qu’est-ce qu’une unité de traitement neuronale (NPU) ?

Une unité de traitement neuronale (NPU) est un microprocesseur spécialisé conçu de base pour gérer les exigences uniques des charges de travail d’IA et d’apprentissage automatique modernes. Alors que les unités centrales de traitement (CPU) et les unités de traitement graphique (GPU) ont historiquement alimenté les tâches de calcul traditionnelles et le rendu graphique, ils n’ont pas été conçus à l’origine pour traiter l’intensité computationnelle des réseaux de neurones profonds. Les NPU comblent cette lacune en se concentrant spécifiquement sur des opérations parallèles à haute débit telles que les multiplications de matrices et les mathématiques de tenseurs – les fondements des modèles d’IA.

Les aspects clés qui différencient les NPU des CPU et des GPU généraux incluent :

  • Arithmétique d’IA optimisée : les NPU utilisent couramment des types de données à faible précision (par exemple, des mathématiques entières 8 bits, ou même plus basses) pour équilibrer la puissance de traitement et l’efficacité énergétique, tandis que les CPU et les GPU s’appuient généralement sur des calculs à virgule flottante à plus haute précision.
  • Architecture parallélisée : les NPU peuvent diviser les tâches d’IA en milliers (ou même millions) de plus petites calculs qui s’exécutent simultanément, augmentant considérablement le débit.
  • Efficacité énergétique : en éliminant les instructions inutiles et en optimisant spécifiquement pour les tâches de réseaux de neurones, les NPU peuvent atteindre de meilleures performances à une puissance inférieure par rapport aux GPU ou aux CPU qui effectuent les mêmes charges de travail d’IA.

Également connus sous le nom d’accélérateurs d’IA, les NPU apparaissent souvent sous forme de matériel distinct attaché aux cartes mères de serveur, ou sous forme de système sur une puce (SoC) dans les smartphones, les ordinateurs portables ou les appareils de bord.

Pourquoi les NPU sont importants pour l’IA générative

L’explosion de l’IA générative – qui comprend les grands modèles de langage (LLM) comme ChatGPT, les outils de génération d’images comme DALL·E et les modèles de synthèse de vidéos – exige des plateformes de calcul capables de gérer de grandes quantités de données, de les traiter en temps réel et d’apprendre efficacement. Les processeurs traditionnels peuvent avoir du mal à répondre à ces exigences, ce qui entraîne une consommation d’énergie élevée, des latences accrues et des goulets d’étranglement de débit.

Avantages clés des NPU pour l’IA générative

  1. Traitement en temps réel : les modèles d’IA générative tels que les transformateurs, les modèles de diffusion et les réseaux antagonistes génératifs (GAN) impliquent d’extensives opérations matricielles et tensorielles. Les NPU excellent dans la multiplication de matrices et l’ajout de vecteurs en parallèle, aidant les modèles génératifs à atteindre des performances à faible latence.
  2. Évolutivité : les NPU sont conçus pour une mise à l’échelle parallèle, ce qui les rend adaptés aux architectures à grande échelle utilisées dans l’IA générative. L’ajout de plus de cœurs NPU ou de NPU à un cluster de centre de données peut augmenter linéairement les performances d’IA sans augmenter considérablement les coûts énergétiques.
  3. Efficacité énergétique : à mesure que la complexité des modèles génératifs augmente, leur consommation d’énergie augmente également. Les NPU aident à maintenir l’empreinte énergétique sous contrôle en se concentrant sur le type de mathématiques dont l’IA générative a besoin, en éliminant les surcoûts de calcul.

Caractéristiques clés des NPU

  1. Traitement parallèle : en divisant les tâches de calcul en de nombreuses plus petites, les NPU peuvent gérer de vastes opérations matricielles beaucoup plus rapidement que les CPU, qui exécutent généralement les instructions de manière plus linéaire ou sérielle. Ce parallélisme est critique pour les tâches d’apprentissage profond, où la formation et l’inférence impliquent de grands lots de données.
  2. Arithmétique à faible précision : la plupart des calculs de réseaux de neurones n’exigent pas la précision des opérations à virgule flottante 32 bits ou 64 bits. Les types de données à faible précision, tels que les entiers 8 bits, réduisent considérablement le nombre de bits traités par opération, permettant une exécution plus rapide et plus économe en énergie tout en conservant la précision du modèle.
  3. Mémoire à bande passante élevée sur puce : la capacité de conserver de grandes quantités de données de formation ou d’inférence près du processeur est cruciale pour les tâches d’IA. De nombreux NPU disposent d’une mémoire à bande passante élevée (HBM) ou de systèmes de mémoire avancés conçus spécifiquement pour les réseaux de neurones, réduisant le besoin de communiquer constamment avec la mémoire externe.
  4. Techniques d’accélération matérielles : les architectures NPU modernes intègrent souvent des unités matérielles spécialisées comme des tableaux systoliques ou des cœurs de tenseurs, leur permettant d’effectuer des multiplications de matrices et d’autres opérations centrées sur l’IA à des vitesses incroyables avec un minimum de surcoût.

Comment les NPU fonctionnent : simulation du cerveau

Les NPU s’inspirent des réseaux de neurones du cerveau humain. Tout comme des milliards de neurones et de synapses traitent l’information en parallèle, un NPU est composé de nombreux éléments de traitement capables de gérer de grandes quantités de données simultanément. Cette conception est particulièrement efficace pour des tâches telles que :

  • Reconnaissance et traitement d’images
  • Traitement du langage naturel (TLN) et reconnaissance vocale
  • Détection d’objets et navigation autonome
  • IA générative (par exemple, génération d’images et de texte)

Poids synaptiques et apprentissage

Un élément fondamental du calcul de réseau de neurones est le concept de poids, qui représentent la « force » ou l’« importance » de chaque connexion neuronale dans le réseau. Les NPU intègrent ces poids directement dans le matériel, permettant des mises à jour plus rapides et plus économes en énergie à mesure que le modèle apprend.

Cœurs à haute capacité simplifiés

Alors que les CPU ont traditionnellement géré de multiples opérations diverses (allant de la navigation Web aux calculs de tableur), les NPU rationalisent la conception pour se concentrer sur quelques opérations de base – comme la multiplication de matrices, les fonctions d’activation et la convolution – exécutées à plusieurs reprises en parallèle.

NPU vs GPU vs CPU

Chaque type de processeur joue un rôle unique dans l’informatique moderne, bien qu’il y ait un certain chevauchement lorsqu’il s’agit de gérer les tâches d’IA. Voici un aperçu rapide :

Caractéristique CPU GPU NPU
Utilisation principale Tâches générales, logique et contrôle Render graphique, traitement parallèle pour les tâches HPC Traitement parallèle spécialisé pour l’IA, l’apprentissage automatique et l’apprentissage profond
Nombre de cœurs Peu (souvent 2-16 dans les puces grand public) Centaines à des milliers de cœurs plus petits Matrice parallèle de cœurs spécialisés
Précision Généralement haute précision (32 bits ou 64 bits) Mélange de précision plus élevée et plus basse (FP32, FP16, etc.) Concentration sur la faible précision (8 bits ou inférieure)
Efficacité énergétique (IA) Moderée lorsqu’elle est mise à l’échelle pour une grande IA Bonne, mais peut être gourmande en énergie à grande échelle Haute efficacité, puissance plus faible par opération
Empreinte physique Intégré dans la carte mère ou le SoC Souvent des cartes autonomes (GPU autonomes) ou SoC Peut être autonome ou intégré dans un SoC (téléphones intelligents, etc.)

Résumé : Bien que les CPU restent cruciaux pour le contrôle système global et les flux de travail traditionnels, et que les GPU offrent une puissance de traitement parallèle robuste (en particulier pour les tâches graphiques lourdes), les NPU sont conçus pour l’accélération de l’IA et fonctionnent souvent à une performance plus élevée par watt pour les charges de travail d’apprentissage automatique.

Applications réelles des NPU

Centres de données et IA dans le cloud

Les grands centres de données abritent des NPU autonomes qui peuvent être attachés directement aux cartes mères de serveur. Ceux-ci accélèrent tout, des moteurs de recommandation (comme ceux qui alimentent Netflix (NFLX ) et Amazon (AMZN )) à l’IA générative comme la génération de texte et d’images en temps réel.

Téléphones intelligents et appareils électroniques grand public

De nombreux téléphones intelligents, ordinateurs portables et tablettes de haute gamme intègrent aujourd’hui un NPU ou un moteur d’IA directement dans le SoC. Le moteur neural d’Apple (AAPL ), le NPU Hexagon de Qualcomm (QCOM ) et le moteur de traitement neuronal de Samsung sont des exemples de solutions intégrées. Cette approche permet :

  • Le traitement d’images et de vidéos en temps réel (par exemple, flou d’arrière-plan sur les appels vidéo)
  • Les assistants vocaux sur appareil (avec reconnaissance vocale)
  • Les fonctionnalités de caméra intelligentes telles que la détection de scène, la reconnaissance faciale et la stabilisation d’image avancée

Appareils de bord et IoT

Les NPU sont devenus essentiels dans l’informatique de bord, où les appareils doivent traiter les données localement plutôt que de les envoyer dans le cloud. C’est particulièrement précieux pour les applications nécessitant une faible latence, la confidentialité des données ou une rétroaction en temps réel – pensez aux appareils intelligents pour la maison, aux capteurs de l’industrie 4.0, aux drones, aux véhicules autonomes et plus encore.

Robotique

Des robots de entrepôt automatisés aux assistants chirurgicaux robotisés, les NPU peuvent prendre des décisions en un éclair en fonction des entrées des capteurs. Leur capacité à gérer les flux vidéo (détection d’objets et reconnaissance de modèles) et d’autres données des capteurs rapidement est transformateur pour la prochaine génération de robots autonomes et semi-autonomes.

NPU pour l’informatique de bord et l’IA sur appareil

Pourquoi l’informatique de bord est importante

À mesure que l’IA se propage dans les accessoires, les capteurs à distance et d’autres appareils de l’Internet des objets (IoT), la capacité de traiter les données près de la source (par opposition au cloud) peut être plus critique que jamais. L’IA de bord réduit les coûts de transfert de données, atténue les problèmes de latence et garde les informations sensibles sur l’appareil – améliorant à la fois la sécurité et la confidentialité.

Rôle des NPU dans l’IA de bord

  1. Consommation d’énergie faible : Souvent alimentés par batterie ou contraints par l’énergie, les appareils de bord nécessitent un processeur d’IA qui puisse fonctionner sans épuiser les ressources. Les NPU, optimisés pour les opérations matricielles efficaces, sont parfaitement adaptés.
  2. Connaissances en temps réel : Que ce soit pour détecter des anomalies dans une usine ou pour réacheminer un drone en plein vol, les décisions d’inférence en un éclair peuvent faire ou défaire la viabilité d’une application. Les NPU offrent cette capacité avec un minimum de surcoût.
  3. Applications sur smartphone : Avec l’émergence de l’IA générative sur appareil, les NPU dans les smartphones alimentent déjà des fonctionnalités de caméra avancées, des traductions de langage en temps réel et une assistance vocale contextuelle.

Le futur des NPU et de l’IA

À mesure que l’IA générative continue d’augmenter exponentiellement en capacité, les exigences en matière de calcul haute performance et ultra-efficace augmenteront également. Déjà, les fabricants de matériel comme Intel (INTC ), AMD, Nvidia (NVDA ), Apple, Qualcomm et Samsung sont en train de intégrer ou d’affiner leurs propres architectures NPU. De même, les centres de données passent à des modèles de calcul hétérogènes – où les CPU, les GPU et les NPU coexistent – pour gérer des charges de travail de plus en plus spécialisées à grande échelle.

NPU pour l’IA générative de nouvelle génération

  • Latence plus faible : les NPU futurs pourraient atteindre une inférence en temps réel presque instantanée, rendant les assistants personnels virtuels et la génération de contenu en temps réel une partie intégrante de la vie quotidienne.
  • Ajustements de modèle sur le fly : à mesure que les modèles deviennent plus dynamiques – en ajustant leur architecture et leurs poids en temps réel – les NPU évolueront pour gérer des scénarios d’apprentissage en ligne continus.
  • Au-delà de la vision et du langage : l’IA générative s’étendra bientôt à des sorties multisensorielles complexes, notamment une rétroaction haptique en temps réel, une génération d’objets 3D ou des expériences audiovisuelles immersives.

Collaboration multi-processeur

Le calcul hétérogène consiste à exploiter le processeur approprié pour le travail approprié. Le CPU gère les tâches généralisées et l’orchestration, le GPU s’occupe des opérations parallèles à grande échelle (comme les graphiques ou les grandes opérations matricielles) et le NPU alimente les tâches d’IA spécialisées – en particulier l’inférence de réseau de neurones à grande échelle.

Dans ce scénario futur, les applications deviennent plus flexibles et plus puissantes :

  • Art génératif peut s’exécuter localement, avec votre NPU gérant les tâches de transfert de style ou de mise à l’échelle en temps réel.
  • Logiciel d’entreprise qui nécessite un traitement d’IA basé sur le langage naturel peut déléguer la correction grammaticale et la compréhension du contexte aux NPU tandis que le CPU coordonne avec le GPU pour la visualisation des données.
  • Simulations complexes dans la recherche scientifique peuvent être réparties entre CPU, GPU et NPU pour gérer efficacement des milliards de points de données.

Innovation matérielle et logicielle rapide

En raison de la nécessité d’une mise à l’échelle rapide de l’IA, les innovations matérielles et logicielles s’accélèrent :

  • Ensembles d’instructions personnalisés : de nombreux NPU sont développés avec des ensembles d’instructions propriétaires alignés sur les algorithmes d’IA en évolution.
  • Cadres d’IA unifiés : les cadres d’IA (par exemple, TensorFlow, PyTorch, ONNX) continuent d’optimiser pour les backends NPU, simplifiant les flux de travail des développeurs.
  • Convergence du cloud et du bord : les mêmes charges de travail d’IA qui étaient autrefois reléguées au cloud peuvent maintenant être réparties entre les GPU du cloud et les NPU, ou directement sur les appareils de bord.

Conclusion

Les unités de traitement neuronales (NPU) amorcent une nouvelle ère de matériel d’IA conçu à des fins spécifiques, répondant directement aux défis posés par l’apprentissage profond, l’IA générative et le traitement de grandes quantités de données. En se concentrant sur des charges de travail parallèles à faible précision, les NPU offrent des performances, une efficacité énergétique et une évolutivité sans précédent – des avantages qui sont primordiaux non seulement pour l’IA de pointe dans le cloud, mais également pour les appareils grand public et les applications émergentes de bord.

Leur importance dans le futur de l’IA ne peut être surestimée. À mesure que la demande d’IA générative sur appareil augmente et que l’informatique hétérogène devient la norme, les NPU deviendront probablement aussi essentiels pour les systèmes alimentés par l’IA que le CPU l’a été pour l’informatique traditionnelle. Que ce soit pour permettre la traduction de langage en temps réel sur votre smartphone ou pour orchestrer de grands modèles de langage dans le centre de données, le NPU est sur le point de transformer la façon dont les machines apprennent et interagissent avec le monde – offrant un aperçu d’un avenir plus intelligent, plus personnalisé et plus économe en énergie.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.