Modèles et plateformes d’IA

Les chercheurs découvrent des sous-réseaux hautement efficaces au sein des réseaux de neurones d’apprentissage profond

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les réseaux de neurones d’apprentissage profond sont souvent massifs et nécessitent d’énormes quantités de puissance de calcul, mais une nouvelle découverte démontre comment cela peut être réduit pour accomplir des tâches de manière plus efficace. Jonathan Frankle et son équipe de MIT ont élaboré l’hypothèse du “ticket de loterie”, qui montre comment il existe des sous-réseaux plus légers au sein des réseaux de neurones plus grands. Ces sous-réseaux peuvent accomplir la tâche en question de manière plus efficace avec moins de puissance de calcul requise, l’un des plus grands défis étant de trouver ces sous-réseaux, ou les tickets de loterie gagnants, comme les appelle l’équipe.

L’équipe a découvert ces sous-réseaux au sein de BERT, la technique de pointe de l’apprentissage automatique pour le traitement du langage naturel (NLP). Le NLP, qui est un sous-domaine de l’intelligence artificielle (IA), est responsable de la décodification et de l’analyse du langage humain, et il est utilisé pour des applications telles que la génération de texte prédictif et les chatbots.

Cependant, BERT est grand et nécessite une puissance de calcul de type supercalculateur, qui est inaccessible à la plupart des utilisateurs. Avec la nouvelle découverte de ces sous-réseaux, cela pourrait ouvrir l’accès, permettant à plus d’utilisateurs d’utiliser la technologie pour développer des outils NLP.

« Nous atteignons le point où nous allons devoir rendre ces modèles plus légers et plus efficaces », déclare Frankle.

Selon lui, ce développement pourrait « réduire les barrières d’entrée » pour le NLP.

BERT – “Obscenely Expensive”  

BERT est fondamental pour des choses comme le moteur de recherche de Google et a reçu beaucoup d’attention depuis que Google l’a publié en 2018. Il s’agit d’une méthode pour créer des réseaux de neurones et est formé en essayant de remplir les passages de texte manquants. L’une des fonctionnalités les plus impressionnantes de BERT est son énorme jeu de données de formation initial.

Il peut ensuite être affiné par les utilisateurs pour des tâches spécifiques, telles que les chatbots de service client, mais encore une fois, cela nécessite une énorme quantité de puissance de traitement, avec la possibilité que les paramètres atteignent 1 milliard.

« Un modèle BERT standard aujourd’hui – le modèle de base – comporte 340 millions de paramètres », déclare Frankle. « C’est obscènement coûteux. C’est bien au-delà de la capacité de calcul de vous ou de moi. »

Selon l’auteur principal Tianlong Chen de l’Université du Texas à Austin, des modèles tels que BERT « souffrent d’une taille de réseau énorme », mais grâce à la nouvelle recherche, « l’hypothèse du ticket de loterie semble être une solution ».

Sous-réseaux efficaces 

Chen et l’équipe ont cherché un modèle plus petit situé au sein de BERT, et ils ont comparé les performances des sous-réseaux découverts avec le modèle BERT original. Cela a été testé sur une variété de tâches NLP différentes, notamment la réponse à des questions et le remplissage de mots vides dans une phrase.

L’équipe a découvert des sous-réseaux réussis qui étaient impressionnants de 40 à 90 % plus minces que le modèle BERT original, avec le pourcentage réel dépendant de la tâche. En outre, ils ont pu les identifier avant l’affinage spécifique à la tâche, ce qui entraîne des coûts de calcul encore plus réduits. Un autre avantage était que certains des sous-réseaux sélectionnés pour une tâche spécifique pouvaient ensuite être réutilisés pour une autre.

« J’étais un peu choqué que cela ait fonctionné », déclare Frankle. « Ce n’est pas quelque chose que j’ai pris pour acquis. J’attendais un résultat beaucoup plus désordonné que celui que nous avons obtenu. »

Selon Ari Morcos, un scientifique de Facebook (META ) AI Research, cette découverte est « convaincante », et « Ces modèles deviennent de plus en plus répandus. Il est donc important de comprendre si l’hypothèse du ticket de loterie tient. »

Morcos déclare également que si ces sous-réseaux pouvaient fonctionner avec beaucoup moins de puissance de calcul, cela « serait très impactant, étant donné que ces modèles extrêmement grands sont actuellement très coûteux à exécuter ».

« Je ne sais pas à quel point nous pouvons aller plus loin en utilisant ces calculs de type supercalculateur », ajoute Frankle. « Nous allons devoir réduire la barrière d’entrée. »

« L’espoir est que cela réduira le coût, que cela rendra cela plus accessible à tous… aux petits qui n’ont qu’un ordinateur portable », conclut-il.

La recherche doit être présentée à la Conférence sur le traitement de l’information neuronale.

Alex dirige les opérations d'information propulsées par l'IA de Unite.AI, en combinant le journalisme, la recherche et l'automatisation pour soutenir une couverture opportune et évolutive de l'intelligence artificielle. Son travail aide à garantir que les développements émergents de l'IA sont mis en avant efficacement tout en maintenant les normes éditoriales de la publication.