Modèles et plateformes d’IA

Pouvez-vous construire des modèles de langage à grande échelle comme ChatGPT à moitié prix ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les modèles de langage à grande échelle (LLM) comme GPT-3 et ChatGPT ont révolutionné l’IA en offrant des capacités de compréhension du langage naturel et de génération de contenu. Mais leur développement coûte cher, ce qui limite l’accès et la recherche ultérieure. Les chercheurs estiment que la formation de GPT-3 a coûté à OpenAI environ $5 millions. Néanmoins, Microsoft (MSFT ) a reconnu le potentiel et a investi $1 milliard en 2019 et $10 milliards en 2023 dans l’entreprise GPT-3 et ChatGPT d’OpenAI.

Les LLM sont des modèles d’apprentissage automatique formés sur des données textuelles étendues pour les applications de traitement automatique des langues. Ils sont basés sur l’architecture de transformateur et utilisent des mécanismes d’attention pour les tâches de traitement automatique des langues comme la réponse aux questions, la traduction automatique, l’analyse des sentiments, etc.

La question se pose : peut-on augmenter l’efficacité de ces grands modèles tout en réduisant le coût computationnel et le temps de formation ?

Plusieurs approches, comme Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance, etc., ont été développées pour réduire le coût computationnel de la formation des réseaux de neurones. La nouvelle approche LiGO (Linear Growth Operator) que nous allons discuter est en train de fixer une nouvelle référence. Elle réduit de moitié le coût computationnel de la formation des LLM.

Avant de discuter de cette technique, il est essentiel d’examiner les facteurs qui contribuent au coût élevé de la création des LLM.

Coût de construction des modèles de langage à grande échelle

Trois dépenses majeures pour le développement des LLM sont les suivantes :

1. Ressources computationnelles

La construction des LLM nécessite des ressources computationnelles massives pour former sur de grands ensembles de données. Ils doivent traiter des milliards de paramètres et apprendre des modèles complexes à partir de données textuelles massives.

L’investissement dans du matériel spécialisé comme les unités de traitement graphique (GPUs) et les unités de traitement de tenseurs (TPUs) est nécessaire pour construire et former les LLM pour atteindre des performances de pointe.

Par exemple, GPT-3 a été formé sur un supercalculateur avec 10 000 GPUs de niveau entreprise (H100 et A100) et 285 000 cœurs de processeur.

2. Consommation d’énergie

Les ressources computationnelles intensives nécessaires pour construire les LLM entraînent une consommation d’énergie significative. Par exemple, la formation de 175 milliards de paramètres de GPT-3 a pris 14,8 jours en utilisant 10 000 GPUs V100, ce qui équivaut à 3,55 millions d’heures de GPU. Un tel niveau de consommation d’énergie a des effets environnementaux significatifs.

3. Stockage et gestion des données

Les LLM sont formés sur de grands ensembles de données. Par exemple, GPT-3 a été formé sur un vaste corpus de données textuelles données, y compris Common Crawl, WebText2, Books1, Books2 et Wikipedia, entre autres sources. Un investissement important en infrastructure est nécessaire pour collecter, curer et stocker ces ensembles de données.

De plus, un stockage dans le cloud est nécessaire pour le stockage des données, et une expertise humaine pour le prétraitement des données et la gestion des versions. De plus, assurer que votre stratégie de données est conforme aux réglementations comme le RGPD ajoute également au coût.

Technique LiGO : réduire le coût de construction des modèles de langage à grande échelle de moitié

LiGO (Linear Growth Operator) est une technique novatrice développée par des chercheurs du MIT pour réduire le coût computationnel de la formation des LLM de 50 %. La méthode consiste à initialiser les poids des modèles plus grands à partir de ceux des modèles plus petits préformés, permettant ainsi une mise à l’échelle efficace des réseaux de neurones.

Yoon Kim, l’auteur principal de l’article, déclare :

« Il a été estimé que la formation de modèles à l’échelle de ce que ChatGPT est censé exécuter pourrait coûter des millions de dollars pour une seule exécution de formation. Pouvez-vous améliorer l’efficacité de ces méthodes de formation, afin que nous puissions toujours obtenir de bons modèles en moins de temps et pour moins d’argent ? Nous proposons de le faire en exploitant les petits modèles de langage qui ont été formés auparavant. »

Cette méthode maintient les avantages de performance des modèles plus grands avec un coût computationnel réduit et un temps de formation comparé à la formation d’un grand modèle à partir de zéro. LiGO utilise un opérateur de croissance linéaire basé sur les données qui combine les opérateurs de profondeur et de largeur pour une performance optimale.

L’article a utilisé divers ensembles de données pour effectuer des expériences basées sur le texte, y compris le corpus de Wikipedia en anglais pour la formation des modèles BERT et RoBERTa et l’ensemble de données C4 pour la formation du modèle GPT2.

Les expériences de technique LiGO comprenaient la croissance de BERT-Small à BERT-Base, BERT-Base à BERT-Large, RoBERTa-Small à RoBERTa-Base, GPT2-Base à GPT2-Medium et CaiT-XS à CaiT-S.

Les chercheurs ont comparé leur approche avec plusieurs autres références, y compris la formation à partir de zéro, la formation progressive, bert2BERT et KI.

La technique LiGO a offert 44,7 % d’économie en FLOPs (opérations à virgule flottante par seconde) et 40,7 % d’économie en temps mur par rapport à la formation de BERT-Base à partir de zéro en réutilisant le modèle BERT-Small. L’opérateur de croissance LiGO surpasse StackBERT, MSLT, bert2BERT et KI dans la formation efficace.

Avantages de l’utilisation d’une technique d’optimisation de formation comme LiGO

LiGO est une méthode de formation de réseau de neurones efficace qui présente divers avantages énumérés ci-dessous :

1. Formation plus rapide

Comme mentionné précédemment, la formation plus rapide est le principal avantage de la technique LiGO. Elle forme les LLM en moitié moins de temps, ce qui augmente la productivité et réduit les coûts.

2. Efficacité des ressources

LiGO est efficace en termes de ressources, car elle minimise le temps mur et les FLOPs, ce qui conduit à une approche plus rentable et plus respectueuse de l’environnement pour la formation de grands modèles de transformateur.

3. Généralisation

La technique LiGO a amélioré les performances des transformateurs de langage et de vision, suggérant qu’il s’agit d’une technique généralisable qui peut être appliquée à diverses tâches.

La construction de produits commerciaux d’IA n’est qu’un aspect des coûts globaux associés aux systèmes d’IA. Un autre composant important des coûts provient des opérations quotidiennes. Par exemple, il en coûte à OpenAI environ $700 000 par jour pour répondre aux requêtes à l’aide de ChatGPT. Les chercheurs sont censés continuer à explorer les approches qui rendent les LLM rentables pendant la formation et plus accessibles à l’exécution.

Pour plus de contenu lié à l’IA, visitez unite.ai.

Haziqa est un Data Scientist avec une expérience approfondie dans la rédaction de contenu technique pour les entreprises d'IA et de SaaS.