Modèles et plateformes d’IA
DeepMind présente l’algorithme JEST : rendant la formation de modèles d’IA plus rapide, moins chère et plus respectueuse de l’environnement
L’IA générative fait des progrès incroyables, transformant des domaines tels que la médecine, l’éducation, la finance, l’art, le sport, etc. Ces progrès proviennent principalement de l’amélioration de la capacité de l’IA à apprendre à partir de jeux de données plus importants et à construire des modèles plus complexes avec des milliards de paramètres. Bien que ces avancées aient conduit à des découvertes scientifiques significatives, créé de nouvelles opportunités commerciales et entraîné une croissance industrielle, elles ont un coût élevé, en particulier en termes d’impact financier et environnemental de la formation de ces modèles à grande échelle. Les algorithmes d’apprentissage nécessitent une puissance de calcul importante pour former des modèles d’IA générative avec de grands jeux de données, ce qui entraîne une consommation d’énergie élevée et une empreinte carbone notable.
Alors que les efforts précédents pour rendre l’IA générative durable se sont concentrés sur l’amélioration de l’efficacité des matériels pour la formation de l’IA et le développement de modèles plus petits avec moins de paramètres, Google DeepMind a adopté une approche innovante, visant à améliorer l’efficacité de l’algorithme de formation de l’IA générative. Ils ont créé un nouvel algorithme, JEST (Sélection conjointe d’exemples), qui fonctionne 13 fois plus vite et est dix fois plus économe en énergie que les techniques actuelles.
Dans cet article, nous explorons les défis de la formation de l’IA et comment JEST aborde ces problèmes. De plus, nous considérons les implications plus larges et les directions de recherche futures pour l’algorithme JEST, en visionnant son impact potentiel au-delà de l’amélioration de la vitesse, de la rentabilité et de la respect de l’environnement dans la formation de l’IA.
Les défis de la formation de l’IA : coûts élevés et impact environnemental
La formation de modèles d’IA générative présente des défis importants en raison des coûts élevés et de l’impact environnemental significatif.
- Coûts financiers : La formation de modèles d’IA générative est une entreprise coûteuse. Les estimations récentes indiquent que la formation d’un seul grand modèle, tel que OpenAI’s GPT-3 avec 175 milliards de paramètres, peut coûter environ 4,6 millions de dollars. La formation de ChatGPT-4 est estimée à environ 100 millions de dollars pour OpenAI. Ces dépenses sont en grande partie attribuables aux ressources de calcul massives, au traitement de données étendu et aux temps de formation prolongés nécessaires.
- Consommation d’énergie : Les processus de formation de l’IA générative sont extrêmement gourmands en énergie. La formation de ces modèles implique des milliers de GPU et consomme plusieurs gigawatt-heures d’énergie, rendant le processus extrêmement énergivore. Les centres de données, qui abritent les infrastructures de calcul pour la formation de l’IA, consomment environ 200 térawatt-heures (TWh) d’électricité par an, soit environ 1 % de la demande d’électricité mondiale. Un rapport de McKinsey prévoit que la consommation d’énergie des centres de données aux États-Unis pourrait passer de 17 gigawatts (GW) en 2017 à 35 GW d’ici 2030, nécessitant la production équivalente de neuf barrages Hoover pour répondre à cette demande supplémentaire.
- Empreinte carbone : La consommation d’énergie élevée de la formation de modèles d’IA générative contribue de manière significative aux émissions de gaz à effet de serre, aggravant le changement climatique. Une étude de l’Université du Massachusetts à Amherst a constaté que la formation d’un grand modèle d’IA peut émettre autant de dioxyde de carbone que cinq voitures pendant leur durée de vie. Plus précisément, la formation d’un seul modèle d’IA peut émettre plus de 626 000 livres de CO2, équivalent à l’empreinte carbone de 315 vols transaméricains.
Ces défis proviennent principalement de deux sources : la dépendance à l’égard de matériel de calcul à forte consommation d’énergie et l’inefficacité des algorithmes de formation actuels. Alors que la communauté de l’IA a fait des progrès dans le développement de matériel économe en énergie, il est nécessaire de mettre l’accent sur la création d’algorithmes plus intelligents qui peuvent optimiser l’utilisation des données et réduire les temps de formation. L’algorithme JEST de Google est une recherche innovante pour rendre les algorithmes de formation plus intelligents. En sélectionnant de manière intelligente les données qui comptent, JEST améliore considérablement l’efficacité de la formation de l’IA, ouvrant la voie à une formation plus durable et rentable de modèles d’IA générative.
Comprendre l’algorithme JEST
JEST est un algorithme d’apprentissage conçu pour former des modèles d’IA générative multimodaux de manière plus efficace. Pour comprendre comment JEST fonctionne, imaginez la formation de l’IA comme la résolution d’un puzzle complexe, où chaque pièce (point de données) aide à construire l’image complète (modèle d’IA). JEST agit comme un solveur de puzzle expérimenté, rendant le processus plus efficace. Tout comme un solveur de puzzle sélectionne les pièces les plus importantes et les plus distinctives, JEST identifie et sélectionne les lots de données les plus précieux à partir du jeu de données, en veillant à ce que chaque lot joue un rôle crucial dans le développement de l’IA.
JEST utilise un modèle d’IA plus petit pour évaluer la qualité des lots de données. Ces lots sont ensuite classés en fonction de leur efficacité dans la formation du modèle. Avec ces lots soigneusement choisis, JEST assemble stratégiquement les lots pour former le modèle. Tout comme un solveur de puzzle range les pièces du puzzle pour maximiser l’efficacité et la cohérence, JEST accélère considérablement le processus de formation en donnant la priorité et en sélectionnant les lots les plus informatifs.
Une partie clé de l’approche de JEST est l’apprentissage contrastif multimodal. Cette technique se concentre sur l’apprentissage de la correspondance entre différents types de données, comme le texte et les images. JEST utilise une méthode d’apprentissage contrastif multimodal pour évaluer l’efficacité d’un échantillon de données multimodal dans la formation du modèle. Outre l’efficacité des échantillons de données individuels, JEST évalue également l’apprentissage collectif des échantillons de données pour sélectionner un petit lot de données à partir d’un « super lot » plus grand. Ce processus aide JEST à sélectionner et à donner la priorité aux lots qui offrent des défis et des opportunités d’apprentissage riches.
Regarder vers l’avenir : JEST au-delà d’une formation de l’IA plus rapide, moins chère et plus respectueuse de l’environnement
Alors que nous explorons les implications futures de JEST (Sélection conjointe d’exemples), il est évident que ses contributions vont au-delà de la simple accélération de la formation de l’IA, de la réduction des coûts et de la promotion de la durabilité environnementale. Ici, nous nous plongeons dans la manière dont JEST peut continuer à améliorer et à transformer le domaine de l’IA générative :
- Amélioration des performances et de la précision du modèle : L’approche innovante de JEST pour la sélection et la priorisation des données conduit à des temps de formation plus rapides et à une meilleure performance du modèle. En se concentrant sur les lots de données les plus informatifs, JEST garantit que les modèles d’IA sont formés à partir de données de haute qualité, améliorant leur précision et leur robustesse. Cet avantage est crucial dans les applications où la précision et la fiabilité sont primordiales, telles que les diagnostics médicaux, la prévision financière et les systèmes autonomes.
- Identification et atténuation des biais dans les données : L’IA est sujette à des biais dans les données où certains groupes ou perspectives sont sous-représentés ou mal représentés. L’approche de JEST pour la sélection des données implique l’évaluation de la qualité et de l’informativité des lots de données. En donnant la priorité à des échantillons de données diversifiés et représentatifs, JEST peut aider les systèmes d’IA à apprendre à partir d’un jeu de données plus équilibré, réduisant ainsi les biais dans les données de formation. Par exemple, dans les applications d’IA en santé, JEST peut sélectionner des lots de données qui englobent divers facteurs démographiques, garantissant que les modèles de diagnostic médical sont formés à partir de populations de patients diversifiées. Cette sélection réduit le risque de biais qui pourraient affecter de manière disproportionnée certains groupes en fonction de la race, du sexe ou du statut socio-économique.
- Facilitation de l’innovation et de la recherche : En réduisant considérablement les ressources de calcul et le temps nécessaires pour la formation de modèles d’IA, JEST abaisse les barrières à l’entrée pour les chercheurs et les innovateurs. Cette accessibilité favorise un écosystème plus dynamique de développement de l’IA, où les petites équipes et les organisations peuvent expérimenter et déployer des solutions d’IA avancées. De plus, les gains d’efficacité offerts par JEST libèrent des ressources qui peuvent être redirigées vers l’exploration de nouveaux domaines en IA, tels que de nouvelles architectures, des algorithmes avancés et des cadres d’IA éthiques.
- Promotion du développement inclusif de l’IA : Le développement de l’IA devrait impliquer des perspectives et des contributions diversifiées pour atténuer efficacement les biais et les préoccupations éthiques. La capacité de JEST à sélectionner des données en fonction de leur valeur informative et de leur représentativité encourage des pratiques inclusives dans la curation des données. Les développeurs d’IA peuvent garantir que JEST aborde efficacement les biais et les considérations éthiques en impliquant des équipes multidisciplinaires dans la définition des critères de sélection des données, y compris des experts en éthique, en sciences sociales et en domaines spécifiques. Cette approche collaborative favorise un développement plus inclusif et responsable des technologies d’IA.
En résumé
L’introduction de l’algorithme JEST par DeepMind représente un saut significatif dans la formation de l’IA générative. En accélérant considérablement les processus de formation et en réduisant la consommation d’énergie, JEST offre des économies de coûts substantielles et répond aux préoccupations environnementales liées au développement de l’IA. Au-delà de ces avantages, JEST a le potentiel d’améliorer la précision des modèles, d’atténuer les biais dans les données, de favoriser l’innovation et de promouvoir le développement inclusif de l’IA. L’affinement et l’application continues de JEST sont sur le point de redéfinir l’avenir de l’IA, avançant vers des solutions d’IA plus efficaces, durables et éthiquement responsables.












