Modèles et plateformes d’IA
L’impact croissant des petits modèles de langage

Par
Aayush Mittal Mittal
L’émergence des petits modèles de langage
Dans le monde en constante évolution de l’intelligence artificielle, la taille d’un modèle de langage a souvent été synonyme de ses capacités. Les grands modèles de langage (LLM) comme GPT-4 ont dominé le paysage de l’IA, présentant des capacités remarquables dans la compréhension et la génération de langage naturel. Cependant, un changement subtil mais significatif est en cours. Les petits modèles de langage, autrefois éclipsés par leurs homologues plus grands, émergent comme des outils puissants dans diverses applications d’IA. Ce changement marque un point critique dans le développement de l’IA, remettant en question la notion longtemps admise que plus grand est toujours mieux.
L’évolution et les limites des grands modèles de langage
Le développement de systèmes d’IA capables de comprendre et de générer un langage humain a principalement porté sur les LLM. Ces modèles ont excellé dans des domaines tels que la traduction, la synthèse et la réponse aux questions, souvent surpassant les modèles plus petits. Cependant, le succès des LLM se fait au prix d’une consommation énergétique élevée, de besoins importants en mémoire et en calcul, et de coûts considérables. Ces défis sont aggravés par le rythme lent de l’innovation des GPU par rapport à la taille croissante de ces modèles, laissant entrevoir un plafond possible pour la mise à l’échelle.
Les chercheurs se tournent de plus en plus vers les petits modèles de langage, qui offrent des alternatives plus efficaces et plus polyvalentes dans certaines situations. Par exemple, une étude de Turc et al. (2019) a démontré que les connaissances distillées des LLM dans des modèles plus petits ont donné des performances similaires avec des exigences computationnelles significativement réduites. De plus, l’application de techniques comme l’apprentissage par transfert a permis à ces modèles de s’adapter efficacement à des tâches spécifiques, atteignant des résultats comparables ou même supérieurs dans des domaines tels que l’analyse de sentiments et la traduction.
Les progrès récents ont souligné le potentiel des modèles plus petits. Les modèles Chinchilla de DeepMind, LLaMa de Meta, Alpaca de Stanford et la série StableLM de Stability AI sont des exemples notables. Ces modèles, malgré leur taille plus petite, rivalisent ou même surpassent les performances de modèles plus grands comme GPT-3.5 dans certaines tâches. Le modèle Alpaca, par exemple, lorsqu’il est affiné sur les réponses de requête GPT-3.5, égale ses performances à un coût substantiellement réduit. De tels développements suggèrent que l’efficacité et l’efficience des modèles plus petits gagnent du terrain dans l’arène de l’IA.
Progrès technologiques et leurs implications
Techniques émergentes dans le développement de petits modèles de langage
Les recherches récentes ont mis en évidence plusieurs techniques innovantes qui améliorent les performances des petits modèles de langage. Les approches UL2R et Flan de Google sont des exemples de premier plan. UL2R, ou “Ultra Léger 2 Réparation”, introduit un objectif de mélange de débruiteurs dans la formation continue, améliorant les performances du modèle dans diverses tâches. Flan, d’un autre côté, implique l’affinage des modèles sur un large éventail de tâches formulées comme des instructions, améliorant à la fois les performances et l’utilisabilité.
De plus, un article de Yao Fu et al. a montré que les modèles plus petits peuvent exceller dans des tâches spécifiques comme le raisonnement mathématique lorsqu’ils sont formés et affinés de manière appropriée. Ces résultats soulignent le potentiel des modèles plus petits dans des applications spécialisées, remettant en question les capacités de généralisation des modèles plus grands.
L’importance de l’utilisation efficace des données
L’utilisation efficace des données est devenue un thème clé dans le domaine des petits modèles de langage. L’article “Les petits modèles de langage sont également des apprentis à quelques exemples” de Timo Schick et al. propose des techniques de masquage spécialisées combinées avec des ensembles de données déséquilibrés pour améliorer les performances des modèles plus petits. De telles stratégies mettent en évidence l’accent croissant sur les approches innovantes pour maximiser les capacités des petits modèles de langage.
Avantages des petits modèles de langage
L’attrait des petits modèles de langage réside dans leur efficacité et leur polyvalence. Ils offrent des temps de formation et d’inférence plus rapides, des empreintes carbone et hydrique réduites, et sont plus adaptés au déploiement sur des appareils à ressources limitées comme les téléphones mobiles. Cette adaptabilité est de plus en plus cruciale dans une industrie qui donne la priorité à l’accessibilité et aux performances de l’IA sur une gamme diversifiée d’appareils.
Innovations et développements industriels
Le déplacement de l’industrie vers des modèles plus petits et plus efficaces est illustré par les développements récents. Le modèle Mixtral 8x7B de Mistral, un modèle de mélange d’experts épars, et le modèle Phi-2 de Microsoft sont des avancées dans ce domaine. Le modèle Mixtral 8x7B, malgré sa taille plus petite, égale la qualité de GPT-3.5 sur certains benchmarks. Le modèle Phi-2 va plus loin, fonctionnant sur des téléphones mobiles avec seulement 2,7 milliards de paramètres. Ces modèles mettent en évidence l’accent croissant de l’industrie sur la réalisation de plus avec moins.
Le modèle Orca 2 de Microsoft illustre encore ce mouvement. En s’appuyant sur le modèle Orca original, Orca 2 améliore les capacités de raisonnement dans les petits modèles de langage, repoussant les limites de la recherche en IA.
En résumé, l’émergence des petits modèles de langage représente un changement de paradigme dans le paysage de l’IA. À mesure que ces modèles continuent d’évoluer et de démontrer leurs capacités, ils ne remettent pas seulement en question la domination des modèles plus grands mais également redéfinissent notre compréhension de ce qui est possible dans le domaine de l’IA.
J'ai passé les cinq dernières années à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de génie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiosité continue m'a également attiré vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.
Découvrir plus


Pertinence plutôt que l’échelle: Concevoir une IA qui résiste au contact avec la réalité


Les laboratoires viennent de prouver que le bac à sable de votre agent n’est qu’une suggestion


Le meilleur modèle d’OpenAI vient d’être lancé derrière une porte gouvernementale


Si un robot peut flirter avec des enfants, qu’est-ce qu’il est autorisé à faire avec vos données ?


Comment faire passer des articles scientifiques absurdes par les réviseurs AI


Les modèles d’IA préfèrent l’écriture humaine à l’écriture générée par l’IA