Modèles et plateformes d’IA

Google rend l’entraînement de l’IA 28% plus rapide en utilisant les SLM comme enseignants

mm
Ajouter Unite.AI à vos sources préférées sur Google

L’entraînement de les grands modèles de langage (LLM) est devenu inabordable pour la plupart des organisations. Avec des coûts qui s’élèvent à des millions et des exigences de calcul qui feraient transpirer un supercalculateur, le développement de l’IA est resté verrouillé derrière les portes des géants de la technologie. Mais Google (GOOGL ) vient de renverser cette histoire avec une approche si simple qu’on se demande pourquoi personne n’y a pensé plus tôt : utiliser de plus petits modèles d’IA comme enseignants.

Comment fonctionne SALT : une nouvelle approche pour l’entraînement des modèles d’IA

Dans un récent article de recherche intitulé “Un peu d’aide peut aller loin : entraînement efficace des LLM en utilisant de petits modèles,” Google Research et DeepMind ont présenté SALT (Small model Aided Large model Training). Il s’agit de la méthode novatrice qui remet en question notre approche traditionnelle de l’entraînement des LLM.

Pourquoi cette recherche est-elle importante ? Actuellement, l’entraînement de grands modèles d’IA est comme essayer d’enseigner à quelqu’un tout ce qu’il doit savoir sur un sujet en une seule fois – c’est inefficace, coûteux et souvent réservé aux organisations ayant d’énormes ressources de calcul. SALT prend une autre voie, en introduisant un processus d’entraînement en deux étapes qui est à la fois innovant et pratique.

Décomposition de la façon dont SALT fonctionne réellement :

Étape 1 : Distillation des connaissances

  • Un petit modèle de langage (SLM) agit comme un enseignant, partageant sa compréhension avec le modèle plus grand
  • Le modèle plus petit se concentre sur le transfert de ses “connaissances acquises” à travers ce que les chercheurs appellent des “étiquettes douces”
  • C’est comme un assistant d’enseignement qui gère les concepts fondamentaux avant que l’étudiant ne passe à des sujets plus avancés
  • Cette étape est particulièrement efficace dans les “régions faciles” de l’apprentissage – des domaines où le modèle plus petit a une confiance prédictive forte

Étape 2 : Apprentissage autonome

  • Le grand modèle passe à l’apprentissage indépendant
  • Il se concentre sur la maîtrise de modèles complexes et de tâches difficiles
  • C’est là que le modèle développe des capacités au-delà de ce que son “enseignant” plus petit pourrait fournir
  • La transition entre les étapes utilise des stratégies soigneusement conçues, notamment la décroissance linéaire et la décroissance linéaire du poids de la perte de distillation

En termes non techniques, imaginez que le petit modèle d’IA est comme un tuteur utile qui guide le grand modèle dans les premières étapes de l’entraînement. Ce tuteur fournit des informations supplémentaires avec ses réponses, indiquant à quel point il est confiant dans chaque réponse. Ces informations supplémentaires, appelées “étiquettes douces”, aident le grand modèle à apprendre plus rapidement et plus efficacement.

Maintenant, à mesure que le grand modèle d’IA devient plus capable, il doit passer de la dépendance à l’apprentissage autonome. C’est là que la “décroissance linéaire” et la “décroissance linéaire du rapport” entrent en jeu.
Pensez à ces techniques comme une réduction progressive de l’influence de l’enseignant avec le temps.
  • Décroissance linéaire : C’est comme réduire progressivement le volume de la voix de l’enseignant. Les conseils de l’enseignant deviennent moins importants à chaque étape, permettant au grand modèle de se concentrer davantage sur l’apprentissage à partir des données brutes elles-mêmes.
  • Décroissance linéaire du rapport : C’est comme ajuster l’équilibre entre les conseils de l’enseignant et la tâche réelle. Au fur et à mesure de la progression de l’entraînement, l’accent est mis davantage sur la tâche originale, tandis que les entrées de l’enseignant deviennent moins dominantes.
L’objectif de ces deux techniques est d’assurer une transition en douceur pour le grand modèle d’IA, en évitant tout changement brusque dans son comportement d’apprentissage.

Les résultats sont convaincants. Lorsque les chercheurs de Google ont testé SALT en utilisant un SLM de 1,5 milliard de paramètres pour entraîner un LLM de 2,8 milliards de paramètres sur le dataset Pile, ils ont constaté :

  • Une réduction de 28 % du temps d’entraînement par rapport aux méthodes traditionnelles
  • Des améliorations significatives des performances après affinement :
    • La précision des problèmes mathématiques a augmenté à 34,87 % (par rapport à 31,84 % pour la référence)
    • La compréhension de la lecture a atteint une précision de 67 % (contre 63,7 %)

Mais ce qui rend SALT vraiment innovant, c’est son cadre théorique. Les chercheurs ont découvert que même un “modèle enseignant plus faible” peut améliorer les performances de l’élève en atteignant ce qu’ils appellent un “échange favorable entre biais et variance”. En termes plus simples, le modèle plus petit aide le plus grand à apprendre des modèles fondamentaux de manière plus efficace, créant ainsi une base solide pour un apprentissage plus avancé.

Pourquoi SALT pourrait remodeler le paysage du développement de l’IA

Rappelez-vous quand le cloud computing a transformé qui pouvait lancer une entreprise technologique ? SALT pourrait faire de même pour le développement de l’IA.

J’ai suivi les innovations dans l’entraînement de l’IA pendant des années, et la plupart des avancées ont principalement profité aux géants de la technologie. Mais SALT est différent.

Voici ce que cela pourrait signifier pour l’avenir :

Pour les organisations à ressources limitées :

  • Vous n’aurez peut-être plus besoin d’une infrastructure de calcul massive pour développer des modèles d’IA capables
  • Les petits laboratoires de recherche et les entreprises pourraient expérimenter le développement de modèles personnalisés
  • La réduction de 28 % du temps d’entraînement se traduit directement par des coûts de calcul inférieurs
  • Plus important encore, vous pourriez commencer avec des ressources de calcul modestes et obtenir encore des résultats professionnels

Pour le paysage du développement de l’IA :

  • Plus d’acteurs pourraient entrer sur le marché, conduisant à des solutions d’IA plus diversifiées et spécialisées
  • Les universités et les institutions de recherche pourraient effectuer plus d’expériences avec leurs ressources existantes
  • La barrière à l’entrée pour la recherche en IA diminue considérablement
  • Nous pourrions voir de nouvelles applications dans des domaines qui ne pouvaient pas auparavant se permettre le développement de l’IA

Ce que cela signifie pour l’avenir

En utilisant de petits modèles comme enseignants, nous ne rendons pas seulement l’entraînement de l’IA plus efficace, mais nous changeons également fondamentalement qui peut participer au développement de l’IA. Les implications vont bien au-delà des améliorations techniques.

Points clés à retenir :

  • La réduction de 28 % du temps d’entraînement fait la différence entre le lancement d’un projet d’IA ou le considérer comme hors de portée
  • Les améliorations des performances (34,87 % en mathématiques, 67 % en tâches de lecture) montrent que l’accessibilité ne signifie pas toujours compromettre la qualité
  • L’approche de SALT prouve que parfois, les meilleures solutions viennent de la révision des fondements plutôt que de l’ajout de puissance de calcul

Que surveiller :

  1. Surveillez les petites organisations qui commencent à développer des modèles d’IA personnalisés
  2. Regardez les nouvelles applications dans des domaines qui ne pouvaient pas auparavant se permettre le développement de l’IA
  3. Cherchez les innovations dans l’utilisation de petits modèles pour des tâches spécialisées

Rappelez-vous : La véritable valeur de SALT réside dans la façon dont il pourrait remodeler qui peut innover dans l’IA. Que vous dirigez un laboratoire de recherche, gériez une équipe technique ou soyez simplement intéressé par le développement de l’IA, c’est le type de percée qui pourrait rendre votre prochain grand projet possible.

Peut-être devriez-vous commencer à réfléchir à ce projet d’IA que vous pensiez être hors de portée. Il pourrait être plus réalisable que vous ne l’imaginiez.

Alex McFarland est un journaliste et écrivain en intelligence artificielle qui explore les derniers développements en intelligence artificielle. Il a collaboré avec de nombreuses startups et publications en intelligence artificielle dans le monde entier.