Leaders d’opinion

Le GPT-4 nous rapprochera-t-il d’une véritable révolution de l’IA ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Il y a presque trois ans que le GPT-3 a été introduit, en mai 2020. Depuis, le modèle de génération de texte basé sur l’IA a suscité beaucoup d’intérêt pour sa capacité à créer du texte qui ressemble et sonne comme s’il avait été écrit par un humain. Maintenant, il semble que la prochaine itération du logiciel, le GPT-4, est juste à l’horizon, avec une date de sortie estimée à quelque part au début de 2023.

Malgré la nature très attendue de cette actualité de l’IA, les détails exacts sur le GPT-4 ont été plutôt flous. OpenAI, l’entreprise derrière le GPT-4, n’a pas publié beaucoup d’informations sur le nouveau modèle, telles que ses fonctionnalités ou ses capacités. Néanmoins, les progrès récents dans le domaine de l’IA, en particulier en ce qui concerne le traitement automatique des langues (TAL), peuvent offrir quelques indices sur ce que nous pouvons attendre du GPT-4.

Qu’est-ce que le GPT ?

Avant de plonger dans les détails, il est utile de définir d’abord ce qu’est le GPT. GPT signifie Generative Pre-trained Transformer et fait référence à un modèle de réseau neuronal en apprentissage profond qui est formé sur des données disponibles sur Internet pour créer de grandes quantités de texte généré par machine. Le GPT-3 est la troisième génération de cette technologie et est l’un des modèles de génération de texte basé sur l’IA les plus avancés actuellement disponibles.

Imaginez le GPT-3 comme fonctionnant un peu comme les assistants vocaux, tels que Siri ou Alexa, mais à une échelle beaucoup plus grande. Au lieu de demander à Alexa de jouer votre chanson préférée ou de faire taper votre texte par Siri, vous pouvez demander au GPT-3 d’écrire un eBook entier en quelques minutes ou de générer 100 idées de publications sur les réseaux sociaux en moins d’une minute. Tout ce que l’utilisateur doit faire est fournir une invite, telle que « Écrivez-moi un article de 500 mots sur l’importance de la créativité ». Tant que l’invite est claire et spécifique, le GPT-3 peut écrire à peu près tout ce que vous lui demandez.

Depuis sa sortie au public, le GPT-3 a trouvé de nombreuses applications commerciales. Les entreprises l’utilisent pour la synthèse de texte, la traduction de langues, la génération de code et l’automatisation à grande échelle de presque toutes les tâches d’écriture.

Cela étant dit, même si le GPT-3 est sans aucun doute très impressionnant dans sa capacité à créer du texte très lisible et ressemblant à celui d’un humain, il est loin d’être parfait. Des problèmes tendent à surgir lorsqu’il est invité à écrire des pièces plus longues, en particulier lorsqu’il s’agit de sujets complexes qui nécessitent une compréhension approfondie. Par exemple, une invite pour générer du code informatique pour un site Web peut renvoyer un code correct mais sous-optimal, donc un codeur humain doit encore aller et améliorer le code. C’est un problème similaire avec les grands documents texte : plus le volume de texte est important, plus il est probable que des erreurs – parfois hilarantes – apparaissent et nécessitent une correction par un écrivain humain.

En résumé, le GPT-3 n’est pas un remplacement complet pour les écrivains ou les codeurs humains, et il ne devrait pas être considéré comme tel. Au lieu de cela, le GPT-3 devrait être considéré comme un assistant d’écriture, qui peut économiser beaucoup de temps aux gens lorsqu’ils ont besoin de générer des idées de billets de blog ou des ébauches pour des copies publicitaires ou des communiqués de presse.

Plus de paramètres = meilleur ?

Une chose à comprendre sur les modèles d’IA est la façon dont ils utilisent les paramètres pour faire des prédictions. Les paramètres d’un modèle d’IA définissent le processus d’apprentissage et fournissent une structure pour la sortie. Le nombre de paramètres dans un modèle d’IA a généralement été utilisé comme mesure de performance. Plus il y a de paramètres, plus le modèle est puissant, lisse et prévisible, du moins selon l’hypothèse de mise à l’échelle.

Par exemple, lorsque le GPT-1 a été publié en 2018, il avait 117 millions de paramètres. Le GPT-2, publié un an plus tard, avait 1,2 milliard de paramètres, tandis que le GPT-3 a augmenté le nombre encore plus haut à 175 milliards de paramètres. Selon une interview d’août 2021 avec Wired, Andrew Feldman, fondateur et PDG de Cerebras, une entreprise qui travaille avec OpenAI, a mentionné que le GPT-4 aurait environ 100 billions de paramètres. Cela rendrait le GPT-4 100 fois plus puissant que le GPT-3, un saut quantique en taille de paramètre qui, à juste titre, a rendu beaucoup de gens très excités.

Cependant, malgré l’affirmation ambitieuse de Feldman, il y a de bonnes raisons de penser que le GPT-4 n’aura pas en fait 100 billions de paramètres. Plus le nombre de paramètres est important, plus le modèle est coûteux à former et à affiner en raison des quantités massives de puissance de calcul requises.

De plus, il y a plus de facteurs que le seul nombre de paramètres qui déterminent l’efficacité d’un modèle. Prenez par exemple Megatron-Turing NLG, un modèle de génération de texte construit par Nvidia et Microsoft, qui a plus de 500 milliards de paramètres. Malgré sa taille, le MT-NLG n’approche pas le GPT-3 en termes de performance. En bref, plus grand ne signifie pas nécessairement mieux.

Il est probable que le GPT-4 aura effectivement plus de paramètres que le GPT-3, mais il reste à voir si ce nombre sera d’un ordre de grandeur supérieur. Au lieu de cela, il y a d’autres possibilités intrigantes que OpenAI est susceptible de poursuivre, telles qu’un modèle plus léger qui se concentre sur les améliorations qualitatives de la conception algorithmique et de l’alignement. L’impact exact de ces améliorations est difficile à prédire, mais ce qui est connu, c’est qu’un modèle sparse peut réduire les coûts de calcul grâce à ce qu’on appelle le calcul conditionnel, c’est-à-dire que tous les paramètres du modèle d’IA ne seront pas activés en permanence, ce qui est similaire à la façon dont les neurones du cerveau humain fonctionnent.

Que pourra faire le GPT-4 ?

Jusqu’à ce qu’OpenAI publie une nouvelle déclaration ou même lance le GPT-4, nous sommes laissés pour spéculer sur la façon dont il différera du GPT-3. Quoi qu’il en soit, nous pouvons faire quelques prédictions

Even si le futur du développement de l’apprentissage profond de l’IA est multimodal, le GPT-4 restera probablement un modèle texte-seulement. En tant qu’humains, nous vivons dans un monde multisensoriel rempli de différents sons, visuels et entrées textuelles. Par conséquent, il est inévitable que le développement de l’IA produira finalement un modèle multimodal qui peut intégrer une variété d’entrées.

Cependant, un bon modèle multimodal est nettement plus difficile à concevoir qu’un modèle texte-seulement. La technologie n’est pas encore là et sur la base de ce que nous savons sur les limites de la taille des paramètres, il est probable qu’OpenAI se concentre sur l’expansion et l’amélioration d’un modèle texte-seulement.

Il est également probable que le GPT-4 sera moins dépendant de l’invocation précise. L’un des inconvénients du GPT-3 est que les invites textuelles doivent être soigneusement rédigées pour obtenir le résultat souhaité. Lorsque les invites ne sont pas soigneusement rédigées, vous pouvez finir par des sorties qui sont fausses, toxiques ou même reflètent des opinions extrémistes. C’est ce qu’on appelle le « problème d’alignement » et il fait référence aux défis pour créer un modèle d’IA qui comprend pleinement les intentions de l’utilisateur. En d’autres termes, le modèle d’IA n’est pas aligné sur les objectifs ou les intentions de l’utilisateur. Puisque les modèles d’IA sont formés à l’aide de jeux de données textuelles provenant d’Internet, il est très facile pour les préjugés humains, les faussetés et les préjugés de se retrouver dans les sorties textuelles.

Cela étant dit, il y a de bonnes raisons de croire que les développeurs font des progrès sur le problème d’alignement. Cet optimisme vient de certaines avancées dans le développement de l’InstructGPT, une version plus avancée du GPT-3 qui est formée sur les commentaires humains pour suivre les instructions et les intentions de l’utilisateur plus étroitement. Les juges humains ont constaté que l’InstructGPT était beaucoup moins dépendant que le GPT-3 d’une bonne invocation.

Cependant, il faut noter que ces tests n’ont été menés qu’avec des employés d’OpenAI, un groupe relativement homogène qui peut ne pas différer beaucoup en termes de genre, de religion ou de opinions politiques. Il est probable que le GPT-4 subira une formation plus diverse qui améliorera l’alignement pour différents groupes, même si l’étendue de cette amélioration reste à voir.

Le GPT-4 remplacera-t-il les humains ?

Malgré la promesse du GPT-4, il est peu probable qu’il remplace complètement le besoin d’écrivains et de codeurs humains. Il y a encore beaucoup de travail à faire sur tout, des optimisations de paramètres à la multimodalité et à l’alignement. Il se peut que cela prenne de nombreuses années avant de voir un générateur de texte qui puisse atteindre une véritable compréhension humaine de la complexité et des nuances de l’expérience réelle.

Quoi qu’il en soit, il y a encore de bonnes raisons d’être enthousiaste à l’approche du GPT-4. L’optimisation des paramètres – plutôt que la simple croissance des paramètres – devrait probablement conduire à un modèle d’IA qui a beaucoup plus de puissance de calcul que son prédécesseur. Et l’amélioration de l’alignement devrait probablement rendre le GPT-4 beaucoup plus convivial pour l’utilisateur.

En outre, nous sommes encore au début du développement et de l’adoption des outils d’IA. De nouveaux cas d’utilisation pour la technologie sont constamment découverts, et à mesure que les gens gagnent plus de confiance et de confort avec l’utilisation de l’IA sur le lieu de travail, il est presque certain que nous verrons une adoption généralisée des outils d’IA dans presque tous les secteurs d’activité dans les prochaines années.

Dr. Danny Rittman, est le CTO de GBT Technologies, une solution conçue pour permettre le déploiement de l'IoT (Internet des objets), des réseaux maillés mondiaux, de l'intelligence artificielle et pour les applications liées à la conception de circuits intégrés.