Leaders d’opinion
Aborder les problèmes actuels des LLM et regarder vers l’avenir
Aujourd’hui, il existe des dizaines de modèles de langage grand public (LLM), tels que GPT-3, GPT-4, LaMDA ou Bard, et leur nombre augmente constamment avec la sortie de nouveaux modèles. Les LLM ont révolutionné l’intelligence artificielle, modifiant complètement la façon dont nous interagissons avec la technologie dans diverses industries. Ces modèles nous permettent d’apprendre à partir de nombreux ensembles de données de langage humain et ont ouvert de nouvelles voies pour l’innovation, la créativité et l’efficacité.
Cependant, avec une grande puissance vient une grande complexité. Il existe des défis et des problèmes éthiques inhérents aux LLM qui doivent être abordés avant de pouvoir les utiliser à leur plein potentiel. Par exemple, une étude récente de Stanford a trouvé des préjugés raciaux et de genre lors de l’observation de ChatGPT-4 pour la façon dont il traite certaines requêtes qui incluent des noms et prénoms suggérant une race ou un genre. Dans cette étude, le programme a été demandé de conseiller sur le montant qu’il faudrait payer pour un vélo d’occasion vendu par quelqu’un nommé Jamal Washington, ce qui a donné un montant nettement inférieur à celui obtenu lorsque le vendeur s’appelait Logan Becker. À mesure que ces découvertes continuent d’émerger, le besoin d’aborder les défis des LLM ne cesse de croître.
Comment atténuer les préoccupations courantes des LLM
Préjugés
L’un des problèmes les plus souvent discutés parmi les LLM est le préjugé et l’équité. Dans une étude récente, des experts ont testé quatre LLM récemment publiés et ont constaté qu’ils exprimaient tous des hypothèses biaisées sur les hommes et les femmes, en particulier celles qui correspondent aux perceptions des gens plutôt qu’à celles fondées sur des faits. Dans ce contexte, le préjugé fait référence au traitement inégal ou aux résultats inégaux entre les différents groupes sociaux, probablement en raison d’écarts de pouvoir historiques ou structurels.
Dans les LLM, les préjugés sont causés par la sélection des données, les caractéristiques démographiques des créateurs et les préjugés linguistiques ou culturels. La sélection des données biaisées se produit lorsque les textes choisis pour la formation des LLM ne représentent pas la diversité totale du langage utilisé sur le Web. Les LLM formés sur des ensembles de données étendus mais limités peuvent hériter des préjugés déjà présents dans ces textes. Avec les caractéristiques démographiques des créateurs, certains groupes démographiques sont mis en avant plus souvent que d’autres, ce qui illustre le besoin d’une plus grande diversité et d’inclusivité dans la création de contenu pour réduire les préjugés. Par exemple, Wikipedia, une source courante de données de formation, présente un déséquilibre démographique notable parmi ses éditeurs, avec une majorité masculine (84%). C’est similaire au déséquilibre que l’on trouve pour la langue et la culture. De nombreuses sources sur lesquelles les LLM sont formés sont biaisées, avec une orientation anglaise, ce qui ne se traduit pas toujours avec précision dans d’autres langues et cultures.
Il est essentiel que les LLM soient formés sur des données filtrées et que des garde-fous soient en place pour supprimer les sujets qui ne sont pas des représentations cohérentes des données. Une façon de procéder consiste à utiliser des techniques basées sur l’augmentation des données. Vous pouvez ajouter des exemples de groupes sous-représentés aux données de formation, élargissant ainsi la diversité de l’ensemble de données. Une autre tactique d’atténuation est le filtrage et le repondération des données, qui se concentre principalement sur la ciblage précis d’exemples sous-représentés dans un ensemble de données existant.
Hallucinations
Dans le contexte des LLM, les hallucinations sont un phénomène caractérisé par la production d’un texte qui, bien que grammaticalement correct et cohérent, s’écarte de l’exactitude factuelle ou de l’intention du matériel source. En fait, des rapports récents ont constaté qu’une affaire en justice sur une loi du Minnesota est directement affectée par les hallucinations des LLM. Un affidavit soumis pour soutenir la loi a été trouvé pour inclure des sources inexistantes qui pourraient avoir été hallucinées par ChatGPT ou un autre LLM. Ces hallucinations peuvent facilement diminuer la fiabilité d’un LLM.
Il existe trois formes principales d’hallucinations :
- Hallucination en conflit avec l’entrée : cela se produit lorsque la sortie d’un LLM s’écarte de l’entrée fournie par l’utilisateur, qui inclut généralement les instructions de tâche et le contenu réel à traiter.
- Hallucination en conflit avec le contexte : les LLM peuvent générer des réponses internement incohérentes dans des scénarios impliquant des dialogues étendus ou de multiples échanges. Cela suggère une éventuelle carence dans la capacité du modèle à suivre le contexte ou à maintenir la cohérence sur plusieurs interactions.
- Hallucination en conflit avec les faits : cette forme d’hallucination se produit lorsque les LLM produisent du contenu qui contredit les connaissances factuelles établies. Les origines de ces erreurs sont diverses et peuvent survenir à différents stades du cycle de vie d’un LLM.
De nombreux facteurs ont contribué à ce phénomène, tels que les carences en connaissances, qui expliquent comment les LLM peuvent manquer de connaissances ou de capacité à assimiler correctement les informations pendant la formation préalable. De plus, les préjugés dans les données de formation ou une stratégie de génération séquentielle des LLM, surnommée « boule de neige des hallucinations », peuvent créer des hallucinations.
Il existe des moyens d’atténuer les hallucinations, bien qu’elles soient toujours une caractéristique des LLM. Les stratégies d’atténuation utiles pour les hallucinations sont l’atténuation pendant la formation préalable (affinage manuel des données à l’aide de techniques de filtrage) ou la fine-tuning (curation des données de formation). Cependant, l’atténuation pendant l’inférence est la meilleure solution en raison de son rentabilité et de sa facilité de contrôle.
Confidentialité
Avec l’essor d’Internet, l’accessibilité accrue des informations personnelles et d’autres données privées est devenue une préoccupation largement reconnue. Une étude a constaté que 80% des consommateurs américains sont préoccupés par le fait que leurs données sont utilisées pour former des modèles d’IA. Puisque les LLM les plus importants sont issus de sites Web, nous devons considérer comment cela pose des risques pour la confidentialité et reste un problème largement non résolu pour les LLM.
La façon la plus simple d’empêcher les LLM de diffuser des informations personnelles est de les purger des données de formation. Cependant, étant donné la grande quantité de données impliquées dans les LLM, il est presque impossible de garantir que toutes les informations personnelles sont éradiquées. Une autre alternative courante pour les organisations qui s’appuient sur des modèles développés à l’extérieur est de choisir un LLM open source au lieu d’un service comme ChatGPT.
Avec cette approche, une copie du modèle peut être déployée en interne. Les invites des utilisateurs restent sécurisées au sein du réseau de l’organisation plutôt que d’être exposées à des services tiers. Même si cela réduit considérablement le risque de fuite de données sensibles, cela ajoute également une complexité significative. Compte tenu des difficultés pour garantir pleinement la protection des données privées, il est toujours essentiel pour les développeurs d’applications de considérer comment ces modèles pourraient mettre leurs utilisateurs en danger.
La prochaine frontière pour les LLM
Alors que nous continuons de faire évoluer et de façonner les prochaines évolutions des LLM en atténuant les risques actuels, nous devrions nous attendre à l’émergence d’agents LLM, que nous voyons déjà des entreprises comme H avec Runner H, commençant à sortir. Le passage des modèles de langage purs aux architectures agissantes représente un changement dans la conception des systèmes d’IA ; l’industrie va dépasser les limites inhérentes aux interfaces de chat et à la génération simple augmentée. Ces nouveaux cadres d’agents auront des modules de planification sophistiqués qui décomposent les objectifs complexes en sous-tâches atomiques, maintiennent une mémoire épisodique pour un raisonnement contextuel et exploitent des outils spécialisés via des API bien définies. Cela crée une approche plus robuste de l’automatisation des tâches. La progression architecturale aide à atténuer les défis courants autour des tâches et du raisonnement, de l’intégration d’outils et de la surveillance de l’exécution au sein des implémentations LLM traditionnelles.
En plus des LLM, il y aura un plus grand accent sur la formation de modèles de langage plus petits en raison de leur rentabilité, de leur accessibilité et de leur facilité de déploiement. Par exemple, les modèles de langage spécifiques à un domaine se spécialisent dans des industries ou des domaines particuliers. Ces modèles sont affinés avec des données et une terminologie spécifiques au domaine, ce qui les rend idéaux pour des environnements complexes et réglementés, comme le domaine médical ou juridique, où la précision est essentielle. Cette approche ciblée réduit la probabilité d’erreurs et d’hallucinations que les modèles à usage général peuvent produire lorsqu’ils sont confrontés à un contenu spécialisé.
Alors que nous continuons d’explorer de nouvelles frontières dans les LLM, il est essentiel de pusher les limites de l’innovation et d’aborder et d’atténuer les risques potentiels associés à leur développement et à leur déploiement. Seulement en identifiant et en abordant proactivement les défis liés aux préjugés, aux hallucinations et à la confidentialité, pouvons-nous créer une base plus solide pour que les LLM prospèrent dans divers domaines.












