Modèles et plateformes d’IA

L’état des LLM multilingues : dépasser l’anglais

mm
Ajouter Unite.AI à vos sources préférées sur Google

Selon une recherche de Microsoft (MSFT ), environ 88 % des langues du monde, parlées par 1,2 milliard de personnes, n’ont pas accès à des Modèles de langage grandeur nature (LLM). C’est parce que la plupart des LLM sont centrés sur l’anglais, c’est-à-dire qu’ils sont principalement construits avec des données en anglais et pour les locuteurs anglais. ​Cette dominance de l’anglais prévaut également dans le développement des LLM et a abouti à un fossé numérique linguistique, pouvant exclure la plupart des personnes des avantages des LLM. Pour résoudre ce problème pour les LLM, un LLM qui peut être formé dans différentes langues et effectuer des tâches dans différentes langues est nécessaire. Entrez les LLM multilingues !

Qu’est-ce que les LLM multilingues ?

Un LLM multilingue peut comprendre et générer du texte dans plusieurs langues. Ils sont formés sur des jeux de données qui contiennent différentes langues et peuvent effectuer diverses tâches dans plus d’une langue à partir d’une invite utilisateur.

Les applications de LLM multilingues sont énormes, elles incluent la traduction de la littérature en dialectes locaux, la communication multilingue en temps réel, la création de contenu multilingue, etc. Ils aideraient tout le monde à accéder à l’information et à se parler facilement, quelle que soit leur langue.

De plus, les LLM multilingues répondent à des défis tels que le manque de nuances culturelles et de contexte, les limitations des données de formation et la perte potentielle de connaissances pendant la traduction.

Comment les LLM multilingues fonctionnent-ils ?

La construction d’un LLM multilingue implique une préparation soigneuse d’un corpus de texte équilibré dans diverses langues et la sélection d’une architecture et d’une technique de formation appropriées pour former le modèle, de préférence un modèle Transformer, qui est parfait pour l’apprentissage multilingue.

Étapes pour construire un LLM multilingue

Source : Image de l’auteur

Une technique consiste à partager des embeddings, qui capturent la signification sémantique des mots dans différentes langues. Cela permet au LLM d’apprendre les similitudes et les différences de chaque langue, lui permettant de comprendre mieux les différentes langues.

Ces connaissances permettent également au LLM de s’adapter à diverses tâches linguistiques, comme la traduction de langues, l’écriture dans différents styles, etc. Une autre technique utilisée est l’apprentissage de transfert cross-lingual, où le modèle est pré-formé sur un grand corpus de données multilingues avant d’être affiné sur des tâches spécifiques.

Ce processus en deux étapes garantit que le modèle a une solide base dans la compréhension multilingue du langage, le rendant adaptable à diverses applications en aval.

Exemples de LLM multilingues

Tableau de comparaison des LLM multilingues

Source : Ruder.io

Plusieurs exemples notables de LLM multilingues ont émergé, chacun répondant à des besoins linguistiques et à des contextes culturels spécifiques. Explorons quelques-uns d’entre eux :

1. BLOOM

BLOOM est un LLM multilingue en accès libre qui donne la priorité aux langues diverses et à l’accessibilité. Avec 176 milliards de paramètres, BLOOM peut effectuer des tâches dans 46 langues naturelles et 13 langues de programmation, ce qui en fait l’un des plus grands et des plus diversifiés LLM.

La nature open-source de BLOOM permet aux chercheurs, aux développeurs et aux communautés linguistiques de bénéficier de ses capacités et de contribuer à son amélioration.

2. YAYI 2

YAYI 2 est un LLM open-source conçu spécifiquement pour les langues asiatiques, en tenant compte des complexités et des nuances culturelles de la région. Il a été pré-formé à partir de zéro sur un corpus multilingue de plus de 16 langues asiatiques contenant 2,65 billions de jetons filtrés.

Cela permet au modèle de donner de meilleurs résultats, en répondant aux besoins spécifiques des langues et des cultures d’Asie.

3. PolyLM

PolyLM est un LLM « polyglotte » open-source qui se concentre sur la résolution des défis des langues à faibles ressources en offrant des capacités d’adaptation. Il a été formé sur un jeu de données d’environ 640 milliards de jetons et est disponible en deux tailles de modèle : 1,7 milliard et 13 milliards. PolyLM connaît plus de 16 langues différentes.

Il permet aux modèles formés sur des langues à ressources élevées d’être affinés pour des langues à faibles ressources avec des données limitées. Cette flexibilité rend les LLM plus utiles dans diverses situations linguistiques et tâches.

4. XGLM

XGLM, avec 7,5 milliards de paramètres, est un LLM multilingue formé sur un corpus couvrant un ensemble diversifié de plus de 20 langues en utilisant la technique d’apprentissage à quelques exemples. Il fait partie d’une famille de LLM multilingues à grande échelle formés sur un énorme jeu de données de texte et de code.

Il vise à couvrir de nombreuses langues complètement, ce qui est pourquoi il se concentre sur l’inclusivité et la diversité linguistique. XGLM démontre le potentiel de construction de modèles répondant aux besoins de diverses communautés linguistiques.

5. mT5

Le mT5 (Text-to-Text Transfer Transformer multilingue massif) a été développé par Google (GOOGL ) AI. Formé sur le jeu de données Common Crawl, mT5 est un LLM multilingue de pointe qui peut gérer 101 langues, allant des langues largement parlées comme l’espagnol et le chinois aux langues moins ressources comme le basque et le quechua.

Il excelle également dans les tâches multilingues telles que la traduction, la synthèse, la réponse aux questions, etc.

Un LLM universel est-il possible ?

Le concept d’un LLM neutre en termes de langue, capable de comprendre et de générer du langage sans biais envers une langue particulière, est intrigant.

Alors que le développement d’un véritable LLM universel est encore loin, les LLM multilingues actuels ont démontré un succès significatif. Une fois pleinement développés, ils pourront répondre aux besoins des langues sous-représentées et des communautés diverses.

Par exemple, des recherches montrent que la plupart des LLM multilingues peuvent faciliter le transfert cross-lingual à zéro coup dans une langue à ressources riches vers une langue à ressources dépourvues sans données de formation spécifiques à la tâche.

De plus, des modèles comme YAYI et BLOOM, qui se concentrent sur des langues et des communautés spécifiques, ont démontré le potentiel des approches centrées sur la langue pour stimuler les progrès et l’inclusivité.

Pour construire un LLM universel ou améliorer les LLM multilingues actuels, les individus et les organisations doivent :

  • Rassembler des locuteurs natifs pour l’engagement communautaire et la curation des jeux de données linguistiques.
  • Soutenir les efforts communautaires en matière de contributions open-source et de financement de la recherche et du développement multilingues.

Les défis des LLM multilingues

Alors que le concept de LLM multilingues universels est prometteur, ils doivent également relever plusieurs défis qui doivent être résolus avant que nous puissions en bénéficier :

1. Quantité de données

Les modèles multilingues nécessitent un vocabulaire plus important pour représenter les jetons dans de nombreuses langues que les modèles monolingues, mais de nombreuses langues manquent de jeux de données à grande échelle. Cela rend difficile la formation efficace de ces modèles.

2. Préoccupations concernant la qualité des données

Assurer l’exactitude et la pertinence culturelle des sorties des LLM multilingues dans toutes les langues est une préoccupation majeure. Les modèles doivent être formés et affinés avec une attention méticuleuse aux nuances linguistiques et culturelles pour éviter les biais et les inexactitudes.

3. Limitations des ressources

La formation et l’exécution de modèles multilingues nécessitent des ressources computationnelles importantes telles que des GPU puissants (par exemple, NVIDIA A100 GPU). Le coût élevé pose des défis, en particulier pour les langues et les communautés à faibles ressources avec un accès limité à l’infrastructure computationnelle.

4. Architecture du modèle

L’adaptation des architectures de modèles pour prendre en compte les structures et les complexités linguistiques diverses est un défi en cours. Les modèles doivent être capables de gérer des langues avec des ordres de mots différents, des variations morphologiques et des systèmes d’écriture différents tout en maintenant des performances et une efficacité élevées.

5. Complexités d’évaluation

Évaluer les performances des LLM multilingues au-delà des benchmarks en anglais est crucial pour mesurer leur efficacité réelle. Cela nécessite de prendre en compte les nuances culturelles, les particularités linguistiques et les exigences spécifiques à un domaine.

Les LLM multilingues ont le potentiel de briser les barrières linguistiques, d’autonomiser les langues sous-représentées et de faciliter la communication efficace à travers des communautés diverses.

N’oubliez pas de suivre les dernières actualités et analyses en matière d’IA et de ML – visitez unite.ai aujourd’hui.

Haziqa est un Data Scientist avec une expérience approfondie dans la rédaction de contenu technique pour les entreprises d'IA et de SaaS.