Modèles et plateformes d’IA
Facebook Crée un Modèle de Traduction Automatique Qui Peut Traduire Directement Entre 100 Langues Différentes
Facebook (META ) a récemment développé un nouveau modèle de traduction automatique qui peut traduire du texte entre n’importe quelle paire de langues parmi un ensemble de 100 langues. Alors que d’autres systèmes de traduction automatique existent, la plupart des autres systèmes de traduction par intelligence artificielle fonctionnent en traduisant d’abord le texte en anglais, puis en convertissant le texte à partir de là. Selon Engadget, le traducteur d’intelligence artificielle de Facebook fonctionne sans utiliser la langue anglaise comme intermédiaire et est capable d’atteindre une précision d’environ 90 %.
Les données d’entraînement de Facebook pour le modèle d’intelligence artificielle étaient composées d’environ 7,5 milliards de paires de phrases, réparties sur 100 langues différentes. Les données ont été compilées à partir du web à l’aide d’une série de crawlers web, et les langues présentes dans les données collectées ont été identifiées à l’aide d’un modèle de langage appelé FastText. Une fois les données collectées, elles ont été traitées par un outil appelé LASER 2.0 pour extraire le sens des différents échantillons de phrases et faire correspondre les phrases dans différentes langues en fonction de leur sens. LASER 2.0 a été développé par Facebook et il utilise des algorithmes d’apprentissage non supervisé pour créer des embeddings. Les embeddings de phrases contiennent des informations sur les relations entre les phrases en fonction de caractéristiques telles que la fréquence d’utilisation et la proximité des phrases. LASER 2.0 peut ensuite créer des paires de phrases qui ont des sens très similaires.
Les données d’entraînement n’ont pas été jumelées uniquement en fonction du sens des phrases. Les langues elles-mêmes ont été regroupées. L’objectif était de concevoir un système qui n’exige pas l’utilisation de l’anglais comme intermédiaire entre deux langues, avec Angela Fan, qui a dirigé le projet, notant que de nombreuses régions du monde parlent deux langues qui ne sont pas l’anglais. Les ingénieurs de Facebook ont effectué la formation en se concentrant sur le jumelage de langues qui sont couramment traduites les unes dans les autres. Quatorze groupes de langues différents ont été créés, sur la base de variables telles que la culture, les similitudes linguistiques et la géographie. Par exemple, l’un des groupes linguistiques créés par les chercheurs contenait les langues les plus courantes de l’Inde, qui comprennent les langues ourdou, tamoul, hindi et bengali. Cela a été fait pour que les langues jumelées couramment reçoivent des traductions de haute qualité.
La méthode d’entraînement axée sur les groupes de langues a conduit à des résultats intéressants. On a constaté que le modèle de traduction résultant avait une précision supérieure aux modèles existants pour certaines paires de langues. Par exemple, lors de la traduction de l’anglais en biélorusse, l’intelligence artificielle a pu appliquer certains modèles qu’elle avait appris lors de la traduction du russe, car le biélorusse a des similitudes linguistiques avec le russe. De même, les efforts de traduction entre l’espagnol et le portugais se sont améliorés, car l’espagnol est la deuxième langue la plus parlée et qu’il y avait un volume important de données d’entraînement pour cette tâche.
Il y a environ soixante langues que le système de traduction ne couvre pas encore, et la précision du modèle sur les langues sans beaucoup de données d’entraînement doit être améliorée avant qu’il soit prêt à être utilisé. De nombreuses langues d’Asie du Sud-Est et d’Afrique manquent du volume de données nécessaire pour former un modèle fiable. L’équipe de recherche devra déterminer une façon de compenser ce manque de données. L’équipe de recherche devra également déterminer comment contrôler les modèles racistes, sexistes ou autrement profanes que le modèle pourrait avoir appris. Même si l’équipe de recherche a utilisé un filtre de grossièretés, le filtre fonctionne principalement sur les données en anglais.
Le système de traduction automatique n’a pas encore été utilisé sur la plate-forme de médias sociaux de Facebook. Le modèle actuel est à des fins de recherche uniquement. Cependant, Facebook se prépare à concevoir des modèles similaires et à les faire gérer les environ 20 milliards de demandes de traduction que le site reçoit chaque jour.












