نماذج ومنصات الذكاء الاصطناعي

فيسبوك يخترع نموذج ترجمة آلي يمكنه الترجمة المباشرة بين 100 لغة مختلفة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

طور فيسبوك مؤخرًا نموذج ترجمة آلي جديد يمكنه ترجمة النصوص بين أي زوج من اللغات من مجموعة مكونة من 100 لغة. بينما توجد أنظمة ترجمة آلية أخرى، تعمل معظم أنظمة الترجمة الآلية الأخرى عن طريق ترجمة النص إلى اللغة الإنجليزية أولاً ثم تحويل النص من هناك. كما ذكرت إنجادجت ، يعمل مترجم فيسبوك الآلي بدون استخدام اللغة الإنجليزية كوسيط ، ويُreported أنه يمكنه تحقيق دقة تقريبية تبلغ حوالي 90٪.

كانت بيانات التدريب لنموذج فيسبوك الآلي مكونة من حوالي 7.5 مليار زوج من الجمل ، موزعة على 100 لغة مختلفة. تم تجميع البيانات من الويب باستخدام سلسلة من زاحفات الويب ، وتم تحديد اللغات الموجودة في البيانات المجمعة باستخدام نموذج لغة يسمى FastText. بمجرد جمع البيانات ، تم تشغيلها من خلال أداة تسمى LASER 2.0 لاستخراج معنى عينات الجمل المختلفة وتماثل الجمل في اللغات المختلفة بناءً على معناها. تم تطوير LASER 2.0 بواسطة فيسبوك ويتطلب خوارزميات التعلم غير المشرّف لإنشاء التضمين. تحتوي تضمين الجمل على معلومات حول العلاقات بين الجمل المختلفة بناءً على ميزات مثل تكرار الاستخدام وكيفية ظهور الجمل بالقرب من بعضها البعض. ثم يمكن لـ LASER 2.0 إنشاء أزواج من الجمل التي لها معان Highly متشابهة.

لم تكن بيانات التدريب مجرد زوج بناءً على معاني الجمل. تم تجميع اللغات نفسها معًا. كان الهدف هو تصميم نظام لا يتطلب استخدام اللغة الإنجليزية كوسيط بين لغتين ، حيث أشارت أنجيلا فان من فيسبوك ، التي قادت المشروع ، إلى أن العديد من المناطق حول العالم تتحدث لغتين ليسا الإنجليزية. قام مهندسو فيسبوك بتنفيذ التدريب بالتركيز على تجميع اللغات التي يتم翻訳ها بشكل شائع إلى بعضها البعض. تم إنشاء十四 مجموعة لغة مختلفة ، بناءً على متغيرات مثل الثقافة والتشابه اللغوي والجغرافيا. على سبيل المثال ، احتوت واحدة من المجموعات اللغوية التي أنشأها الباحثون على اللغات الأكثر شيوعًا في الهند ، بما في ذلك اللغات الأردية والتاميلية والهندية والبنغالية. تم القيام بذلك حتى تتلقى اللغات الشائعة الترجمات عالية الجودة.

أدى نهج التدريب المُركّز على المجموعة اللغوية إلى بعض النتائج المثيرة. تم العثور على أن نموذج الترجمة الناتج كان أكثر دقة من النماذج الحالية لبعض أزواج اللغات. على سبيل المثال ، عند الترجمة من الإنجليزية إلى البيلاروسية ، كان بإمكان الآلة تطبيق بعض الأنماط التي تعلمتها عند ترجمة اللغة الروسية لأن اللغة البيلاروسية لها تشابهات لغوية مع اللغة الروسية. وبالمثل ، تحسنت جهود الترجمة بين اللغة الإسبانية والبرتغالية لأن اللغة الإسبانية هي اللغة الثانية الأكثر تحدثًا ، وكان هناك حجم كبير من بيانات التدريب للمهمة.

هناك حوالي ستين لغة لا تغطيها نظام الترجمة بعد ، ويحتاج نموذج دقة إلى تحسين قبل أن يكون جاهزًا للاستخدام. تفتقر العديد من اللغات في جنوب شرق آسيا وأفريقيا إلى حجم البيانات المطلوب لتدريب نموذج موثوق. سيتعين على فريق البحث تحديد طريقة لتعويض هذا النقص في البيانات. كما سيتعين على فريق البحث تحديد كيفية التحكم في أي أنماط عنصرية أو جنسية أو فاحشة قد تعلمها النموذج. بينما استخدم فريق البحث مرشح الكلمات البذيئة ، يعمل المرشح بشكل رئيسي على البيانات الإنجليزية.

لم يتم استخدام نظام الترجمة الآلي بعد على منصة فيسبوك الإعلامية الاجتماعية. النموذج الحالي هو لأغراض البحث فقط. ومع ذلك ، يتم إعداد فيسبوك لتصميم نماذج مشابهة لها وتحمل حوالي 20 مليار طلب ترجمة يتلقاها الموقع كل يوم.

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.