एआई मॉडल और प्लेटफ़ॉर्म

फेसबुक ने 100 अलग-अलग भाषाओं के बीच सीधे अनुवाद करने में सक्षम मशीन अनुवाद मॉडल बनाया है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

फेसबुक ने हाल ही में एक नया मशीन अनुवाद मॉडल विकसित किया है जो 100 भाषाओं के सेट में से किसी भी दो भाषाओं के बीच पाठ का अनुवाद कर सकता है। जबकि अन्य मशीन अनुवाद प्रणालियां मौजूद हैं, अधिकांश अन्य एआई अनुवाद प्रणालियां पहले पाठ को अंग्रेजी में अनुवादित करती हैं और फिर उसे वहां से परिवर्तित करती हैं। जैसा कि Engadget ने रिपोर्ट किया है, फेसबुक के एआई अनुवादक अंग्रेजी भाषा का मध्यस्थ के रूप में उपयोग किए बिना काम करता है और कथित तौर पर लगभग 90% सटीकता प्राप्त करने में सक्षम है।

फेसबुक के एआई मॉडल के लिए प्रशिक्षण डेटा लगभग 7.5 अरब वाक्य जोड़ियों से बना था, जो 100 अलग-अलग भाषाओं में वितरित किया गया था। डेटा को वेब से वेब क्रॉलर की श्रृंखला का उपयोग करके संकलित किया गया था, और संग्रहीत डेटा में मौजूद भाषाओं की पहचान फास्टटेक्स्ट नामक एक भाषा मॉडल का उपयोग करके की गई थी। एक बार डेटा संग्रहीत हो जाने के बाद, इसे LASER 2.0 नामक एक टूल के माध्यम से चलाया गया विभिन्न वाक्य नमूनों के अर्थ को निकालने और उनके अर्थ के आधार पर विभिन्न भाषाओं में वाक्यों को मिलाने के लिए। LASER 2.0 को फेसबुक द्वारा विकसित किया गया था और यह अनुप्रवेशी शिक्षण एल्गोरिदम का उपयोग करके एम्बेडिंग बनाता है। वाक्य एम्बेडिंग में वाक्यों के बीच संबंधों के बारे में जानकारी होती है, जैसे कि उपयोग की आवृत्ति और वाक्यों के बीच की निकटता। LASER 2.0 तब उच्च समान अर्थ वाले वाक्यों के जोड़े बनाने में सक्षम है।

प्रशिक्षण डेटा को केवल वाक्य अर्थ के आधार पर जोड़ा नहीं गया था। भाषाएं स्वयं समूहों में विभाजित की गई थीं। लक्ष्य एक ऐसी प्रणाली को डिज़ाइन करना था जिसमें दो भाषाओं के बीच मध्यस्थ के रूप में अंग्रेजी की आवश्यकता नहीं होती, फेसबुक की एंजेला फैन, जिन्होंने परियोजना का नेतृत्व किया, ने उल्लेख किया कि दुनिया भर के कई क्षेत्र ऐसे हैं जो अंग्रेजी के अलावा दो भाषाएं बोलते हैं। फेसबुक के इंजीनियरों ने प्रशिक्षण द्वारा भाषाओं को एक दूसरे के साथ अक्सर अनुवादित की जाने वाली भाषाओं के जोड़े पर ध्यान केंद्रित करके किया। चौदह अलग-अलग भाषा समूह बनाए गए, जो संस्कृति, भाषाई समानताएं और भूगोल जैसे कारकों पर आधारित थे। उदाहरण के लिए, शोधकर्ताओं द्वारा बनाए गए भाषाई समूहों में से एक में भारत में सबसे आम भाषाएं शामिल थीं, जिनमें उर्दू, तमिल, हिंदी और बंगाली शामिल थीं। यह इसलिए किया गया ताकि सामान्यतः जोड़ी गई भाषाओं को उच्च गुणवत्ता वाले अनुवाद प्राप्त हों।

भाषा-समूह पर केंद्रित प्रशिक्षण विधि के कुछ दिलचस्प परिणाम सामने आए। यह पाया गया कि परिणामी अनुवाद मॉडल में कुछ भाषा जोड़ियों के लिए वर्तमान में मौजूद मॉडलों की तुलना में अधिक सटीकता थी। उदाहरण के लिए, अंग्रेजी और बेलारूसी के बीच अनुवाद करते समय, एआई रूसी के साथ अनुवाद करते समय सीखे गए कुछ पैटर्न को लागू करने में सक्षम था क्योंकि बेलारूसी में रूसी के साथ भाषाई समानताएं हैं। इसी तरह, स्पेनिश और पुर्तगाली के बीच अनुवाद प्रयासों में सुधार हुआ क्योंकि स्पेनिश दूसरी सबसे व्यापक बोली जाने वाली भाषा है और इस कार्य के लिए पर्याप्त प्रशिक्षण डेटा था।

अनुवाद प्रणाली अभी तक लगभग साठ भाषाओं को कवर नहीं करती है, और कम प्रशिक्षण डेटा वाली भाषाओं पर मॉडल की सटीकता में सुधार की आवश्यकता है trước कि यह उपयोग के लिए तैयार हो। दुनिया भर में कई भाषाएं, विशेष रूप से दक्षिण पूर्व एशिया और अफ्रीका में, एक विश्वसनीय मॉडल को प्रशिक्षित करने के लिए आवश्यक डेटा की मात्रा का अभाव है। शोध टीम को यह निर्धारित करने की आवश्यकता है कि इस डेटा की कमी के लिए कैसे मुआवजा दिया जाए। शोध टीम को यह भी निर्धारित करने की आवश्यकता है कि मॉडल द्वारा सीखे गए किसी भी नस्लवादी, लिंगवादी या अश्लील पैटर्न को कैसे नियंत्रित किया जाए। जबकि शोध टीम ने एक अभद्र भाषा फिल्टर का उपयोग किया है, फिल्टर मुख्य रूप से अंग्रेजी डेटा पर काम करता है।

मशीन अनुवाद प्रणाली को अभी तक फेसबुक के सोशल मीडिया प्लेटफॉर्म पर नियोजित नहीं किया गया है। वर्तमान मॉडल शोध उद्देश्यों के लिए ही है। हालांकि, फेसबुक समान मॉडलों को डिज़ाइन करने और उन्हें साइट पर प्रतिदिन प्राप्त होने वाले लगभग 20 अरब अनुवाद अनुरोधों को संभालने के लिए तैयार कर रहा है।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।