एआई मॉडल और प्लेटफ़ॉर्म

डेटा2वेक: स्व-पर्यवेक्षित लर्निंग में एक मील का पत्थर

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मशीन लर्निंग मॉडल्स ने हमेशा प्रशिक्षण के लिए लेबल वाले डेटा पर भरोसा किया है, और पारंपरिक रूप से, लेबल वाले डेटा पर मॉडल्स को प्रशिक्षित करने से सटीक परिणाम मिलते हैं। हालांकि, लेबल वाले डेटा का उपयोग करने का मुख्य नुकसान यह है कि प्रशिक्षण डेटा के आकार में वृद्धि के साथ उच्च एनोटेशन लागतें बढ़ जाती हैं। उच्च एनोटेशन लागत विकासकर्ताओं के लिए एक बड़ा अवरोध है, खासकर जब वे एक बड़े परियोजना पर काम कर रहे हों जिसमें प्रशिक्षण डेटा की बड़ी मात्रा हो।

लेबल वाले डेटा की समस्या को हल करने के लिए, विकासकर्ताओं ने एसएसएल या स्व-पर्यवेक्षित लर्निंग की अवधारणा का आविष्कार किया। स्व-पर्यवेक्षित लर्निंग एक मशीन लर्निंग प्रक्रिया है जिसमें मॉडल खुद को प्रशिक्षित करता है ताकि वह इनपुट के एक हिस्से से दूसरे हिस्से को सीख सके। एक स्व-पर्यवेक्षित लर्निंग मॉडल लेबल वाले डेटा के पर्यवेक्षित संकेतों का उपयोग करने के बजाय डेटा के बीच संबंधों का शोषण करने का लक्ष्य रखता है।

स्व-पर्यवेक्षित लर्निंग के अलावा, मशीन लर्निंग मॉडल्स को लेबल वाले डेटा के उपयोग के बिना प्रशिक्षित करने के लिए कई अन्य तरीके और मॉडल हैं। हालांकि, इनमें से अधिकांश तरीकों में दो बड़ी समस्याएं हैं

  1. वे अक्सर एक单 मॉडल के लिए विशेषज्ञ होते हैं, जैसे कि एक छवि या पाठ।
  2. उन्हें उच्च मात्रा में गणनात्मक शक्ति की आवश्यकता होती है।

इन सीमाओं के कारण, एक औसत मानव मस्तिष्क एक ही प्रकार के डेटा से बहुत अधिक प्रभावी ढंग से सीख सकता है, जब इसकी तुलना एक एआई मॉडल से की जाती है जो अलग-अलग मॉडल और प्रशिक्षण डेटा पर निर्भर करता है ताकि यह छवि, पाठ और भाषण के बीच अंतर कर सके।

इन समस्याओं को हल करने के लिए, मेटा एआई ने डेटा2वेक, पहली बार का एक स्व-पर्यवेक्षित उच्च-प्रदर्शन अल्गोरिथ्म विकसित किया है जो तीन अलग-अलग मॉडलों से पैटर्न जानकारी सीखने में सक्षम है: छवि, पाठ और भाषण। डेटा2वेक अल्गोरिथ्म के कार्यान्वयन के साथ, पाठ समझने को छवि सेगमेंटेशन समस्या पर लागू किया जा सकता है, या यह भाषण मान्यता कार्य में भी तैनात किया जा सकता है।

इस लेख में, हम डेटा2वेक मॉडल के बारे में विस्तार से चर्चा करेंगे। हम मॉडल के तरीके की समीक्षा, संबंधित कार्य, वास्तुकला और परिणामों पर अधिक गहराई से चर्चा करेंगे ताकि आपको डेटा2वेक अल्गोरिथ्म की स्पष्ट समझ हो।

डेटा2वेक परिचय: मूल विचार

हालांकि स्व-पर्यवेक्षित लर्निंग की मूल अवधारणा मॉडलों में लागू की जाती है, वास्तविक उद्देश्य और अल्गोरिथ्म एक मॉडल से दूसरे मॉडल में भिन्न होते हैं क्योंकि वे एक单 मॉडल के संबंध में डिज़ाइन किए गए थे। एक मॉडल के लिए डिज़ाइन करना ही कारण है कि एक ही स्व-पर्यवेक्षित लर्निंग अल्गोरिथ्म विभिन्न प्रकार के प्रशिक्षण डेटा पर प्रभावी ढंग से काम नहीं कर सकता है।

एक मॉडल और अल्गोरिथ्म की चुनौती को पार करने के लिए, मेटा एआई ने डेटा2वेक जारी किया, जो कंप्यूटर विजन, एनएलपी या भाषण के लिए एक ही सीखने की विधि का उपयोग करता है।

डेटा2वेक अल्गोरिथ्म के पीछे का मूल विचार मास्क्ड दृश्य का उपयोग करके पूर्ण इनपुट डेटा के लेटेंट प्रतिनिधित्व की भविष्यवाणी करना है, जो मानक ट्रांसफॉर्मर वास्तुकला की मदद से स्व-जलन सेटअप में किया जाता है। इसलिए, स्थानीय प्रकृति के मॉडल-विशिष्ट वस्तुओं के बजाय, जैसे कि छवियां, पाठ या आवाज, डेटा2वेक अल्गोरिथ्म पूरे प्रशिक्षण या इनपुट डेटा से जानकारी के साथ लेटेंट प्रतिनिधित्व की भविष्यवाणी करता है।

एआई उद्योग को डेटा2वेक अल्गोरिथ्म की आवश्यकता क्यों है?

स्व-पर्यवेक्षित लर्निंग मॉडल्स प्रशिक्षण डेटा के मानव-संकेतित लेबल का उपयोग करके प्रतिनिधित्व बनाते हैं, और यह एनएलपी या प्राकृतिक भाषा प्रसंस्करण और कंप्यूटर विजन प्रौद्योगिकी के विकास के पीछे एक प्रमुख कारण है। ये स्व-पर्यवेक्षित लर्निंग प्रतिनिधित्व हैं जो कारण हैं कि कार्यों जैसे भाषण मान्यता और मशीन लर्निंग में असुपरवाइज्ड लर्निंग का उपयोग किया जाता है।

अब तक, ये स्व-पर्यवेक्षित लर्निंग अल्गोरिथ्म व्यक्तिगत मॉडलों पर केंद्रित हैं, जो पूर्वाग्रह और विशिष्ट डिज़ाइन में परिणाम होते हैं। व्यक्तिगत मॉडलों की स्व-पर्यवेक्षित लर्निंग अल्गोरिथ्म कंप्यूटर विजन और एनएलपी सहित विभिन्न एआई अनुप्रयोगों में चुनौतियां पैदा करती हैं।

उदाहरण के लिए, भाषण प्रसंस्करण में स्व-पर्यवेक्षित लर्निंग कार्य को परिभाषित करने के लिए भाषण इकाइयों का शब्दकोश हो सकता है। इसी तरह, कंप्यूटर विजन में, डेवलपर्स या तो इनपुट को पुनरावर्ती कर सकते हैं, विचारों को सीख सकते हैं या डेटा संवर्द्धन के लिए प्रतिनिधित्व सीख सकते हैं। हालांकि ये पूर्वाग्रह उपयोगी हैं, यह पुष्टि करना मुश्किल है कि क्या वे अन्य मॉडलों में सामान्य होंगे।

डेटा2वेक अल्गोरिथ्म स्व-पर्यवेक्षित लर्निंग उद्योग में एक महत्वपूर्ण मील का पत्थर है क्योंकि यह एक से अधिक मॉडलों में सुधार करने का लक्ष्य रखता है। इसके अलावा, डेटा2वेक अल्गोरिथ्म इनपुट के पुनर्निर्माण या विरोधी लर्निंग पर निर्भर नहीं करता है।

इसलिए, डेटा2वेक की आवश्यकता का कारण यह है कि डेटा2वेक अल्गोरिथ्म एआई में प्रगति को तेज करने और विकसित करने में सक्षम होने की क्षमता रखता है एआई और एमएल मॉडल जो अपने आसपास के विभिन्न पहलुओं के बारे में सीखने में सक्षम हैं। वैज्ञानिकों को उम्मीद है कि डेटा2वेक अल्गोरिथ्म उन्हें अधिक अनुकूलन योग्य एआई और एमएल मॉडल विकसित करने की अनुमति देगा जो आज के एआई मॉडल्स से परे उन्नत कार्य कर सकते हैं।

डेटा2वेक अल्गोरिथ्म क्या है?

डेटा2वेक एक एकीकृत फ्रेमवर्क है जो छवियों, भाषण और पाठ जैसे विभिन्न डेटा मॉडलों में स्व-पर्यवेक्षित मशीन लर्निंग को लागू करने का लक्ष्य रखता है।

डेटा2वेक अल्गोरिथ्म का उद्देश्य विभिन्न मॉडलों में सामान्य पैटर्न सीखने में मॉडल्स को बेहतर बनाने के लिए एक समान सीखने का उद्देश्य बनाना है। डेटा2वेक मॉडल सीखने के अल्गोरिथ्म को एकीकृत करता है, लेकिन यह अभी भी प्रत्येक मॉडल के लिए प्रतिनिधित्व सीखता है।

डेटा2वेक अल्गोरिथ्म की शुरुआत के साथ, मेटा एआई उम्मीद करता है कि यह मल्टीमॉडल लर्निंग को प्रभावी और सरल बना देगा।

डेटा2वेक अल्गोरिथ्म कैसे काम करता है?

डेटा2वेक अल्गोरिथ्म लेटेंट टार्गेट प्रतिनिधित्व की भविष्यवाणी को मास्क्ड पूर्वानुमान के साथ जोड़ती है, हालांकि यह लेटेंट प्रतिनिधित्व को सामान्य बनाने के लिए कई नेटवर्क परतों का उपयोग करती है। मॉडल विशेष रूप से एक ट्रांसफॉर्मर नेटवर्क को प्रशिक्षित करता है जो या तो शिक्षक या छात्र मोड में उपयोग किया जाता है।

शिक्षक मोड में, मॉडल पहले प्रशिक्षण डेटा के प्रतिनिधित्व बनाता है जो सीखने के कार्य में लक्ष्य के रूप में कार्य करता है। छात्र मोड में, मॉडल एक मास्क्ड संस्करण को एनकोड करता है जो पूर्ण डेटा प्रतिनिधित्व की भविष्यवाणी करने के लिए उपयोग किया जाता है।

उपरोक्त चित्र दिखाता है कि डेटा2वेक मॉडल विभिन्न मॉडलों के लिए एक ही सीखने की प्रक्रिया का उपयोग कैसे करता है। पहले चरण में, मॉडल इनपुट डेटा (शिक्षक मोड) के प्रतिनिधित्व उत्पन्न करता है। मॉडल तब इन प्रतिनिधित्वों को मास्क्ड संस्करण के आधार पर पुनरावर्ती करता है।

इसके अलावा, डेटा2वेक अल्गोरिथ्म को मॉडल-विशिष्ट डिज़ाइन जैसे इनपुट को सामान्य करने या दृश्य टोकन सीखने का एक सरलीकृत संस्करण माना जा सकता है। लेकिन डेटा2वेक और अन्य अल्गोरिथ्मों के बीच एक महत्वपूर्ण अंतर यह है कि डेटा2वेक अल्गोरिथ्म अपने लक्ष्य प्रतिनिधित्व को संदर्भित और निरंतर बनाने के लिए स्व-ध्यान का उपयोग करता है। दूसरी ओर, अन्य स्व-पर्यवेक्षित लर्निंग मॉडल स्थानीय संदर्भ पर आधारित एक निश्चित सेट का उपयोग करते हैं।

डेटा2वेक: मॉडल विधि

डेटा2वेक मॉडल को प्रशिक्षित किया जाता है ताकि यह इनपुट डेटा के एक आंशिक दृश्य को देखते हुए मॉडल प्रतिनिधित्व की भविष्यवाणी कर सके। जैसा कि दी गई फिगर में देखा जा सकता है, कुत्ते का चेहरा मास्क्ड है, एक विशिष्ट खंड आवाज नोट मास्क्ड है, और पाठ में “के साथ” शब्द मास्क्ड है।

मॉडल पहले प्रशिक्षण नमूने (छात्र मोड) के एक मास्क्ड संस्करण को एनकोड करता है, और फिर मॉडल के वजनों (θ) के एक्सपोनेंशियल मूविंग एवरेज के रूप में पैरामीटरीकृत मॉडल के साथ इनपुट के एक अनमास्क्ड संस्करण को एनकोड करता है (शिक्षक मोड)। इसके अलावा, लक्ष्य प्रतिनिधित्व प्रशिक्षण नमूने में मौजूद जानकारी को एनकोड करते हैं, और छात्र मोड में, सीखने का कार्य इन प्रतिनिधित्वों की भविष्यवाणी करने के लिए उपयोग किया जाता है जब एक आंशिक दृश्य इनपुट दिया जाता है।

मॉडल वास्तुकला

डेटा2वेक मॉडल एक मानक ट्रांसफॉर्मर वास्तुकला का उपयोग करता है जिसमें इनपुट डेटा का मॉडल-विशिष्ट एनकोडिंग होता है। कंप्यूटर विजन से संबंधित कार्यों के लिए, मॉडल विट स्ट्रेटजी का उपयोग करता है ताकि 16×16 पिक्सेल के पैच के रूप में एक छवि को एनकोड किया जा सके, और एक रैखिक परिवर्तन के रूप में एक अनुक्रम के रूप में फीड किया जा सके।

इसके अलावा, भाषण मान्यता से संबंधित डेटा के लिए, मॉडल एक मल्टी-लेयर 1-डी कन्वोल्यूशनल न्यूरल नेटवर्क का उपयोग करता है जो 16 kHz वेवफॉर्म को 50 Hz प्रतिनिधित्व में मैप करता है। पाठ डेटा को संसाधित करने के लिए, मॉडल डेटा को उप-शब्द इकाइयों को निकालने के लिए प्रीप्रोसेस करता है, और फिर वितरणात्मक स्थान में एम्बेडिंग वेक्टर के माध्यम से डेटा को एम्बेड करता है।

मास्किंग

एक बार मॉडल ने इनपुट डेटा को टोकन के एक अनुक्रम के रूप में एम्बेड किया, तो मॉडल इन इकाइयों के हिस्सों को मास्किंग टोकन के साथ प्रतिस्थापित करके मास्क करता है, और फिर अनुक्रम को ट्रांसफॉर्मर नेटवर्क में फीड करता है। कंप्यूटर विजन के लिए, मॉडल ब्लॉक-वार मास्किंग रणनीति का अभ्यास करता है। लेटेंट भाषण प्रतिनिधित्व का उपयोग भाषण डेटा के खंडों को मास्क करने के लिए किया जाता है, और भाषा से संबंधित कार्यों के लिए, टोकन मास्क्ड होते हैं।

प्रशिक्षण लक्ष्य

डेटा2वेक मॉडल मास्क्ड नमूने के आधार पर अनमास्क्ड प्रशिक्षण नमूने के मॉडल प्रतिनिधित्व की भविष्यवाणी करने का लक्ष्य रखता है। मॉडल केवल मास्क्ड समय के लिए प्रतिनिधित्व की भविष्यवाणी करता है।

मॉडल संदर्भित प्रतिनिधित्व की भविष्यवाणी करता है जो न केवल विशिष्ट समय को एनकोड करता है, बल्कि नमूने से अन्य जानकारी को भी एनकोड करता है क्योंकि यह ट्रांसफॉर्मर नेटवर्क में स्व-ध्यान का उपयोग करता है। संदर्भित प्रतिनिधित्व और ट्रांसफॉर्मर नेटवर्क का उपयोग डेटा2वेक मॉडल को मौजूदा बीईआरटी, वेव2वेक, बीईआईटी, सिमएमआईएम, एमएई, और मास्कफीट मॉडल से अलग करता है जो संदर्भित जानकारी के बिना लक्ष्य की भविष्यवाणी करते हैं।

यहाँ देखें कि डेटा2वेक मॉडल शिक्षक मोड को कैसे पैरामीटरीकृत करता है ताकि यह नेटवर्क प्रतिनिधित्व की भविष्यवाणी कर सके जो लक्ष्य के रूप में कार्य करते हैं।

शिक्षक पैरामीटरीकरण

डेटा2वेक मॉडल अनमास्क्ड प्रशिक्षण नमूने के एनकोडिंग को ईएमए या एक्सपोनेंशियल मूविंग एवरेज के मॉडल पैरामीटर (θ) के साथ पैरामीटरीकृत करता है, जहां लक्ष्य मोड (△) में मॉडल के वजन होते हैं

                                           ∆ ← τ∆ + (1 − τ ) θ

 

इसके अलावा, मॉडल τ के लिए अनुसूची निर्धारित करता है जो पैरामीटर को τ0 से τe (लक्ष्य मान) तक पहले τn अपडेट पर रैखिक रूप से बढ़ाता है। इन अपडेट के बाद, मॉडल मूल्य को स्थिर रखता है जब तक कि प्रशिक्षण समाप्त नहीं हो जाता। ईएमए रणनीति शिक्षक को प्रशिक्षण की शुरुआत में अधिक बार अपडेट करती है जब मॉडल यादृच्छिक होता है। जैसे ही प्रशिक्षण आगे बढ़ता है और अच्छे पैरामीटर सीखे जाते हैं, शिक्षक को कम बार अपडेट किया जाता है।

परिणाम दिखाते हैं कि मॉडल अधिक कुशल और सटीक होता है जब यह शिक्षक और छात्र मोड के बीच सुविधा और स्थितिजन्य एनकोडर के पैरामीटर साझा करता है।

लक्ष्य

प्रशिक्षण लक्ष्यों का निर्माण शिक्षक नेटवर्क की शीर्ष K परतों के आउटपुट पर निर्भर करता है जो छात्र मोड में मास्क्ड समय के लिए होता है। शिक्षक नेटवर्क की l परत का आउटपुट किसी भी समय t के लिए aके रूप में संकेत दिया जाता है। मॉडल तब प्रत्येक ब्लॉक के लिए सामान्यीकरण लागू करता है ताकि aलागू किया जा सके

  

 

समय t के लिए प्रशिक्षण लक्ष्य yt प्राप्त करने के लिए शीर्ष K ब्लॉकों को औसतन। कुल L ब्लॉक वाले नेटवर्क के लिए।

यह प्रशिक्षण लक्ष्य बनाता है जिसे मॉडल छात्र मोड में पुनरावर्ती करता है। प्रारंभिक प्रयोगों में, डेटा2वेक मॉडल ने प्रत्येक ब्लॉक को अलग से एक समर्पित परियोजना के साथ भविष्यवाणी करने में अच्छा प्रदर्शन किया और साथ ही अधिक कुशल था।

इसके अलावा, लक्ष्यों को सामान्य करने से डेटा2वेक मॉडल को समय के लिए स्थिर प्रतिनिधित्व में ढहने से रोकने में मदद मिलती है, और लक्ष्य डेटासेट में विशेषताओं को प्रभावित करने से उच्च सामान्यीकरण वाली परतों को रोकता है। भाषण मान्यता के लिए, मॉडल वर्तमान इनपुट नमूने पर बिना किसी सीखे हुए पैरामीटर के इंस्टेंस सामान्यीकरण का उपयोग करता है। यह मुख्य रूप से इसलिए है क्योंकि इनपुट डेटा पर छोटा कदम है, और आसपास के प्रतिनिधित्व अत्यधिक संबंधित हैं।

इसके अलावा, शोधकर्ताओं ने पाया कि जब कंप्यूटर विजन और एनएलपी के साथ काम किया जाता है, तो पैरामीटर-मुक्त सामान्यीकरण पर्याप्त रूप से काम करता है। समस्या को वेरिएंस-इनवेरियन्स-कोवेरियन्स नियमन के साथ भी हल किया जा सकता है, लेकिन ऊपर उल्लिखित रणनीति पर्याप्त रूप से काम करती है और इसके लिए कोई अतिरिक्त पैरामीटर की आवश्यकता नहीं है।

उद्देश्य

संदर्भित प्रशिक्षण लक्ष्यों yt के लिए, मॉडल लक्ष्यों को पुनरावर्ती करने के लिए एक स्मूथ एल1 हानि का उपयोग करता है जैसा कि नीचे बताया गया है

यहाँ, β समय के लिए पूर्वानुमान ft(x) के बीच अंतर के आकार पर निर्भर करता है। इस हानि का लाभ यह है कि यह अपवादों के प्रति कम संवेदनशील है, बीटा की सेटिंग को समायोजित करने की आवश्यकता के साथ।

प्रयोगात्मक सेटअप

डेटा2वेक मॉडल को दो मॉडल आकारों के साथ प्रयोग किया जाता है: डेटा2वेक लार्ज और डेटा2वेक बेस। संख्यात्मक स्थिरता के लिए, ईएमए अपडेट को एफपी32 में किया जाता है, और मॉडल में एल = 12 या एल = 24 ट्रांसफॉर्मर ब्लॉक होते हैं जिनके गुप्त आयाम (एच) = 768 या एच = 1024 होते हैं। आइए विभिन्न मॉडलों और उद्देश्यों के लिए प्रयोगात्मक सेटअप का विस्तार से विश्लेषण करें।

कंप्यूटर विजन

डेटा2वेक मॉडल 224×224 पिक्सेल की छवियों को 16×16 पिक्सेल के पैच के रूप में एम्बेड करता है। प्रत्येक पैच को रैखिक रूप से परिवर्तित किया जाता है, और एक अनुक्रम के रूप में 196 प्रतिनिधित्व के साथ मानक ट्रांसफॉर्मर में फीड किया जाता है।

मॉडल बीईआईटी का पालन करता है ताकि आसपास के पैच के साथ ब्लॉक को मास्क किया जा सके, प्रत्येक ब्लॉक में कम से कम 16 पैच हों और एक यादृच्छिक पहलू अनुपात हो। हालांकि, मूल रूप से बीईआईटी मॉडल में 40% पैच को मास्क करने के बजाय, डेटा2वेक मॉडल 60% पैच को मास्क करता है ताकि बेहतर सटीकता प्राप्त की जा सके।

इसके अलावा, मॉडल यादृच्छिक रूप से छवि फसलों को बदल देता है, क्षैतिज रूप से फ्लिप करता है, और रंग जिटरिंग करता है। अंत में, डेटा2वेक मॉडल शिक्षक और छात्र दोनों मोड में समान संशोधित छवि का उपयोग करता है।

विट-बी मॉडल को 800 एपोक्स के लिए प्री-ट्रेन किया जाता है, और डेटा2वेक मॉडल विट-एल मॉडल के लिए 8,192 और विट-बी मॉडल के लिए 2,048 के बैच आकार का उपयोग करता है। डेटा2वेक मॉडल विट-एल के लिए 0.001 और विट-बी के लिए 40 एपोक्स के लिए 0.001 तक 80 एपोक्स के लिए वार्मअप लर्निंग दर के साथ एक कोसाइन और एडम शेड्यूल का उपयोग करता है।

विट-बी और विट-एल दोनों के लिए, डेटा2वेक मॉडल बीटा = 2, के = 6 और τ = 0.9998 का उपयोग करता है, जो एक निरंतर है और कोई अनुसूची नहीं है। मॉडल स्टोकास्टिक गहराई दर 0.2 का भी उपयोग करता है।

इसके अलावा, विट-एल के लिए, मॉडल 1,600 एपोक्स के लिए प्रशिक्षित किया जाता है, जहां पहले 800 एपोक्स में 0.9998 की लर्निंग दर होती है, और फिर मॉडल लर्निंग दर अनुसूची को रीसेट करता है और 0.9999 की लर्निंग दर के साथ अंतिम 800 एपोक्स के लिए जारी रहता है।

छवि वर्गीकरण के लिए, मॉडल अंतिम ट्रांसफॉर्मर ब्लॉक के आउटपुट के मीन-पूल का उपयोग करता है और इसे सॉफ्टमैक्स-नॉर्मलाइज्ड क्लासिफायर में फीड करता है। मॉडल तब विट-एल को 50 एपोक्स और विट-बी को 100 एपोक्स के लिए कोसाइन और एडम के साथ वार्मअप लर्निंग दर का उपयोग करके फाइन-ट्यून करता है।

भाषण प्रसंस्करण

भाषण प्रसंस्करण के लिए, डेटा2वेक मॉडल फेयरसेक का उपयोग करता है, एक अनुक्रम-मॉडलिंग किट जो ग्राहक मॉडल को सारांश, अनुवाद और पाठ जनरेशन के लिए प्रशिक्षित करने के लिए उपयोग किया जाता है। मॉडल 16 kHz वेवफॉर्म को इनपुट के रूप में लेता है जो एक फीचर एनकोडर द्वारा संसाधित किया जाता है, जिसमें 512 चैनल, कर्नल चौड़ाई (10,3,3,3,3,2,2), और स्ट्राइड (5,2,2,2,2,2,2) होते हैं।

उपरोक्त परिणाम एनकोडर के आउटपुट आवृत्ति को 50Hz बनाता है, और प्रत्येक नमूने के बीच 20ms का कदम होता है। रिसेप्टिव फील्ड में 400 इनपुट नमूने या 25 ms ऑडियो शामिल हैं। रॉ वेवफॉर्म को एनकोडर में फीड करने से पहले यूनिट वेरायटी और शून्य मean तक सामान्य किया जाता है।

मास्किंग रणनीति जो डेटा2वेक बेस मॉडल के लिए उपयोग की जाती है वह बेव्स्की फ्रेमवर्क के लिए स्व-पर्यवेक्षित लर्निंग में भाषण मान्यता के लिए समान है। मॉडल p = 0.065 के लिए सभी समय के लिए शुरू करने वाले सूचकांक का नमूना लेता है, और फिर अगले दस समय के लिए मास्किंग जारी रखता है। एक विशिष्ट प्रशिक्षण अनुक्रम के लिए, यह प्रक्रिया लगभग 49% कुल समय के लिए मास्किंग की अनुमति देती है।

प्रशिक्षण के दौरान, डेटा2वेक मॉडल τ को रैखिक रूप से अनुकूलित करता है, τo = 0.999, τe = 0.9999, और τn = 30,000। डेटा2वेक मॉडल बेस मॉडल के लिए एडम ऑप्टिमाइज़र के साथ 5×10-4 की चोटी लर्निंग दर का उपयोग करता है। इसके अलावा, बेस मॉडल एक त्रि-स्टेज शेड्यूलर का उपयोग करता है जो पहले 3% अपडेट के लिए लर्निंग दर को रैखिक रूप से गर्म करता है, अगले 90% के लिए इसे बनाए रखता है, और फिर शेष 7% के लिए इसे रैखिक रूप से घटा देता है।

प्राकृतिक भाषा प्रसंस्करण

डेटा2वेक मॉडल 50के प्रकार के बाइट-जोड़ी एनकोडिंग का उपयोग करके इनपुट को टोकनाइज़ करता है, और फिर प्रत्येक प्रकार के लिए एक एम्बेडिंग सीखता है। डेटा को एनकोड करने के बाद, मॉडल 15% यूनिफ़ॉर्म रूप से चुने गए टोकन के लिए बीईआरटी मास्किंग रणनीति लागू करता है, जिनमें से 80% सीखे हुए मास्क टोकन द्वारा प्रतिस्थापित किए जाते हैं, 10% यादृच्छिक वोकेबुलरी टोकन द्वारा प्रतिस्थापित किए जाते हैं, और शेष 10% अपरिवर्तित रहते हैं।

प्री-ट्रेनिंग के दौरान, मॉडल τo = 0.999, τe = 0.9999, और τn = 100,000, के = 10, और β = 4 का उपयोग करता है। मॉडल एडम ऑप्टिमाइज़र के साथ 2×10-4 की चोटी लर्निंग दर के साथ एक त्रि-स्टेज लर्निंग दर अनुसूची का उपयोग करता है, जो पहले 5% अपडेट के लिए लर्निंग दर को रैखिक रूप से गर्म करता है, अगले 80% के लिए इसे बनाए रखता है, और फिर शेष 15% के लिए इसे रैखिक रूप से घटा देता है।

इसके अलावा, मॉडल 16 जीपीयू के साथ 256 अनुक्रमों के बैच आकार के साथ प्रशिक्षित किया जाता है, और प्रत्येक अनुक्रम में लगभग 512 टोकन होते हैं। डाउनस्ट्रीमिंग के लिए, मॉडल को चार अलग-अलग लर्निंग दरों पर प्रशिक्षित किया जाता है: 1×10-4, 2×10-4, 3×10-4, 4×10-4, और सबसे अच्छा प्रदर्शन करने वाला मॉडल को आगे के एनएलपी डाउनस्ट्रीमिंग कार्यों के लिए चुना जाता है।

परिणाम

आइए देखें कि डेटा2वेक मॉडल विभिन्न मॉडलों के लिए उपरोक्त रणनीतियों को लागू करने पर कैसा प्रदर्शन करता है।

कंप्यूटर विजन

कंप्यूटर विजन के लिए, डेटा2वेक मॉडल को इमेजनेट-1के डेटासेट से प्राप्त छवियों पर प्री-ट्रेन किया जाता है। परिणामी मॉडल को उसी बेंचमार्क के लेबल वाले डेटा का उपयोग करके फाइन-ट्यून किया जाता है। मानक अभ्यास के अनुसार, मॉडल को तब मान्यकरण डेटा पर शीर्ष-1 सटीकता के संदर्भ में मूल्यांकन किया जाता है।

परिणामों को एक ही स्व-पर्यवेक्षित मॉडल के संदर्भ में, एक अलग दृश्य टोकनाइज़र को अतिरिक्त डेटा पर प्रशिक्षित करने के संदर्भ में, या अन्य स्व-पर्यवेक्षित लर्निंग मॉडल के संदर्भ में विभाजित किया जाता है।

नीचे दी गई तालिका डेटा2वेक मॉडल के प्रदर्शन की तुलना कंप्यूटर विजन के लिए अन्य मौजूदा मॉडलों के साथ करती है: विट-एल और विट-बी।

उपरोक्त तालिका के परिणामों को निम्नलिखित रूप में सारांशित किया जा सकता है:

  • डेटा2वेक मॉडल एकल मॉडल सेटिंग में विट-एल और विट-बी मॉडल के साथ पूर्व के कार्यों से बेहतर प्रदर्शन करता है।
  • मास्क्ड पूर्वानुमान सेटअप जो डेटा2वेक अल्गोरिथ्म में संदर्भित लेटेंट प्रतिनिधित्व की भविष्यवाणी करने के लिए उपयोग किया जाता है, स्थानीय लक्ष्यों की भविष्यवाणी करने वाले तरीकों की तुलना में बेहतर प्रदर्शन करता है, जैसे कि इमेज फीचर्स को इंजीनियर करना, इनपुट पिक्सेल, या दृश्य टोकन।
  • डेटा2वेक मॉडल छात्र नेटवर्क के अंतिम परत को पुनरावर्ती करने वाले स्व-जलन विधियों से भी बेहतर प्रदर्शन करता है, जो दो अलग-अलग छवि संस्करणों को इनपुट के रूप में लेते हैं।

ऑडियो और भाषण प्रसंस्करण

ऑडियो और भाषण प्रसंस्करण के लिए, डेटा2वेक मॉडल को लगभग 960 घंटे के ऑडियो डेटा पर प्रशिक्षित किया जाता है, जो लिब्रिस्पीच (एलएस-960) डेटासेट से प्राप्त होता है। डेटासेट में अंग्रेजी में ऑडियोबुक्स से साफ भाषण ऑडियो शामिल है, और यह ऑडियो और भाषण प्रसंस्करण उद्योग में एक मानक बेंचमार्क माना जाता है।

विभिन्न संसाधन सेटिंग्स में मॉडल के प्रदर्शन का विश्लेषण करने के लिए, शोधकर्ताओं ने डेटा2वेक मॉडल को विभिन्न मात्रा में लेबल वाले डेटा (कुछ मिनट से लेकर कई घंटों तक) के लिए स्वचालित भाषण मान्यता के लिए फाइन-ट्यून किया। मॉडल के प्रदर्शन का विश्लेषण करने के लिए, डेटा2वेक की तुलना हुबर्ट और वेव2वेक 2.0 के साथ की जाती है, जो दो लोकप्रिय अल्गोरिथ्म हैं जो भाषण और ऑडियो प्रतिनिधित्व सीखने पर निर्भर करते हैं जो विचारों पर निर्भर करते हैं।

उपरोक्त तालिका डेटा2वेक के प्रदर्शन की तुलना भाषण मान्यता के लिए अन्य मौजूदा मॉडलों के साथ करती है और शब्द दर के संदर्भ में तुलना करती है। एलएम डिकोडिंग के लिए उपयोग किए जाने वाले भाषा मॉडल को दर्शाता है। परिणामों को निम्नलिखित रूप में सारांशित किया जा सकता है:

  • डेटा2वेक मॉडल लेबल वाले डेटा सेटअप में सुधार दिखाता है, जिसमें बेस मॉडल के लिए 10 मिनट के लेबल वाले डेटा के साथ सबसे बड़ा लाभ है।
  • बड़े मॉडल के लिए, मॉडल छोटे लेबल वाले डेटासेट पर बेहतर प्रदर्शन करता है, और संसाधन-संपन्न डेटासेट पर प्रदर्शन समान होता है जिसमें 100 और 960 घंटे के लेबल वाले डेटा होते हैं। यह इसलिए है क्योंकि प्रदर्शन आमतौर पर संसाधन-संपन्न लेबल वाले डेटासेट पर अधिकांश मॉडलों के लिए संतृप्त हो जाता है।
  • परिणामों से यह भी पता चलता है कि जब मॉडल समृद्ध संदर्भित लक्ष्यों का उपयोग करता है, तो विचारों को सीखना आवश्यक नहीं है।
  • प्रशिक्षण के दौरान संदर्भित लक्ष्यों को सीखने से प्रदर्शन में काफी सुधार होता है।

इसके अलावा, डेटा2वेक के दृष्टिकोण को भाषण मान्यता के लिए मान्य करने के लिए, मॉडल को ऑडियोसेट बेंचमार्क पर प्रशिक्षित किया जाता है। हालांकि ऑडियोसेट के लिए प्री-ट्रेनिंग सेटअप लिब्रिस्पीच के समान है, मॉडल को 200,000 अपडेट पर के = 12 और 94.5 मिनट के बैच आकार के साथ प्रशिक्षित किया जाता है।

मॉडल तब डीप्नॉर्म फ्रेमवर्क और लेयर नॉर्मलाइजेशन को लक्ष्यों पर लागू करता है ताकि प्रशिक्षण को स्थिर करने में मदद मिल सके। इसके अलावा, मॉडल को 21.3 मिनट के बैच आकार पर 13k अपडेट पर संतुलित उपसेट पर फाइन-ट्यून किया जाता है। मॉडल लीनियर सॉफ्टमैक्स पूलिंग और मिक्सअप के साथ 0.7 की संभावना का उपयोग करता है। मॉडल तब 527 अद्वितीय ऑडियो वर्गों में एक एकल रैखिक परियोजना जोड़ता है और परियोजना लर्निंग दर को 2e-4 तक सेट करता है।

इसके अलावा, प्री-ट्रेन्ड पैरामीटर की लर्निंग दर 3e-5 है, और मॉडल फाइन-ट्यूनिंग डेटासेट के लिए मास्किंग तकनीकों का उपयोग करता है। नीचे दी गई तालिका परिणामों को सारांशित करती है, और यह देखा जा सकता है कि डेटा2वेक मॉडल एक ही फाइन-ट्यूनिंग और प्री-ट्रेनिंग डेटा के साथ एक तुलनात्मक सेटअप से बेहतर प्रदर्शन करता है।

प्राकृतिक भाषा प्रसंस्करण

पाठ के लिए डेटा2वेक मॉडल के प्रदर्शन का विश्लेषण करने के लिए, मॉडल को बीईआरटी और अंग्रेजी विकिपीडिया डेटासेट पर 1 मिलियन अपडेट और 256 अनुक्रमों के बैच आकार के साथ प्री-ट्रेन किया जाता है। मॉडल का मूल्यांकन जीएलयूई या सामान्य भाषा समझ मूल्यांकन बेंचमार्क पर किया जाता है, जिसमें प्राकृतिक भाषा अनुमान कार्य (एमएनएलआई या मल्टी जेनर नेचरल लैंग्वेज इन्फरेंस), वाक्य समानता (क्यूक्यूपी या क्वोरा क्वेश्चन पेयर बेंचमार्क, एमआरपीसी या माइक्रोसॉफ्ट रिसर्च पैराग्राफ कॉर्पस, और एसटीएस-बी या सेमेंटिक टेक्स्चुअल समानता बेंचमार्क), भावना विश्लेषण (एसएसटी-2 या स्टैनफोर्ड सेंटिमेंट ट्रीबैंक), और व्याकरण (कोला) शामिल हैं।

इसके अलावा, मॉडल को फाइन-ट्यून करने के लिए, प्रत्येक कार्य के लेबल वाले डेटा प्रदान किए जाते हैं, और मान्यकरण सेट पर औसत सटीकता की रिपोर्ट की जाती है जिसमें 5 फाइन-ट्यूनिंग रन होते हैं। नीचे दी गई तालिका डेटा2वेक मॉडल के प्रदर्शन को प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए सारांशित करती है और इसे अन्य मॉडलों के साथ तुलना करती है।

  • उपरोक्त डेटा से पता चलता है कि डेटा2वेक मॉडल बेसलाइन रोबर्टा मॉडल से बेहतर प्रदर्शन करता है क्योंकि डेटा2वेक मॉडल में यादृच्छिक लक्ष्य नहीं हैं।
  • डेटा2वेक मॉडल पहला सफल प्री-ट्रेन्ड एनएलपी मॉडल है जो विचारों के रूप में प्रशिक्षण लक्ष्यों के रूप में विचारों, शब्दों या उप-शब्दों का उपयोग नहीं करता है। इसके बजाय, डेटा2वेक फ्रेमवर्क पूरे अनमास्क्ड पाठ अनुक्रम पर संदर्भित लेटेंट प्रतिनिधित्व की भविष्यवाणी करता है।
  • यह एक सीखने की कार्य बनाता है जिसमें मॉडल को वर्तमान अनुक्रम से विशिष्ट गुणों वाले लक्ष्यों की भविष्यवाणी करने की आवश्यकता होती है, न कि प्रत्येक पाठ इकाई के लिए सार्वजनिक प्रतिनिधित्व की भविष्यवाणी करने की।
  • इसके अलावा, लक्ष्य सेट तय नहीं है, और मॉडल नई लक्ष्यों को परिभाषित करने और शब्दावली सेटिंग्स के लिए खुला है।

डेटा2वेक: अभिलेशन अध्ययन

अभिलेशन एक शब्द है जो एआई और एमएल सिस्टम में एक घटक को हटाने को संदर्भित करता है। एक अभिलेशन अध्ययन का उपयोग यह जांचने के लिए किया जाता है कि मॉडल के प्रदर्शन पर किसी विशिष्ट घटक को हटाने का क्या प्रभाव पड़ता है, जो शोधकर्ताओं को उस घटक के योगदान को समझने में मदद करता है।

परत-समयित लक्ष्य

डेटा2वेक और अन्य स्व-पर्यवेक्षित लर्निंग मॉडल के बीच एक प्रमुख अंतर यह है कि डेटा2वेक मॉडल शिक्षक नेटवर्क से कई परतों के आधार पर लक्ष्यों का उपयोग करता है। यह विचार यह है कि वेव2वेक 2.0 मॉडल की शीर्ष परतें डाउनस्ट्रीम कार्यों के लिए मध्य परतों की तुलना में अच्छा प्रदर्शन नहीं करती हैं।

निम्नलिखित प्रयोग में, तीनों मॉडलों के प्रदर्शन को मापा जाता है जब के = 1, 2, …, 12 परतों का औसत लिया जाता है, जहां के = 1 केवल शीर्ष परत की भविष्यवाणी करता है। हालांकि, तेजी से पलटने के लिए, डेटा2वेक बेस मॉडल को 12 परतों के साथ प्रशिक्षित किया जाता है। भाषण मान्यता के लिए, मॉडल को लिब्रिस्पीच पर 200,000 अपडेट और 10 घंटे के लेबल वाले विभाजन पर फाइन-ट्यून किया जाता है। प्राकृतिक भाषा प्रसंस्करण के लिए, मॉडल जीएलयूई मूल्यांकन सेट पर औसत स्कोर की रिपोर्ट करता है, और कंप्यूटर विजन के लिए, मॉडल को 300 एपोक्स के लिए प्री-ट्रेन किया जाता है और फिर इमेजनेट डेटासेट पर प्राप्त शीर्ष-1 सटीकता की रिपोर्ट की जाती है।

उपरोक्त आंकड़े से पता चलता है कि कई परतों पर आधारित लक्ष्य आमतौर पर एक ही परत के = 1 का उपयोग करने से बेहतर प्रदर्शन करते हैं। सभी उपलब्ध परतों का उपयोग करना एक अच्छा अभ्यास है क्योंकि न्यूरल नेटवर्क विभिन्न प्रकार की विशेषताओं को विभिन्न परतों पर बनाते हैं जो फीचर परतों के रूप में निकाली जाती हैं।

विभिन्न परतों से विशेषताओं का उपयोग करने से सटीकता में सुधार होता है और स्व-पर्यवेक्षित लर्निंग प्रक्रिया को समृद्ध करता है।

लक्ष्य सुविधा प्रकार

ट्रांसफॉर्मर ब्लॉक में डेटा2वेक मॉडल में कई परतें होती हैं जो सभी लक्ष्य सुविधाओं के रूप में कार्य कर सकती हैं। विभिन्न परतों के प्रभाव का विश्लेषण करने के लिए, मॉडल को लिब्रिस्पीच के भाषण मॉडल पर प्रशिक्षित किया जाता है जो विभिन्न परतों का उपयोग लक्ष्य सुविधाओं के रूप में करता है।

नीचे दिया गया आंकड़ा स्पष्ट रूप से दर्शाता है कि फीड फॉरवर्ड नेटवर्क या एफएफएन का आउटपुट आदर्श रूप से काम करता है, जबकि स्व-ध्यान ब्लॉक के आउटपुट का उपयोग करने से एक उपयोगी मॉडल नहीं मिलता है।

लक्ष्य संदर्भीकरण

डेटा2वेक मॉडल में शिक्षक प्रतिनिधित्व स्व-ध्यान का उपयोग पूरे इनपुट पर संदर्भित लक्ष्य बनाने के लिए करता है। यह डेटा2वेक को अन्य स्व-पर्यवेक्षित लर्निंग मॉडल से अलग करता है जो स्थानीय भागों को पुनरावर्ती या भविष्यवाणी करने के लिए एक सीखने की कार्य बनाते हैं। यह सवाल उठता है: क्या डेटा2वेक मॉडल को अच्छा प्रदर्शन करने के लिए संदर्भित लक्ष्यों की आवश्यकता है?

इस प्रश्न का उत्तर देने के लिए, शोधकर्ताओं ने लक्ष्य प्रतिनिधित्व बनाए जो पूरे इनपुट डेटा तक पहुंच नहीं रखते हैं, लेकिन केवल एक निर्धारित खंड तक। मॉडल तब प्रशिक्षित किया जाता है और फिर पूरे संदर्भ आकार तक पहुंच के साथ फाइन-ट्यून किया जाता है।

नीचे दिया गया आंकड़ा दर्शाता है कि बड़े संदर्भ आकार अक्सर बेहतर प्रदर्शन की ओर ले जाते हैं, और जब पूरा इनपुट नमूना दिखाई देता है, तो यह सबसे अच्छा सटीकता प्रदान करता है। यह आगे साबित करता है कि समृद्ध लक्ष्य प्रतिनिधित्व बेहतर प्रदर्शन की ओर ले जा सकते हैं।

मॉडल-विशिष्ट सुविधा एक्सट्रेक्टर और मास्किंग

डेटा2वेक का प्राथमिक उद्देश्य एक सरल सीखने की प्रक्रिया को डिज़ाइन करना है जो विभिन्न मॉडलों के साथ काम कर सके। यह इसलिए है क्योंकि वर्तमान मॉडल और फ्रेमवर्क एक एकीकृत सीखने के शासन का उपयोग करते हैं, लेकिन वे अभी भी मॉडल-विशिष्ट मास्किंग और सुविधा एक्सट्रेक्टर का उपयोग करते हैं।

यह समझ में आता है कि फ्रेमवर्क मुख्य रूप से एक मॉडल के साथ काम करते हैं क्योंकि इनपुट डेटा की प्रकृति एक दूसरे से बहुत भिन्न होती है। उदाहरण के लिए, भाषण मान्यता मॉडल उच्च-रिज़ॉल्यूशन इनपुट (जैसे 10 kHz वेवफॉर्म) का उपयोग करते हैं जो हज़ारों नमूनों के साथ आते हैं। वेवफॉर्म को फिर एक मल्टी-लेयर कन्वोल्यूशनल न्यूरल नेटवर्क द्वारा संसाधित किया जाता है ताकि 50 Hz प्रतिनिधित्व अनुक्रम प्राप्त किया जा सके।

संरचित और संदर्भित लक्ष्य

डेटा2वेक और अन्य मास्क्ड पूर्वानुमान मॉडल के बीच मुख्य अंतर यह है कि डेटा2वेक मॉडल में प्रशिक्षण लक्ष्य संदर्भित होते हैं। ये लक्ष्य शिक्षक मोड में पूरे मास्क्ड इनपुट पर स्व-ध्यान का उपयोग करके निर्मित किए जाते हैं।

कुछ अन्य फ्रेमवर्क जैसे बायोल (बूटस्ट्रैप योर ओन लेटेंट) या डीआईएनओ भी डेटा2वेक की तरह लेटेंट प्रतिनिधित्व का उपयोग करते हैं, लेकिन उनका प्राथमिक फोकस परिवर्तन-अनुरूप प्रतिनिधित्व सीखने पर है।

अंतिम विचार

एआई और एमएल उद्योग में हाल के कार्यों से पता चलता है कि एकीकृत मॉडल आर्किटेक्चर मल्टीमॉडल को संबोधित करने के लिए एक प्रभावी दृष्टिकोण हो सकता है। डेटा2वेक मॉडल स्व-पर्यवेक्षित लर्निंग दृष्टिकोण का उपयोग करता है जो तीन मॉडलों के साथ काम करता है: भाषण, छवि और पाठ।

डेटा2वेक मॉडल के पीछे का मूल विचार आंशिक दृश्य का उपयोग करके पूर्ण इनपुट डेटा की संदर्भित जानकारी की भविष्यवाणी करना है। डेटा2वेक फ्रेमवर्क के उपयोग से, पाठ समझने को छवि सेगमेंटेशन समस्या पर लागू किया जा सकता है, या यह भाषण मान्यता कार्य में तैनात किया जा सकता है।

डेटा2वेक वास्तव में स्व-पर्यवेक्षित लर्निंग उद्योग में एक मील का पत्थर है क्योंकि यह एक से अधिक मॉडलों में सीखने की एक ही विधि का प्रदर्शन करता है, जो मॉडल को मॉडलों के बीच सीखने को आसान बना सकता है।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।