Anderson का एंगल

एक एकल प्रश्न के लिए जीपीटी-शैली की भाषा मॉडल बनाना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

चीन के शोधकर्ताओं ने जीपीटी-3 शैली की प्राकृतिक भाषा प्रसंस्करण प्रणाली बनाने के लिए एक आर्थिक तरीका विकसित किया है, जिसमें समय और पैसे की बढ़ती लागत को कम किया जा सके, जो उच्च-वॉल्यूम डेटासेट को प्रशिक्षित करने में शामिल होता है – एक बढ़ती प्रवृत्ति जो अन्यथा इस क्षेत्र को एआई को फांग खिलाड़ियों और उच्च-स्तरीय निवेशकों के लिए सीमित कर देगी।

प्रस्तावित फ्रेमवर्क को टास्क-ड्रिवन भाषा मॉडलिंग (टीएलएम) कहा जाता है। इसके बजाय एक विशाल और जटिल मॉडल को एक विशाल निगम पर प्रशिक्षित करने के बजाय, टीएलएम एक बहुत छोटा मॉडल प्रशिक्षित करता है जो वास्तव में मॉडल के अंदर एक प्रश्न को शामिल करता है।

बाएं, उच्च-वॉल्यूम भाषा मॉडल के लिए एक पारंपरिक हाइपरस्केल दृष्टिकोण; दाएं, टीएलएम का स्लिमलाइन तरीका एक विशाल भाषा निगम का अन्वेषण करने के लिए प्रति-विषय या प्रति-प्रश्न आधार पर। स्रोत: https://arxiv.org/pdf/2111.04130.pdf

बाएं, उच्च-वॉल्यूम भाषा मॉडल के लिए एक पारंपरिक हाइपरस्केल दृष्टिकोण; दाएं, टीएलएम का स्लिमलाइन तरीका एक विशाल भाषा निगम का अन्वेषण करने के लिए प्रति-विषय या प्रति-प्रश्न आधार पर। स्रोत: https://arxiv.org/pdf/2111.04130.pdf

प्रभावी रूप से, एक अद्वितीय एनएलपी एल्गोरिदम या मॉडल एक एकल प्रश्न का उत्तर देने के लिए उत्पादित किया जाता है, एक विशाल और अव्यावहारिक सामान्य भाषा मॉडल बनाने के बजाय जो विभिन्न प्रश्नों का उत्तर दे सकता है।

टीएलएम का परीक्षण करते समय, शोधकर्ताओं ने पाया कि नई दृष्टिकोण प्रीट्रेन्ड लैंग्वेज मॉडल्स जैसे रॉबर्टा-लार्ज और हाइपरस्केल एनएलपी सिस्टम जैसे ओपनएआई के जीपीटी-3, गूगल के ट्रिलियन पैरामीटर स्विच ट्रांसफॉर्मर मॉडल, कोरिया के हाइपरक्लोवर, एआई21 लैब्स के जुरासिक 1, और माइक्रोसॉफ्ट के मेगाट्रॉन-ट्यूरिंग एनएलजी 530बी के समान या बेहतर परिणाम प्राप्त करता है।

आठ वर्गीकरण डेटासेट पर चार डोमेन में टीएलएम के परीक्षण में, लेखकों ने यह भी पाया कि प्रणाली प्रशिक्षण फ्लॉप्स (फ्लोटिंग पॉइंट ऑपरेशन प्रति सेकंड) को दो क्रमों से कम कर देती है। शोधकर्ताओं को उम्मीद है कि टीएलएम एक क्षेत्र को ‘लोकतांत्रिक’ बना सकता है जो बढ़ती जटिलता के कारण एलिट बन रहा है, जहां एनएलपी मॉडल इतने बड़े हो गए हैं कि वे वास्तव में स्थानीय रूप से स्थापित नहीं किए जा सकते हैं, और इसके बजाय ओपनएआई और माइक्रोसॉफ्ट एज्योर के महंगे और सीमित-एक्सेस एपीआई के पीछे बैठे हैं।

लेखकों का कहना है कि प्रशिक्षण समय को दो क्रमों से कम करने से प्रशिक्षण लागत 1,000 जीपीयू पर एक दिन के लिए 8 जीपीयू पर 48 घंटे तक कम हो जाती है।

新しい रिपोर्ट का शीर्षक बिना बड़े पैमाने पर प्रीट्रेनिंग के एनएलपी: एक सरल और कुशल फ्रेमवर्क है, और त्सिंगहुआ विश्वविद्यालय के तीन शोधकर्ताओं और चीन स्थित एआई विकास कंपनी रिकरेंट एआई इंक के एक शोधकर्ता से आया है।

अन्यायपूर्ण उत्तर

सामान्य भाषा मॉडल को प्रशिक्षित करने की लागत बढ़ती जा रही है और यह एक संभावित ‘थर्मल सीमा’ के रूप में देखा जा रहा है जिसके कारण एनएलपी वास्तव में संस्कृति में फैल सकता है।

एनएलपी मॉडल आर्किटेक्चर में पहलुओं की वृद्धि पर आंकड़े, ए121 लैब्स की 2020 की रिपोर्ट से। स्रोत: https://arxiv.org/pdf/2004.08900.pdf

एनएलपी मॉडल आर्किटेक्चर में पहलुओं की वृद्धि पर आंकड़े, ए121 लैब्स की 2020 की रिपोर्ट से। स्रोत: https://arxiv.org/pdf/2004.08900.pdf

2019 में एक शोधकर्ता गणना की गई कि एक्सएलनेट मॉडल (जो उस समय बERT को पार करने के लिए रिपोर्ट किया गया था) को 2.5 दिनों में 64 डिवाइसों पर 512 कोर पर प्रशिक्षित करने में 61,440 अमेरिकी डॉलर की लागत आती है, जबकि जीपीटी-3 को प्रशिक्षित करने में 12 मिलियन की लागत आई – इसके पूर्ववर्ती जीपीटी-2 की तुलना में 200 गुना अधिक महंगा।

प्रश्न की आवश्यकताओं के आधार पर डेटा के उपसेट

इसके बजाय, नई प्रस्तावित वास्तुकला सटीक वर्गीकरण, लेबल और सामान्यीकरण प्राप्त करने के लिए एक प्रश्न का उपयोग एक फिल्टर के रूप में करती है जो एक बड़े भाषा डेटाबेस से एक उपसेट को परिभाषित करता है जो प्रशिक्षित किया जाएगा, साथ ही प्रश्न के साथ, सीमित विषय पर उत्तर प्रदान करने के लिए।

‘टीएलएम को दो मुख्य विचारों से प्रेरित किया जाता है। पहला, मानव एक कार्य को सिर्फ दुनिया के ज्ञान के एक छोटे से हिस्से का उपयोग करके मास्टर करते हैं (उदाहरण के लिए, छात्रों को परीक्षा के लिए तैयारी करने के लिए दुनिया भर की सभी पुस्तकों में से कुछ अध्यायों की समीक्षा करने की आवश्यकता होती है)। ‘

‘हम यह अनुमान लगाते हैं कि एक विशिष्ट कार्य के लिए बड़े निगम में बहुत अधिक अतिरिक्तता है। दूसरा, पर्यवेक्षित लेबल वाले डेटा पर प्रशिक्षण करना डाउनस्ट्रीम प्रदर्शन के लिए अधिक डेटा-कुशल होता है अनलेबल्ड डेटा पर भाषा मॉडलिंग उद्देश्य को अनुकूलित करने की तुलना में। टीएलएम कार्य डेटा का उपयोग सामान्य निगम से एक छोटे से उपसेट को पुनर्प्राप्त करने के लिए करता है। इसके बाद दोनों पुनर्प्राप्त डेटा और कार्य डेटा का उपयोग करके एक पर्यवेक्षित कार्य उद्देश्य और एक भाषा मॉडलिंग उद्देश्य को संयुक्त रूप से अनुकूलित किया जाता है।’

इसके अलावा, टीएलएम का उपयोग करके अत्यधिक प्रभावी एनएलपी मॉडल प्रशिक्षण को सस्ता बनाने के अलावा, लेखक टास्क-ड्रिवन एनएलपी मॉडल का उपयोग करने के कई फायदे देखते हैं। एक के लिए, शोधकर्ता क्रमिक लंबाई, टोकनाइजेशन, हाइपरपैरामीटर ट्यूनिंग और डेटा प्रतिनिधित्व के लिए अधिक लचीलापन का आनंद ले सकते हैं।

परीक्षण और परिणाम

टीएलएम को चार डोमेन – जैव चिकित्सा विज्ञान, समाचार, समीक्षा और कंप्यूटर विज्ञान में आठ कार्यों पर परीक्षण किया गया था। कार्यों को उच्च-संसाधन और निम्न-संसाधन श्रेणियों में विभाजित किया गया था। उच्च-संसाधन कार्यों में 5,000 से अधिक कार्य डेटा शामिल थे, जैसे एजीन्यूज और आरसीटी, अन्य लोगों के बीच; निम्न-संसाधन कार्यों में केमप्रोट और एसीएल-एआरसी, साथ ही हाइपरपार्टिसन न्यूज डिटेक्शन डेटासेट शामिल थे।

शोधकर्ताओं ने दो प्रशिक्षण सेट विकसित किए जिन्हें कॉर्पस-बर्ट और कॉर्पस-रोबेर्टा कहा जाता है, जो बाद वाला पहले की तुलना में दस गुना बड़ा था। प्रयोगों ने सामान्य प्रीट्रेन्ड लैंग्वेज मॉडल बर्ट (गूगल से) और रॉबर्टा (फेसबुक से) की तुलना नई वास्तुकला से की।

लेख में यह观察 किया गया है कि हालांकि टीएलएम एक सामान्य तरीका है, और इसकी सीमा और अनुप्रयोग की संभावना अधिक व्यापक और उच्च-वॉल्यूम राज्य-ऑफ-द-आर्ट मॉडल की तुलना में सीमित होनी चाहिए, यह डोमेन-आधारित फाइन-ट्यूनिंग तरीकों के करीब प्रदर्शन करने में सक्षम है।

‘टीएलएम उच्च सटीकता और पीएलएम की तुलना में बहुत अधिक कुशलता के साथ परिणाम प्राप्त करने में सक्षम है। इसके अलावा, टीएलएम बड़े पैमाने पर अधिक लाभ प्राप्त करता है। यह दर्शाता है कि बड़े पैमाने पर पीएलएम को एक विशिष्ट कार्य के लिए उपयोगी नहीं होने वाले अधिक सामान्य ज्ञान को संग्रहीत करने के लिए प्रशिक्षित किया जा सकता है।’

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai