एआई मॉडल और प्लेटफ़ॉर्म

बड़ी भाषा मॉडल्स को मल्टी-टोकन प्रेडिक्शन के साथ सुपरचार्ज करना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

बड़ी भाषा मॉडल्स (LLMs) जैसे GPT, LLaMA, और अन्य ने अपनी अद्भुत क्षमता के साथ दुनिया को चकित कर दिया है जो मानव-जैसा पाठ समझने और उत्पन्न करने में सक्षम हैं। हालांकि, उनकी प्रभावशाली क्षमताओं के बावजूद, इन मॉडल्स को प्रशिक्षित करने की मानक विधि, जिसे “नेक्स्ट-टोकन प्रेडिक्शन” के रूप में जाना जाता है, कुछ अंतर्निहित सीमाओं के साथ आती है।

नेक्स्ट-टोकन प्रेडिक्शन में, मॉडल को एक अनुक्रम में अगले शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जिसमें पिछले शब्द दिए जाते हैं। जबकि यह दृष्टिकोण सफल सिद्ध हुआ है, यह मॉडल्स को लंबी दूरी की निर्भरताओं और जटिल तर्क कार्यों के साथ संघर्ष करने वाले मॉडल्स का उत्पादन कर सकता है। इसके अलावा, शिक्षक-बल प्रशिक्षण शासन और अनुमान के दौरान स्व-उत्पादक पीढ़ी प्रक्रिया के बीच असंगति उपोत्पादक प्रदर्शन का परिणाम हो सकती है।

मेटा एआई से ग्लॉकले एट अल। (2024) द्वारा एक हालिया शोध पत्र “मल्टी-टोकन प्रेडिक्शन” नामक एक नए प्रशिक्षण दृष्टिकोण की शुरुआत करता है जो इन सीमाओं को संबोधित करने और बड़ी भाषा मॉडल्स को सुपरचार्ज करने का लक्ष्य रखता है। इस ब्लॉग पोस्ट में, हम इस नए शोध के मूल概念ों, तकनीकी विवरण, और संभावित परिणामों में गहराई से जाएंगे।

सिंगल-टोकन प्रेडिक्शन: पारंपरिक दृष्टिकोण

मल्टी-टोकन प्रेडिक्शन के विवरण में जाने से पहले, यह समझना आवश्यक है कि बड़ी भाषा मॉडल प्रशिक्षण के लिए वर्षों से पारंपरिक दृष्टिकोण क्या रहा है – सिंगल-टोकन प्रेडिक्शन, जिसे नेक्स्ट-टोकन प्रेडिक्शन के रूप में भी जाना जाता है।

नेक्स्ट-टोकन प्रेडिक्शन दृष्टिकोण

नेक्स्ट-टोकन प्रेडिक्शन दृष्टिकोण में, भाषा मॉडल्स को एक अनुक्रम में अगले शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जिसमें पिछला संदर्भ दिया जाता है। अधिक औपचारिक रूप से, मॉडल को अगले टोकन xt+1 की संभावना को अधिकतम करने के लिए कार्य किया जाता है, जो पिछले टोकन x1, x2, …, xt पर निर्भर करता है। यह आमतौर पर क्रॉस-एंट्रोपी हानि को कम करके किया जाता है:

L = -Σt log P(xt+1 | x1, x2, …, xt)

यह सरल लेकिन शक्तिशाली प्रशिक्षण उद्देश्य कई सफल बड़ी भाषा मॉडल्स के लिए आधार रहा है, जैसे कि GPT (Radford et al., 2018), BERT (Devlin et al., 2019), और उनके विविधताएं।

शिक्षक-बल और स्व-उत्पादक पीढ़ी

नेक्स्ट-टोकन प्रेडिक्शन शिक्षक-बल नामक एक प्रशिक्षण तकनीक पर निर्भर करता है, जहां मॉडल को प्रशिक्षण के दौरान प्रत्येक भविष्य के टोकन के लिए आधार सत्य प्रदान किया जाता है। यह मॉडल को सही संदर्भ और लक्ष्य अनुक्रमों से सीखने में मदद करता है, जो अधिक स्थिर और कुशल प्रशिक्षण की अनुमति देता है।

हालांकि, अनुमान या पीढ़ी के दौरान, मॉडल स्व-उत्पादक तरीके से काम करता है, जो पिछले उत्पन्न टोकन के आधार पर एक-एक टोकन की भविष्यवाणी करता है। शिक्षक-बल प्रशिक्षण शासन और स्व-उत्पादक पीढ़ी प्रक्रिया के बीच यह असंगति उपोत्पादक प्रदर्शन का कारण बन सकती है, विशेष रूप से लंबी अनुक्रमों या जटिल तर्क कार्यों के लिए।

नेक्स्ट-टोकन प्रेडिक्शन की सीमाएं

नेक्स्ट-टोकन प्रेडिक्शन ने आश्चर्यजनक रूप से सफल रहा है, लेकिन इसमें कुछ अंतर्निहित सीमाएं भी हैं:

  1. लघु-कालिक फोकस: केवल अगले टोकन की भविष्यवाणी करके, मॉडल लंबी दूरी की निर्भरताओं और पाठ की समग्र संरचना और सुसंगतता को पकड़ने में संघर्ष कर सकता है, जो असंगत या असुसंगत उत्पन्न करने का कारण बन सकता है।
  2. स्थानीय पैटर्न लैचिंग: नेक्स्ट-टोकन प्रेडिक्शन मॉडल्स प्रशिक्षण डेटा में स्थानीय पैटर्न पर लैच कर सकते हैं, जो उन्हें बाहरी वितरण परिदृश्यों या अधिक अमूर्त तर्क कार्यों के लिए सामान्यीकरण करना मुश्किल बना सकता है।
  3. तर्क क्षमताएं: जटिल तर्क, एल्गोरिदमिक सोच, या तार्किक संचालन जैसे कार्यों के लिए, नेक्स्ट-टोकन प्रेडिक्शन पर्याप्त प्रेरक पूर्वाग्रह या प्रतिनिधित्व प्रदान नहीं कर सकता है।
  4. नमूना अकुशलता: नेक्स्ट-टोकन प्रेडिक्शन की स्थानीय प्रकृति के कारण, मॉडल्स को आवश्यक ज्ञान और तर्क कौशल प्राप्त करने के लिए बड़े प्रशिक्षण डेटासेट की आवश्यकता हो सकती है, जो नमूना अकुशलता का कारण बन सकती है।

इन सीमाओं ने शोधकर्ताओं को वैकल्पिक प्रशिक्षण दृष्टिकोणों की खोज करने के लिए प्रेरित किया है, जैसे कि मल्टी-टोकन प्रेडिक्शन, जो इन कमियों को संबोधित करने और बड़ी भाषा मॉडल्स के लिए नए क्षमताएं अनलॉक करने का लक्ष्य रखता है।

नेक्स्ट-टोकन प्रेडिक्शन दृष्टिकोण की तुलना में मल्टी-टोकन प्रेडिक्शन तकनीक की तुलना करके, पाठक इस नए शोध के प्रेरणा और संभावित लाभों को बेहतर ढंग से समझ सकते हैं।

मल्टी-टोकन प्रेडिक्शन क्या है?

मल्टी-टोकन प्रेडिक्शन का मुख्य विचार भाषा मॉडल्स को एक ही समय में कई भविष्य के टोकन की भविष्यवाणी करने के लिए प्रशिक्षित करना है, न कि केवल अगले टोकन की। विशेष रूप से, प्रशिक्षण के दौरान, मॉडल को प्रत्येक स्थिति में अगले n टोकन की भविष्यवाणी करने के लिए कार्य किया जाता है, जो एक साझा मॉडल ट्रंक के शीर्ष पर n स्वतंत्र आउटपुट हेड्स का उपयोग करता है।

उदाहरण के लिए, 4-टोकन प्रेडिक्शन सेटअप के साथ, मॉडल को एक ही समय में अगले 4 टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाएगा, जो पिछले संदर्भ के आधार पर दिया जाता है। यह दृष्टिकोण मॉडल को लंबी दूरी की निर्भरताओं और पाठ की समग्र संरचना और सुसंगतता को पकड़ने के लिए प्रोत्साहित करता है।

एक टॉय उदाहरण

मल्टी-टोकन प्रेडिक्शन की अवधारणा को बेहतर ढंग से समझने के लिए, आइए एक सरल उदाहरण पर विचार करें:

“तेज़ भूरा लोमड़ी ऊपर उदास कुत्ते पर कूदता है।”

मानक नेक्स्ट-टोकन प्रेडिक्शन दृष्टिकोण में, मॉडल को अगले शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जो पिछले संदर्भ के आधार पर दिया जाता है। उदाहरण के लिए, संदर्भ “तेज़ भूरा लोमड़ी ऊपर उदास कुत्ते पर” के साथ, मॉडल को अगले शब्द “कूदता” की भविष्यवाणी करने के लिए कार्य किया जाता है।

मल्टी-टोकन प्रेडिक्शन के साथ, हालांकि, मॉडल को एक ही समय में कई भविष्य के शब्दों की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है। उदाहरण के लिए, यदि हम n=4 सेट करते हैं, तो मॉडल को एक ही समय में अगले 4 शब्दों की भविष्यवाणी करने के लिए प्रशिक्षित किया जाएगा। संदर्भ “तेज़ भूरा लोमड़ी ऊपर उदास कुत्ते पर” के साथ, मॉडल को शब्दों की अनुक्रम “कूदता है” की भविष्यवाणी करने के लिए कार्य किया जाता है।

मॉडल को एक ही समय में कई भविष्य के टोकन की भविष्यवाणी करने के लिए प्रशिक्षित करके, यह पाठ की समग्र संरचना और सुसंगतता को पकड़ने के लिए प्रोत्साहित करता है।

तकनीकी विवरण

लेखक मल्टी-टोकन प्रेडिक्शन के लिए एक सरल लेकिन प्रभावी आर्किटेक्चर का प्रस्ताव करते हैं। मॉडल में एक साझा ट्रांसफॉर्मर ट्रंक होता है जो इनपुट संदर्भ का एक लैटेंट प्रतिनिधित्व उत्पन्न करता है, जिसके बाद n स्वतंत्र ट्रांसफॉर्मर लेयर (आउटपुट हेड्स) होते हैं जो संबंधित भविष्य टोकन की भविष्यवाणी करते हैं।

प्रशिक्षण के दौरान, फॉरवर्ड और बैकवर्ड पास को सावधानीपूर्वक निर्देशित किया जाता है ताकि जीपीयू मेमोरी फुटप्रिंट को कम किया जा सके। साझा ट्रंक लैटेंट प्रतिनिधित्व की गणना करता है, और फिर प्रत्येक आउटपुट हेड क्रमिक रूप से अपना फॉरवर्ड और बैकवर्ड पास करता है, ट्रंक स्तर पर ग्रेडिएंट्स को एकत्र करता है। यह दृष्टिकोण सभी लॉगिट वेक्टर और उनके ग्रेडिएंट्स को एक ही समय में मैटेरियलाइज़ करने से बचता है, जिससे पीक जीपीयू मेमोरी उपयोग O(nV + d) से O(V + d) तक कम हो जाता है, जहां V वोकेबुलरी आकार है और d लैटेंट प्रतिनिधित्व का आयाम है।

मेमोरी-कुशल कार्यान्वयन

मल्टी-टोकन प्रेडिक्टर्स को प्रशिक्षित करने में एक चुनौती उनकी जीपीयू मेमोरी उपयोग को कम करना है। चूंकि वोकेबुलरी आकार (V) आमतौर पर लैटेंट प्रतिनिधित्व (d) के आयाम से बहुत बड़ा होता है, लॉगिट वेक्टर जीपीयू मेमोरी उपयोग की बोतलनेक बन जाते हैं।

इस चुनौती का समाधान करने के लिए, लेखक एक मेमोरी-कुशल कार्यान्वयन का प्रस्ताव करते हैं जो फॉरवर्ड और बैकवर्ड ऑपरेशन के क्रम को सावधानीपूर्वक अनुकूलित करता है। सभी लॉगिट्स और उनके ग्रेडिएंट्स को एक ही समय में मैटेरियलाइज़ करने के बजाय, कार्यान्वयन प्रत्येक स्वतंत्र आउटपुट हेड के लिए फॉरवर्ड और बैकवर्ड पास को क्रमिक रूप से करता है, ट्रंक स्तर पर ग्रेडिएंट्स को एकत्र करता है।

यह दृष्टिकोण सभी लॉगिट वेक्टर और उनके ग्रेडिएंट्स को एक ही समय में मेमोरी में स्टोर करने से बचता है, जिससे पीक जीपीयू मेमोरी उपयोग O(nV + d) से O(V + d) तक कम हो जाता है, जहां n भविष्य टोकन की संख्या है जो एक ही समय में भविष्यवाणी की जा रही है।

मल्टी-टोकन प्रेडिक्शन के लाभ

शोध पत्र मल्टी-टोकन प्रेडिक्शन के कई आकर्षक लाभ प्रस्तुत करता है:

  1. सुधारित नमूना कुशलता: मॉडल को एक ही समय में कई भविष्य टोकन की भविष्यवाणी करने के लिए प्रशिक्षित करके, मल्टी-टोकन प्रेडिक्शन मॉडल को बेहतर नमूना कुशलता की ओर ले जाता है। लेखक कोड समझने और उत्पन्न करने के कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार प्रदर्शित करते हैं, जिसमें 13B पैरामीटर वाले मॉडल औसतन 15% अधिक समस्याओं का समाधान करते हैं।
  2. तेज़ अनुमान: मल्टी-टोकन प्रेडिक्शन के साथ प्रशिक्षित अतिरिक्त आउटपुट हेड्स का उपयोग स्व-विचारशील डिकोडिंग के लिए किया जा सकता है, जो एक प्रकार की डिकोडिंग है जो समानांतर टोकन प्रेडिक्शन की अनुमति देती है। यह विभिन्न बैच आकारों पर अनुमान के समय में 3 गुना तक की वृद्धि का परिणाम हो सकता है, यहां तक कि बड़े मॉडल्स के लिए भी।
  3. लंबी दूरी की निर्भरता को बढ़ावा देना: मल्टी-टोकन प्रेडिक्शन मॉडल को लंबी दूरी की निर्भरताओं और पैटर्न को पकड़ने के लिए प्रोत्साहित करता है, जो उन कार्यों के लिए विशेष रूप से लाभकारी है जिन्हें बड़े संदर्भों पर समझ और तर्क की आवश्यकता होती है।
  4. एल्गोरिदमिक तर्क: लेखक सिंथेटिक कार्यों पर प्रयोग प्रस्तुत करते हैं जो मल्टी-टोकन प्रेडिक्शन मॉडल्स की एल्गोरिदमिक तर्क क्षमताओं के विकास में श्रेष्ठता प्रदर्शित करते हैं, विशेष रूप से छोटे मॉडल आकार के लिए।
  5. सुसंगतता और स्थिरता: मॉडल को एक ही समय में कई भविष्य टोकन की भविष्यवाणी करने के लिए प्रशिक्षित करके, मल्टी-टोकन प्रेडिक्शन सुसंगत और स्थिर प्रतिनिधित्वों के विकास को प्रोत्साहित करता है। यह उन कार्यों के लिए विशेष रूप से लाभकारी है जिन्हें लंबे और अधिक सुसंगत पाठ उत्पन्न करने की आवश्यकता होती है, जैसे कि कहानी सुनाना, रचनात्मक लेखन, या निर्देशात्मक मैनुअल उत्पन्न करना।
  6. सुधारित सामान्यीकरण: लेखक के प्रयोग सुझाव देते हैं कि मल्टी-टोकन प्रेडिक्शन मॉडल्स में बेहतर सामान्यीकरण क्षमताएं होती हैं, विशेष रूप से बाहरी वितरण परिदृश्यों में। यह मॉडल की क्षमता के कारण हो सकता है जो लंबी दूरी की पैटर्न और निर्भरताओं को पकड़ता है, जो इसे अनदेखे परिदृश्यों में अधिक प्रभावी ढंग से अनुमान लगाने में मदद कर सकता है।

उदाहरण और अंतर्दृष्टि

मल्टी-टोकन प्रेडिक्शन के काम करने के तरीके को बेहतर ढंग से समझने के लिए, आइए कुछ उदाहरणों पर विचार करें:

  1. कोड जेनरेशन: कोड जेनरेशन के संदर्भ में, एक ही समय में कई टोकन की भविष्यवाणी करना मॉडल को अधिक जटिल कोड संरचनाओं को समझने और उत्पन्न करने में मदद कर सकता है। उदाहरण के लिए, जब एक फंक्शन परिभाषा उत्पन्न की जा रही हो, तो केवल अगले टोकन की भविष्यवाणी करना फंक्शन सिग्नेचर को सही ढंग से उत्पन्न करने के लिए पर्याप्त संदर्भ प्रदान नहीं कर सकता है। हालांकि, एक ही समय में कई टोकन की भविष्यवाणी करने से, मॉडल फंक्शन नाम, पैरामीटर, और रिटर्न प्रकार के बीच निर्भरताओं को बेहतर ढंग से पकड़ सकता है, जिससे अधिक सटीक और सुसंगत कोड जेनरेशन हो सकता है।
  2. प्राकृतिक भाषा तर्क: एक ऐसे परिदृश्य पर विचार करें जहां एक भाषा मॉडल को एक प्रश्न का उत्तर देने के लिए कई चरणों या जानकारी के टुकड़ों पर तर्क करने की आवश्यकता होती है। एक ही समय में कई टोकन की भविष्यवाणी करने से, मॉडल तर्क प्रक्रिया के विभिन्न घटकों के बीच निर्भरताओं को बेहतर ढंग से पकड़ सकता है, जिससे अधिक सुसंगत और सटीक उत्तर मिल सकते हैं।
  3. लंबी पाठ जेनरेशन: लंबी पाठ जेनरेशन के लिए, जैसे कि कहानियां, लेख, या निर्देशात्मक मैनुअल, सुसंगतता और स्थिरता बनाए रखना नेक्स्ट-टोकन प्रेडिक्शन द्वारा प्रशिक्षित मॉडल्स के लिए चुनौतीपूर्ण हो सकता है। मल्टी-टोकन प्रेडिक्शन मॉडल को पाठ की समग्र संरचना और प्रवाह को पकड़ने के लिए प्रोत्साहित करता है, जिससे अधिक सुसंगत और स्थिर लंबी पाठ जेनरेशन हो सकती है।

सीमाएं और भविष्य के दिशानिर्देश

जबकि पत्र में प्रस्तुत परिणाम प्रभावशाली हैं, कुछ सीमाएं और खुले प्रश्न हैं जिन्हें आगे की जांच की आवश्यकता है:

  1. आदर्श टोकन संख्या: पत्र विभिन्न मानों की खोज करता है और पाता है कि n=4 कई कार्यों के लिए अच्छा काम करता है। हालांकि, आदर्श मान निर्भर कर सकता है कार्य, डेटासेट, और मॉडल आकार पर। आदर्श n के निर्धारण के लिए सिद्धांतकारी तरीके विकसित करना आगे के प्रदर्शन में सुधार का मार्ग हो सकता है।
  2. वोकेबुलरी आकार और टोकनीकरण: लेखकों का उल्लेख है कि मल्टी-टोकन प्रेडिक्शन मॉडल्स के लिए वोकेबुलरी आकार और टोकनीकरण रणनीति नेक्स्ट-टोकन प्रेडिक्शन मॉडल्स के लिए उपयोग किए जाने वालों से भिन्न हो सकते हैं। इस पहलू की खोज से बेहतर व्यापार बंद हो सकता है जो संकुचित अनुक्रम लंबाई और गणनात्मक दक्षता के बीच हो।
  3. सहायक भविष्यवाणी हानि: लेखक सुझाव देते हैं कि उनका काम बड़ी भाषा मॉडल्स के लिए नए सहायक भविष्यवाणी हानि के विकास में रुचि को बढ़ावा दे सकता है, नेक्स्ट-टोकन प्रेडिक्शन के अलावा। विभिन्न सहायक हानियों और मल्टी-टोकन प्रेडिक्शन के संयोजन की जांच करना एक रोमांचक शोध दिशा है।
  4. सिद्धांतकारी समझ: जबकि पत्र कुछ अंतर्दृष्टि और अनुभवजन्य प्रमाण प्रदान करता है कि मल्टी-टोकन प्रेडिक्शन इतना अच्छा क्यों काम करता है, इस दृष्टिकोण के पीछे की सिद्धांतकारी समझ का गहरा विश्लेषण मूल्यवान होगा।

निष्कर्ष

ग्लॉकले एट अल। द्वारा “बेहतर और तेज़ बड़ी भाषा मॉडल्स के माध्यम से मल्टी-टोकन प्रेडिक्शन” शोध पत्र एक नए प्रशिक्षण दृष्टिकोण की शुरुआत करता है जो बड़ी भाषा मॉडल्स के प्रदर्शन और क्षमताओं में महत्वपूर्ण सुधार करने की क्षमता रखता है। मॉडल्स को एक ही समय में कई भविष्य टोकन की भविष्यवाणी करने के लिए प्रशिक्षित करके, मल्टी-टोकन प्रेडिक्शन लंबी दूरी की निर्भरताओं, एल्गोरिदमिक तर्क क्षमताओं, और बेहतर नमूना कुशलता को बढ़ावा देता है।

लेखकों द्वारा प्रस्तावित तकनीकी कार्यान्वयन सरल और गणनात्मक रूप से कुशल है, जो इस दृष्टिकोण को बड़े पैमाने पर भाषा मॉडल प्रशिक्षण में लागू करने के लिए व्यावहारिक बनाता है। इसके अलावा, स्व-विचारशील डिकोडिंग के लिए अतिरिक्त आउटपुट हेड्स का उपयोग तेज़ अनुमान के समय का एक महत्वपूर्ण व्यावहारिक लाभ है।

हालांकि अभी भी खुले प्रश्न और अन्वेषण के क्षेत्र हैं, यह शोध बड़ी भाषा मॉडल्स के क्षेत्र में एक रोमांचक कदम है। जब बड़ी भाषा मॉडल्स की मांग बढ़ रही है, मल्टी-टोकन प्रेडिक्शन इन शक्तिशाली एआई सिस्टम्स की अगली पीढ़ी में एक महत्वपूर्ण घटक बन सकता है।

मैं पिछले पांच वर्षों से मशीन लर्निंग और डीप लर्निंग की दुनिया में खुद को डूबो रहा हूं। मेरा जुनून और विशेषज्ञता ने मुझे 50 से अधिक विविध सॉफ्टवेयर इंजीनियरिंग परियोजनाओं में योगदान देने के लिए प्रेरित किया है, जिनमें से अधिकांश में एआई/एमएल पर विशेष ध्यान केंद्रित किया गया है। मेरी जारी जिज्ञासा ने मुझे प्राकृतिक भाषा प्रसंस्करण की ओर आकर्षित किया है, जिस क्षेत्र को मैं आगे अन्वेषण करने के लिए उत्सुक हूं।