एआई मॉडल और प्लेटफ़ॉर्म

लॉन्गराइटर: 10,000+ शब्दों का जेनरेशन लॉन्ग कॉन्टेक्स्ट एलएलएम्स से

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
LONGWRITER: UNLEASHING 10,000+ WORD GENERATION FROM LONG CONTEXT LLMS

वर्तमान लॉन्ग-कॉन्टेक्स्ट बड़े भाषा मॉडल (एलएलएम) 100,000 टोकन तक के इनपुट को प्रोसेस कर सकते हैं, लेकिन वे 2,000 शब्दों से अधिक के आउटपुट का उत्पादन करने में संघर्ष करते हैं। नियंत्रित प्रयोगों से पता चलता है कि मॉडल की प्रभावी जेनरेशन लंबाई निर्देशित फाइन-ट्यूनिंग (एसएफटी) के दौरान देखे गए उदाहरणों द्वारा आंतरिक रूप से सीमित है। अन्य शब्दों में, यह आउटपुट सीमा मौजूदा एसएफटी डेटासेट में लंबे आउटपुट उदाहरणों की कमी से उत्पन्न होती है।

लंबे समय से चल रहे एलएलएम में हाल की प्रगति ने बड़े पैमाने पर मेमोरी क्षमता वाले मॉडलों के विकास को जन्म दिया है, जो 100,000 टोकन से अधिक के इतिहास को संसाधित करने में सक्षम हैं। हालांकि, विस्तृत इनपुट को संभालने की उनकी क्षमता के बावजूद, वर्तमान लंबे समय से चल रहे एलएलएम समान रूप से लंबे आउटपुट का उत्पादन करने में संघर्ष करते हैं।

इस सीमा का पता लगाने के लिए, लॉन्गराइटर राज्य-ऑफ-द-आर्ट लंबे समय से चल रहे मॉडलों की अधिकतम आउटपुट लंबाई की जांच करता है, जो विभिन्न प्रश्नों के साथ जो विभिन्न प्रतिक्रिया लंबाई की आवश्यकता होती है, जैसे कि “रोमन साम्राज्य के इतिहास पर 10,000 शब्दों का लेख लिखें।” परिणामों से पता चलता है कि सभी मॉडल लगातार 2,000 शब्दों से अधिक के आउटपुट का उत्पादन करने में विफल रहते हैं। इसके अलावा, उपयोगकर्ता इंटरैक्शन लॉग का विश्लेषण यह दर्शाता है कि 1% से अधिक उपयोगकर्ता प्रोम्प्ट्स विशेष रूप से इस सीमा से अधिक के आउटपुट का अनुरोध करते हैं, जो वर्तमान शोध में इस मुद्दे को संबोधित करने की तत्काल आवश्यकता को उजागर करता है।

इस सीमा को दूर करने के लिए, लॉन्गराइटर एजेंट्राइट की शुरुआत करता है, एक एजेंट-आधारित पाइपलाइन जो ऑफ-द-शेल्फ एलएलएम का उपयोग करके स्वचालित रूप से विस्तारित, सुसंगत आउटपुट का निर्माण करती है। एजेंट्राइट दो चरणों में काम करता है: पहले, यह एक विस्तृत लेखन योजना तैयार करता है जिसमें प्रत्येक अनुच्छेद के लिए संरचना और लक्ष्य शब्द गणना शामिल होती है, जो उपयोगकर्ता के इनपुट पर आधारित होती है। फिर, इस योजना का पालन करते हुए, यह मॉडल को प्रत्येक अनुच्छेद के लिए सामग्री का उत्पादन करने के लिए प्रेरित करता है, जो कि एक क्रमिक तरीके से होता है। लॉन्गराइटर के प्रयोगों से पता चलता है कि एजेंट्राइट 20,000 शब्दों तक के उच्च गुणवत्ता और सुसंगत आउटपुट का उत्पादन कर सकता है।

एजेंट्राइट पाइपलाइन पर निर्माण करके, लॉन्गराइटर जीपीटी-4ओ का उपयोग करके 6,000 लंबे आउटपुट एसएफटी डेटा का उत्पादन करता है, जिसे लॉन्गराइटर-6के नाम दिया जाता है, और मौजूदा मॉडलों को प्रशिक्षित करने के लिए इस डेटा को जोड़ता है। उल्लेखनीय रूप से, लॉन्गराइटर-6के सफलतापूर्वक मॉडल की क्षमता को 10,000 शब्दों से अधिक के अच्छी तरह से संरचित आउटपुट का उत्पादन करने के लिए अनलॉक करता है। इस दृष्टिकोण की प्रभावशीलता का मूल्यांकन करने के लिए, लॉन्गराइटर लॉन्गबेंच-राइट बेंचमार्क विकसित करता है, जिसमें विभिन्न उपयोगकर्ता लेखन निर्देश शामिल हैं, जिनमें आउटपुट लंबाई विशिष्टता 0-500 शब्द, 500-2,000 शब्द, 2,000-4,000 शब्द और 4,000 शब्द से अधिक है। लॉन्गबेंच-राइट पर मूल्यांकन से पता चलता है कि लॉन्गराइटर का 9बी आकार का मॉडल राज्य-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है, यहां तक कि बड़े प्रोप्राइटरी मॉडलों की तुलना में भी। लॉन्गराइटर आगे प्राथमिकता डेटा का निर्माण करता है और डीपीओ का उपयोग करके मॉडल को लंबे लेखन निर्देशों का पालन करने और उच्च गुणवत्ता वाली सामग्री का उत्पादन करने में मदद करता है, जो प्रयोगों के माध्यम से भी प्रभावी साबित हुआ है।

लॉन्गराइटर का काम निम्नलिखित नए योगदान करता है:

  • जेनरेशन लंबाई सीमा का विश्लेषण: लॉन्गराइटर वर्तमान लंबे समय से चल रहे एलएलएम की आउटपुट लंबाई को सीमित करने वाले प्राथमिक कारक की पहचान करता है, जो एसएफटी डेटा में आउटपुट लंबाई की सीमा है।
  • एजेंट्राइट: इस सीमा को पार करने के लिए, लॉन्गराइटर एजेंट्राइट का प्रस्ताव करता है, जो एक विभाजित और जीतने वाला दृष्टिकोण का उपयोग करके ऑफ-द-शेल्फ एलएलएम का उपयोग करके एसएफटी डेटा का निर्माण करता है। एजेंट्राइट का उपयोग करके, लॉन्गराइटर लॉन्गराइटर-6के डेटासेट का निर्माण करता है।
  • मौजूदा एलएलएम की आउटपुट विंडो आकार को बढ़ाना: लॉन्गराइटर लॉन्गराइटर-6के डेटासेट को अपने एसएफटी डेटा में शामिल करके मौजूदा मॉडलों की आउटपुट विंडो आकार को 10,000+ शब्दों तक बढ़ाने में सफल होता है, जबकि आउटपुट गुणवत्ता को बनाए रखता है। लॉन्गराइटर यह भी दिखाता है कि डीपीओ मॉडल की लंबी पाठ लेखन क्षमताओं को और बढ़ाता है।

एजेंट्राइट: स्वचालित डेटा निर्माण

ऑफ-द-शेल्फ एलएलएम का उपयोग करके एसएफटी डेटा का स्वचालित रूप से निर्माण करने के लिए, लॉन्गराइटर एजेंट्राइट को डिज़ाइन करता है, एक एजेंट-आधारित पाइपलाइन जो विभाजित और जीतने वाले दृष्टिकोण का उपयोग करती है। एजेंट्राइट पहले लंबे लेखन कार्यों को कई उपकार्यों में तोड़ता है, प्रत्येक उपकार्य में मॉडल को केवल एक अनुच्छेद लिखने की आवश्यकता होती है। मॉडल तब इन उपकार्यों को क्रमिक रूप से निष्पादित करता है, और लॉन्गराइटर उपकार्य आउटपुट को जोड़कर अंतिम लंबे आउटपुट का उत्पादन करता है। इस दृष्टिकोण का उपयोग पहले से ही विभिन्न क्षेत्रों में किया जा चुका है, जैसे कि समस्या समाधान, सॉफ्टवेयर विकास और मॉडल मूल्यांकन में। लॉन्गराइटर का काम मॉडलों को जटिल लंबे फॉर्म लेखन कार्यों को पूरा करने में सक्षम बनाने के लिए योजना को एकीकृत करने के लिए पहला है।

चरण I: योजना

मानव लेखकों की सोच प्रक्रिया से प्रेरित, जो आमतौर पर लंबे लेखन कार्यों के लिए एक समग्र योजना बनाने से शुरू करते हैं, लॉन्गराइटर एलएलएम की योजना क्षमताओं का उपयोग करके लेखन निर्देश दिए जाने पर एक लेखन रूपरेखा का उत्पादन करता है। यह योजना प्रत्येक अनुच्छेद के लिए मुख्य सामग्री और शब्द गणना आवश्यकताओं को शामिल करती है। लॉन्गराइटर द्वारा उपयोग किया जाने वाला प्रॉम्प्ट निम्नलिखित है:

“मुझे एक लंबे फॉर्म लेखन निर्देश को कई उपकार्यों में तोड़ने में मदद करें। प्रत्येक उपकार्य एक अनुच्छेद के लिए लेखन का मार्गदर्शन करेगा और इसमें उस अनुच्छेद के लिए मुख्य बिंदु और शब्द गणना आवश्यकता शामिल होगी। लेखन निर्देश निम्नलिखित है: {उपयोगकर्ता निर्देश}। कृपया इसे निम्नलिखित प्रारूप में तोड़ें, प्रत्येक उपकार्य एक पंक्ति पर:

अनुच्छेद 1 – मुख्य बिंदु: [अनुच्छेद के मुख्य बिंदु का विवरण, विस्तार से] – शब्द गणना: [शब्द गणना आवश्यकता, उदाहरण के लिए 400 शब्द]
अनुच्छेद 2 – मुख्य बिंदु: [अनुच्छेद के मुख्य बिंदु का विवरण, विस्तार से] – शब्द गणना: [शब्द गणना आवश्यकता, उदाहरण के लिए 1000 शब्द]।

सुनिश्चित करें कि प्रत्येक उपकार्य स्पष्ट और विशिष्ट है, और सभी उपकार्य लेखन निर्देश की पूरी सामग्री को कवर करते हैं। उपकार्यों को बहुत बारीकी से न तोड़ें, प्रत्येक उपकार्य का अनुच्छेद कम से कम 200 शब्द और अधिक से अधिक 1000 शब्द होना चाहिए। कोई अन्य सामग्री का उत्पादन न करें।”

चरण II: लिखें

चरण I से लेखन योजना प्राप्त करने के बाद, लॉन्गराइटर एलएलएम को क्रमिक रूप से बुलाता है ताकि प्रत्येक उपकार्य को पूरा किया जा सके, जिससे खंड-दर-खंड लेखन सामग्री का उत्पादन हो सके। आउटपुट की सुसंगतता सुनिश्चित करने के लिए, जब लॉन्गराइटर मॉडल को n-वें खंड का उत्पादन करने के लिए कहता है, तो पहले से उत्पादित n-1 खंड भी इनपुट के रूप में दिए जाते हैं, जिससे मॉडल मौजूदा लेखन इतिहास के आधार पर अगले खंड को लिखने में सक्षम होता है।

मान्यकरण

लॉन्गराइटर दो लंबे फॉर्म लेखन डेटासेट पर एजेंट्राइट विधि की जेनरेशन लंबाई और गुणवत्ता का परीक्षण करता है। पहला डेटासेट, लॉन्गराइट-रूलर, जेनरेशन लंबाई को मापने के लिए उपयोग किया जाता है, जबकि दूसरा, लॉन्गबेंच-राइट, मॉडल-उत्पादित सामग्री की गुणवत्ता और लेखन निर्देशों के साथ इसकी संगतता का मूल्यांकन करने के लिए उपयोग किया जाता है।

पर्यवेक्षित फाइन-ट्यूनिंग

लॉन्गराइटर दो नवीनतम ओपन-सोर्स मॉडलों पर प्रशिक्षण करता है, जिनमें जीएलएम-4-9बी और लामा-3.1-8बी शामिल हैं। दोनों मॉडल बेस मॉडल हैं और 128k टोकन तक की संदर्भ विंडो को सपोर्ट करते हैं, जो उन्हें प्राकृतिक रूप से लंबे आउटपुट पर प्रशिक्षण के लिए उपयुक्त बनाता है। प्रशिक्षण को अधिक कुशल बनाने के लिए, लॉन्गराइटर पैकिंग प्रशिक्षण के साथ नुकसान वजन को अपनाता है। दोनों मॉडलों पर प्रशिक्षण के परिणामस्वरूप दो मॉडल होते हैं: लॉन्गराइटर-9बी (जीएलएम-4-9बी-लॉन्गराइटर के लिए संक्षिप्त) और लॉन्गराइटर-8बी (लामा-3.1-8बी-लॉन्गराइटर के लिए संक्षिप्त)।

संरेखण (डीपीओ)

मॉडल की आउटपुट गुणवत्ता में सुधार करने और लंबे निर्देशों का पालन करने की इसकी क्षमता में सुधार करने के लिए, लॉन्गराइटर पर्यवेक्षित फाइन-ट्यून किए गए लॉन्गराइटर-9बी मॉडल पर सीधे वरीयता अनुकूलन (डीपीओ) करता है। डीपीओ डेटा जीएलएम-4 के चैट डीपीओ डेटा (लगभग 50k प्रविष्टियों) से आता है। इसके अलावा, लॉन्गराइटर लंबे फॉर्म लेखन निर्देशों पर केंद्रित 4k जोड़े डेटा का निर्माण करता है। प्रत्येक लेखन निर्देश के लिए, लॉन्गराइटर लॉन्गराइटर-9बी से 4 आउटपुट का नमूना लेता है और इन आउटपुट को एक विशिष्ट विधि का उपयोग करके स्कोर करता है। एक लंबाई-आधारित स्कोर भी जोड़ा जाता है। उच्चतम स्कोर वाला आउटपुट सकारात्मक नमूने के रूप में चुना जाता है, और शेष तीन आउटपुट में से एक को यादृच्छिक रूप से नकारात्मक नमूने के रूप में चुना जाता है।

लॉन्गराइटर: प्रयोग और परिणाम

लॉन्गराइटर लॉन्गबेंच-राइट पर 4 प्रोप्राइटरी मॉडल और 5 ओपन-सोर्स मॉडल का मूल्यांकन करता है, साथ ही प्रशिक्षित लॉन्गराइटर मॉडल। लॉन्गराइटर के ज्ञान के अनुसार, सूरी-आईओआरपीओ लंबे फॉर्म पाठ जेनरेशन के लिए संरेखित करने वाला एकमात्र पिछला मॉडल है, जो मिस्ट्रल-7बी-इन्स्ट्रक्ट-वी0.2 पर लोरा का उपयोग करके प्रशिक्षित किया जाता है। मूल्यांकन सेटअप लॉन्गराइट-रूलर पर समान है, लॉन्गराइटर आउटपुट तापमान को 0.5 पर सेट करता है और मॉडल के जेनरेशन मैक्स टोकन पैरामीटर को इसके एपीआई कॉल द्वारा अनुमति दी जाने वाली अधिकतम सीमा पर सेट करता है। ओपन-सोर्स मॉडल के लिए, यह 32,768 पर सेट किया जाता है।

अधिकांश पिछले मॉडल 2,000 शब्दों से अधिक की लंबाई आवश्यकता को पूरा नहीं कर पाते हैं, जबकि लॉन्गराइटर मॉडल लगातार ऐसे प्रॉम्प्ट के लिए लंबे और समृद्ध प्रतिक्रियाएं प्रदान करते हैं।

प्रत्येक आवश्यक लंबाई सीमा के लिए आउटपुट लंबाई स्कोर का अवलोकन करते हुए, लॉन्गराइटर यह पाता है कि पिछले मॉडल आमतौर पर [2k, 4k) सीमा में प्रॉम्प्ट पर खराब प्रदर्शन करते हैं (70 से कम स्कोर), केवल क्लॉड 3.5 सोनेट एक अच्छा स्कोर प्राप्त करता है। [4k, 20k) सीमा में प्रॉम्प्ट के लिए, लगभग सभी पिछले मॉडल आउटपुट लंबाई को प्राप्त करने में पूरी तरह से असमर्थ हैं, यहां तक कि 0 (आउटपुट लंबाई आवश्यकता का एक तिहाई से कम) स्कोर करते हैं। लॉन्गराइटर-6के प्रशिक्षण डेटा को जोड़कर, लॉन्गराइटर का प्रशिक्षित मॉडल प्रभावी रूप से आवश्यक आउटपुट लंबाई तक पहुंचता है, जबकि गुणवत्ता को बनाए रखता है, जैसा कि [2k, 20k) सीमा में स्कोर और बिखरे हुए प्लॉट से सुझाया गया है।

डीपीओ मॉडल की आउटपुट गुणवत्ता और लंबे जेनरेशन में लंबाई आवश्यकताओं का पालन करने की इसकी क्षमता दोनों में सुधार करता है।

लॉन्गराइटर-9बी और लॉन्गराइटर-9बी-डीपीओ के स्कोर की तुलना करके, हम पाते हैं कि डीपीओ दोनों एसएल और एसक्यू स्कोर (+4% और +3% क्रमशः) में महत्वपूर्ण सुधार करता है, और यह सुधार सभी सीमाओं में संगत है। यह दिखाता है कि लंबे जेनरेशन परिदृश्य में, डीपीओ मॉडल की आउटपुट गुणवत्ता में सुधार करता है और इसकी आउटपुट लंबाई को अनुरोधित लंबाई के साथ बेहतर संरेखित करता है।

लॉन्गराइटर मॉडल की आउटपुट लंबाई सीमा 10k से 20k शब्दों के बीच बढ़ा दी गई है, जबकि और भी लंबे आउटपुट का समर्थन करने के लिए अधिक लंबे आउटपुट वाले डेटा की आवश्यकता है।

लॉन्गराइट-रूलर परीक्षण के परिणामों को प्रस्तुत करते हुए, लॉन्गराइटर मॉडल की अधिकतम जेनरेशन लंबाई 10k से 20k शब्दों के बीच होती है। लंबे आउटपुट वाले एसएफटी डेटा की कमी संभवतः मॉडल को और भी लंबी आउटपुट लंबाई प्राप्त करने से रोकने का प्राथमिक कारण है।

अंतिम विचार

इस कार्य में, हमने लॉन्गराइटर के बारे में चर्चा की, एक एजेंट-आधारित पाइपलाइन जो अल्ट्रा-लॉन्ग जेनरेशन कार्यों को उपकार्यों में विभाजित करती है, वर्तमान एलएलएम के लिए 2,000 शब्दों की जेनरेशन सीमा की पहचान करती है और अपने आउटपुट विंडो आकार को बढ़ाने के लिए लंबे आउटपुट डेटा को जोड़ने का प्रस्ताव करती है। लॉन्गराइटर एजेंट्राइट पाइपलाइन का उपयोग करके लंबे आउटपुट डेटा का स्वचालित रूप से निर्माण करता है और मौजूदा मॉडलों को प्रशिक्षित करने के लिए इस डेटा को जोड़ता है। व्यापक अध्ययन डेटा प्रशिक्षण के दृष्टिकोण की प्रभावशीलता को प्रदर्शित करते हैं। भविष्य के कार्य के लिए, लॉन्गराइटर निम्नलिखित तीन दिशाओं का सुझाव देता है: 1. एजेंट्राइट फ्रेमवर्क को और भी लंबे आउटपुट के निर्माण के लिए विस्तारित करना। 2. एजेंट्राइट फ्रेमवर्क को उच्च गुणवत्ता वाले लंबे आउटपुट डेटा का निर्माण करने के लिए परिष्कृत करना। 3. लंबे मॉडल आउटपुट अनुमान की दक्षता को चुनौतियां प्रस्तुत करते हैं। अनुमान की दक्षता में सुधार के लिए कई तरीके प्रस्तावित किए गए हैं। यह जांचना उचित होगा कि ये तरीके कैसे मॉडल की दक्षता में सुधार कर सकते हैं बिना जेनरेशन गुणवत्ता को समझौता किए।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।