एआई मॉडल और प्लेटफ़ॉर्म
ईयूरेका : मानव-स्तरीय पुरस्कार डिज़ाइन के माध्यम से बड़े भाषा मॉडल कोडिंग
बड़े भाषा मॉडल्स ने हाल के वर्षों में जो प्रगति की है, यह आश्चर्यजनक नहीं है कि ये एलएलएम फ्रेमवर्क्स सीक्वेंशियल हाई-लेवल निर्णय लेने के कार्यों के लिए सेमेंटिक प्लानर्स के रूप में उत्कृष्टता से काम करते हैं। हालांकि, डेवलपर्स को अभी भी बड़े भाषा मॉडल्स के पूर्ण क्षमता का उपयोग करने के लिए संघर्ष करना पड़ता है, खासकर जब जटिल कम-स्तरीय मैनिपुलेशन कार्यों को सीखने की बात आती है। इसके बावजूद, आज के बड़े भाषा मॉडल्स को सरल कौशल सीखने या पाठ्य प्रॉम्प्ट्स का निर्माण करने के लिए महत्वपूर्ण डोमेन और विषय विशेषज्ञता की आवश्यकता होती है, जो उनके प्रदर्शन और मानव-स्तरीय चपलता के बीच एक महत्वपूर्ण अंतर पैदा करता है।
इस अंतर को पाटने के लिए, एनवीडिया, कैलटेक, यूपेन और अन्य से डेवलपर्स ने ईयूरेका प्रस्तुत किया है, जो एक एलएलएम-पावर्ड मानव-स्तरीय डिज़ाइन अल्गोरिदम है। ईयूरेका का उद्देश्य एलएलएम फ्रेमवर्क्स की विभिन्न क्षमताओं का उपयोग करना है, जिनमें कोड-लेखन, इन-कॉन्टेक्स्ट सुधार, और जीरो-शॉट सामग्री जेनरेशन शामिल हैं, ताकि पुरस्कार कोड्स का अभूतपूर्व अनुकूलन किया जा सके। इन पुरस्कार कोड्स को प्रबल प्रशिक्षण के साथ मिलाकर, फ्रेमवर्क्स जटिल कौशल सीख सकते हैं या मैनिपुलेशन कार्य कर सकते हैं।
इस लेख में, हम ईयूरेका फ्रेमवर्क की जांच करेंगे और इसके फ्रेमवर्क, कार्य, और परिणामों का विश्लेषण करेंगे जो यह पुरस्कार फंक्शन्स को उत्पन्न करने में प्राप्त करता है, जो मानव द्वारा उत्पन्न पुरस्कार फंक्शन्स से बेहतर होने का दावा करते हैं। हम यह भी देखेंगे कि ईयूरेका फ्रेमवर्क कैसे एक नए दृष्टिकोण के लिए मार्ग प्रशस्त करता है जो प्रबल प्रशिक्षण के माध्यम से मानव प्रतिक्रिया (आरएलएचएफ) को सक्षम बनाता है और ग्रेडिएंट-मुक्त इन-कॉन्टेक्स्ट लर्निंग को सक्षम बनाता है। आइए शुरू करें।
ईयूरेका : एक परिचय
आज, स्टेट ऑफ द आर्ट एलएलएम फ्रेमवर्क्स जैसे जीपीटी-3 और जीपीटी-4 सीक्वेंशियल हाई-लेवल निर्णय लेने के कार्यों के लिए सेमेंटिक प्लानर्स के रूप में उत्कृष्ट परिणाम प्रदान करते हैं, लेकिन डेवलपर्स अभी भी कम-स्तरीय मैनिपुलेशन कार्यों को सीखने के लिए उनके प्रदर्शन में सुधार के तरीकों की तलाश में हैं। इसके अलावा, डेवलपर्स ने观察 किया है कि प्रबल प्रशिक्षण का उपयोग दृढ़ परिणाम प्राप्त करने के लिए किया जा सकता है, और अन्य डोमेन में भी पुरस्कार फंक्शन्स को सावधानी से मानव डिज़ाइनर्स द्वारा निर्मित किया जाना चाहिए, और इन पुरस्कार फंक्शन्स को सीखने के लिए उपयुक्त संकेत प्रदान करने में सक्षम होना चाहिए। जब वास्तविक दुनिया के प्रबल प्रशिक्षण कार्यों की तुलना की जाती है जो कम पुरस्कार स्वीकार करते हैं, तो यह मॉडल के लिए पैटर्न सीखने में कठिनाई पैदा करता है, और पुरस्कार को आकार देने से आवश्यक सीखने के संकेत प्रदान किए जाते हैं। इसके अलावा, पुरस्कार फंक्शन्स, उनके महत्व के बावजूद, डिज़ाइन करने में अत्यधिक चुनौतीपूर्ण होते हैं, और उनके डिज़ाइन में अक्सर अनियंत्रित व्यवहार की ओर ले जाते हैं।

ईयूरेका फ्रेमवर्क को तीन मुख्य एल्गोरिदमिक डिज़ाइन विकल्पों के साथ विकसित किया गया है: इवोल्यूशनरी सर्च, एनवायरनमेंट अस कॉन्टेक्स्ट, और रिवार्ड रिफ्लेक्शन। पहले, ईयूरेका फ्रेमवर्क एनवायरनमेंट सोर्स कोड को कॉन्टेक्स्ट के रूप में लेता है और जीरो-शॉट सेटिंग में कार्यक्षम पुरस्कार फंक्शन्स को उत्पन्न करता है। इसके बाद, फ्रेमवर्क इवोल्यूशनरी सर्च का उपयोग करके अपने पुरस्कारों की गुणवत्ता में सुधार करता है, और प्रत्येक पुनरावृत्ति या युग में पुरस्कार उम्मीदवारों के बैचों का प्रस्ताव करता है और सबसे आशाजनक लोगों को परिष्कृत करता है। तीसरे और अंतिम चरण में, फ्रेमवर्क रिवार्ड रिफ्लेक्शन दृष्टिकोण का उपयोग करके पुरस्कारों के इन-कॉन्टेक्स्ट सुधार को अधिक प्रभावी बनाता है, जो अंततः फ्रेमवर्क को लक्षित और स्वचालित पुरस्कार संपादन को सक्षम बनाता है।
ईयूरेका : मॉडल आर्किटेक्चर, और समस्या सेटिंग
ईयूरेका फ्रेमवर्क का मुख्य उद्देश्य पुरस्कार आकार देने के लिए एक आकारित या क्यूरेटेड पुरस्कार फंक्शन को वापस करना है, जो सीधे अनुकूलन के लिए कठिनाइयों का कारण बन सकता है, खासकर जब कम पुरस्कार होते हैं। इसके अलावा, डिज़ाइनर्स केवल प्रश्नों का उपयोग करके इन मूल पुरस्कार फंक्शन्स तक पहुंच सकते हैं, जो ईयूरेका फ्रेमवर्क को पुरस्कार जेनरेशन के लिए एक प्रोग्राम सिंथेसिस सेटिंग का उपयोग करने का कारण बनता है।
ईयूरेका फ्रेमवर्क में तीन मूलभूत एल्गोरिदमिक घटक हैं: इवोल्यूशनरी सर्च, एनवायरनमेंट अस कॉन्टेक्स्ट, और रिवार्ड रिफ्लेक्शन। इवोल्यूशनरी सर्च का उपयोग करके फ्रेमवर्क पुरस्कार उम्मीदवारों का प्रस्ताव करता है और उन्हें परिष्कृत करता है, जबकि एनवायरनमेंट अस कॉन्टेक्स्ट का उपयोग करके यह जीरो-शॉट सेटिंग में कार्यक्षम पुरस्कार फंक्शन्स को उत्पन्न करता है। रिवार्ड रिफ्लेक्शन दृष्टिकोण का उपयोग करके फ्रेमवर्क पुरस्कारों के इन-कॉन्टेक्स्ट सुधार को अधिक प्रभावी बनाता है, जो अंततः फ्रेमवर्क को लक्षित और स्वचालित पुरस्कार संपादन को सक्षम बनाता है।
एनवायरनमेंट अस कॉन्टेक्स्ट
वर्तमान में, एलएलएम फ्रेमवर्क्स को पुरस्कार डिज़ाइन करने के लिए एनवायरनमेंट स्पेसिफिकेशन्स की आवश्यकता होती है, जबकि ईयूरेका फ्रेमवर्क एनवायरनमेंट सोर्स कोड को सीधे कॉन्टेक्स्ट के रूप में लेता है, पुरस्कार कोड की आवश्यकता के बिना। ईयूरेका द्वारा अपनाई गई यह दृष्टिकोण दो प्रमुख लाभ प्रदान करता है। पहले, एलएलएम फ्रेमवर्क्स को कोडिंग के उद्देश्यों के लिए मूल कोड सेट्स पर प्रशिक्षित किया जाता है, जो मौजूदा प्रोग्रामिंग भाषाओं जैसे सी, सी++, पायथन, जावा आदि में लिखे जाते हैं। दूसरे, एनवायरनमेंट सोर्स कोड का उपयोग करने से आमतौर पर एनवायरनमेंट्स को सेमेंटिक रूप से प्रकट किया जाता है, और उन वेरिएबल्स को प्रकट किया जाता है जो पुरस्कार फंक्शन को उत्पन्न करने के लिए उपयुक्त होते हैं।
इवोल्यूशनरी सर्च
ईयूरेका फ्रेमवर्क में इवोल्यूशनरी सर्च को शामिल करने का उद्देश्य पुरस्कारों की गुणवत्ता में सुधार करना है, जो पिछले पुनरावृत्ति से प्राप्त कार्यक्षम पुरस्कार फंक्शन्स का उपयोग करके एक नए और बेहतर पुरस्कार फंक्शन को प्रस्तावित करने के लिए किया जाता है। ईयूरेका फ्रेमवर्क, जब इन-कॉन्टेक्स्ट सुधार और निर्देश-अनुसरण क्षमताओं के साथ मिलकर बड़े भाषा मॉडल्स का उपयोग करता है, तो यह पुरस्कारों को संशोधित करने के लिए एक विधि प्रदान करता है और मौजूदा पुरस्कार कोड को संशोधित करने के लिए नीति प्रशिक्षण के सारांश का उपयोग करने का सुझाव देता है।
रिवार्ड रिफ्लेक्शन
पुरस्कारों के इन-कॉन्टेक्स्ट संशोधन को आधार देने के लिए, यह आवश्यक है कि उत्पन्न पुरस्कारों की गुणवत्ता का मूल्यांकन किया जाए और उन्हें शब्दों में व्यक्त किया जाए। ईयूरेका फ्रेमवर्क इसे पूरा करने के लिए एक सरल रणनीति का उपयोग करता है, जिसमें पुरस्कार मूल्यांकन के लिए संख्यात्मक स्कोर प्रदान किए जाते हैं। जब कार्य फिटनेस फंक्शन एक समग्र मेट्रिक के रूप में कार्य करता है, तो यह क्रेडिट असाइनमेंट की कमी के कारण पुरस्कार फंक्शन के कार्य करने के कारणों के बारे में कोई मूल्यवान जानकारी प्रदान नहीं करता है। इसलिए, पुरस्कार निदान को अधिक लक्षित और विस्तृत बनाने के प्रयास में, फ्रेमवर्क स्वचालित प्रतिक्रियाओं का उपयोग करके नीति प्रशिक्षण गतिविधियों को पाठ में सारांशित करने का प्रस्ताव करता है।
प्रशिक्षण और बेसलाइन
ईयूरेका फ्रेमवर्क के दो मुख्य प्रशिक्षण घटक हैं: नीति सीखना और पुरस्कार मूल्यांकन मेट्रिक्स।
नीति सीखना
प्रत्येक कार्य के लिए अंतिम पुरस्कार फंक्शन को उसी प्रबल प्रशिक्षण अल्गोरिदम का उपयोग करके अनुकूलित किया जाता है, जिसमें समान हाइपरपैरामीटर्स का उपयोग किया जाता है, जो मानव-इंजीनियर्ड पुरस्कार फंक्शन को अच्छा प्रदर्शन करने के लिए फाइन-ट्यून किए जाते हैं।
पुरस्कार मूल्यांकन मेट्रिक्स
चूंकि कार्य मेट्रिक्स प्रत्येक कार्य के साथ मूल्यांकन और सेमेंटिक अर्थ में भिन्न होते हैं, ईयूरेका फ्रेमवर्क मानव-सामान्यीकृत स्कोर की रिपोर्ट करता है, जो एक समग्र माप प्रदान करता है जिसका उपयोग फ्रेमवर्क द्वारा मानव-उत्पन्न पुरस्कारों के साथ अपने प्रदर्शन की तुलना करने के लिए किया जा सकता है, जो मूल पुरस्कार मेट्रिक्स के अनुसार होता है।
परिणाम और परिणाम
ईयूरेका फ्रेमवर्क के प्रदर्शन का विश्लेषण करने के लिए, हम इसकी मानव पुरस्कारों के खिलाफ प्रदर्शन, समय के साथ सुधार, नए पुरस्कारों का उत्पादन, लक्षित सुधार को सक्षम बनाने और मानव प्रतिक्रियाओं के साथ काम करने की क्षमता का मूल्यांकन करेंगे।
ईयूरेका मानव पुरस्कारों से बेहतर प्रदर्शन करता है
निम्नलिखित आंकड़ा विभिन्न बेंचमार्क पर एकत्रित परिणामों को दर्शाता है, और जैसा कि स्पष्ट रूप से देखा जा सकता है, ईयूरेका फ्रेमवर्क मानव-स्तरीय पुरस्कारों से बेहतर या उनके बराबर प्रदर्शन करता है दोनों डेक्सटरिटी और आइजैक कार्यों पर। इसके विपरीत, एल2आर बेसलाइन कम-आयामी कार्यों पर समान प्रदर्शन प्रदान करता है, लेकिन जब उच्च-आयामी कार्यों की बात आती है, तो प्रदर्शन में अंतर काफी महत्वपूर्ण होता है।

समय के साथ सुधार
ईयूरेका फ्रेमवर्क की एक प्रमुख विशेषता इसकी क्षमता है जो लगातार समय के साथ अपने प्रदर्शन में सुधार करता है, और निम्नलिखित आंकड़े में परिणाम दिखाए गए हैं।

जैसा कि स्पष्ट रूप से देखा जा सकता है, फ्रेमवर्क प्रत्येक पुनरावृत्ति के साथ बेहतर पुरस्कार उत्पन्न करता है और मानव पुरस्कारों के प्रदर्शन को भी पार कर जाता है, जो इसके इन-कॉन्टेक्स्ट इवोल्यूशनरी पुरस्कार खोज दृष्टिकोण का उपयोग करने के कारण होता है।
नए पुरस्कारों का उत्पादन
ईयूरेका फ्रेमवर्क द्वारा उत्पन्न पुरस्कारों की नवीनता का मूल्यांकन करने के लिए, हम मानव और ईयूरेका पुरस्कारों के बीच संबंध की गणना कर सकते हैं और इसे एक स्कैटर प्लॉट पर प्लॉट कर सकते हैं, जहां प्रत्येक बिंदु एक व्यक्तिगत ईयूरेका पुरस्कार का प्रतिनिधित्व करता है प्रत्येक कार्य के लिए। जैसा कि स्पष्ट रूप से देखा जा सकता है, ईयूरेका फ्रेमवर्क मुख्य रूप से मानव पुरस्कारों से बेहतर प्रदर्शन करने वाले कम संबंधित पुरस्कार फंक्शन्स को उत्पन्न करता है।

लक्षित सुधार को सक्षम बनाना
पुरस्कार प्रतिक्रिया में पुरस्कार रिफ्लेक्शन के महत्व का मूल्यांकन करने के लिए, डेवलपर्स ने एक अभ्यास का मूल्यांकन किया, जिसमें ईयूरेका फ्रेमवर्क को पुरस्कार रिफ्लेक्शन के बिना चलाया गया, जो प्रतिक्रिया प्रॉम्प्ट्स को केवल स्नैपशॉट मानों तक सीमित करता है। आइजैक कार्यों पर चलाने पर, डेवलपर्स ने देखा कि पुरस्कार रिफ्लेक्शन के बिना, ईयूरेका फ्रेमवर्क ने औसत सामान्यीकृत स्कोर में 29% की गिरावट का अनुभव किया।
मानव प्रतिक्रियाओं के साथ काम करना
मानव-संरेखित और अधिक प्रदर्शनकारी पुरस्कार फंक्शन्स को उत्पन्न करने के लिए विभिन्न प्रकार के इनपुट को शामिल करने के लिए, ईयूरेका फ्रेमवर्क स्वचालित पुरस्कार डिज़ाइन के अलावा मानव प्रतिक्रिया से प्रबल प्रशिक्षण के लिए एक नए ग्रेडिएंट-मुक्त इन-कॉन्टेक्स्ट लर्निंग दृष्टिकोण को प्रस्तुत करता है, और दो महत्वपूर्ण अवलोकन किए गए।
- ईयूरेका मानव पुरस्कारों से लाभान्वित हो सकता है और सुधार कर सकता है।
- पुरस्कार प्रतिक्रिया के लिए मानव प्रतिक्रिया का उपयोग प्रतिक्रिया व्यवहार को उत्पन्न करता है।

उपरोक्त आंकड़ा दर्शाता है कि ईयूरेका फ्रेमवर्क मानव पुरस्कार प्रारंभिकीकरण का उपयोग करके महत्वपूर्ण प्रदर्शन और दक्षता में सुधार करता है, जो यह सुझाव देता है कि मूल पुरस्कारों की गुणवत्ता फ्रेमवर्क की इन-कॉन्टेक्स्ट पुरस्कार सुधार क्षमता पर महत्वपूर्ण प्रभाव नहीं डालती है।

उपरोक्त आंकड़ा यह भी दर्शाता है कि ईयूरेका फ्रेमवर्क न केवल मानव-संरेखित नीतियों को उत्पन्न कर सकता है, बल्कि मानव प्रतिक्रिया को शामिल करके पुरस्कारों को संशोधित भी कर सकता है।
अंतिम विचार
इस लेख में, हमने ईयूरेका के बारे में बात की है, जो एक एलएलएम-पावर्ड मानव-स्तरीय डिज़ाइन अल्गोरिदम है जो पुरस्कार कोड्स के अभूतपूर्व अनुकूलन को प्राप्त करने के लिए एलएलएम फ्रेमवर्क्स की विभिन्न क्षमताओं का उपयोग करने का प्रयास करता है। पुरस्कार कोड्स को प्रबल प्रशिक्षण के साथ मिलाकर, फ्रेमवर्क्स जटिल कौशल सीख सकते हैं या मैनिपुलेशन कार्य कर सकते हैं। ईयूरेका फ्रेमवर्क का मुख्य बल इस बात पर है कि यह मानव हस्तक्षेप या कार्य-विशिष्ट प्रॉम्प्ट इंजीनियरिंग के बिना व्यापक कार्यों पर मानव-स्तरीय पुरस्कार जेनरेशन क्षमता प्रदान करता है, और इसकी मुख्य ताकत जटिल कार्यों को सीखने में निहित है, जो पाठ्यक्रम सीखने के दृष्टिकोण का उपयोग करता है।
सामग्री का प्रदर्शन और बहुमुखी प्रतिभा दर्शाता है कि बड़े भाषा मॉडल्स के साथ इवोल्यूशनरी अल्गोरिदम्स को मिलाने से पुरस्कारों के डिज़ाइन के लिए एक स्केलेबल और सामान्य दृष्टिकोण प्राप्त किया जा सकता है, और यह अंतर्दृष्टि अन्य खुले समाप्ति खोज समस्याओं पर भी लागू हो सकती है।












