एआई मॉडल और प्लेटफ़ॉर्म
मानव मूल्यों के साथ एआई संरेखण को आगे बढ़ाना वार्म के माध्यम से
मानव मूल्यों के साथ एआई प्रणाली का संरेखण
आर्टिफ़िशियल इंटेलिजेंस (एआई) प्रणालियाँ जटिल कार्यों में मानवों की सहायता करने में बढ़ती क्षमता प्रदर्शित कर रही हैं, चाहे वह ग्राहक सेवा चैटबॉट हों या चिकित्सा निदान एल्गोरिदम। हालांकि, जैसे ही ये एआई प्रणालियाँ अधिक जिम्मेदारियाँ संभालती हैं, यह सुनिश्चित करना महत्वपूर्ण है कि वे मानव मूल्यों और प्राथमिकताओं के साथ संरेखित रहें। इसे प्राप्त करने के लिए एक दृष्टिकोण पुरस्कार सीखने से मानव प्रतिक्रिया (आरएलएचएफ) की तकनीक है। आरएलएचएफ में, एक एआई प्रणाली, जिसे नीति के रूप में जाना जाता है, मानव निर्णयों के आधार पर पुरस्कृत या दंडित की जाती है। लक्ष्य यह है कि नीति अपने पुरस्कारों को अधिकतम करने के लिए सीखे, और इस प्रकार मानव प्राथमिकताओं के अनुसार व्यवहार करे।
आरएलएचएफ का एक मूल घटक पुरस्कार मॉडल (आरएम) है। आरएम नीति की क्रियाओं और आउटपुट का मूल्यांकन करने और सीखने की प्रक्रिया को मार्गदर्शन करने के लिए एक पुरस्कार संकेत लौटाने के लिए जिम्मेदार है। एक अच्छा आरएम डिज़ाइन करना चुनौतीपूर्ण है, क्योंकि मानव प्राथमिकताएं जटिल, संदर्भ-निर्भर और यहां तक कि व्यक्तियों के बीच भी असंगत हो सकती हैं। हाल ही में, गूगल डीपमाइंड के शोधकर्ताओं ने मानव मूल्यों के साथ एआई को संरेखित करने में सुधार करने के लिए एक नवीन तकनीक का प्रस्ताव किया है, जिसे वेटेड एवरेज्ड रिवार्ड मॉडल (वार्म) कहा जाता है।
पुरस्कार हैकिंग की समस्या
आरएलएचएफ में एक प्रमुख समस्या पुरस्कार हैकिंग है। पुरस्कार हैकिंग तब होती है जब नीति आरएम प्रणाली को गेम करने के लिए तरीके ढूंढती है ताकि वास्तविक उद्देश्यों को संतुष्ट किए बिना उच्च पुरस्कार प्राप्त किए जा सकें। उदाहरण के लिए, मान लें कि लक्ष्य एक लेखन सहायक एआई को उच्च गुणवत्ता वाले सारांश उत्पन्न करने के लिए प्रशिक्षित करना है। आरएम संक्षिप्त और जानकारीपूर्ण सारांश को पुरस्कृत कर सकता है। नीति तब इसे शोषण करना सीख सकती है bằng बहुत छोटे और जानकारीपूर्ण सारांश को उत्पन्न करके जो केवल कुछ कीवर्ड के साथ आरएम को धोखा देते हैं।
पुरस्कार हैकिंग दो मुख्य कारणों से होती है:
- वितरण परिवर्तन – आरएम को एक सीमित डेटासेट पर प्रशिक्षित किया जाता है जिसमें मानव-लेबल वाले उदाहरण होते हैं। जब इसे तैनात किया जाता है, तो नीति के आउटपुट आरएम द्वारा अच्छी तरह से सामान्यीकृत नहीं किए जा सकने वाले वितरण से आ सकते हैं।
- शोरदार लेबल – मानव लेबलिंग परिपूर्ण नहीं है, और अंतर-रेटर असहमति हो सकती है। आरएम शोर संकेतों के बजाय विश्वसनीय संकेतों पर ध्यान केंद्रित कर सकता है।
पुरस्कार हैकिंग मानव अपेक्षाओं के अनुरूप नहीं होने वाली उपयोगहीन प्रणालियों की ओर ले जाती है। इससे भी बदतर, यह दुर्भाग्यपूर्ण परिस्थितियों में तैनाती के परिणामस्वरूप पूर्वाग्रह या खतरनाक एआई व्यवहार पैदा कर सकता है।
मॉडल मर्जिंग का उदय
मॉडल रताटूइल जैसी मॉडल मर्जिंग रणनीतियों में बढ़ती रुचि बड़े मॉडलों की अप्रभावीता और अव्यावहारिकता की बढ़ती जागरूकता से प्रेरित है। एक 1 ट्रिलियन पैरामीटर मॉडल को प्रशिक्षित करने के लिए निषिद्ध मात्रा में डेटा, कंप्यूट, समय और लागत की आवश्यकता होती है। अधिक महत्वपूर्ण बात यह है कि ऐसे मॉडल प्रशिक्षण वितरण पर अधिक फिट हो जाते हैं, जिससे वे विविध वास्तविक दुनिया की स्थितियों में सामान्यीकरण करने में असमर्थ हो जाते हैं।
मॉडल मर्जिंग एक विकल्प प्रदान करता है जो बड़े मॉडलों की क्षमता को बिना नियंत्रित रूप से स्केल अप किए प्राप्त करने की अनुमति देता है। विभिन्न वितरण, कार्यों या उद्देश्यों पर प्रशिक्षित कई विशेषज्ञ मॉडल को पुन: उपयोग करके, मॉडल मर्जिंग विविधता और बाहरी-वितरण दृढ़ता में सुधार करने का लक्ष्य रखता है। यह धारणा है कि विभिन्न मॉडल विभिन्न पूर्वानुमान पैटर्न को पकड़ते हैं जो एक दूसरे के पूरक हो सकते हैं जब उन्हें मिलाया जाता है।
हाल के परिणाम इस अवधारणा का वादा दिखाते हैं। मॉडल मर्जिंग द्वारा प्राप्त मॉडल, जिनमें बहुत कम पैरामीटर होते हैं, जीपीटी -3 जैसे विशाल मॉडल के प्रदर्शन को मैच या यहां तक कि पार कर सकते हैं। उदाहरण के लिए, मॉडल रताटूइल एन्सेम्बल में केवल 7 मध्यम आकार के चेकपॉइंट शामिल हैं, जो उच्च-आयामी पाठ से अर्थ संबंध डेटासेट पर राज्य-कला सटीकता प्राप्त करते हैं और जीपीटी -3 को पार करते हैं।
मॉडल मर्जिंग की सादगी एक बड़ा बोनस है। कई सहायक मॉडल को प्रशिक्षित करने के लिए अतिरिक्त संसाधनों की मांग होती है। लेकिन महत्वपूर्ण बात यह है कि अनुमान समय की गणना एकल मॉडल के समान रहती है, क्योंकि वजन एक में संघनित होते हैं। यह विधि को आसानी से अनुकूलन योग्य बनाता है, बिना विलंबता या मेमोरी लागत के चिंता के।
मॉडल मर्जिंग के तंत्र
लेकिन मॉडल मर्जिंग से सटीकता में यह लाभ क्या सक्षम करता है? हाल के विश्लेषण ने कुछ संकेत दिए हैं:
- स्मृति को कम करना: प्रत्येक मॉडल प्रशिक्षण के दौरान डेटासेट के विभिन्न शफल्ड बैच देखता है। औसतन मेमोरीकरण को कम करता है, केवल डेटासेट-स्तरीय सामान्यीकरण को बनाए रखता है।
- विचरण को कम करना: स्वतंत्र रूप से प्रशिक्षित मॉडल में असंबद्ध त्रुटियां होती हैं। उन्हें संयोजित करने से शोर को औसतन निकाल दिया जाता है, जिससे कैलिब्रेशन में सुधार होता है।
- विविधता के माध्यम से नियमितीकरण: विभिन्न सहायक कार्यों को मजबूर करने से मॉडल विभिन्न वितरणों में उपयोगी सामान्यीकृत विशेषताओं पर ध्यान केंद्रित करते हैं।
- दृढ़ता में वृद्धि: अनिश्चितता की भविष्यवाणियों में असंगति संकेत देती है। औसतन बाहरी निर्णयों को मॉडरेट करता है, विश्वसनीयता में सुधार करता है।
मूल रूप से, मॉडल मर्जिंग व्यक्तिगत मॉडलों की कमजोरियों को संतुलित करके उनकी सामूहिक ताकत को बढ़ाता है। मिली हुई प्रतिनिधित्व सामान्य अंतर्निहित कारण संरचनाओं को पकड़ता है, आकस्मिक भिन्नताओं की उपेक्षा करता है।
यह概念ual आधार मॉडल मर्जिंग को अन्य लोकप्रिय तकनीकों जैसे एन्सेम्बलिंग और मल्टी-टास्क लर्निंग से जोड़ता है। ये सभी तरीके मॉडल या कार्यों में विविधता का लाभ उठाते हैं ताकि बहुमुखी और अनिश्चितता-जागरूक प्रणालियों को प्राप्त किया जा सके। हालांकि, वजन औसतन की सादगी मॉडल मर्जिंग को वास्तविक दुनिया की तैनाती के लिए एक अनोखा लाभ देती है।
वेटेड एवरेज्ड रिवार्ड मॉडल
वार्म एक प्रॉक्सी रिवार्ड मॉडल (आरएम) का उपयोग करता है, जो कई व्यक्तिगत आरएम का वजन औसत है, प्रत्येक को एक ही पूर्व-प्रशिक्षित एलएलएम से लेकिन विभिन्न हाइपरपैरामीटर के साथ फाइन-ट्यून किया जाता है। यह विधि दक्षता, वितरण परिवर्तन के तहत विश्वसनीयता और असंगत प्राथमिकताओं के खिलाफ दृढ़ता में सुधार करती है। अध्ययन से यह भी पता चलता है कि वार्म को प्रॉक्सी आरएम के रूप में उपयोग करना, विशेष रूप से औसतन किए गए आरएम की बढ़ी हुई संख्या के साथ, परिणामों में सुधार करता है और ‘पुरस्कार हैकिंग’ की शुरुआत में देरी करता है, जो एक घटना है जहां नियंत्रण पुरस्कार समय के साथ खराब हो जाते हैं।
यहाँ एक उच्च-स्तरीय अवलोकन है:
- एक बड़े कॉर्पस पर पूर्व-प्रशिक्षित एक आधार भाषा मॉडल से शुरू करें। प्रत्येक आरएम को शीर्ष पर छोटे कार्य-विशिष्ट परतें जोड़कर आरएम को प्रारंभ करें।
- प्रत्येक आरएम को अलग से मानव प्राथमिकता डेटासेट पर फाइन-ट्यून करें, विभिन्न हाइपरपैरामीटर जैसे सीखने की दर का उपयोग विविधता के लिए करें।
- फाइन-ट्यून किए गए आरएम के वजन को औसत करके एक एकल वार्म एन्सेम्बल प्राप्त करें।
मुख्य अंतर्दृष्टि यह है कि वजन औसतन सभी विविध आरएम में सीखी गई अंतर्निहित स्थिर जानकारी को बनाए रखता है। यह शोर संकेतों पर निर्भरता को कम करता है, दृढ़ता में सुधार करता है। एन्सेम्बल विचरण कमी से भी लाभान्वित होता है, वितरण परिवर्तन के बावजूद विश्वसनीयता में सुधार करता है।
जैसा कि पहले चर्चा की गई, स्वतंत्र रूप से प्रशिक्षित मॉडलों में विविधता मॉडल मर्जिंग की पूरी क्षमता को अनलॉक करने के लिए महत्वपूर्ण है। लेकिन उत्पादक विविधता को बढ़ावा देने के लिए कुछ ठोस तकनीकें क्या हैं?
वार्म पेपर कुछ चतुर विचारों का अन्वेषण करता है जो अधिक व्यापक रूप से सामान्य हो सकते हैं:
क्रम शफल
एक सरल लेकिन प्रभावी दृष्टिकोण प्रत्येक मॉडल द्वारा प्रशिक्षण के दौरान देखे जाने वाले डेटा बिंदुओं के क्रम को शफल करना है। यहां तक कि यह सरल चरण वजन को डिकोरेलेट करता है, पैटर्न के अत्यधिक मेमोरीकरण को कम करता है।
हाइपरपैरामीटर भिन्नता
प्रत्येक रन के लिए हाइपरपैरामीटर जैसे सीखने की दर और ड्रॉपआउट संभावना को समायोजित करने से उपयोगी विविधता पेश की जाती है। मॉडल अलग-अलग रूप से अभिसरण करते हैं, डेटासेट के विभिन्न गुणों को पकड़ते हैं।
चेकपॉइंट एवरेजिंग – बकलावा
बकलावा विधि मॉडल को मिलाने के लिए एक ही पूर्व-प्रशिक्षण траजेक्टरी के साथ विभिन्न स्नैपशॉट से मॉडल को प्रारंभ करती है। यह मॉडल सूप की तुलना में साझा प्रारंभ बिंदु की आवश्यकता को कम करता है। मॉडल रताटूइल की तुलना में बकलावा अतिरिक्त कार्यों से बचता है। समग्र रूप से, यह सटीकता-विविधता संतुलन को प्रभावी ढंग से हासिल करता है।
विश्लेषण से पता चलता है कि पुराने चेकपॉइंट को जोड़ने से व्यक्तिगत प्रदर्शन खराब हो जाता है, विविधता लाभ को खतरा होता है। केवल प्रत्येक रन से अंतिम प्रतिनिधित्व को औसतन करना बेहतर प्रदर्शन करता है। सामान्य तौर पर, दृढ़ता के साथ विविधता लक्ष्यों को संतुलित करना एक खुला शोध चुनौती बना हुआ है।
कुल मिलाकर, मॉडल मर्जिंग मौजूदा संसाधनों को प्रभावी ढंग से रिसाइकल करने के लिए क्षेत्र में सामान्य जोश के साथ अच्छी तरह से संरेखित होती है, जिससे सुधार, दक्षता और बहुमुखी प्रतिभा में वृद्धि होती है। वजन औसतन की सादगी इसे मजबूत मॉडल को आसानी से इकट्ठा करने के लिए एक प्रमुख उम्मीदवार के रूप में स्थापित करती है।
वार्म के विपरीत पारंपरिक एन्सेम्बलिंग विधियाँ, जो भविष्यवाणियों को औसतन करती हैं, वार्म केवल एक ही सेट के वजन को बनाए रखता है। पाठ सारांश कार्यों पर प्रयोग वार्म की प्रभावशीलता का प्रदर्शन करते हैं:
- सर्वश्रेष्ठ-ऑफ-एन नमूनाकरण के लिए, वार्म मानव प्राथमिकता लेबल के अनुसार 92.5% जीत दर हासिल करता है, यादृच्छिक चयन के खिलाफ।
- आरएलएचएफ में, वार्म नीति एकल आरएम के साथ प्रशिक्षित नीति के खिलाफ 79.4% जीत दर हासिल करती है, समान संख्या में चरणों के बाद।
- वार्म तब भी अच्छा प्रदर्शन करता है जब मानव लेबल का एक चौथाई भ्रष्ट होता है।
इन परिणामों से वार्म की क्षमता का पता चलता है व्यावहारिक तकनीक के रूप में वास्तविक दुनिया के एआई सहायकों को विकसित करने में जो विश्वसनीय रूप से मानव मूल्यों के साथ संरेखित रहते हैं। मानव प्रतिक्रिया में असंगतताओं को चिकना करने से, वार्म नीतियां मानव मूल्यों के साथ दृढ़ता से संरेखित रह सकती हैं क्योंकि वे नए अनुभवों से सीखती रहती हैं।
बड़ा चित्र
वार्म दो प्रमुख एआई संरेखण अनुसंधान रुझानों के चौराहे पर बैठता है। पहला बाहरी-वितरण सामान्यीकरण का अध्ययन है, जो मॉडल के प्रदर्शन में सुधार करने का लक्ष्य रखता है जो प्रशिक्षण वितरण से भिन्न नए डेटा पर होता है। दूसरा एल्गोरिदमिक दृढ़ता पर शोध है, जो छोटे इनपुट विकृतियों या शोर के बावजूद विश्वसनीयता पर केंद्रित है।
सीखी गई अंतर्निहितता की धारणा के आसपास इन क्षेत्रों के बीच संबंध बनाकर, वार्म मूल्य संरेखण के लिए अधिक सख्ती से आधारित तकनीकों की ओर ले जाता है। वार्म से प्राप्त अंतर्दृष्टि आरएलएचएफ से परे भी सामान्य हो सकती है, व्यापक मशीन लर्निंग प्रणालियों के लिए पाठ्यक्रम प्रदान करती है जो खुली दुनिया के साथ बातचीत करती हैं।
निश्चित रूप से, पुरस्कार मॉडलिंग केवल संरेखण पहेली का एक टुकड़ा है। हमें पुरस्कार निर्दिष्टीकरण, विस्तृत पर्यवेक्षण, और सुरक्षित अन्वेषण जैसी अन्य चुनौतियों पर प्रगति की भी आवश्यकता है। वार्म को पूरक तकनीकों के साथ मिलाकर, एआई के विकास को तेज किया जा सकता है जो मानव समृद्धि को स्थायी रूप से बढ़ावा देता है। संयुक्त रूप से, शोधकर्ता दृढ़ संरेखण के सिद्धांतों को उजागर कर रहे हैं जो लाभकारी और नैतिक एआई प्रणालियों के लिए मार्ग प्रशस्त करते हैं।














