एआई मॉडल और प्लेटफ़ॉर्म

गहरे प्रोत्साहन सीखने का उपयोग करके पर्यायवाची पीढ़ी – विचार नेताओं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जब हम लिखते हैं या बात करते हैं, तो हमने सभी को यह सोचा है कि क्या दूसरों के साथ एक विचार को संवाद करने का एक बेहतर तरीका है। किन शब्दों का उपयोग करना चाहिए? विचार को कैसे संरचित करना चाहिए? वे कैसे प्रतिक्रिया देंगे? फ्रेज़े पर, हम भाषा के बारे में बहुत समय बिताते हैं – क्या काम करता है और क्या नहीं।

कल्पना कीजिए कि आप 10 मिलियन लोगों की सूची में एक ईमेल अभियान के लिए विषय पंक्ति लिख रहे हैं जो एक नए लैपटॉप पर 20% की छूट को बढ़ावा देगा।

कौन सी पंक्ति चुनेंगे:

  • अब आप अपने अगले ऑर्डर पर अतिरिक्त 20% की छूट पा सकते हैं
  • तैयार हो जाएं – अतिरिक्त 20% की छूट

जबकि वे एक ही जानकारी प्रदान करते हैं, एक ने दूसरे की तुलना में लगभग 15% उच्च खुली दर हासिल की (और मुझे लगता है कि आप हमारे मॉडल को यह अनुमान लगाने में नहीं हरा सकते कि कौन सा है?)। जबकि भाषा का परीक्षण अक्सर ए/बी परीक्षण या बहु-सशस्त्र बैंडिट के माध्यम से किया जा सकता है, स्वचालित रूप से पर्यायवाची उत्पन्न करना एक真正 चुनौतीपूर्ण शोध समस्या बनी हुई है।

दो वाक्य एक दूसरे के पर्यायवाची माने जाते हैं यदि वे एक ही अर्थ साझा करते हैं और परस्पर विनिमय योग्य हो सकते हैं। एक और महत्वपूर्ण बात जिसे अक्सर अनदेखा किया जाता है वह यह है कि क्या मशीन द्वारा उत्पन्न वाक्य सुव्यवस्थित है।

पर्यवेक्षित शिक्षा के विपरीत, प्रोत्साहन सीखने (आरएल) एजेंट अपने वातावरण के साथ बातचीत करके और परिणामस्वरूप प्राप्त पुरस्कारों को देखकर सीखते हैं। यह थोड़ा सूक्ष्म अंतर एल्गोरिदम के काम करने और मॉडल के प्रशिक्षण के तरीके के लिए बड़े प्रभाव है। गहरा प्रोत्साहन सीखना एक कार्य अनुमानक के रूप में तंत्रिका नेटवर्क का उपयोग करता है ताकि एजेंट जटिल वातावरण में मानवों को पार करना सीख सके, जैसे कि गो, एटारी और स्टारक्राफ्ट II

इसके बावजूद, प्रोत्साहन सीखने का वास्तविक दुनिया की समस्याओं पर, जिनमें प्राकृतिक भाषा प्रसंस्करण (एनएलपी) भी शामिल है, व्यापक रूप से अनुप्रयोग नहीं किया गया है।

मेरे डेटा विज्ञान में एमएससी थीसिस के हिस्से के रूप में, हम दिखाते हैं कि गहरा प्रोत्साहन कैसे पर्यवेक्षित शिक्षा विधियों को पार कर सकता है स्वचालित रूप से इनपुट पाठ के पर्यायवाची उत्पन्न करने में। सर्वोत्तम पर्यायवाची पीढ़ी की समस्या को सबसे अधिक सेमेंटिक समानता के साथ वाक्यों के बीच श्रृंखला के रूप में देखा जा सकता है जबकि आउटपुट में सुव्यवस्था बनाए रखना है। प्रोत्साहन सीखने वाले एजेंट नियंत्रण वातावरण में अधिकतम अपेक्षित पुरस्कार प्राप्त करने के लिए सर्वोत्तम कार्यों के सेट को खोजने के लिए अच्छी तरह से अनुकूल हैं।

मशीन लर्निंग में अधिकांश समस्याओं के विपरीत, अधिकांश प्राकृतिक भाषा पीढ़ी (एनएलजी) अनुप्रयोगों में सबसे बड़ी समस्या मॉडलिंग में नहीं बल्कि मूल्यांकन में है। जबकि मानव मूल्यांकन वर्तमान में एनएलजी मूल्यांकन में स्वर्ण मानक माना जाता है, यह कई महत्वपूर्ण नुकसानों से ग्रस्त है, जिनमें महंगा, समय लेने वाला, ट्यून करने में मुश्किल और प्रयोगों और डेटासेट के माध्यम से पुनरुत्पादन योग्य नहीं होना शामिल है (हान, 2016)। परिणामस्वरूप, शोधकर्ता लंबे समय से स्वचालित मेट्रिक्स की तलाश में हैं जो सरल, सामान्य और मानव निर्णय को प्रतिबिंबित करते हैं (पापिनेनी एट अल, 2002)

मशीन द्वारा उत्पन्न छवि कैप्शन का मूल्यांकन करने में सबसे सामान्य स्वचालित मूल्यांकन विधियों का सार नीचे उनके पेशेवरों और विपक्षों के साथ संक्षेपित किया गया है:

प्रोत्साहन सीखने का उपयोग करके पर्यायवाची पीढ़ी पाइपलाइन

हमने एक प्रणाली विकसित की जिसे पैराफ्रेज़ नामक उच्च गुणवत्ता वाले पर्यायवाची उत्पन्न करता है। प्रणाली में कई चरण होते हैं ताकि प्रोत्साहन सीखने को गणनात्मक रूप से कुशल तरीके से लागू किया जा सके। पाइपलाइन का एक संक्षिप्त सार नीचे दिया गया है, जिसमें अधिक विवरण शोध प्रबंध में शामिल है।

डेटासेट

पर्यायवाची डेटासेट के कई शोध में उपयोग किए जाते हैं, जिनमें शामिल हैं: माइक्रोसॉफ्ट पर्यायवाची कॉर्पस, एसीएल की सेमेंटिक टेक्स्ट समानता प्रतियोगिता, क्वोरा डुप्लिकेट प्रश्न, और ट्विटर साझा लिंक। हमने एमएस-सीओसीओ को इसके आकार, स्वच्छता और दो उल्लेखनीय पर्यायवाची पीढ़ी पत्रों के लिए बेंचमार्क के रूप में इसके उपयोग के कारण चुना है। एमएस-सीओसीओ में 120k सामान्य दृश्यों की छवियों के साथ 5 छवि कैप्शन प्रति छवि 5 अलग-अलग मानव अनnotators द्वारा प्रदान किए जाते हैं।

हालांकि यह मुख्य रूप से कंप्यूटर विजन शोध के लिए डिज़ाइन किया गया है, कैप्शन में उच्च सेमेंटिक समानता होती है और वे दिलचस्प पर्यायवाची होते हैं। दी गई छवि कैप्शन विभिन्न लोगों द्वारा प्रदान की जाती हैं, वे दृश्य में विवरण प्रदान करने में छोटे भिन्नताएं होती हैं इसलिए उत्पन्न वाक्य विवरण की कल्पना करते हैं।

पर्यवेक्षित मॉडल

प्रोत्साहन सीखने में नमूना दक्षता, प्रशिक्षण समय, और समग्र सर्वोत्तम अभ्यास में काफी सुधार हुआ है, प्रोत्साहन सीखने वाले मॉडल को शून्य से प्रशिक्षित करना अभी भी तुलनात्मक रूप से बहुत धीमा और अस्थिर है (अरुलकुमारन एट अल, 2017)। इसलिए, शून्य से प्रशिक्षित करने के बजाय, हम पहले एक पर्यवेक्षित मॉडल को प्रशिक्षित करते हैं और फिर इसे प्रोत्साहन सीखने का उपयोग करके ठीक करते हैं।

हम एक एन्कोडर-डिकोडर मॉडल फ्रेमवर्क का उपयोग करते हैं और कई बेसलाइन पर्यवेक्षित मॉडलों के प्रदर्शन का मूल्यांकन करते हैं। प्रोत्साहन सीखने का उपयोग करके मॉडल को ठीक करते समय, हम केवल डिकोडर नेटवर्क को ठीक करते हैं और एन्कोडर नेटवर्क को स्थिर मानते हैं। इस तरह हम दो मुख्य फ्रेमवर्क पर विचार करते हैं:

  • मानक/वैनिला एन्कोडर डिकोडर का उपयोग करके पर्यवेक्षित मॉडल को शून्य से प्रशिक्षित करना
  • पूर्व-प्रशिक्षित वाक्य एम्बेडिंग मॉडल का उपयोग करके एन्कोडर के लिए, जिसमें शामिल हैं: पूल्ड शब्द एम्बेडिंग (ग्लोव), इन्फरसेंट, और बीईआरटी

पर्यवेक्षित मॉडल आमतौर पर बीईआरटी और वैनिला एन्कोडर-डिकोडर के साथ सर्वोत्तम प्रदर्शन प्राप्त करते हैं।

जबकि प्रदर्शन काफी उचित है, तीन सामान्य त्रुटि स्रोत हैं: हकलाना, वाक्य खंड उत्पन्न करना, और हॉलुसिनेशन। ये वे मुख्य समस्याएं हैं जिन्हें प्रोत्साहन सीखने का उपयोग करके हल किया जाना है।

प्रोत्साहन सीखने वाला मॉडल

प्रोत्साहन सीखने वाले एल्गोरिदम को लागू करना बहुत चुनौतीपूर्ण है, खासकर जब आप नहीं जानते कि क्या समस्या हल की जा सकती है। पर्यावरण, एजेंट, हाइपरपैरामीटर, पुरस्कार कार्य, या सभी के संयोजन में समस्याएं हो सकती हैं। ये समस्याएं तब और बढ़ जाती हैं जब आप गहरे प्रोत्साहन सीखने का उपयोग कर रहे होते हैं क्योंकि आपको तंत्रिका नेटवर्क की जटिलता को डिबग करने का मजा मिलता है।

जैसा कि सभी डिबगिंग के साथ, यह महत्वपूर्ण है कि सरल शुरू करें। हमने दो अच्छी तरह से समझे जाने वाले खिलौना प्रोत्साहन सीखने वाले वातावरण (कार्टपोल और फ्रोजनलेक) को प्रोत्साहन सीखने वाले एल्गोरिदम का परीक्षण करने और पर्यवेक्षित मॉडल से ज्ञान को स्थानांतरित करने के लिए एक दोहराने योग्य रणनीति खोजने के लिए लागू किया।

हमने पाया कि एक अभिनेता-आलोचक एल्गोरिदम ने इन वातावरणों में रीनफोर्स को बेहतर बनाया। अभिनेता-आलोचक मॉडल में ज्ञान को स्थानांतरित करने के संदर्भ में, हमने पाया कि अभिनेता के वजन को प्रशिक्षित पर्यवेक्षित मॉडल के साथ आरंभ करना और आलोचक को पूर्व-प्रशिक्षित करने से सर्वोत्तम प्रदर्शन मिला। हमने पाया कि जटिल नीति ज्ञान को नए वातावरण में सामान्य बनाना चुनौतीपूर्ण है क्योंकि वे कई नए हाइपरपैरामीटर पेश करते हैं जिन्हें काम करने के लिए ट्यून करने की आवश्यकता होती है।

इन अंतर्दृष्टि द्वारा समर्थित, हम तब पर्यायवाची पीढ़ी कार्य के लिए एक दृष्टिकोण विकसित करने के लिए आगे बढ़ते हैं। हमें पहले एक वातावरण बनाने की आवश्यकता है।

वातावरण हमें आसानी से विभिन्न मूल्यांकन मेट्रिक्स का उपयोग करके पुरस्कार कार्यों के प्रभाव का परीक्षण करने की अनुमति देता है।

हम तब एजेंट को परिभाषित करते हैं, इसके कई फायदों को देखते हुए हम एक अभिनेता-आलोचक वास्तुकला का उपयोग करते हैं। अभिनेता का उपयोग अनुक्रम में अगले शब्द का चयन करने के लिए किया जाता है और इसके वजन को प्रशिक्षित पर्यवेक्षित मॉडल का उपयोग करके आरंभ किया जाता है। आलोचक एक अनुमान प्रदान करता है कि एक राज्य को प्राप्त होने वाला अपेक्षित पुरस्कार क्या होगा, जो अभिनेता को सीखने में मदद करता है।

सही पुरस्कार कार्य का डिज़ाइन

प्रोत्साहन सीखने वाली प्रणाली का सबसे महत्वपूर्ण घटक पुरस्कार कार्य है, क्योंकि यह वह है जिसे प्रोत्साहन सीखने वाला एजेंट अनुकूलित करने का प्रयास करता है। यदि पुरस्कार कार्य गलत है, तो परिणाम भी पीड़ित होंगे, भले ही प्रणाली के बाकी हिस्से काम कर रहे हों।

एक क्लासिक उदाहरण यह है कोस्ट रनर्स जहां ओपनएआई शोधकर्ताओं ने पुरस्कार कार्य को कुल स्कोर को अधिकतम करने के रूप में निर्धारित किया, दौड़ जीतने के बजाय। परिणाम यह है कि एजेंट ने एक लूप की खोज की जहां वह टर्बो को हिट करके दौड़ पूरी किए बिना उच्चतम स्कोर प्राप्त कर सकता था।

https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title

चूंकि पर्यायवाची की गुणवत्ता का मूल्यांकन करना स्वयं एक हल की जाने वाली समस्या है, एक पुरस्कार कार्य को स्वचालित रूप से इस उद्देश्य को पकड़ने के लिए डिज़ाइन करना और भी कठिन है। भाषा के अधिकांश पहलू रेखीय मेट्रिक्स में अच्छी तरह से विभाजित नहीं होते हैं और कार्य-निर्भर होते हैं (नोविकोवा एट अल, 2017)

प्रोत्साहन सीखने वाला एजेंट अक्सर एक दिलचस्प रणनीति का पता लगाता है जो पुरस्कारों को अधिकतम करने के लिए मूल्यांकन मेट्रिक्स की कमजोरियों का फायदा उठाता है, न कि उच्च गुणवत्ता वाला पाठ उत्पन्न करता है। यह आमतौर पर उन मेट्रिक्स पर खराब प्रदर्शन के परिणामस्वरूप होता है जिन्हें एजेंट सीधे अनुकूलित नहीं कर रहा है।

हम तीन मुख्य दृष्टिकोण पर विचार करते हैं:

  1. शब्द-ओवरलैप मेट्रिक्स

सामान्य एनएलपी मूल्यांकन मेट्रिक्स पर्यायवाची और मूल्यांकन वाक्य के बीच शब्द ओवरलैप के अनुपात पर विचार करते हैं। अधिक ओवरलैप होने पर अधिक पुरस्कार मिलता है। शब्द-स्तरीय दृष्टिकोणों की चुनौती यह है कि एजेंट बहुत सारे कनेक्टिंग शब्दों जैसे “एक है के” को शामिल करता है और सुव्यवस्था का कोई उपाय नहीं है। यह बहुत कम गुणवत्ता वाले पर्यायवाची का परिणाम है।

  1. वाक्य-स्तरीय समानता और सुव्यवस्था मेट्रिक्स

उत्पन्न पर्यायवाची के मुख्य गुण यह है कि यह सुव्यवस्थित होना चाहिए और इनपुट वाक्य के साथ सेमेंटिक रूप से समान होना चाहिए। इसलिए, हम उन्हें व्यक्तिगत रूप से स्कोर करने का प्रयास करते हैं, फिर मेट्रिक्स को जोड़ते हैं। सेमेंटिक समानता के लिए, हम पूर्व-प्रशिक्षित मॉडल से वाक्य एम्बेडिंग के बीच कोसाइन समानता का उपयोग करते हैं, जिसमें बीईआरटी शामिल है। सुव्यवस्था के लिए, हम जीपीटी-2 से वाक्य की विचित्रता पर आधारित स्कोर का उपयोग करते हैं। कोसाइन समानता और सुव्यवस्था स्कोर जितना अधिक होगा, पुरस्कार उतना ही अधिक होगा।

हमने विभिन्न वाक्य एम्बेडिंग मॉडल और सुव्यवस्था मॉडल के कई संयोजनों का प्रयास किया, और जबकि प्रदर्शन उचित था, एजेंट का सामना करने वाली मुख्य समस्या सेमेंटिक समानता के साथ सुव्यवस्था को पर्याप्त रूप से संतुलित करना था। अधिकांश कॉन्फ़िगरेशन के लिए, एजेंट ने सुव्यवस्था को प्राथमिकता दी, जिसके परिणामस्वरूप विवरण को हटा दिया गया और अधिकांश इकाइयों को किसी चीज़ के “बीच में” या “मेज़” या “सड़क के किनारे” पर रखा गया।

मल्टी-ऑब्जेक्टिव प्रोत्साहन सीखना एक खुला शोध प्रश्न है और इस मामले में बहुत चुनौतीपूर्ण है।

  1. एक प्रतिद्वंद्वी मॉडल का उपयोग करके पुरस्कार कार्य के रूप में

चूंकि मानव मूल्यांकन को स्वर्ण मानक माना जाता है, हम एक अलग मॉडल को प्रशिक्षित करते हैं जिसे विभेदक कहा जाता है ताकि यह अनुमान लगा सके कि क्या दो वाक्य एक दूसरे के पर्यायवाची हैं (जिस तरह एक मानव मूल्यांकनकर्ता करेगा)। प्रोत्साहन सीखने वाले मॉडल का लक्ष्य तब इस मॉडल को यह विश्वास दिलाना है कि उत्पन्न वाक्य मूल वाक्य का पर्यायवाची है। विभेदक एक स्कोर उत्पन्न करता है कि दो वाक्य एक दूसरे के पर्यायवाची होने की कितनी संभावना है, जिसे प्रोत्साहन सीखने वाले एजेंट को प्रशिक्षित करने के लिए पुरस्कार के रूप में उपयोग किया जाता है।

प्रत्येक 5,000 अनुमानों के बाद, विभेदक को यह बताया जाता है कि कौन सा पर्यायवाची डेटासेट से आया था और कौन सा उत्पन्न किया गया था ताकि यह अपने भविष्य के अनुमानों में सुधार कर सके। प्रक्रिया कई दौरों के लिए जारी रहती है, जिसमें एजेंट विभेदक को धोखा देने का प्रयास करता है और विभेदक उत्पन्न पर्यायवाची और डेटासेट से मूल्यांकन पर्यायवाची के बीच अंतर करने का प्रयास करता है।

कई दौरों के प्रशिक्षण के बाद, एजेंट पर्यवेक्षित मॉडल और अन्य पुरस्कार कार्यों से बेहतर पर्यायवाची उत्पन्न करता है।

निष्कर्ष और सीमाएं

प्रतिद्वंद्वी दृष्टिकोण (जिसमें गेम के लिए स्व-खेल शामिल है) प्रोत्साहन सीखने वाले एल्गोरिदम को निर्दिष्ट पुरस्कार कार्य के बिना कertain कार्यों पर मानव स्तर के प्रदर्शन से अधिक प्रशिक्षित करने के लिए एक बहुत ही आशाजनक दृष्टिकोण प्रदान करते हैं।

जबकि प्रोत्साहन सीखने में पर्यवेक्षित शिक्षा को पार किया, प्रोत्साहन सीखने का उपयोग करने में अतिरिक्त ओवरहेड की मात्रा कोड, गणना, और जटिलता में नहीं है जो अधिकांश अनुप्रयोगों के लिए प्रदर्शन लाभ के लायक है। प्रोत्साहन सीखना सबसे अच्छा उन स्थितियों में छोड़ दिया जाता है जहां पर्यवेक्षित शिक्षा को आसानी से लागू नहीं किया जा सकता है, और एक पुरस्कार कार्य आसानी से परिभाषित किया जा सकता है (जैसे एटारी गेम)। दृष्टिकोण और एल्गोरिदम पर्यवेक्षित शिक्षा में बहुत अधिक परिपक्व हैं और त्रुटि संकेत बहुत मजबूत है, जिसके परिणामस्वरूप प्रशिक्षण बहुत तेज और स्थिर है।

एक और विचार यह है कि जैसे अन्य तंत्रिका नेटवर्क दृष्टिकोण, एजेंट उत्पादन अनुप्रयोगों में विफल हो सकता है जहां यह पहले देखे गए इनपुट से बहुत अलग है, जिसमें एक अतिरिक्त परत की आवश्यकता होती है स्वचालित रूप से सैनिटी जांच।

प्रोत्साहन सीखने वाले दृष्टिकोणों और पिछले कुछ वर्षों में गणनात्मक बुनियादी ढांचे में प्रगति का विस्फोट उद्योग में, विशेष रूप से एनएलपी में प्रोत्साहन सीखने को लागू करने के लिए बड़े अवसर खोलेगा।

एंड्रू गिब्स-ब्रावो Phrasee में एक डेटा साइंटिस्ट हैं जो Phrasee की विश्व-अग्रणी AI-Powered कॉपीराइटिंग के पीछे की तकनीक में सुधार पर ध्यान केंद्रित कर रहे हैं। वह लंदन रिन्फोर्समेंट लर्निंग कम्युनिटी मीटअप के सह-संगठक भी हैं और आरएल, एनएलपी, और मशीन लर्निंग की सभी चीजों में रुचि रखते हैं।