प्रॉम्प्ट इंजीनियरिंग

बड़े भाषा मॉडल के साथ उन्नत पाठ एम्बेडिंग का प्रशिक्षण

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

पाठ एम्बेडिंग शब्दों, वाक्यों, अनुच्छेदों या दस्तावेजों के वेक्टर प्रतिनिधित्व हैं जो उनके अर्थपूर्ण अर्थ को पकड़ते हैं। वे आज कई प्राकृतिक भाषा प्रसंस्करण (एनएलपी) अनुप्रयोगों में एक मूलभूत निर्माण खंड के रूप में कार्य करते हैं, जिनमें जानकारी पुनर्प्राप्ति, प्रश्न उत्तर, सेमेंटिक खोज और अधिक शामिल हैं।

वेक्टर एम्बेडिंग

वेक्टर एम्बेडिंग

बड़े भाषा मॉडल (एलएलएम) जैसे जीपीटी-3 में हाल के उन्नति ने कुछ शॉट लर्निंग और प्राकृतिक भाषा पीढ़ी में प्रभावशाली क्षमता दिखाई है। क्या हम एलएलएम का लाभ उठाकर पाठ एम्बेडिंग की स्थिति को भी आगे बढ़ा सकते हैं? अपने पत्र “बड़े भाषा मॉडल के साथ पाठ एम्बेडिंग में सुधार” में, माइक्रोसॉफ्ट के शोधकर्ता एक नई विधि का प्रस्ताव करते हैं जो एलएलएम के साथ सिंथेटिक प्रशिक्षण डेटा को उत्पन्न करके और उस पर फ़ाइन-ट्यूनिंग करके श्रेष्ठ परिणाम प्राप्त करती है।

मौजूदा तरीकों की चुनौतियाँ

पारंपरिक पाठ एम्बेडिंग तकनीकें जैसे शब्द वेक्टर के भारित औसत या टीएफ-आईडीएफ पाठ में समृद्ध संदर्भ जानकारी को पर्याप्त रूप से पकड़ने में विफल रहती हैं। अधिक हाल की विधियाँ जो पूर्व-प्रशिक्षित भाषा मॉडल जैसे बीईआरटी पर आधारित हैं, बेहतर संदर्भ-जागरूक एम्बेडिंग प्राप्त करती हैं।

हालांकि, उन्हें जटिल बहु-चरण प्रशिक्षण पाइपलाइनों की आवश्यकता होती है:

  • बिलियन कमजोर रूप से लेबल वाले या कृत्रिम पाठ जोड़े पर पूर्व-प्रशिक्षण
  • सीमित हाथ से क्यूरेटेड डेटासेट पर फ़ाइन-ट्यूनिंग

इसके लिए बड़े पैमाने पर कंप्यूटिंग संसाधनों और डेटा संग्रह के लिए मानव प्रयास की आवश्यकता होती है। प्रशिक्षण डेटा विविधता और भाषा कवरेज में भी सीमित है। उदाहरण के लिए, बीईआईआर बेंचमार्क में केवल 15 पुनर्प्राप्ति कार्यों के लिए डेटासेट शामिल हैं।

मौजूदा तरीकों में मुख्य रूप से बीईआरटी-शैली की छोटी वास्तुकला का उपयोग बैकबोन मॉडल के रूप में किया जाता है। वे अधिक उन्नत एलएलएम और संबंधित तकनीकों का लाभ उठाने में असमर्थ हैं।

विधि: एलएलएम के साथ सिंथेटिक डेटा जेनरेशन

इन सीमाओं को पार करने के लिए, शोधकर्ता एलएलएम जैसे जीपीटी-3 और जीपीटी-4 का उपयोग करके विविध सिंथेटिक प्रशिक्षण डेटा को उत्पन्न करने के लिए एक नई एकल-चरण प्रशिक्षण दृष्टिकोण का प्रस्ताव करते हैं।

मुख्य चरण हैं:

  1. कार्य टैक्सोनॉमी: पाठ एम्बेडिंग कार्यों को श्रेणियों में वर्गीकृत करने के लिए एक टैक्सोनॉमी परिभाषित करें:
    • असममित कार्य (प्रश्न और दस्तावेज़ पर्यायवाची नहीं हैं, जैसे खोज)
    • सममित कार्य (प्रश्न और दस्तावेज़ पर्यायवाची हैं, जैसे सेमेंटिक समानता)
  2. प्रॉम्प्ट डिज़ाइन: प्रत्येक कार्य प्रकार के लिए प्रॉम्प्ट टेम्पलेट बनाएं जो एलएलएम को प्रासंगिक प्रशिक्षण उदाहरणों को उत्पन्न करने के लिए मार्गदर्शन करते हैं।
  3. सिंथेटिक डेटा जेनरेशन: डिज़ाइन किए गए प्रॉम्प्ट का उपयोग करके एलएलएम को प्रॉम्प्ट करें ताकि विभिन्न सेमेंटिक कार्यों पर 93 भाषाओं में (प्रश्न, दस्तावेज़) जोड़े के सैकड़ों हज़ारों को कवर किया जा सके।
  4. मॉडल प्रशिक्षण: सिंथेटिक डेटा पर खुले स्रोत एलएलएम जैसे मिस्ट्रल को फ़ाइन-ट्यून करें और विरोधी हानि का उपयोग करें।

यह विधि मानव लेबलिंग प्रयास के बिना विभिन्न कार्यों और भाषाओं के लिए पर्याप्त प्रशिक्षण डेटा बनाने की अनुमति देती है। एलएलएम में पहले से ही वेब-स्केल निगमों पर पूर्व-प्रशिक्षण के माध्यम से एम्बेड किए गए ज्ञान का लाभ उठाकर, हम पाठ एम्बेडिंग के लिए विशिष्ट रूप से तैयार उच्च गुणवत्ता वाले डेटा को संश्लेषित कर सकते हैं।

शोधकर्ता 2-चरण प्रॉम्प्ट रणनीति के साथ इसका प्रदर्शन करते हैं:

  • जीपीटी-4 को संभावित पुनर्प्राप्ति कार्यों का सुझाव देने के लिए प्रॉम्प्ट करें

उच्च स्तरीय पुनर्प्राप्ति कार्यों के लिए प्रॉम्प्ट

    उच्च स्तरीय पुनर्प्राप्ति कार्यों के लिए प्रॉम्प्ट
  • सुझाए गए कार्यों के आधार पर (प्रश्न, दस्तावेज़) नमूनों को उत्पन्न करने के लिए इसे फिर से प्रॉम्प्ट करें

प्रत्येक कार्य के लिए (प्रश्न, सकारात्मक, कठिन नकारात्मक) ट्रिपल का उत्पादन करें

    प्रत्येक कार्य के लिए (प्रश्न, सकारात्मक, कठिन नकारात्मक) ट्रिपल का उत्पादन करें

प्रॉम्प्ट डिज़ाइन के कुछ प्रमुख पहलू:

  • मानव-जैसे निर्देशों के लिए प्राकृतिक भाषा प्रॉम्प्ट
  • विविधता को प्रोत्साहित करने के लिए प्लेसहोल्डर (जैसे प्रश्न लंबाई, स्पष्टता, दस्तावेज़ लंबाई)
  • एक ही कार्य प्रकार के लिए कई टेम्पलेट्स से डेटा को जोड़ना
  • संसाधन उपलब्धता के आधार पर भाषाओं को वजन देना

कुल मिलाकर, उन्होंने 500k पाठ एम्बेडिंग उदाहरणों को 180M टोकन की कंप्यूटिंग लागत पर उत्पन्न किया। प्रमुख भाषा अंग्रेजी (43%) थी, जिसके बाद पोलिश, जापानी, इतालवी और अन्य थीं।

मॉडल प्रशिक्षण के लिए, उन्होंने छोटे बीईआरटी-शैली की वास्तुकला के बजाय खुले स्रोत 7B पैरामीटर मिस्ट्रल मॉडल को फ़ाइन-ट्यून करना चुना। चूंकि मिस्ट्रल पहले से ही वेब-स्केल निगमों पर पूर्व-प्रशिक्षित था, अतिरिक्त विरोधी पूर्व-प्रशिक्षण की आवश्यकता नहीं थी। इसके अलावा यह मामूली सुधार प्रदान करता था।

पूरा फ़ाइन-ट्यूनिंग 1k से कम चरणों में हुआ, जिसमें सिंथेटिक और मानव-लेबल वाले डेटा का मिश्रण शामिल था। यह प्रस्तावित दृष्टिकोण की नमूना दक्षता को प्रदर्शित करता है।

परिणाम

शोधकर्ताओं ने एमटीईबी बेंचमार्क पर अपने मॉडल का मूल्यांकन किया, जो वर्गीकरण, क्लस्टरिंग, सेमेंटिक समानता, सारांश और जानकारी पुनर्प्राप्ति जैसे विभिन्न कार्यों को कवर करता है।

उनके मॉडल ने पिछले राज्य-ऑफ-द-आर्ट से 2.4 अंकों में औसत स्कोर में बेहतर प्रदर्शन किया, लगभग हर श्रेणी में नए रिकॉर्ड स्थापित किए:

मॉडल पिछला एसओटीए प्रस्तावित मॉडल
वर्गीकरण 76.0 78.5
क्लस्टरिंग 46.1 50.3
जोड़ीवार वर्गीकरण 87.1 88.3
पुनर्स्थापन 60.0 60.2
पुनर्प्राप्ति 54.3 56.9
एसटीएस 83.1 84.6
सारांश 31.6 31.4
औसत 64.2 66.6

remarkably, यहां तक कि बिना किसी लेबल वाले डेटा का उपयोग किए और केवल सिंथेटिक डेटा पर प्रशिक्षण दिए, यह प्रतिस्पर्धी सटीकता हासिल की – पूरी तरह से पर्यवेक्षित मॉडल से केवल 3.5 अंक पीछे। यह एलएलएम का उपयोग करके पाठ एम्बेडिंग को उत्पन्न करने की व्यवहार्यता को प्रदर्शित करता है, मानव लेबलिंग प्रयास के बिना।

शोधकर्ताओं ने 18 भाषाओं को कवर करने वाले बहुभाषी एमआईआरएसी बेंचमार्क पर भी मूल्यांकन किया। उनके मॉडल ने उच्च संसाधन भाषाओं पर पिछले सर्वश्रेष्ठ को पार किया, लेकिन कम संसाधन वाली भाषाओं पर कमजोर प्रदर्शन किया। वे अनुमान लगाते हैं कि कम संसाधन वाली भाषाओं पर पूर्व-प्रशिक्षण एलएलएम को और अधिक व्यापक रूप से करने से इसे कम किया जा सकता है।

संक्षेप में, एलएलएम-उत्पन्न सिंथेटिक डेटा पर प्रशिक्षित पाठ एम्बेडिंग नए राज्य-ऑफ-द-आर्ट परिणाम स्थापित करते हैं, जबकि पिछले बहु-चरण दृष्टिकोणों की तुलना में सरल और अधिक कुशल प्रशिक्षण का उपयोग करते हैं। प्रॉम्प्ट इंजीनियरिंग और सिंथेटिक डेटा गुणवत्ता में आगे के शोध के साथ, यह विधि बहुभाषी पाठ एम्बेडिंग को बहुत आगे बढ़ा सकती है।

विश्लेषण

इस कार्य से कई मूल्यवान निष्कर्ष निकलते हैं:

  • जीपीटी-3 और जीपीटी-4 जैसे एलएलएम में विभिन्न एनएलपी कार्यों के लिए उच्च गुणवत्ता वाले सिंथेटिक प्रशिक्षण डेटा को उत्पन्न करने की प्रभावशाली क्षमता है जब उन्हें उपयुक्त रूप से प्रॉम्प्ट किया जाता है। यह मानव-लेबल वाले डेटा पर निर्भरता को कम कर सकता है।
  • पाठ एम्बेडिंग के लिए, विरोधी पूर्व-प्रशिक्षण मिस्ट्रल जैसे मॉडल पर फ़ाइन-ट्यूनिंग के लिए नगण्य लाभ प्रदान करता है जो पहले से ही वेब-स्केल निगमों पर पूर्व-प्रशिक्षित हैं। यह प्रशिक्षण दक्षता में एक महत्वपूर्ण अंतर्दृष्टि है।
  • पुनर्प्राप्ति संवर्धित पीढ़ी विधियां एलएलएम को गतिशील रूप से बाहरी ज्ञान तक पहुंचने में सक्षम बना रही हैं। इसलिए, पाठ एम्बेडिंग में सुधार इन एलएलएम को बढ़ाने के लिए मूल्यवान है।
  • कम संसाधन वाली भाषाओं में प्रदर्शन में सुधार करने के लिए अभी भी महत्वपूर्ण कमी है। अधिक प्रतिनिधि डेटा पर पूर्व-प्रशिक्षित बहुभाषी एलएलएम इस अंतर को पाटने में मदद कर सकते हैं।
  • 概念 रूप से, भाषा मॉडलिंग और पाठ एम्बेडिंग एक ही सिक्के के दो पहलू हैं – भाषा सेमांटिक्स को समझना। सिंथेटिक डेटा प्रॉम्प्टिंग के साथ, एलएलएम को जटिल पाइपलाइनों के बिना एम्बेडर में जैविक रूप से फ़ाइन-ट्यून किया जा सकता है।

भविष्य के कार्य के लिए कुछ आशाजनक दिशाएं हैं:

  • जीपीटी-नियोक्स जैसे खुले स्रोत एलएलएम का उपयोग करके सिंथेटिक डेटा को उत्पन्न करना
  • लंबे संदर्भों के लिए एम्बेडर को हल्के पोस्ट-प्रशिक्षण के माध्यम से अनुकूलित करने का अन्वेषण करना
  • गुणवत्ता और कार्य कवरेज को नियंत्रित करने के लिए प्रॉम्प्ट इंजीनियरिंग तकनीकों का विकास
  • उद्योग उपयोग के लिए अनुमान लेटेंसी और स्टोरेज लागत को बेहतर बनाने के तरीके

बेंचमार्क को पार करने से परे, एलएलएम का उपयोग करके पाठ एम्बेडिंग में सुधार करने से भविष्य के लिए रोमांचक संभावनाएं खुलती हैं। जैसे-जैसे एलएलएम प्राकृतिक भाषा पर अपनी पकड़ में सुधार करते हैं, उनकी उच्च-विश्वसनीयता वाले सिंथेटिक डेटा को उत्पन्न करने की क्षमता भी सुधरेगी।

हालांकि, वास्तविक दुनिया के प्रभाव को अनुवादित करने के लिए महत्वपूर्ण शोध दिशाएं बनी हुई हैं।

अनुकूलन और नियंत्रण

सिंथेटिक डेटा का एक प्रमुख लाभ विशिष्ट आवश्यकताओं के लिए उदाहरणों को प्रोग्रामेटिक रूप से उत्पन्न करने की क्षमता है। जैसा कि पत्र में दिखाया गया है, प्रॉम्प्ट इंजीनियरिंग Hundreds of thousands of embedding tasks के लिए प्रशिक्षण डेटा को उत्पन्न करने की अनुमति देती है।

हालांकि, वर्तमान प्रॉम्प्ट डिज़ाइन अभ्यास अधिक कला की तुलना में विज्ञान है। सिंथेटिक डेटा के गुणों को सटीक रूप से नियंत्रित करने के लिए व्यवस्थित, पुनरुत्पादक विधियों को विकसित करना इस तकनीक की व्यापक पहुंच को बढ़ा सकता है।

उदाहरण के लिए, जटिलता, अस्पष्टता और उदाहरणों की नईता जैसे कारकों को संशोधित करने के लिए तकनीकों को संबोधित करने से डाउनस्ट्रीम कार्यों में लचीलेपन के मुद्दों को संबोधित करने में मदद मिल सकती है। विकसित हो रहे वास्तविक दुनिया के वितरण के अनुरूप गतिशील प्रॉम्प्ट पीढ़ी एक और खुला चुनौती है।

पैमाने पर प्रशिक्षण

जबकि पूर्व-प्रशिक्षित एलएलएम पहले से ही महत्वपूर्ण भाषाई ज्ञान को एन्कोड करते हैं, उनकी डेटा पीढ़ी कौशल संभावित रूप से आगे के पैमाने के साथ बेहतर हो सकता है। जीपीटी-4 जैसे मॉडल, जो ट्रिलियन टोकन के इंटरनेट टेक्स्ट पर प्रशिक्षित हैं, मजबूत कुछ-शॉट लर्निंग प्रदर्शित करते हैं, लेकिन विशेष रूप से प्रशिक्षण डेटा को संश्लेषित करने के लिए अनुकूलित नहीं किए गए हैं।

वेब-स्केल पर स्व-प्रशिक्षित डेटा पीढ़ी के लिए वास्तुकला और उद्देश्यों को अनुकूलित करना इस दृष्टिकोण की गुणवत्ता और दक्षता में काफी सुधार कर सकता है। प्राप्त ज्ञान को पूरक करने के लिए पुनर्प्राप्त ज्ञान को कुशलता से एकीकृत करना एक और आशाजनक दिशा है।

बहुकार्य और बहुभाषी

जैसा कि पत्र में उल्लेख किया गया है, कम संसाधन वाली भाषाओं पर प्रदर्शन में सुधार करना अभी भी एक मुद्दा है। एकल बड़े एलएलएम को पूर्व-प्रशिक्षित करने के बजाय, विशिष्ट डेटा मोडलिटी या भाषा डोमेन में विशेषज्ञता वाले छोटे मॉडलों के बेड़े को प्रशिक्षित करना एक विकल्प है।

इस तरह के एक समूह दृष्टिकोण से दुर्लभ कार्यों और भाषाओं पर कवरेज में सुधार करने में मदद मिल सकती है क्योंकि विशेषज्ञों के बीच सीखे गए प्रतिनिधित्व साझा किए जा सकते हैं। समय के साथ कार्य और भाषा विशेषज्ञता का विस्तार करने के लिए निरंतर सीखना भी एक रोमांचक दृष्टिकोण है।

निष्कर्ष में, यह पत्र एलएलएम से प्रशिक्षण डेटा को संश्लेषित करने की एक अभिनव अवधारणा को प्रस्तुत करता है ताकि प्रदर्शनकारी पाठ एम्बेडिंग बनाई जा सके। उनके परिणाम इस पद्धति की प्रभावशीलता को प्रदर्शित करते हैं, पिछले बेंचमार्क को पार करते हैं। जैसे-जैसे एलएलएम और सिंथेटिक डेटा तकनीकें आगे बढ़ती हैं, एम्बेडर को प्रशिक्षित करने के लिए उनके ज्ञान का लाभ उठाना एक अत्यधिक आशाजनक दिशा बन सकती है।

मैं पिछले पांच वर्षों से मशीन लर्निंग और डीप लर्निंग की दुनिया में खुद को डूबो रहा हूं। मेरा जुनून और विशेषज्ञता ने मुझे 50 से अधिक विविध सॉफ्टवेयर इंजीनियरिंग परियोजनाओं में योगदान देने के लिए प्रेरित किया है, जिनमें से अधिकांश में एआई/एमएल पर विशेष ध्यान केंद्रित किया गया है। मेरी जारी जिज्ञासा ने मुझे प्राकृतिक भाषा प्रसंस्करण की ओर आकर्षित किया है, जिस क्षेत्र को मैं आगे अन्वेषण करने के लिए उत्सुक हूं।