एआई मॉडल और प्लेटफ़ॉर्म

मिनी जीपीटी-5: इंटरलीव्ड विजन-एंड-लैंग्वेज जेनरेशन वाया जेनरेटिव वोकेंस

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

पिछले कुछ वर्षों में, बड़े भाषा मॉडल (एलएलएम) ने प्राकृतिक भाषा प्रसंस्करण (एनएलपी) में नए मानकों को प्राप्त करने के लिए एआई डेवलपर्स का ध्यान आकर्षित किया है। इन मॉडलों ने पाठ उत्पादन और समझने में नए मानक स्थापित किए हैं। हालांकि, पाठ उत्पादन में प्रगति के बावजूद, पाठ की कथाओं के साथ सुसंगत छवियों का उत्पादन करना अभी भी एक चुनौती है। इसे संबोधित करने के लिए, डेवलपर्स ने “जनरेटिव वोकेंस” पर आधारित एक नवीन दृष्टि और भाषा उत्पादन दृष्टिकोण पेश किया है, जो पाठ-छवि आउटपुट के लिए एक सेतु का निर्माण करता है।

मिनी जीपीटी-5 का आधार एक दो-चरणीय प्रशिक्षण रणनीति पर है, जो विवरण-मुक्त बहुसंचारी डेटा उत्पादन पर केंद्रित है, जहां प्रशिक्षण डेटा को व्यापक छवि विवरण की आवश्यकता नहीं है। इसके अलावा, मॉडल की अखंडता को बढ़ाने के लिए, मॉडल में एक वर्गीकरण-मुक्त मार्गदर्शन प्रणाली शामिल है, जो छवि उत्पादन के लिए वोकेन की प्रभावशीलता को बढ़ाती है। प्रारंभिक चरण में, मिनी जीपीटी-5 फ्रेमवर्क ने शक्तिशाली प्रदर्शन और बेसलाइन डिव्टर मॉडल की तुलना में एक महत्वपूर्ण सुधार दिखाया है, जो एमएमडायलॉग डेटासेट पर प्रशिक्षित है, और विस्ट डेटासेट पर मानव मूल्यांकन में इसकी क्षमता को लगातार प्रदर्शित किया है।

मिनी जीपीटी5: एक परिचय

एलएलएम फ्रेमवर्क के हाल के विकास के साथ, और इन एलएलएम फ्रेमवर्क पर आधारित अनुप्रयोगों के साथ, बहुसंचारी सुविधा एकीकरण एक क्षेत्र है जिसने अपनी लोकप्रियता में वृद्धि देखी है, क्योंकि यह एक महत्वपूर्ण प्रगति है जो राज्य-ऑफ-द-आर्ट सामग्री निर्माण उपकरण से लेकर उन्नत बहुसंचारी संवाद एजेंट तक विभिन्न अनुप्रयोगों को शक्ति प्रदान करती है। निरंतर अनुसंधान और विकास के साथ, भाषा और दृष्टि मॉडल उस बिंदु पर हैं जहां काम उन्हें दोनों पाठ और दृश्य डेटा को सहजता से उत्पन्न करने में सक्षम बनाने के लिए किया जा रहा है। एलएलएम की बहुसंचारी डेटा को सहजता से उत्पन्न करने की क्षमता ई-कॉमर्स, मीडिया, और वर्चुअल रियलिटी सहित विभिन्न डोमेन में बातचीत को बढ़ाने में मदद करेगी।

अंततः, लक्ष्य मॉडलों को एक सुसंगत और तर्कसंगत तरीके से पाठ और दृश्य मॉडलिटी दोनों का उपयोग करके संश्लेषण, पहचान, और प्रतिक्रिया करने में सक्षम बनाना है, जो जानकारी के प्रवाह को सुसंगत बनाने और तार्किक कथाओं का निर्माण करने में एक महत्वपूर्ण भूमिका निभाता है। पाठ और दृश्य मॉडलिटी के संयोजन की आवश्यकता एलएलएम में अधिक तरल, एकीकृत और इंटरैक्टिव बहुसंचारी बातचीत की आवश्यकता से प्रेरित है, और अंततः भाषा और दृष्टि के बीच वैकल्पिक उत्पादन को प्राप्त करने के लिए। हालांकि, एलएलएम में एकीकृत और इंटरैक्टिव बहुसंचारी बातचीत प्राप्त करना एक जटिल कार्य है जिसमें कई चुनौतियां शामिल हैं, जिनमें से कुछ हैं:

  1. वर्तमान एलएलएम पाठ उत्पादन और पाठ-छवि जोड़े के प्रसंस्करण में अत्यधिक कुशल और सक्षम हैं, लेकिन छवि उत्पादन में संतोषजनक प्रदर्शन प्रदान नहीं करते हैं।
  2. इन दृष्टि और भाषा मॉडलों का विकास विषय-केंद्रित डेटा पर बहुत अधिक निर्भर करता है, जो मॉडलों के लिए उत्पन्न पाठ को उनकी संबंधित छवियों के साथ संरेखित करना चुनौतीपूर्ण बनाता है।
  3. अंत में, अधिक प्रभावी रणनीतियों की आवश्यकता है क्योंकि उनकी क्षमताओं में वृद्धि के साथ, एलएलएम की स्मृति आवश्यकताएं भी बढ़ जाती हैं, विशेष रूप से डाउनस्ट्रीम कार्यों को करने के दौरान।

मिनी जीपीटी-5 फ्रेमवर्क, एक इंटरलीव्ड भाषा और दृष्टि उत्पादन एल्गोरिदम तकनीक जो “जनरेटिव वोकेंस” की अवधारणा को पेश करती है, उपरोक्त चुनौतियों का समाधान करने का प्रयास करती है। मिनी जीपीटी-5 फ्रेमवर्क बहुसंचारी डेटा उत्पादन के लिए एक नई दृष्टिकोण प्रस्तुत करता है जो बड़े भाषा मॉडलों को स्टेबल डिफ्यूजन तकनीकों के साथ एकीकृत करता है जो विशेष दृश्य टोकन का उपयोग करते हैं। प्रस्तावित दो-चरण प्रशिक्षण विधि मिनी जीपीटी-5 फ्रेमवर्क में विवरण-मुक्त प्रशिक्षण के महत्व पर जोर देती है और मॉडल को सीमित डेटा वाले दृश्यों में भी कुशल प्रदर्शन प्रदान करने के लिए तैयार करती है।

लेकिन मिनी जीपीटी-5 मॉडल को वर्तमान में मौजूद फ्रेमवर्क से क्या अलग बनाता है वह यह है कि मिनी जीपीटी-5 फ्रेमवर्क के सामान्य चरण डोमेन-विशिष्ट एनोटेशन से मुक्त हैं। इसके अलावा, उत्पन्न पाठ और उनकी संबंधित छवियों को एक दूसरे के साथ सुसंगत बनाने के लिए, मिनी जीपीटी-5 फ्रेमवर्क एक दो-हिस्से की रणनीति को तैनात करता है जो वर्गीकरण-मुक्त मार्गदर्शन को बढ़ाता है और जनरेटिव वोकेंस का उपयोग करता है। मिनी जीपीटी-5 फ्रेमवर्क प्रशिक्षण की दक्षता को अनुकूलित करता है और अपनी पैरामीटर-दक्षता वाली फाइन-ट्यूनिंग रणनीति के माध्यम से स्मृति सीमाओं को संबोधित करता है।

एक त्वरित सारांश प्रदान करने के लिए, मिनी जीपीटी-5 फ्रेमवर्क

  1. बहुसंचारी एनकोडर का उपयोग करता है जो एक नए और सामान्य तरीके को प्रस्तुत करता है जो पारंपरिक एलएलएम की तुलना में अधिक प्रभावी सिद्ध हुआ है, और स्टेबल डिफ्यूजन तकनीकों के साथ जनरेटिव टोकन को जोड़ती है ताकि इंटरलीव्ड भाषा और दृश्य आउटपुट उत्पन्न किया जा सके।
  2. विवरण-मुक्त बहुसंचारी आउटपुट के उत्पादन के लिए एक दो-चरणीय प्रशिक्षण रणनीति का प्रस्ताव करता है, और प्रशिक्षण के दौरान वर्गीकरण-मुक्त मार्गदर्शन को शामिल करता है ताकि उत्पन्न डेटा की गुणवत्ता को और बेहतर बनाया जा सके।

मिनी जीपीटी-5 मॉडल पिछले शोध और कार्य से प्रेरित है, विशेष रूप से

  • पाठ से छवि उत्पादन: पाठ विवरणों को उनकी संबंधित दृश्य प्रतिनिधित्व में परिवर्तित करने और पाठ से छवि मॉडलों को सुविधाजनक बनाने के लिए।
  • एमएलएलएम या बहुसंचारी बड़े भाषा मॉडल: पूर्व-प्रशिक्षित एलएलएम मॉडलों का उपयोग करके उनकी बहुसंचारी डेटा उत्पादन में प्रभावशीलता का अन्वेषण करना।
  • बड़े भाषा मॉडल के साथ बहुसंचारी उत्पादन: एलएलएम की क्षमताओं को भाषा और दृश्य डेटा उत्पादन को सहजता से एकीकृत करने के लिए बढ़ाने के लिए।

मिनी जीपीटी-5: विधि, वास्तुकला, और फ्रेमवर्क

बड़े भाषा मॉडलों को बहुसंचारी डेटा उत्पादन क्षमताओं से लैस करने के लिए, मिनी जीपीटी-5 मॉडल एक फ्रेमवर्क प्रस्तुत करता है जो पाठ से छवि उत्पादन मॉडलों और पूर्व-प्रशिक्षित बहुसंचारी बड़े भाषा मॉडलों को एकीकृत करने का लक्ष्य रखता है। मिनी जीपीटी-5 फ्रेमवर्क “जनरेटिव वोकेंस” की अवधारणा को भी पेश करता है, जो विशेष दृश्य टोकन हैं जो डोमेन के पार असंगतताओं को संबोधित करने में मदद करते हैं और सीधे कच्ची छवियों पर प्रशिक्षित हो सकते हैं। मिनी जीपीटी-5 फ्रेमवर्क में वर्गीकरण-मुक्त रणनीति और एक उन्नत दो-चरण प्रशिक्षण विधि को भी शामिल किया गया है ताकि एलएलएम द्वारा उत्पन्न बहुसंचारी डेटा की गुणवत्ता में सुधार किया जा सके। आइए मिनी जीपीटी-5 फ्रेमवर्क को विस्तार से देखें।

बहुसंचारी इनपुट चरण

हाल के वर्षों में, एलएलएम के विकास ने बहुसंचारी समझने की क्षमता को प्रकाश में लाया है, जो छवियों को एक अनुक्रमिक इनपुट के रूप में संसाधित करने में सक्षम बनाता है। मिनी जीपीटी-5 फ्रेमवर्क दृश्य विशेषताओं को उत्पन्न करने के प्रयास में विशेष रूप से डिज़ाइन किए गए जनरेटिव वोकेंस का उपयोग करता है, जो एलएलएम की बहुसंचारी समझने की क्षमता को बहुसंचारी डेटा उत्पादन में विस्तारित करता है। इसके अलावा, मिनी जीपीटी-5 फ्रेमवर्क बहुसंचारी आउटपुट सीखने के लिए एलएलएम फ्रेमवर्क के साथ पैरामीटर-दक्षता और कटिंग-एज फाइन-ट्यूनिंग तकनीकों का उपयोग करता है।

बहुसंचारी एनकोडिंग

मिनी जीपीटी-5 फ्रेमवर्क में पूर्व-प्रशिक्षित दृश्य एनकोडर प्रत्येक इनपुट छवि को एक विशेषता में परिवर्तित करता है, और प्रत्येक पाठ टोकन को एक वेक्टर के रूप में एम्बेड किया जाता है, और इनपुट प्रॉम्प्ट विशेषताएं इन एम्बेडिंग्स को एक दूसरे के साथ जोड़कर उत्पन्न की जाती हैं।

बड़े भाषा मॉडल में वोकेंस जोड़ना

पारंपरिक रूप से, बड़े भाषा मॉडल की शब्दावली में केवल पाठ टोकन शामिल होते हैं, जिसके कारण मिनी जीपीटी-5 फ्रेमवर्क के डेवलपर्स को जनरेटिव और पारंपरिक एलएलएम के बीच की खाई को पाटने की आवश्यकता थी। मिनी जीपीटी-5 फ्रेमवर्क एलएलएम की शब्दावली में जनरेटिव टोकन के रूप में विशेष टोकन पेश करता है। फिर, फ्रेमवर्क इन विशेष वोकेंस के लिए एलएलएम की छुपी हुई आउटपुट स्थिति का उपयोग बाद के छवि उत्पादन के लिए करता है, और वोकेंस की स्थिति द्वारा इंटरलीव्ड छवियों का समावेश दर्शाया जाता है।

पीईएफटी या पैरामीटर-दक्षता वाली फाइन-ट्यूनिंग

पीईएफटी या पैरामीटर-दक्षता वाली फाइन-ट्यूनिंग एलएलएम को प्रशिक्षित करने के लिए एक महत्वपूर्ण अवधारणा है, और फिर भी, पीईएफटी के बहुसंचारी सेटिंग्स में अनुप्रयोग अभी भी बड़े पैमाने पर अन्वेषण किया जाना बाकी है। मिनी जीपीटी-5 फ्रेमवर्क मिनी जीपीटी-4 फ्रेमवर्क के एनकोडर पर पैरामीटर-दक्षता वाली फाइन-ट्यूनिंग का उपयोग करता है ताकि मॉडल को निर्देशों या प्रॉम्प्ट्स को बेहतर ढंग से समझने और शून्य-शॉट या नए वातावरण में समग्र प्रदर्शन में सुधार करने में मदद मिल सके।

बहुसंचारी आउटपुट उत्पादन

जनरेटिव मॉडल को जनरेटिव टोकन के साथ सटीक रूप से संरेखित करने के लिए, मिनी जीपीटी-5 फ्रेमवर्क एक कॉम्पैक्ट मैपिंग मॉड्यूल को प्रस्तुत करता है जो आयामों को मिलाने और पर्यवेक्षी हानियों को शामिल करने के लिए है, जिसमें लेटेंट डिफ्यूजन मॉडल हानि और पाठ स्थान हानि शामिल हैं। लेटेंट डिफ्यूजन पर्यवेक्षी हानि सीधे टोकन के साथ उपयुक्त दृश्य विशेषताओं को संरेखित करती है, जबकि पाठ स्थान हानि मॉडल को टोकन की सही स्थितियों को सीखने में मदद करती है। चूंकि मिनी जीपीटी-5 फ्रेमवर्क में जनरेटिव वोकेंस छवियों द्वारा सीधे निर्देशित किए जाते हैं, मिनी जीपीटी-5 फ्रेमवर्क को छवियों के लिए व्यापक विवरण की आवश्यकता नहीं होती है, जिससे विवरण-मुक्त सीखने की अनुमति मिलती है।

पाठ स्थान उत्पादन

मिनी जीपीटी-5 फ्रेमवर्क पाठ स्थान में वोकेंस और पाठ दोनों को संयुक्त रूप से उत्पन्न करने के लिए एक कारणात्मक भाषा मॉडलिंग विधि का पालन करता है, और प्रशिक्षण के दौरान, वोकेंस को मैदान की सच्ची छवियों की स्थिति में जोड़ा जाता है और मॉडल को पाठ उत्पादन के दौरान वोकेंस की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है।

वोकेंस विशेषताओं को छवि उत्पादन के लिए मैपिंग

पाठ स्थान का उत्पादन करने के बाद, फ्रेमवर्क छुपी हुई आउटपुट स्थिति को पाठ से छवि उत्पादन मॉडल के पाठ-शर्त विशेषता स्थान के साथ संरेखित करता है। फ्रेमवर्क में एक फीचर मैपिंग मॉड्यूल भी शामिल है जिसमें एक दो-परत एमएलपी मॉडल, एक सीखने योग्य डिकोडर फीचर अनुक्रम, और एक चार-परत एनकोडर-डिकोडर ट्रांसफॉर्मर मॉडल शामिल है।

एलडीएम या लेटेंट डिफ्यूजन मॉडल के साथ छवि उत्पादन

शोर-मुक्त प्रक्रिया में आवश्यक छवियों को उत्पन्न करने के लिए, फ्रेमवर्क मैपिंग विशेषताओं का उपयोग एक शर्त के रूप में करता है। फ्रेमवर्क प्रशिक्षण के दौरान एक पूर्व-प्रशिक्षित वीएई का उपयोग करके मैदान की सच्ची छवि को पहले एक लेटेंट विशेषता में परिवर्तित करता है, जिसके बाद शोर जोड़कर लेटेंट शोर विशेषता प्राप्त की जाती है।

मिनी जीपीटी-5 फ्रेमवर्क द्वारा तैनात व्यापक दृष्टिकोण विकसित करने वाले डेवलपर्स को दृश्य और पाठ के तत्वों की सुसंगत समझ और उत्पादन में मदद मिलती है, जो विशेष टोकन, पूर्व-प्रशिक्षित मॉडलों की क्षमताओं का लाभ उठाने और नवीन प्रशिक्षण तकनीकों का उपयोग करके किया जाता है।

मिनी जीपीटी-5: प्रशिक्षण और परिणाम

मिनी जीपीटी-5 फ्रेमवर्क पर काम करते समय, डेवलपर्स ने देखा कि सीधे इंटरलीव्ड पाठ और छवि डेटासेट पर प्रशिक्षण छवियों की गुणवत्ता में कमी और संरेखण की समस्या पैदा कर सकता है, जो छवि और पाठ डोमेन के बीच महत्वपूर्ण डोमेन शिफ्ट के कारण होता है। इस मुद्दे को कम करने के लिए, डेवलपर्स ने दो अलग प्रशिक्षण रणनीतियों को अपनाया है,

  1. वर्गीकरण-मुक्त मार्गदर्शन तकनीकों को शामिल करना जो डिफ्यूजन प्रक्रिया के दौरान जनरेटिव टोकन की प्रभावशीलता को बढ़ाता है।
  2. दूसरी रणनीति दो चरणों में विभाजित है
    1. एक प्रारंभिक पूर्व-प्रशिक्षण चरण जो मुख्य रूप से खुरदरी विशेषताओं को संरेखित करने पर केंद्रित है।
    2. एक फाइन-ट्यूनिंग चरण जो विशेषता सीखने की सुविधा प्रदान करता है।

सीएफजी या वर्गीकरण-मुक्त मार्गदर्शन

बहुसंचारी उत्पादन के लिए सीएफजी का उपयोग करने का विचार उत्पन्न पाठ और छवियों के बीच सुसंगतता और तर्क को बढ़ाने के प्रयास से उत्पन्न हुआ, और सीएफजी को पाठ से छवि डिफ्यूजन प्रक्रिया के दौरान पेश किया जाता है। यह विधि देखी जाती है कि अनुकूल और अनुकूलनहीन उत्पादन दोनों पर प्रशिक्षण द्वारा और अनुकूलन ड्रॉपआउट के साथ, जनरेटिव मॉडल अनुकूलित परिणाम प्राप्त कर सकता है।

दो-चरण प्रशिक्षण रणनीति

पाठ-छवि उत्पादन और शुद्ध पाठ उत्पादन के बीच महत्वपूर्ण डोमेन शिफ्ट को देखते हुए, मिनी जीपीटी-5 फ्रेमवर्क प्रशिक्षण के लिए एक दो-चरण रणनीति का उपयोग करता है

  1. एकल पाठ-छवि जोड़े वाले डेटासेट में छवि उत्पादन विशेषताओं को वोकेंस विशेषता के साथ संरेखित करने वाला एकल-मोडल संरेखण चरण (यूएएस),
  2. बहुसंचारी सीखने का चरण (एमएलएस)।

प्रारंभ में, फ्रेमवर्क एकल पाठ-छवि जोड़े वाले डेटासेट में छवि उत्पादन विशेषताओं को वोकेंस विशेषता के साथ संरेखित करता है, जहां प्रत्येक डेटा नमूने में केवल एक पाठ और एक छवि होती है, और पाठ आमतौर पर छवि की कैप्शन होती है। इस चरण में, फ्रेमवर्क एलएलएम को कैप्शन का उपयोग करके वोकेंस उत्पन्न करने की अनुमति देता है।

एक बार यूएएस को सफलतापूर्वक निष्पादित करने के बाद, मॉडल एकल पाठ विवरण के लिए छवियों का उत्पादन कर सकता है, लेकिन इंटरलीव्ड भाषा और दृष्टि उत्पादन, जिसमें पाठ-छवि जोड़े और जटिल तर्क शामिल हैं, में संघर्ष करता है। इस बाधा को दूर करने के लिए, डेवलपर्स ने विस्ट जैसे इंटरलीव्ड दृष्टि और भाषा डेटासेट का उपयोग करके मिनी जीपीटी-5 फ्रेमवर्क को पीईएफटी पैरामीटर के साथ फाइन-ट्यून किया है। इस चरण में, फ्रेमवर्क डेटासेट से तीन अलग कार्य बनाता है

  1. पाठ केवल उत्पादन: दिए गए अगले छवि के लिए संबंधित पाठ का उत्पादन करता है।
  2. छवि केवल उत्पादन: दिए गए अगले पाठ के लिए संबंधित छवि का उत्पादन करता है।
  3. बहुसंचारी उत्पादन: दिए गए संदर्भ का उपयोग करके पाठ-छवि जोड़े का उत्पादन करता है।

मिनी जीपीटी-5: बेंचमार्क और परिणाम

बहुसंचारी उत्पादन में अपने प्रदर्शन का व्यापक मूल्यांकन करने के लिए, मिनी जीपीटी-5 विकास टीम ने अपने प्रदर्शन की तुलना अन्य प्रमुख बेसलाइन मॉडलों जैसे डिव्टर, जीआईएलएल, और फाइन-ट्यून्ड यूनिमॉडल जनरेशन मॉडल से की है, और तुलना नीचे दी गई तालिका में दिखाई गई है।

मिनी जीपीटी-5 फ्रेमवर्क समझता है कि बहुसंचारी आउटपुट संदर्भ के अनुसार अर्थपूर्ण हो सकता है, लेकिन वास्तविक दुनिया से भिन्न हो सकता है, जो मिनी जीपीटी-5 फ्रेमवर्क को मॉडल के प्रदर्शन का मूल्यांकन और मूल्यांकन करने के लिए मानव इनपुट को शामिल करने का मुख्य कारण है। समग्र रूप से, मिनी जीपीटी-5 फ्रेमवर्क की बहुसंचारी कार्यों में प्रभावशीलता का मूल्यांकन तीन दृष्टिकोणों से किया जाता है:

  1. भाषा निरंतरता: यह मूल्यांकन करता है कि उत्पन्न सामग्री प्रदान किए गए संदर्भ के साथ सहजता से संरेखित है या नहीं।
  2. छवि गुणवत्ता: यह मूल्यांकन करता है कि उत्पन्न छवि कितनी प्रासंगिक और स्पष्ट है।
  3. बहुसंचारी सुसंगतता: यह निर्धारित करता है कि संयुक्त पाठ-छवि आउटपुट प्रारंभिक संदर्भ के साथ सुसंगत है या नहीं।

विस्ट अंतिम चरण मूल्यांकन

प्रयोग के पहले चरण में, मिनी जीपीटी-5 फ्रेमवर्क संबंधित छवियों का उत्पादन करने का लक्ष्य रखता है, और नीचे दी गई तालिका इस सेटिंग से प्राप्त परिणामों का सारांश प्रस्तुत करती है।

जैसा कि देखा जा सकता है, मिनी जीपीटी-5 फ्रेमवर्क तीनों सेटिंग्स में फाइन-ट्यून्ड एसडी2 फ्रेमवर्क को पार कर जाता है, जो मिनी जीपीटी-5 पाइपलाइन की प्रभावशीलता को दर्शाता है।

उपरोक्त चित्र मिनी जीपीटी-5 फ्रेमवर्क और फाइन-ट्यून्ड मिनी जीपीटी-4 फ्रेमवर्क के बीच एस-बर्ट, रोग-एल और मेटियोर प्रदर्शन मेट्रिक्स पर प्रदर्शन की तुलना करता है। परिणाम दर्शाते हैं कि जनरेटिव वोकेंस का उपयोग बहुसंचारी समझने की कार्यों में नकारात्मक रूप से प्रभावशीलता को प्रभावित नहीं करता है। परिणाम यह भी दिखाते हैं कि मिनी जीपीटी-5 फ्रेमवर्क लंबे-क्षैतिज बहुसंचारी इनपुट प्रॉम्प्ट्स का उपयोग करके उच्च-गुणवत्ता और सुसंगत छवियों का उत्पादन करने में सक्षम है, बिना मूल मॉडल की बहुसंचारी समझने की क्षमता को समझौता किए।

उपरोक्त तालिका तीन फ्रेमवर्क के बीच 5,000 नमूनों पर बहुसंचारी उत्पादन के लिए बहुसंचारी सुसंगतता, छवि गुणवत्ता और भाषा निरंतरता के दृष्टिकोण से प्रदर्शन की तुलना करती है। जैसा कि देखा जा सकता है, मिनी जीपीटी-5 फ्रेमवर्क अन्य दो बेसलाइन मॉडलों को 70% से अधिक मामलों में पार कर जाता है। दूसरी ओर, नीचे दी गई तालिका सीसी3एम सत्यापन डेटासेट पर एकल छवि उत्पादन के लिए मिनी जीपीटी-5 फ्रेमवर्क के प्रदर्शन को प्रदर्शित करती है। डेटा सीमाओं के कारण, डेवलपर्स ने स्टेबल डिफ्यूजन के साथ उपयोग किए जाने पर वोकेंस संरेखण में एक अंतराल पाया। इस सीमा के बावजूद, मिनी जीपीटी-5 फ्रेमवर्क सभी मेट्रिक्स पर वर्तमान राज्य-ऑफ-द-आर्ट बेसलाइन जीआईएलएल फ्रेमवर्क को पार करता है।

निष्कर्ष

इस लेख में, हमने मिनी जीपीटी-5 के बारे में बात की है, जो एक इंटरलीव्ड भाषा और दृष्टि उत्पादन एल्गोरिदम तकनीक है जो “जनरेटिव वोकेंस” की अवधारणा को पेश करती है ताकि एलएलएम की क्षमताओं को बहुसंचारी डेटा उत्पादन के लिए सुसंगत रूप से संरेखित किया जा सके। हमने मिनी जीपीटी-5 फ्रेमवर्क के आवश्यक घटकों और समग्र वास्तुकला के बारे में बात की है, साथ ही साथ परिणामों के बारे में भी बात की है जो वर्तमान बेसलाइन और राज्य-ऑफ-द-आर्ट मॉडलों की तुलना में प्रदर्शन और दक्षता में महत्वपूर्ण सुधार दर्शाते हैं। मिनी जीपीटी-5 बहुसंचारी सामग्री और डेटा उत्पादन डोमेन में एक नए बेंचमार्क को स्थापित करने का लक्ष्य रखता है, और पिछले मॉडलों द्वारा सामना की जाने वाली चुनौतियों को हल करने का प्रयास करता है जब वे समान समस्या का समाधान करने का प्रयास करते हैं।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।