एआई मॉडल और प्लेटफ़ॉर्म

SHOW-O: एकल ट्रांसफॉर्मर जो मल्टीमॉडल समझ और पीढ़ी को एकजुट करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

बड़े भाषा मॉडल (LLM) में महत्वपूर्ण प्रगति ने मल्टीमॉडल बड़े भाषा मॉडल (MLLM) के विकास को प्रेरित किया है। MLLM के शुरुआती प्रयास, जैसे कि LLaVA, MiniGPT-4, और InstructBLIP, मल्टीमॉडल समझ क्षमताओं में उल्लेखनीय प्रदर्शन करते हैं। LLM को मल्टीमॉडल डोमेन में एकीकृत करने के लिए, इन अध्ययनों ने पूर्व-प्रशिक्षित मॉडल-विशिष्ट एन्कोडर, जैसे कि CLIP, के सुविधाओं को LLM के इनपुट स्पेस में परियोजना करने का अन्वेषण किया, जिससे ट्रांसफॉर्मर बैकबोन के भीतर मल्टीमॉडल समझ और तर्क संभव हो गया। हालांकि MLLM के लिए विभिन्न डिज़ाइन विकल्प हैं, जैसे कि दृष्टि एन्कोडर, फीचर संरेखण एडेप्टर, और डेटासेट, इन मॉडलों के अधिकांश प्रशिक्षण स्व-रिग्रेसिव पीढ़ी के सिद्धांत का पालन करते हैं, जो LLM में पाठ पीढ़ी के लिए प्रभावी साबित हुआ है। अपनी मजबूत मल्टीमॉडल समझ क्षमताओं के बावजूद, ये मॉडल मुख्य रूप से दृश्य धारणा पर ध्यान केंद्रित करते हैं और पाठ के अलावा मल्टीमॉडल आउटपुट को उत्पन्न करने में असमर्थ होते हैं।

ट्रांसफॉर्मर मॉडल ने प्राकृतिक भाषा प्रसंस्करण में स्व-रिग्रेसिव मॉडलिंग में महान सफलता का प्रदर्शन किया है। पिछले अध्ययनों ने सीधे इसी स्व-रिग्रेसिव मॉडलिंग को छवि पिक्सेल की निर्भरता सीखने के लिए लागू किया है, जैसे कि वीडियोपोएट ने एक डिकोडर-ओनली ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करके मल्टीमॉडल इनपुट से उच्च-गुणवत्ता वाले वीडियो को सिंथेसाइज करने के लिए किया है। हाल ही में, LlamaGen ने दिखाया है कि Llama जैसे बड़े भाषा मॉडल आर्किटेक्चर स्व-रिग्रेसिव रूप से छवि टोकन को मॉडल कर सकता है, जो वर्ग-शर्त छवि पीढ़ी में अच्छा प्रदर्शन करता है।

इस लेख में, हम Show-O पर चर्चा करेंगे, जो एक एकल ट्रांसफॉर्मर है जो मल्टीमॉडल समझ और पीढ़ी को एकजुट करता है। पूरी तरह से स्व-रिग्रेसिव मॉडल के विपरीत, Show-O स्व-रिग्रेसिव और विच्छिन्न धारणा मॉडलिंग को एकजुट करता है ताकि विभिन्न और मिश्रित मॉडलिटी के इनपुट और आउटपुट को अनुकूलित रूप से संभाला जा सके। एकजुट मॉडल दृश्य प्रश्न उत्तर देने, पाठ-टू-छवि पीढ़ी, पाठ-निर्देशित इनपेंटिंग/एक्सट्रापोलेशन, और मिश्रित-मॉडलिटी पीढ़ी जैसे विभिन्न दृश्य-भाषा कार्यों का समर्थन करता है। विभिन्न बेंचमार्क पर, Show-O ने समान या बेहतर प्रदर्शन का प्रदर्शन किया है जो मौजूदा व्यक्तिगत मॉडल के साथ तुलना करता है जो समान या बड़े पैरामीटर सेट के साथ हैं, जो इसे अगली पीढ़ी के फाउंडेशन मॉडल के रूप में अपनी संभावना को उजागर करता है।

SHOW-O: मल्टीमॉडल समझ और पीढ़ी को एकजुट करना

पिछले कुछ वर्षों में, मल्टीमॉडल बुद्धिमत्ता के दो मुख्य स्तंभों में महत्वपूर्ण प्रगति हुई है: समझ और पीढ़ी। मल्टीमॉडल समझ के लिए, मल्टीमॉडल बड़े भाषा मॉडल (MLLM) जैसे LLaVA ने दृश्य प्रश्न उत्तर देने जैसे दृश्य-भाषा कार्यों में असाधारण क्षमता का प्रदर्शन किया है। दृश्य पीढ़ी के लिए, शोर-नोइज़ डिफ्यूजन प्रोबेबिलिस्टिक मॉडल (DDPM) ने पारंपरिक उत्पादक सिद्धांतों को क्रांतिकारी बनाया है, जो पाठ-टू-छवि/वीडियो पीढ़ी में अभूतपूर्व प्रदर्शन हासिल किया है।

इन व्यक्तिगत क्षेत्रों में उपलब्धियों को देखते हुए, यह जांचना स्वाभाविक है कि क्या एक एकल ट्रांसफॉर्मर मल्टीमॉडल समझ और पीढ़ी दोनों को संभाल सकता है। हाल के प्रयासों ने विभिन्न मॉडलों को एकजुट करने का प्रयास किया है, लेकिन वे अक्सर समझ और पीढ़ी के लिए अलग-अलग मॉडल का उपयोग करते हैं।

हाल ही में, चमेलियन ने दिखाया है कि यह संभव है। चमेलियन विभिन्न मॉडलिटी को एकजुट करके पाठ और छवि टोकन दोनों को उत्पन्न करने में सक्षम है। हालांकि, यह स्पष्ट नहीं है कि छवि पैच या पिक्सेल को स्व-रिग्रेसिव रूप से मॉडल करना इष्टतम है या नहीं।

यह हमें यह जांचने के लिए प्रेरित करता है कि क्या एक एकल ट्रांसफॉर्मर स्व-रिग्रेसिव और धारणा मॉडलिंग दोनों को एकजुट कर सकता है। Show-O एक नए सिद्धांत की कल्पना करता है जहां पाठ विच्छिन्न टोकन के रूप में प्रस्तुत किया जाता है और स्व-रिग्रेसिव रूप से मॉडल किया जाता है, जबकि निरंतर छवि पिक्सेल धारणा मॉडलिंग का उपयोग करके मॉडल किया जाता है।

Show-O एक एकल ट्रांसफॉर्मर है जो मल्टीमॉडल समझ और पीढ़ी दोनों को एकजुट करता है। Show-O पूर्व-प्रशिक्षित LLM पर आधारित है और पाठ-आधारित तर्क के लिए स्व-रिग्रेसिव मॉडलिंग का उपयोग करता है। Show-O विच्छिन्न धारणा मॉडलिंग का उपयोग करके छवि टोकन को मॉडल करता है, जो निरंतर प्रस्तुतियों का उपयोग करने के बजाय विच्छिन्न टोकन का उपयोग करता है।

SHOW-O: विधि और आर्किटेक्चर

Show-O के पीछे का मुख्य उद्देश्य एक एकजुट मॉडल विकसित करना है जो स्व-रिग्रेसिव और धारणा मॉडलिंग को एकजुट करता है ताकि मल्टीमॉडल समझ और पीढ़ी दोनों को संभाला जा सके। ऐसा मॉडल विकसित करना महत्वपूर्ण चुनौतियों को प्रस्तुत करता है, जिनमें से मुख्य मुद्दे हैं: i) मॉडल के इनपुट/आउटपुट स्पेस को परिभाषित करना; ii) विभिन्न मॉडलिटी के विभिन्न प्रकार के इनपुट डेटा को एकजुट करना; iii) एक एकल ट्रांसफॉर्मर में स्व-रिग्रेसिव और धारणा मॉडलिंग को एकजुट करना; और iv) ऐसे एकजुट मॉडल को प्रभावी ढंग से प्रशिक्षित करना।

टोकनाइजेशन

Show-O पूर्व-प्रशिक्षित LLM पर आधारित है, और इसलिए, यह एकजुट सीखने को विच्छिन्न स्पेस में करना स्वाभाविक है। एकजुट शब्दावली बनाए रखने से जो विच्छिन्न पाठ और छवि टोकन दोनों को शामिल करता है, Show-O को विच्छिन्न टोकन की भविष्यवाणी करने के लिए एक ही सीखने का उद्देश्य दिया जाता है।

पाठ टोकनाइजेशन

Show-O पूर्व-प्रशिक्षित LLM पर आधारित है, और पाठ डेटा के लिए समान टोकनाइज़र का उपयोग किया जाता है बिना किसी संशोधन के।

छवि टोकनाइजेशन

MAGVIT-v2 के अनुसरण में, Show-O लगभग 35M छवि डेटा का उपयोग करके एक लुकअप-मुक्त क्वांटाइज़र प्रशिक्षित करता है। क्वांटाइज़र 8,192 के आकार का एक कोडबुक बनाए रखता है और 256×256 रिज़ॉल्यूशन की छवियों को 16×16 विच्छिन्न टोकन में एन्कोड करता है। MAGVIT-v2 को इसकी आसान फाइन-ट्यूनिंग के लिए चुना जाता है, जो इसे वीडियो टोकनाइज़र के रूप में उपयुक्त बनाता है जो समय संपीड़न क्षमता को भी प्रस्तुत करता है, जिसे Show-O भविष्य में अन्वेषण करने की योजना बना रहा है।

आर्किटेक्चर

Show-O मौजूदा LLM की आर्किटेक्चर को विरासत में लेता है बिना किसी आर्किटेक्चर संशोधन के, सिवाय प्रत्येक ध्यान層 में QK-Norm ऑपरेशन को प्रीफिक्स करने के। Show-O पूर्व-प्रशिक्षित LLM के वजन के साथ आरंभ किया जाता है और एम्बेडिंग लेयर के आकार को 8,192 नए सीखने योग्य एम्बेडिंग को शामिल करके विस्तारित करता है जो विच्छिन्न छवि टोकन के लिए हैं।

एकजुट प्रॉम्प्टिंग

मल्टीमॉडल समझ और पीढ़ी पर एकजुट सीखने के लिए, Show-O एक एकजुट प्रॉम्प्टिंग रणनीति का उपयोग करता है ताकि विभिन्न प्रकार के इनपुट डेटा को प्रारूपित किया जा सके।

ओम्नी-अटेंशन मैकेनिज्म

Show-O एक ओम्नी-अटेंशन मैकेनिज्म प्रस्तुत करता है जो विभिन्न प्रकार के संकेतों को विभिन्न तरीकों से मॉडल करने में सक्षम है। यह व्यापक ध्यान मैकेनिज्म इनपुट अनुक्रम के प्रारूप के आधार पर स्व-रिग्रेसिव और पूर्ण ध्यान के बीच अनुकूलित रूप से स्विच करता है।

SHOW-O: प्रयोग और परिणाम

निम्नलिखित तालिका Show-O की मल्टीमॉडल समझ क्षमता को सार्वजनिक बेंचमार्क पर प्रस्तुत करती है, जैसे कि छवि कैप्शनिंग और दृश्य प्रश्न उत्तर देने के कार्य।

वर्तमान संस्करण Show-O Phi-1.5 पर आधारित है, और इसलिए, Show-O का समझ-मात्र समकक्ष, LLaVA-v1.5-Phi-1.5, सीधे बेसलाइन के रूप में कार्य करता है। Show-O सभी मूल्यांकन मेट्रिक्स में बेसलाइन LLaVA-v1.5-Phi-1.5 के समान प्रदर्शन प्रदर्शित करता है, जो केवल मल्टीमॉडल समझ के लिए समर्पित है।

गुणात्मक तुलना

हम SDv1.5, SDXL, और LlamaGen जैसे धारणा-आधारित मॉडल के साथ गुणात्मक तुलना प्रस्तुत करते हैं, साथ ही LWM और SEED-X जैसे एकजुट मॉडल।

पाठ-निर्देशित इनपेंटिंग और एक्सट्रापोलेशन

Show-O पाठ-आधारित इनपेंटिंग और एक्सट्रापोलेशन को स्वाभाविक रूप से समर्थन करता है बिना किसी फाइन-ट्यूनिंग के।

अंतिम विचार

इस लेख में, हमने Show-O पर चर्चा की है, जो एक एकल ट्रांसफॉर्मर है जो मल्टीमॉडल समझ और पीढ़ी को एकजुट करता है। Show-O स्व-रिग्रेसिव और विच्छिन्न धारणा मॉडलिंग को एकजुट करता है ताकि विभिन्न और मिश्रित मॉडलिटी के इनपुट और आउटपुट को अनुकूलित रूप से संभाला जा सके। एकजुट मॉडल दृश्य प्रश्न उत्तर देने, पाठ-टू-छवि पीढ़ी, पाठ-निर्देशित इनपेंटिंग/एक्सट्रापोलेशन, और मिश्रित-मॉडलिटी पीढ़ी जैसे विभिन्न दृश्य-भाषा कार्यों का समर्थन करता है। विभिन्न बेंचमार्क पर, Show-O ने समान या बेहतर प्रदर्शन का प्रदर्शन किया है जो मौजूदा व्यक्तिगत मॉडल के साथ तुलना करता है जो समान या बड़े पैरामीटर सेट के साथ हैं, जो इसे अगली पीढ़ी के फाउंडेशन मॉडल के रूप में अपनी संभावना को उजागर करता है।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।