Anderson का एंगल

जिगसॉ पज़ल्स बूस्ट एआई विज़ुअल रीज़निंग

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

नया शोध संकेत देता है कि एआई मॉडल जिगसॉ पज़ल्स को हल करके दृष्टि में सुधार कर सकते हैं। छवियों, वीडियो, और 3डी दृश्यों को पुनर्व्यवस्थित करके उन्हें अपने दृश्य कौशल को तेज करने में मदद मिलती है, बिना अतिरिक्त डेटा, लेबल, या टूल्स की आवश्यकता के।

 

वर्तमान में मल्टीमॉडल लार्ज लैंग्वेज मॉडल (एमएलएलएम*) को आगे बढ़ाने के लिए, कुछ आसान जीत और कोई मुफ्त भोजन नहीं हैं।

हालांकि 2025 के कई चीनी फॉस्स रिलीज़ में कम विकास और चलने की लागत है, पश्चिमी रिलीज़ अक्सर समस्या को अधिक डेटा वॉल्यूम, अधिक अनुमान शक्ति, और अधिक बिजली के साथ हल करने का प्रयास करते हैं (हालांकि, जैसा कि हम हाल ही में नोट किया, अधिक वास्तविक मानव अनnotator, क्योंकि यह बहुत महंगा है даже $ट्रिलियन+ पैमाने पर जेन-एआई क्रांति के लिए)।

शोध साहित्य में, अधिकांश कथित ‘मुफ्त’ दृष्टिकोण एआई आर्किटेक्चर के विकास में केवल छोटे क्रमिक सुधार प्रदान करते हैं; या फिर उन क्षेत्रों में सुधार जो सबसे गंभीर रूप से पीछा किए जा रहे हैं नहीं हैं। फिर भी, ‘मूलभूत सिद्धांतों’ की खोज जो एआई विकास की गति को तेज कर सकती है, बहुत आकर्षक है और इसे छोड़ना मुश्किल है।

पिकिंग अप द पीसेस

एक नए शोध सहयोग में, चीनी संस्थानों के बीच एक नए शोध सहयोग ने दावा किया है कि वीएलएम को जिगसॉ पज़ल्स हल करने से उनके प्रदर्शन में उल्लेखनीय सुधार होता है, हालांकि इस सुदृढ़ शिक्षा दृष्टिकोण ने पहले इस क्षेत्र में कम प्रदर्शन किया है, और यह किसी भी अतिरिक्त प्रणाली, सहायक मॉडल या ‘बोल्ट-ऑन’ प्रक्रियाओं की आवश्यकता नहीं है:

<img class=" wp-image-223795" src="https://www.unite.ai/wp-content/uploads/2025/10/figure-1-1.jpg" alt="विज़ुअल जिगसॉ एक स्व-प्रशिक्षित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल में दृष्टि-केंद्रित कौशल में सुधार करता है। छवियों, वीडियो, और 3डी डेटा पर जिगसॉ कार्यों के प्रशिक्षण से, मॉडल में छवियों में तीक्ष्ण, स्थानिक, और रचनात्मक धारणा में सुधार होता है, वीडियो में समयिक तर्क में सुधार होता है, और 3डी दृश्यों में ज्यामिति-जागरूक समझ में सुधार होता है। ऊपर दी गई रडार चार्ट में सुसंगत लाभ दिखाए गए हैं बेस क्यूवेन2.5-वीएल के साथ, मूल्य स्केल को प्रत्येक बेंचमार्क के लिए स्पष्टता के लिए समायोजित किया गया है। स्रोत: https://arxiv.org/pdf/2509.25190

शोधकर्ताओं द्वारा विकसित प्रणाली को विज़ुअल जिगसॉ नाम दिया गया है, और इसमें मौजूदा एमएलएलएम को टुकड़ों में विभाजित और यादृच्छिक रूप से वितरित किए गए डेटा पर प्रशिक्षित करना शामिल है। लेखकों ने इस दृष्टिकोण के लिए तीन मोडलिटी विकसित की हैं: छवि, वीडियो, और 3डी (अर्थात, सीजीआई-शैली मेश), और पाया कि एक मध्यम अनुकूलन इसी प्रक्रिया के तीनों डोमेन में लाभकारी था:

विज़ुअल जिगसॉ कार्यों का प्रतिनिधित्व। छवि जिगसॉ में, एक छवि को पैच में विभाजित किया जाता है, भ्रमित किया जाता है, और मॉडल सही लेआउट का अनुमान लगाता है; वीडियो जिगसॉ में, क्लिप को भ्रमित किया जाता है और मॉडल समय में उनका क्रम बहाल करता है; 3डी जिगसॉ में, विभिन्न गहराई के बिंदुओं को भ्रमित किया जाता है और मॉडल उन्हें निकटतम से दूर तक क्रम में रखता है। मॉडल के आउटपुट को ग्राउंड ट्रुथ के खिलाफ स्कोर किया जाता है, आंशिक रूप से सही समाधानों के लिए आंशिक क्रेडिट दिया जाता है।

विज़ुअल जिगसॉ कार्यों का प्रतिनिधित्व। छवि जिगसॉ में, एक छवि को पैच में विभाजित किया जाता है, भ्रमित किया जाता है, और मॉडल सही लेआउट का अनुमान लगाता है; वीडियो जिगसॉ में, क्लिप को भ्रमित किया जाता है और मॉडल समय में उनका क्रम बहाल करता है; 3डी जिगसॉ में, विभिन्न गहराई के बिंदुओं को भ्रमित किया जाता है और मॉडल उन्हें निकटतम से दूर तक क्रम में रखता है। मॉडल के आउटपुट को ग्राउंड ट्रुथ के खिलाफ स्कोर किया जाता है, आंशिक रूप से सही समाधानों के लिए आंशिक क्रेडिट दिया जाता है।

विज़ुअल जिगसॉ की प्रशिक्षण विधि एआई मॉडल को दृष्टि संबंधी जानकारी को समझने में सुधार करने में मदद करती है जो इन जटिल छवियों, वीडियो क्लिप, या 3डी डेटा बिंदुओं को पुनर्व्यवस्थित करके की जाती है।

प्रक्रिया शब्दों पर आधारित है, न कि छवियों पर, और इसलिए मॉडल को छवियों को उत्पन्न करने या किसी अतिरिक्त दृश्य घटक का उपयोग करने की आवश्यकता नहीं है। यह विधि रिनफोर्समेंट लर्निंग फ्रॉम वेरिफायबल रिवार्ड्स (आरएलवीआर) नामक प्रणाली में फिट होती है, जहां मॉडल को स्पष्ट, स्वचालित नियमों के आधार पर सही उत्तरों के लिए पुरस्कृत किया जाता है; और जहां, इसलिए, मानव लेबलिंग की आवश्यकता नहीं है।

यह महत्वपूर्ण तथ्य वास्तव में नए पत्र से कठिन है: कि प्रणाली सेमैंटिक रूप से जिगसॉ को इकट्ठा कर रही है, विवरण के माध्यम से, और न कि मानव जो इस तरह के पज़ल्स को हल करना सीखते हैं उस प्रकार के आकार-प्रतिनिधित्व तरीके से:

नए पत्र के पूरक सामग्री से, एक उदाहरण आरएल कार्य जो पाठ-आधारित प्रक्रिया को दर्शाता है।

नए पत्र के पूरक सामग्री से, एक उदाहरण आरएल कार्य जो पाठ-आधारित प्रक्रिया को दर्शाता है। छवियाँ जो एमएलएलएम को दिखाई जाएंगी यहाँ नहीं दिखाई गई हैं।

हालांकि एमएलएलएम विज़न-सेंट्रिक कार्यों के साथ व्यापक रूप से सौदा करते हैं, वे भाषा-आधारित आर्किटेक्चर हैं, न कि छवियों, वीडियो या आकार प्रतिनिधित्व जैसे 3डी मेश उत्पन्न करने के लिए डिज़ाइन किए गए हैं।

छवि जिगसॉ कार्य के उदाहरण। प्रत्येक पंक्ति में भ्रमित पैच दिखाए गए हैं जिन्हें मॉडल को उनके मूल लेआउट में पुनर्व्यवस्थित करना होगा, जो दाईं ओर दिखाया गया है।

छवि जिगसॉ कार्य के उदाहरण। प्रत्येक पंक्ति में भ्रमित पैच दिखाए गए हैं जिन्हें मॉडल को उनके मूल लेआउट में पुनर्व्यवस्थित करना होगा, जो दाईं ओर दिखाया गया है।

किसी भी मामले में, यह प्रकार का प्रशिक्षण मुख्य शिक्षण चरण के बाद किया जाता है, जब मॉडल पहले से ही कुछ छवियों को समझने में सक्षम होता है।

पूर्व दृष्टिकोण जैसे 2017 के स्विस पेपर अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स ने इस प्रकार के सुदृढ़ दृष्टिकोण का उपयोग किया था, लेकिन कम सफलता के साथ, कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) पर, एक आधुनिक एमएलएलएम की तुलना में एक अलग प्रकार की आर्किटेक्चर।

2017 रिलीज 'अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स' से, एक न्यूरल सिस्टम के लिए पुरस्कार-आधारित चुनौती के रूप में टुकड़ों का उपयोग करने का एक प्रारंभिक उदाहरण। स्रोत: https://arxiv.org/pdf/1603.09246

2017 रिलीज ‘अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स’ से, एक न्यूरल सिस्टम के लिए पुरस्कार-आधारित चुनौती के रूप में टुकड़ों का उपयोग करने का एक प्रारंभिक उदाहरण। स्रोत: https://arxiv.org/pdf/1603.09246

परीक्षणों में, विज़ुअल जिगसॉ ने दावा किया कि वे विभिन्न बेंचमार्क पर सुसंगत और मापनीय सुधार किए हैं: छवि जिगसॉ कार्य ने बारीकी से धारणा, स्थानिक लेआउट समझ, और रचनात्मक तर्क में सुधार किया; वीडियो जिगसॉ कार्य ने मॉडल की क्षमता को बढ़ाया समयिक अनुक्रमों को ट्रैक करने और घटना क्रम के बारे में तर्क करने के लिए; और 3डी जिगसॉ कार्य ने गहराई-आधारित समझ और स्थानिक तर्क में सुधार किया, केवल आरजीबी-डी इनपुट का उपयोग करके।

तीनों मोडलिटी में, पत्र दोहराता है, नई विधि ने कई प्रतिस्पर्धी बेसलाइन को पार किया, बिना किसी वास्तुकला परिवर्तन, अतिरिक्त दृश्य मॉड्यूल, या अतिरिक्त पर्यवेक्षित डेटा की आवश्यकता के:

‘व्यापक प्रयोगों से यह साबित होता है कि विस्तृत धारणा, समयिक तर्क, और 3डी स्थानिक समझ में महत्वपूर्ण सुधार हुए हैं। हमारे निष्कर्ष एमएलएलएम में स्व-प्रशिक्षित दृष्टि-केंद्रित कार्यों की संभावना को उजागर करते हैं और आगे के शोध को प्रेरित करने का लक्ष्य रखते हैं दृष्टि-केंद्रित पूर्व-डिज़ाइन पर।’

नया पेपर विज़ुअल जिगसॉ पोस्ट-ट्रेनिंग इम्प्रूव्स एमएलएलएम नामक है, और नаньयांग टेक्नोलॉजिकल यूनिवर्सिटी, लिंकोपिंग यूनिवर्सिटी, और सेंसटाइम रिसर्च के छह शोधकर्ताओं से आया है। पेपर के साथ एक प्रोजेक्ट साइट है जिसमें लाइव डेमो (और आप अपनी छवि को छवि-आधारित जिगसॉ डेमो में लोड कर सकते हैं)। प्रोजेक्ट के लिए कोड और वज़न को सामान्य रूप से उपलब्ध कराया गया है,

विधि

हालांकि हम तीन परीक्षण मोडलिटी के लिए जानकारी को कैसे विभाजित किया जाता है, इस पर एक नज़र डालेंगे, हमें पहले नई प्रणाली के लिए पुरस्कार डिज़ाइन पर विचार करना चाहिए।

विज़ुअल जिगसॉ दृष्टिकोण मॉडल की प्रतिक्रियाओं को ग्रेडेड पुरस्कार का उपयोग करके स्कोर करता है, न कि केवल पास या विफल। यदि मॉडल सटीक सही क्रम का अनुमान लगाता है, तो यह पूरा पुरस्कार प्राप्त करता है; यदि उत्तर अधिकांशतः सही है, लेकिन पूरी तरह से नहीं, तो मॉडल आंशिक क्रेडिट प्राप्त करता है, जो एक छूट कारक द्वारा स्केल किया जाता है ताकि निकट-मिस को अधिक मूल्य न दिया जा सके (यह मॉडल को प्रणाली को गेमिंग से रोकता है जो केवल आंशिक रूप से सही अनुमानों को दोहराता है)।

अमान्य उत्तर, जैसे कि चीट का उपयोग करके एक ही संख्या को दोहराना, शून्य स्कोर प्राप्त करते हैं। सुसंगत प्रारूप को प्रोत्साहित करने के लिए, मॉडल को अपने तर्क को <think> टैग के अंदर और अपने अंतिम उत्तर को <answer> टैग के अंदर रखना होगा। यह सही प्रारूप का उपयोग करने पर एक छोटा बोनस प्राप्त करता है।

छवियाँ

छवि मोडलिटी के लिए एक पज़ल बनाने के लिए, एक छवि को पहले एक ग्रिड में विभाजित किया जाता है जो इसे बराबर आकार के ब्लॉक में काटता है:

सिस्टम के लिए हल करने के लिए छवि-आधारित पैच के उदाहरण।

सिस्टम के लिए हल करने के लिए छवि-आधारित पैच के उदाहरण।

पैच को एक निश्चित क्रम में व्यवस्थित किया जाता है, जैसे कि एक पृष्ठ पर पढ़ने का क्रम, trước उन्हें यादृच्छिक रूप से भ्रमित करने से। मॉडल को तब इस भ्रमित सेट को दिखाया जाता है और यह मूल लेआउट का अनुमान लगाने के लिए कहा जाता है जो मूल छवि को पुनर्स्थापित करता है।

प्रशिक्षण में, सीओसीओ डेटासेट की 118,000 छवियों का उपयोग किया गया था, प्रत्येक छवि से नौ पैच (यानी, ‘पज़ल पीस’) प्राप्त हुए। सिस्टम को दिए गए प्रॉम्प्ट को इस लेख में पहले दिखाया गया है (छवि जिसमें कैप्शन शुरू होता है ‘नए पत्र के पूरक सामग्री से’)।

वीडियो

वीडियो जिगसॉ कार्य के लिए, एक वीडियो को समय के साथ समान रूप से क्लिप में विभाजित किया जाता है और फिर क्लिप को भ्रमित किया जाता है। मॉडल को तब इस भ्रमित क्रम को दिखाया जाता है और यह मूल कालानुक्रमिक क्रम में उनका अनुमान लगाने के लिए कहा जाता है:

वीडियो पज़ल चुनौती के संक्षिप्त उदाहरण, पत्र की पूरक सामग्री से।

वीडियो पज़ल चुनौती के संक्षिप्त उदाहरण, पत्र की पूरक सामग्री से।

इस मोडलिटी के लिए प्रशिक्षण में, एलएलएवी-वीडियो डेटासेट का उपयोग किया गया था, जिसमें प्रत्येक वीडियो को छह क्लिप में विभाजित किया गया था। क्लिप की सीमाओं पर फ्रेम-मिलान संकेतों का शोषण करने से मॉडल को रोकने के लिए, प्रत्येक क्लिप की शुरुआत और अंत में 5% फ्रेम को ट्रिम किया गया था।

क्लिप में अधिकतम 12 फ्रेम थे, प्रत्येक का अधिकतम रिज़ॉल्यूशन 128x28x28 पिक्सल था। 24 सेकंड से कम वीडियो को बाहर कर दिया गया था।

इस कार्य के लिए प्रॉम्प्ट नीचे दिखाया गया है:

वीडियो कार्य के लिए सुदृढ़ शिक्षा प्रॉम्प्ट।

वीडियो कार्य के लिए सुदृढ़ शिक्षा प्रॉम्प्ट, जिसमें एमएलएलएम को दिखाई जाने वाली क्लिप नहीं हैं।

3डी डेटा

एक पूर्ण 3डी जिगसॉ कार्य आमतौर पर 3डी स्पेस (जैसे वोक्सेल ब्लॉक या पॉइंट क्लाउड टुकड़े) को छोटे टुकड़ों में तोड़ने और मॉडल को उनकी मूल स्थानिक व्यवस्था को पुनर्निर्माण करने के लिए प्रशिक्षित करने को शामिल करता है।

हालांकि, औसत एमएलएलएम सीधे कच्चे 3डी डेटा को संभालने में सक्षम नहीं है, बल्कि सेमैंटिक रूप से व्याख्या की गई छवि या वीडियो इनपुट पर निर्भर करता है। इसलिए, वर्तमान एमएलएलएम के साथ संगत एक कार्य बनाने के लिए जो अभी भी 3डी तर्क में टैप करता है, लेखकों ने 2डी छवियों (अर्थात, आरजीबी-डी छवियों) का उपयोग करने वाला एक अधिक ट्रैक्टेबल वेरिएंट पेश किया जो प्रत्येक पिक्सेल के लिए गहराई जानकारी शामिल करता है।

3डी स्पेशियल अंडरस्टैंडिंग बेंचमार्क का उपयोग करके मूल्यांकन के लिए उदाहरण प्रश्न, जो सापेक्ष दृष्टिकोण और कैमरा गति तर्क के बारे में पूछते हैं। 3डी जिगसॉ मॉडल दृश्य के बीच स्थानिक संबंध और कैमरा घूर्णन की संभावित दिशा दोनों का सही अनुमान लगाता है, क्यूवेन2.5-वीएल-7बी बेसलाइन को पार करता है।

3डी स्पेशियल अंडरस्टैंडिंग बेंचमार्क का उपयोग करके मूल्यांकन के लिए उदाहरण प्रश्न, जो सापेक्ष दृष्टिकोण और कैमरा गति तर्क के बारे में पूछते हैं। 3डी जिगसॉ मॉडल दृश्य के बीच स्थानिक संबंध और कैमरा घूर्णन की संभावित दिशा दोनों का सही अनुमान लगाता है, क्यूवेन2.5-वीएल-7बी बेसलाइन को पार करता है।

प्रत्येक आरजीबी-डी छवि से, मॉडल को विभिन्न गहराई के साथ बिंदुओं की एक भ्रमित सूची दी जाती है, जो निकट से दूर तक होती है, जिसका उद्देश्य केवल 2डी छवि का उपयोग करके उनकी मूल गहराई-आधारित क्रम को पुनर्प्राप्त करना है:

3डी जिगसॉ के लिए आरएल प्रॉम्प्ट।

3डी जिगसॉ के लिए आरएल प्रॉम्प्ट।

प्रत्येक बिंदु को छवि पर चिह्नित किया जाता है (जो मॉडल को दिखाया जाता है, लेकिन ऊपर दी गई छवि में सीधे दिखाया नहीं जाता है), और मॉडल को यह अनुमान लगाना होता है कि कौन सा निकटतम, दूसरा निकटतम, और इसी तरह, मूल गहराई क्रम को पुनर्निर्माण करके है।

3डी जिगसॉ कार्य को स्कैननेट डेटासेट की आरजीबी-डी छवियों पर प्रशिक्षित किया जाता है, 300,000 नमूनों का उपयोग करके जो प्रत्येक छवि से छह गहराई बिंदुओं का यादृच्छिक चयन करके बनाए जाते हैं।

3डी जिगसॉ में उपयोग किए जाने वाले स्कैननेट डेटासेट से बिंदु बादलों के उदाहरण। स्रोत: https://arxiv.org/pdf/1702.04405

3डी जिगसॉ में उपयोग किए जाने वाले स्कैननेट डेटासेट से बिंदु बादलों के उदाहरण। स्रोत: https://arxiv.org/pdf/1702.04405

प्रत्येक बिंदु को 0.1 से 10 मीटर की गहराई सीमा के भीतर होना आवश्यक था, और विविधता को बढ़ावा देने के लिए, किसी भी दो बिंदुओं को एक ही सेट में एक दूसरे के 40 पिक्सल से कम या 0.2 मीटर से कम गहराई में नहीं होना चाहिए।

परीक्षण

प्रारंभिक परीक्षणों के लिए, प्रणाली ने क्यूवेन2.5-वीएल-7बी-इन्सट्रक्ट को आधार बहुमोडल मॉडल के रूप में उपयोग किया। प्रशिक्षण में ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (जीआरपीओ) अल्गोरिदम का उपयोग किया गया था, दोनों केएल नियमितीकरण और एंट्रोपी हानि को हटा दिया गया था।

आंशिक भविष्यवाणियों के लिए, 0.2 का छूट कारक लागू किया गया था। छवि जिगसॉ प्रशिक्षण में 256 का वैश्विक बैच आकार था, जबकि वीडियो और 3डी जिगसॉ में 128 का उपयोग किया गया था। सीखने की दर 1×10⁻⁶ पर सेट की गई थी।

प्रत्येक प्रॉम्प्ट के लिए, मॉडल ने 1.0 के डिकोडिंग तापमान पर 16 प्रतिक्रियाएं उत्पन्न कीं। छवि और वीडियो जिगसॉ कार्यों को 1,000 चरणों के लिए प्रशिक्षित किया गया था, जबकि 3डी जिगसॉ कार्य को 800 चरणों के लिए प्रशिक्षित किया गया था।

छवि जिगसॉ

छवि जिगसॉ मॉडल का तीन श्रेणियों के दृष्टि-केंद्रित बेंचमार्क पर परीक्षण किया गया था: विस्तृत धारणा और समझ के लिए, एमएमवीपी, एमएमस्टार का विस्तृत धारणा उपसेट; एमएमबेंच; एचआर-बेंच; वी*; एमएमई-रियलवर्ल्ड (लाइट); लिसा-ग्राउंडिंग; और ओवीडी-इवल

एकल दृष्टिकोण स्थानिक समझ के लिए, बेंचमार्क वीएसआर; ओम्निस्पेशियल; और गहराई-वीएसआर वी2 (डीए-2के) थे। रचनात्मक दृश्य समझ के लिए, परीक्षणों ने विनोग्राउंड और सुगरक्रेप++ का उपयोग किया।

तीन बेसलाइन का परीक्षण किया गया था, सभी क्यूवेन2.5-वीएल-7बी से व्युत्पन्न: थिंकलाइट-वीएल बहुमोडल तर्क के लिए; वीएल-कोगिटो सामान्य दृष्टि और वैज्ञानिक कार्यों के लिए; और एलएलएवी-क्रिटिक-आर1 छवि धारणा के लिए।

सभी का मूल्यांकन लघु उत्तरों का उपयोग करके किया गया था, क्योंकि श्रृंखला के विचार (सीओटी) तर्क कभी-कभी प्रदर्शन को कम कर देता था।

छवि बेंचमार्क पर मूल्यांकन परिणाम। छवि जिगसॉ ने क्यूवेन2.5-वीएल-7बी बेस मॉडल पर सुधार किया सभी कार्य श्रेणियों में (अर्थात, विस्तृत धारणा और समझ; एकल दृष्टिकोण स्थानिक समझ; और रचनात्मक दृश्य तर्क), पूर्व-प्रशिक्षित बेसलाइन को पार करते हुए।

छवि बेंचमार्क पर मूल्यांकन परिणाम। छवि जिगसॉ ने क्यूवेन2.5-वीएल-7बी बेस मॉडल पर सुधार किया सभी कार्य श्रेणियों में (अर्थात, विस्तृत धारणा और समझ; एकल दृष्टिकोण स्थानिक समझ; और रचनात्मक दृश्य तर्क), पूर्व-प्रशिक्षित बेसलाइन को पार करते हुए।

छवि जिगसॉ के परिणामों के बारे में, ऊपर दिखाए गए, लेखकों का कहना है:

‘[छवि में] यह दिखाता है कि हमारी विधि तीनों प्रकार के बेंचमार्क पर दृष्टि-केंद्रित क्षमताओं में सुसंगत सुधार करती है। ये परिणाम पुष्टि करते हैं कि छवि जिगसॉ पोस्ट-ट्रेनिंग को शामिल करने से एमएलएलएम की दृष्टि संबंधी आधार और विस्तृत दृष्टि समझ में महत्वपूर्ण सुधार होता है, तर्क-केंद्रित पोस्ट-ट्रेनिंग रणनीतियों से परे। ‘

‘हम इन सुधारों को इस तथ्य से जोड़ते हैं कि छवि जिगसॉ को हल करने से मॉडल को स्थानीय पैच विवरण पर ध्यान केंद्रित करने, वैश्विक स्थानिक लेआउट का अनुमान लगाने और अंतर-पैच संबंधों के बारे में तर्क करने की आवश्यकता होती है, जो सीधे विस्तृत, स्थानिक और रचनात्मक समझ को लाभान्वित करता है।’

वीडियो जिगसॉ

वीडियो जिगसॉ के लिए, मूल्यांकन एओटीबेंच; विनोग्राउंड; टीओएमएटीओ; फेवर-बेंच; टीयूएनए-बेंच; वीडियो-एमएमई; टेम्पकॉम्पास; टीवीबेंच; मोशनबेंच; एलवीबेंच; वीएसआई-बेंच; वीडियो-टीटी; और सीवीबेंच पर किया गया था।

वीडियो-आर1 का उपयोग एक बेसलाइन के रूप में किया गया था, जिसे शीतल-प्रारंभ पर्यवेक्षित फाइन-ट्यूनिंग के साथ प्रशिक्षित किया गया था, उसके बाद वीडियो समझ और तर्क के लिए सुदृढ़ शिक्षा। इस मामले में, मूल्यांकन में पूरी तर्क प्रक्रिया शामिल थी, क्योंकि यह सुसंगत रूप से बेहतर परिणाम उत्पन्न करती थी niż सीधे उत्तर।

सभी मॉडल को 256x28x28 पिक्सल तक सीमित किया गया था, और तीन फ्रेम सेटिंग्स – 16, 32, और 64 पर परीक्षण किया गया था:

वीडियो बेंचमार्क पर मूल्यांकन परिणाम, वीडियो जिगसॉ को सभी कार्यों और फ्रेम सेटिंग्स पर बेसलाइन से बेहतर प्रदर्शन करते हुए।

वीडियो बेंचमार्क पर मूल्यांकन परिणाम, वीडियो जिगसॉ को सभी कार्यों और फ्रेम सेटिंग्स पर बेसलाइन से बेहतर प्रदर्शन करते हुए।

वीडियो जिगसॉ ने सभी वीडियो समझ बेंचमार्क और फ्रेम सेटिंग्स पर सुसंगत सुधार का उत्पादन किया, विशेष रूप से समयिक तर्क और दिशात्मकता जैसे कार्यों में लाभ जैसे एओटीबेंच में, और साथ ही साथ क्रॉस-वीडियो तर्क बेंचमार्क जैसे सीवीबेंच में:

‘ये परिणाम पुष्टि करते हैं कि वीडियो जिगसॉ कार्यों को हल करने से मॉडल को बेहतर ढंग से समयिक निरंतरता को पकड़ने, वीडियो के साथ संबंधों को समझने, दिशात्मक संगति के बारे में तर्क करने और समग्र और सामान्य वीडियो समझ परिदृश्यों में सामान्यीकरण करने में मदद मिलती है।’

3डी डेटा

3डी मोडलिटी के लिए, मॉडल का एसएटी-रियल; 3डीएसआरबेंच; व्यूस्पेशियल; ऑल-एंगल्स; उपरोक्त ओम्निस्पेशियल; वीएसआई-बेंच; एसपीएआरबेंच (टीनी); और उपरोक्त डीए-2के पर मूल्यांकन किया गया था।

3डी बेंचमार्क पर मूल्यांकन परिणाम: 3डी जिगसॉ ने डीए-2के जैसे गहराई तुलना कार्यों पर प्रदर्शन में सुधार किया, साथ ही साथ एकल-दृश्य, बहु-दृश्य और स्व-केंद्रित वीडियो इनपुट को कवर करने वाले व्यापक 3डी धारणा बेंचमार्क पर।

3डी बेंचमार्क पर मूल्यांकन परिणाम: 3डी जिगसॉ ने डीए-2के जैसे गहराई तुलना कार्यों पर प्रदर्शन में सुधार किया, साथ ही साथ एकल-दृश्य, बहु-दृश्य और स्व-केंद्रित वीडियो इनपुट को कवर करने वाले व्यापक 3डी धारणा बेंचमार्क पर।

यहाँ लेखक कहते हैं:

‘[3डी] जिगसॉ सभी बेंचमार्क पर महत्वपूर्ण सुधार प्राप्त करता है। अप्रत्याशित रूप से, सबसे बड़ा लाभ डीए-2के पर है, जो हमारे गहराई-क्रम पूर्व-प्रशिक्षण कार्य से सीधे संबंधित है। अधिक महत्वपूर्ण बात यह है कि हम एकल-दृश्य (जैसे 3डीएसआरबेंच, [ओम्निस्पेशियल]), बहु-दृश्य (जैसे व्यूस्पेशियल, ऑल-एंगल्स), और स्व-केंद्रित वीडियो इनपुट (जैसे वीएसआई-बेंच) सहित विभिन्न कार्यों पर सुसंगत सुधार देखते हैं। ‘

‘ये परिणाम दर्शाते हैं कि हमारा दृष्टिकोण न केवल विशिष्ट कौशल को सिखाता है गहराई क्रम, लेकिन यह भी प्रभावी ढंग से मॉडल की सामान्य क्षमता को मजबूत करता है 3डी स्थानिक संरचना की धारणा और तर्क करने के लिए।’

निष्कर्ष

यह पत्र से पूरी तरह से स्पष्ट नहीं है कि छवि और विवरण के बीच संबंध है जो एमएलएलएम प्रदर्शन में सुधार को संचालित कर रहा है।

पहली नज़र में, जिगसॉ पज़ल्स के माध्यम से सीखने की प्रक्रिया हमारे अपने प्रारंभिक प्रयासों और विकास के समान लगती है। हालांकि, पत्र की एक गहरी जांच से पता चलता है कि भाषा एमएलएलएम के लिए दृश्य और सेमेंटिक वास्तविकता के बीच एक आकर्षक पुल के रूप में कार्य करती है।

 

* कृपया ध्यान दें कि पत्र के लेखक ‘मल्टीमॉडल लार्ज लैंग्वेज मॉडल’ शब्द का उपयोग करना पसंद करते हैं, जिसे ‘एमएलएलएम’ के रूप में संक्षिप्त किया जाता है। यह एक उभरता हुआ या कम बार-बार उपयोग किया जाने वाला शब्द है, और मॉडलों पर लागू होता है जो विस्तृत रूप से छवियों को स्थानिक रूप से तर्क और विश्लेषण कर सकते हैं, लेकिन छवियों का उत्पादन नहीं करते हैं। जैसा कि नए दृष्टिकोण और मॉडल उभरते हैं, यह शब्दावली निरंतर संशोधन के अधीन है। पहली बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।

पहली बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai