Anderson का एंगल
जिगसॉ पज़ल्स बूस्ट एआई विज़ुअल रीज़निंग

नया शोध संकेत देता है कि एआई मॉडल जिगसॉ पज़ल्स को हल करके दृष्टि में सुधार कर सकते हैं। छवियों, वीडियो, और 3डी दृश्यों को पुनर्व्यवस्थित करके उन्हें अपने दृश्य कौशल को तेज करने में मदद मिलती है, बिना अतिरिक्त डेटा, लेबल, या टूल्स की आवश्यकता के।
वर्तमान में मल्टीमॉडल लार्ज लैंग्वेज मॉडल (एमएलएलएम*) को आगे बढ़ाने के लिए, कुछ आसान जीत और कोई मुफ्त भोजन नहीं हैं।
हालांकि 2025 के कई चीनी फॉस्स रिलीज़ में कम विकास और चलने की लागत है, पश्चिमी रिलीज़ अक्सर समस्या को अधिक डेटा वॉल्यूम, अधिक अनुमान शक्ति, और अधिक बिजली के साथ हल करने का प्रयास करते हैं (हालांकि, जैसा कि हम हाल ही में नोट किया, अधिक वास्तविक मानव अनnotator, क्योंकि यह बहुत महंगा है даже $ट्रिलियन+ पैमाने पर जेन-एआई क्रांति के लिए)।
शोध साहित्य में, अधिकांश कथित ‘मुफ्त’ दृष्टिकोण एआई आर्किटेक्चर के विकास में केवल छोटे क्रमिक सुधार प्रदान करते हैं; या फिर उन क्षेत्रों में सुधार जो सबसे गंभीर रूप से पीछा किए जा रहे हैं नहीं हैं। फिर भी, ‘मूलभूत सिद्धांतों’ की खोज जो एआई विकास की गति को तेज कर सकती है, बहुत आकर्षक है और इसे छोड़ना मुश्किल है।
पिकिंग अप द पीसेस
एक नए शोध सहयोग में, चीनी संस्थानों के बीच एक नए शोध सहयोग ने दावा किया है कि वीएलएम को जिगसॉ पज़ल्स हल करने से उनके प्रदर्शन में उल्लेखनीय सुधार होता है, हालांकि इस सुदृढ़ शिक्षा दृष्टिकोण ने पहले इस क्षेत्र में कम प्रदर्शन किया है, और यह किसी भी अतिरिक्त प्रणाली, सहायक मॉडल या ‘बोल्ट-ऑन’ प्रक्रियाओं की आवश्यकता नहीं है:
<img class=" wp-image-223795" src="https://www.unite.ai/wp-content/uploads/2025/10/figure-1-1.jpg" alt="विज़ुअल जिगसॉ एक स्व-प्रशिक्षित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल में दृष्टि-केंद्रित कौशल में सुधार करता है। छवियों, वीडियो, और 3डी डेटा पर जिगसॉ कार्यों के प्रशिक्षण से, मॉडल में छवियों में तीक्ष्ण, स्थानिक, और रचनात्मक धारणा में सुधार होता है, वीडियो में समयिक तर्क में सुधार होता है, और 3डी दृश्यों में ज्यामिति-जागरूक समझ में सुधार होता है। ऊपर दी गई रडार चार्ट में सुसंगत लाभ दिखाए गए हैं बेस क्यूवेन2.5-वीएल के साथ, मूल्य स्केल को प्रत्येक बेंचमार्क के लिए स्पष्टता के लिए समायोजित किया गया है। स्रोत: https://arxiv.org/pdf/2509.25190
शोधकर्ताओं द्वारा विकसित प्रणाली को विज़ुअल जिगसॉ नाम दिया गया है, और इसमें मौजूदा एमएलएलएम को टुकड़ों में विभाजित और यादृच्छिक रूप से वितरित किए गए डेटा पर प्रशिक्षित करना शामिल है। लेखकों ने इस दृष्टिकोण के लिए तीन मोडलिटी विकसित की हैं: छवि, वीडियो, और 3डी (अर्थात, सीजीआई-शैली मेश), और पाया कि एक मध्यम अनुकूलन इसी प्रक्रिया के तीनों डोमेन में लाभकारी था:

विज़ुअल जिगसॉ कार्यों का प्रतिनिधित्व। छवि जिगसॉ में, एक छवि को पैच में विभाजित किया जाता है, भ्रमित किया जाता है, और मॉडल सही लेआउट का अनुमान लगाता है; वीडियो जिगसॉ में, क्लिप को भ्रमित किया जाता है और मॉडल समय में उनका क्रम बहाल करता है; 3डी जिगसॉ में, विभिन्न गहराई के बिंदुओं को भ्रमित किया जाता है और मॉडल उन्हें निकटतम से दूर तक क्रम में रखता है। मॉडल के आउटपुट को ग्राउंड ट्रुथ के खिलाफ स्कोर किया जाता है, आंशिक रूप से सही समाधानों के लिए आंशिक क्रेडिट दिया जाता है।
विज़ुअल जिगसॉ की प्रशिक्षण विधि एआई मॉडल को दृष्टि संबंधी जानकारी को समझने में सुधार करने में मदद करती है जो इन जटिल छवियों, वीडियो क्लिप, या 3डी डेटा बिंदुओं को पुनर्व्यवस्थित करके की जाती है।
प्रक्रिया शब्दों पर आधारित है, न कि छवियों पर, और इसलिए मॉडल को छवियों को उत्पन्न करने या किसी अतिरिक्त दृश्य घटक का उपयोग करने की आवश्यकता नहीं है। यह विधि रिनफोर्समेंट लर्निंग फ्रॉम वेरिफायबल रिवार्ड्स (आरएलवीआर) नामक प्रणाली में फिट होती है, जहां मॉडल को स्पष्ट, स्वचालित नियमों के आधार पर सही उत्तरों के लिए पुरस्कृत किया जाता है; और जहां, इसलिए, मानव लेबलिंग की आवश्यकता नहीं है।
यह महत्वपूर्ण तथ्य वास्तव में नए पत्र से कठिन है: कि प्रणाली सेमैंटिक रूप से जिगसॉ को इकट्ठा कर रही है, विवरण के माध्यम से, और न कि मानव जो इस तरह के पज़ल्स को हल करना सीखते हैं उस प्रकार के आकार-प्रतिनिधित्व तरीके से:

नए पत्र के पूरक सामग्री से, एक उदाहरण आरएल कार्य जो पाठ-आधारित प्रक्रिया को दर्शाता है। छवियाँ जो एमएलएलएम को दिखाई जाएंगी यहाँ नहीं दिखाई गई हैं।
हालांकि एमएलएलएम विज़न-सेंट्रिक कार्यों के साथ व्यापक रूप से सौदा करते हैं, वे भाषा-आधारित आर्किटेक्चर हैं, न कि छवियों, वीडियो या आकार प्रतिनिधित्व जैसे 3डी मेश उत्पन्न करने के लिए डिज़ाइन किए गए हैं।

छवि जिगसॉ कार्य के उदाहरण। प्रत्येक पंक्ति में भ्रमित पैच दिखाए गए हैं जिन्हें मॉडल को उनके मूल लेआउट में पुनर्व्यवस्थित करना होगा, जो दाईं ओर दिखाया गया है।
किसी भी मामले में, यह प्रकार का प्रशिक्षण मुख्य शिक्षण चरण के बाद किया जाता है, जब मॉडल पहले से ही कुछ छवियों को समझने में सक्षम होता है।
पूर्व दृष्टिकोण जैसे 2017 के स्विस पेपर अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स ने इस प्रकार के सुदृढ़ दृष्टिकोण का उपयोग किया था, लेकिन कम सफलता के साथ, कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) पर, एक आधुनिक एमएलएलएम की तुलना में एक अलग प्रकार की आर्किटेक्चर।

2017 रिलीज ‘अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स’ से, एक न्यूरल सिस्टम के लिए पुरस्कार-आधारित चुनौती के रूप में टुकड़ों का उपयोग करने का एक प्रारंभिक उदाहरण। स्रोत: https://arxiv.org/pdf/1603.09246
परीक्षणों में, विज़ुअल जिगसॉ ने दावा किया कि वे विभिन्न बेंचमार्क पर सुसंगत और मापनीय सुधार किए हैं: छवि जिगसॉ कार्य ने बारीकी से धारणा, स्थानिक लेआउट समझ, और रचनात्मक तर्क में सुधार किया; वीडियो जिगसॉ कार्य ने मॉडल की क्षमता को बढ़ाया समयिक अनुक्रमों को ट्रैक करने और घटना क्रम के बारे में तर्क करने के लिए; और 3डी जिगसॉ कार्य ने गहराई-आधारित समझ और स्थानिक तर्क में सुधार किया, केवल आरजीबी-डी इनपुट का उपयोग करके।
तीनों मोडलिटी में, पत्र दोहराता है, नई विधि ने कई प्रतिस्पर्धी बेसलाइन को पार किया, बिना किसी वास्तुकला परिवर्तन, अतिरिक्त दृश्य मॉड्यूल, या अतिरिक्त पर्यवेक्षित डेटा की आवश्यकता के:
‘व्यापक प्रयोगों से यह साबित होता है कि विस्तृत धारणा, समयिक तर्क, और 3डी स्थानिक समझ में महत्वपूर्ण सुधार हुए हैं। हमारे निष्कर्ष एमएलएलएम में स्व-प्रशिक्षित दृष्टि-केंद्रित कार्यों की संभावना को उजागर करते हैं और आगे के शोध को प्रेरित करने का लक्ष्य रखते हैं दृष्टि-केंद्रित पूर्व-डिज़ाइन पर।’
नया पेपर विज़ुअल जिगसॉ पोस्ट-ट्रेनिंग इम्प्रूव्स एमएलएलएम नामक है, और नаньयांग टेक्नोलॉजिकल यूनिवर्सिटी, लिंकोपिंग यूनिवर्सिटी, और सेंसटाइम रिसर्च के छह शोधकर्ताओं से आया है। पेपर के साथ एक प्रोजेक्ट साइट है जिसमें लाइव डेमो (और आप अपनी छवि को छवि-आधारित जिगसॉ डेमो में लोड कर सकते हैं)। प्रोजेक्ट के लिए कोड और वज़न को सामान्य रूप से उपलब्ध कराया गया है,
विधि
हालांकि हम तीन परीक्षण मोडलिटी के लिए जानकारी को कैसे विभाजित किया जाता है, इस पर एक नज़र डालेंगे, हमें पहले नई प्रणाली के लिए पुरस्कार डिज़ाइन पर विचार करना चाहिए।
विज़ुअल जिगसॉ दृष्टिकोण मॉडल की प्रतिक्रियाओं को ग्रेडेड पुरस्कार का उपयोग करके स्कोर करता है, न कि केवल पास या विफल। यदि मॉडल सटीक सही क्रम का अनुमान लगाता है, तो यह पूरा पुरस्कार प्राप्त करता है; यदि उत्तर अधिकांशतः सही है, लेकिन पूरी तरह से नहीं, तो मॉडल आंशिक क्रेडिट प्राप्त करता है, जो एक छूट कारक द्वारा स्केल किया जाता है ताकि निकट-मिस को अधिक मूल्य न दिया जा सके (यह मॉडल को प्रणाली को गेमिंग से रोकता है जो केवल आंशिक रूप से सही अनुमानों को दोहराता है)।
अमान्य उत्तर, जैसे कि चीट का उपयोग करके एक ही संख्या को दोहराना, शून्य स्कोर प्राप्त करते हैं। सुसंगत प्रारूप को प्रोत्साहित करने के लिए, मॉडल को अपने तर्क को <think> टैग के अंदर और अपने अंतिम उत्तर को <answer> टैग के अंदर रखना होगा। यह सही प्रारूप का उपयोग करने पर एक छोटा बोनस प्राप्त करता है।
छवियाँ
छवि मोडलिटी के लिए एक पज़ल बनाने के लिए, एक छवि को पहले एक ग्रिड में विभाजित किया जाता है जो इसे बराबर आकार के ब्लॉक में काटता है:

सिस्टम के लिए हल करने के लिए छवि-आधारित पैच के उदाहरण।
पैच को एक निश्चित क्रम में व्यवस्थित किया जाता है, जैसे कि एक पृष्ठ पर पढ़ने का क्रम, trước उन्हें यादृच्छिक रूप से भ्रमित करने से। मॉडल को तब इस भ्रमित सेट को दिखाया जाता है और यह मूल लेआउट का अनुमान लगाने के लिए कहा जाता है जो मूल छवि को पुनर्स्थापित करता है।
प्रशिक्षण में, सीओसीओ डेटासेट की 118,000 छवियों का उपयोग किया गया था, प्रत्येक छवि से नौ पैच (यानी, ‘पज़ल पीस’) प्राप्त हुए। सिस्टम को दिए गए प्रॉम्प्ट को इस लेख में पहले दिखाया गया है (छवि जिसमें कैप्शन शुरू होता है ‘नए पत्र के पूरक सामग्री से’)।
वीडियो
वीडियो जिगसॉ कार्य के लिए, एक वीडियो को समय के साथ समान रूप से क्लिप में विभाजित किया जाता है और फिर क्लिप को भ्रमित किया जाता है। मॉडल को तब इस भ्रमित क्रम को दिखाया जाता है और यह मूल कालानुक्रमिक क्रम में उनका अनुमान लगाने के लिए कहा जाता है:

वीडियो पज़ल चुनौती के संक्षिप्त उदाहरण, पत्र की पूरक सामग्री से।
इस मोडलिटी के लिए प्रशिक्षण में, एलएलएवी-वीडियो डेटासेट का उपयोग किया गया था, जिसमें प्रत्येक वीडियो को छह क्लिप में विभाजित किया गया था। क्लिप की सीमाओं पर फ्रेम-मिलान संकेतों का शोषण करने से मॉडल को रोकने के लिए, प्रत्येक क्लिप की शुरुआत और अंत में 5% फ्रेम को ट्रिम किया गया था।
क्लिप में अधिकतम 12 फ्रेम थे, प्रत्येक का अधिकतम रिज़ॉल्यूशन 128x28x28 पिक्सल था। 24 सेकंड से कम वीडियो को बाहर कर दिया गया था।
इस कार्य के लिए प्रॉम्प्ट नीचे दिखाया गया है:

वीडियो कार्य के लिए सुदृढ़ शिक्षा प्रॉम्प्ट, जिसमें एमएलएलएम को दिखाई जाने वाली क्लिप नहीं हैं।
3डी डेटा
एक पूर्ण 3डी जिगसॉ कार्य आमतौर पर 3डी स्पेस (जैसे वोक्सेल ब्लॉक या पॉइंट क्लाउड टुकड़े) को छोटे टुकड़ों में तोड़ने और मॉडल को उनकी मूल स्थानिक व्यवस्था को पुनर्निर्माण करने के लिए प्रशिक्षित करने को शामिल करता है।
हालांकि, औसत एमएलएलएम सीधे कच्चे 3डी डेटा को संभालने में सक्षम नहीं है, बल्कि सेमैंटिक रूप से व्याख्या की गई छवि या वीडियो इनपुट पर निर्भर करता है। इसलिए, वर्तमान एमएलएलएम के साथ संगत एक कार्य बनाने के लिए जो अभी भी 3डी तर्क में टैप करता है, लेखकों ने 2डी छवियों (अर्थात, आरजीबी-डी छवियों) का उपयोग करने वाला एक अधिक ट्रैक्टेबल वेरिएंट पेश किया जो प्रत्येक पिक्सेल के लिए गहराई जानकारी शामिल करता है।

3डी स्पेशियल अंडरस्टैंडिंग बेंचमार्क का उपयोग करके मूल्यांकन के लिए उदाहरण प्रश्न, जो सापेक्ष दृष्टिकोण और कैमरा गति तर्क के बारे में पूछते हैं। 3डी जिगसॉ मॉडल दृश्य के बीच स्थानिक संबंध और कैमरा घूर्णन की संभावित दिशा दोनों का सही अनुमान लगाता है, क्यूवेन2.5-वीएल-7बी बेसलाइन को पार करता है।
प्रत्येक आरजीबी-डी छवि से, मॉडल को विभिन्न गहराई के साथ बिंदुओं की एक भ्रमित सूची दी जाती है, जो निकट से दूर तक होती है, जिसका उद्देश्य केवल 2डी छवि का उपयोग करके उनकी मूल गहराई-आधारित क्रम को पुनर्प्राप्त करना है:

3डी जिगसॉ के लिए आरएल प्रॉम्प्ट।
प्रत्येक बिंदु को छवि पर चिह्नित किया जाता है (जो मॉडल को दिखाया जाता है, लेकिन ऊपर दी गई छवि में सीधे दिखाया नहीं जाता है), और मॉडल को यह अनुमान लगाना होता है कि कौन सा निकटतम, दूसरा निकटतम, और इसी तरह, मूल गहराई क्रम को पुनर्निर्माण करके है।
3डी जिगसॉ कार्य को स्कैननेट डेटासेट की आरजीबी-डी छवियों पर प्रशिक्षित किया जाता है, 300,000 नमूनों का उपयोग करके जो प्रत्येक छवि से छह गहराई बिंदुओं का यादृच्छिक चयन करके बनाए जाते हैं।

3डी जिगसॉ में उपयोग किए जाने वाले स्कैननेट डेटासेट से बिंदु बादलों के उदाहरण। स्रोत: https://arxiv.org/pdf/1702.04405
प्रत्येक बिंदु को 0.1 से 10 मीटर की गहराई सीमा के भीतर होना आवश्यक था, और विविधता को बढ़ावा देने के लिए, किसी भी दो बिंदुओं को एक ही सेट में एक दूसरे के 40 पिक्सल से कम या 0.2 मीटर से कम गहराई में नहीं होना चाहिए।
परीक्षण
प्रारंभिक परीक्षणों के लिए, प्रणाली ने क्यूवेन2.5-वीएल-7बी-इन्सट्रक्ट को आधार बहुमोडल मॉडल के रूप में उपयोग किया। प्रशिक्षण में ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (जीआरपीओ) अल्गोरिदम का उपयोग किया गया था, दोनों केएल नियमितीकरण और एंट्रोपी हानि को हटा दिया गया था।
आंशिक भविष्यवाणियों के लिए, 0.2 का छूट कारक लागू किया गया था। छवि जिगसॉ प्रशिक्षण में 256 का वैश्विक बैच आकार था, जबकि वीडियो और 3डी जिगसॉ में 128 का उपयोग किया गया था। सीखने की दर 1×10⁻⁶ पर सेट की गई थी।
प्रत्येक प्रॉम्प्ट के लिए, मॉडल ने 1.0 के डिकोडिंग तापमान पर 16 प्रतिक्रियाएं उत्पन्न कीं। छवि और वीडियो जिगसॉ कार्यों को 1,000 चरणों के लिए प्रशिक्षित किया गया था, जबकि 3डी जिगसॉ कार्य को 800 चरणों के लिए प्रशिक्षित किया गया था।
छवि जिगसॉ
छवि जिगसॉ मॉडल का तीन श्रेणियों के दृष्टि-केंद्रित बेंचमार्क पर परीक्षण किया गया था: विस्तृत धारणा और समझ के लिए, एमएमवीपी, एमएमस्टार का विस्तृत धारणा उपसेट; एमएमबेंच; एचआर-बेंच; वी*; एमएमई-रियलवर्ल्ड (लाइट); लिसा-ग्राउंडिंग; और ओवीडी-इवल।
एकल दृष्टिकोण स्थानिक समझ के लिए, बेंचमार्क वीएसआर; ओम्निस्पेशियल; और गहराई-वीएसआर वी2 (डीए-2के) थे। रचनात्मक दृश्य समझ के लिए, परीक्षणों ने विनोग्राउंड और सुगरक्रेप++ का उपयोग किया।
तीन बेसलाइन का परीक्षण किया गया था, सभी क्यूवेन2.5-वीएल-7बी से व्युत्पन्न: थिंकलाइट-वीएल बहुमोडल तर्क के लिए; वीएल-कोगिटो सामान्य दृष्टि और वैज्ञानिक कार्यों के लिए; और एलएलएवी-क्रिटिक-आर1 छवि धारणा के लिए।
सभी का मूल्यांकन लघु उत्तरों का उपयोग करके किया गया था, क्योंकि श्रृंखला के विचार (सीओटी) तर्क कभी-कभी प्रदर्शन को कम कर देता था।

छवि बेंचमार्क पर मूल्यांकन परिणाम। छवि जिगसॉ ने क्यूवेन2.5-वीएल-7बी बेस मॉडल पर सुधार किया सभी कार्य श्रेणियों में (अर्थात, विस्तृत धारणा और समझ; एकल दृष्टिकोण स्थानिक समझ; और रचनात्मक दृश्य तर्क), पूर्व-प्रशिक्षित बेसलाइन को पार करते हुए।
छवि जिगसॉ के परिणामों के बारे में, ऊपर दिखाए गए, लेखकों का कहना है:
‘[छवि में] यह दिखाता है कि हमारी विधि तीनों प्रकार के बेंचमार्क पर दृष्टि-केंद्रित क्षमताओं में सुसंगत सुधार करती है। ये परिणाम पुष्टि करते हैं कि छवि जिगसॉ पोस्ट-ट्रेनिंग को शामिल करने से एमएलएलएम की दृष्टि संबंधी आधार और विस्तृत दृष्टि समझ में महत्वपूर्ण सुधार होता है, तर्क-केंद्रित पोस्ट-ट्रेनिंग रणनीतियों से परे। ‘
‘हम इन सुधारों को इस तथ्य से जोड़ते हैं कि छवि जिगसॉ को हल करने से मॉडल को स्थानीय पैच विवरण पर ध्यान केंद्रित करने, वैश्विक स्थानिक लेआउट का अनुमान लगाने और अंतर-पैच संबंधों के बारे में तर्क करने की आवश्यकता होती है, जो सीधे विस्तृत, स्थानिक और रचनात्मक समझ को लाभान्वित करता है।’
वीडियो जिगसॉ
वीडियो जिगसॉ के लिए, मूल्यांकन एओटीबेंच; विनोग्राउंड; टीओएमएटीओ; फेवर-बेंच; टीयूएनए-बेंच; वीडियो-एमएमई; टेम्पकॉम्पास; टीवीबेंच; मोशनबेंच; एलवीबेंच; वीएसआई-बेंच; वीडियो-टीटी; और सीवीबेंच पर किया गया था।
वीडियो-आर1 का उपयोग एक बेसलाइन के रूप में किया गया था, जिसे शीतल-प्रारंभ पर्यवेक्षित फाइन-ट्यूनिंग के साथ प्रशिक्षित किया गया था, उसके बाद वीडियो समझ और तर्क के लिए सुदृढ़ शिक्षा। इस मामले में, मूल्यांकन में पूरी तर्क प्रक्रिया शामिल थी, क्योंकि यह सुसंगत रूप से बेहतर परिणाम उत्पन्न करती थी niż सीधे उत्तर।
सभी मॉडल को 256x28x28 पिक्सल तक सीमित किया गया था, और तीन फ्रेम सेटिंग्स – 16, 32, और 64 पर परीक्षण किया गया था:

वीडियो बेंचमार्क पर मूल्यांकन परिणाम, वीडियो जिगसॉ को सभी कार्यों और फ्रेम सेटिंग्स पर बेसलाइन से बेहतर प्रदर्शन करते हुए।
वीडियो जिगसॉ ने सभी वीडियो समझ बेंचमार्क और फ्रेम सेटिंग्स पर सुसंगत सुधार का उत्पादन किया, विशेष रूप से समयिक तर्क और दिशात्मकता जैसे कार्यों में लाभ जैसे एओटीबेंच में, और साथ ही साथ क्रॉस-वीडियो तर्क बेंचमार्क जैसे सीवीबेंच में:
‘ये परिणाम पुष्टि करते हैं कि वीडियो जिगसॉ कार्यों को हल करने से मॉडल को बेहतर ढंग से समयिक निरंतरता को पकड़ने, वीडियो के साथ संबंधों को समझने, दिशात्मक संगति के बारे में तर्क करने और समग्र और सामान्य वीडियो समझ परिदृश्यों में सामान्यीकरण करने में मदद मिलती है।’
3डी डेटा
3डी मोडलिटी के लिए, मॉडल का एसएटी-रियल; 3डीएसआरबेंच; व्यूस्पेशियल; ऑल-एंगल्स; उपरोक्त ओम्निस्पेशियल; वीएसआई-बेंच; एसपीएआरबेंच (टीनी); और उपरोक्त डीए-2के पर मूल्यांकन किया गया था।

3डी बेंचमार्क पर मूल्यांकन परिणाम: 3डी जिगसॉ ने डीए-2के जैसे गहराई तुलना कार्यों पर प्रदर्शन में सुधार किया, साथ ही साथ एकल-दृश्य, बहु-दृश्य और स्व-केंद्रित वीडियो इनपुट को कवर करने वाले व्यापक 3डी धारणा बेंचमार्क पर।
यहाँ लेखक कहते हैं:
‘[3डी] जिगसॉ सभी बेंचमार्क पर महत्वपूर्ण सुधार प्राप्त करता है। अप्रत्याशित रूप से, सबसे बड़ा लाभ डीए-2के पर है, जो हमारे गहराई-क्रम पूर्व-प्रशिक्षण कार्य से सीधे संबंधित है। अधिक महत्वपूर्ण बात यह है कि हम एकल-दृश्य (जैसे 3डीएसआरबेंच, [ओम्निस्पेशियल]), बहु-दृश्य (जैसे व्यूस्पेशियल, ऑल-एंगल्स), और स्व-केंद्रित वीडियो इनपुट (जैसे वीएसआई-बेंच) सहित विभिन्न कार्यों पर सुसंगत सुधार देखते हैं। ‘
‘ये परिणाम दर्शाते हैं कि हमारा दृष्टिकोण न केवल विशिष्ट कौशल को सिखाता है गहराई क्रम, लेकिन यह भी प्रभावी ढंग से मॉडल की सामान्य क्षमता को मजबूत करता है 3डी स्थानिक संरचना की धारणा और तर्क करने के लिए।’
निष्कर्ष
यह पत्र से पूरी तरह से स्पष्ट नहीं है कि छवि और विवरण के बीच संबंध है जो एमएलएलएम प्रदर्शन में सुधार को संचालित कर रहा है।
पहली नज़र में, जिगसॉ पज़ल्स के माध्यम से सीखने की प्रक्रिया हमारे अपने प्रारंभिक प्रयासों और विकास के समान लगती है। हालांकि, पत्र की एक गहरी जांच से पता चलता है कि भाषा एमएलएलएम के लिए दृश्य और सेमेंटिक वास्तविकता के बीच एक आकर्षक पुल के रूप में कार्य करती है।
* कृपया ध्यान दें कि पत्र के लेखक ‘मल्टीमॉडल लार्ज लैंग्वेज मॉडल’ शब्द का उपयोग करना पसंद करते हैं, जिसे ‘एमएलएलएम’ के रूप में संक्षिप्त किया जाता है। यह एक उभरता हुआ या कम बार-बार उपयोग किया जाने वाला शब्द है, और मॉडलों पर लागू होता है जो विस्तृत रूप से छवियों को स्थानिक रूप से तर्क और विश्लेषण कर सकते हैं, लेकिन छवियों का उत्पादन नहीं करते हैं। जैसा कि नए दृष्टिकोण और मॉडल उभरते हैं, यह शब्दावली निरंतर संशोधन के अधीन है। पहली बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।
पहली बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।












