Anderson का एंगल

जिगसॉ पज़ल्स बूस्ट एआई विज़ुअल रीज़निंग

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

नया शोध संकेत देता है कि एआई मॉडल जिगसॉ पज़ल्स को हल करके दृष्टि में सुधार कर सकते हैं। छवियों, वीडियो, और 3डी दृश्यों को पुनर्व्यवस्थित करके उन्हें अपने दृश्य कौशल को तेज करने में मदद मिलती है, बिना

 

अतिरिक्त डेटा, लेबल, या टूल्स की आवश्यकता के। वर्तमान मेंमल्टीमॉडललार्ज लैंग्वेज मॉडल ( एमएलएलएम *) को आगे बढ़ाने के लिए, कुछ आसान जीत और कोई मुफ्त भोजन नहीं हैं। हालांकि 2025 के कई चीनी फॉस्स रिलीज़ में शोध साहित्य में, अधिकांश कथित ‘मुफ्त’ दृष्टिकोण एआई आर्किटेक्चर के विकास में केवल छोटे क्रमिक सुधार प्रदान करते हैं; याफिर उन क्षेत्रों में सुधार भी, जो सबसे गंभीर रूप से पीछा किए जा रहे हैं नहीं हैं। फिर ‘मूलभूत सिद्धांतों’ की खोज जोएआई विकास की गति को तेज कर सकती है, बहुत आकर्षक हैं और उन्हें छोड़ना मुश्किल है। वेस्टर्न रिलीज़ अक्सर ज़्यादा डेटा वॉल्यूम, ज़्यादा इनफ़रेंस पावर और ज़्यादा पावर के साथ समस्या को हल करने की कोशिश करते हैं (हालांकि, जैसा कि हमने हाल ही में बताया, ज़्यादा असली इंसानी एनोटेटर की ज़रूरत है, क्योंकि यह $ट्रिलियन+ स्केल के जेन-AI रेवोल्यूशन के लिए बहुत महंगा है)।

पिकिंग अप द पीसेस

एक नए शोध सहयोग में, चीनी संस्थानों के बीच एक नए शोध सहयोग ने दावा किया है कि वीएलएम को जिगसॉ पज़ल्स हल करने से उनके प्रदर्शन में उल्लेखनीय सुधार होता है, हालांकि इस सुदृढ़ शिक्षा दृष्टिकोण ने पहले इस क्षेत्र में कम प्रदर्शन किया है, और यह किसी भी अतिरिक्त प्रणाली, सहायक मॉडल या ‘बोल्ट-ऑन’ प्रक्रियाओं की आवश्यकता नहीं है:

विज़ुअल जिग्स एक स्व-पर्यवेक्षित पोस्ट-प्रशिक्षण ढांचा है जो मल्टीमॉडल बड़े भाषा मॉडल में दृष्टि-केंद्रित कौशल में सुधार करता है। छवियों, वीडियो और 3डी डेटा में जिग्सॉ कार्यों पर प्रशिक्षण से, मॉडल छवियों में तेज बारीक-बारीक, स्थानिक और संरचनागत धारणा, वीडियो में मजबूत अस्थायी तर्क और 3डी दृश्यों में ज्यामिति-जागरूक समझ को बढ़ाते हैं। ऊपर की छवि में रडार चार्ट आधार Qwen2.5-VL पर लगातार लाभ दिखाते हैं, स्पष्टता के लिए प्रत्येक बेंचमार्क के लिए मूल्य पैमाने को समायोजित किया जाता है। स्रोत: https://arxiv.org/pdf/2509.25190 <img class=” wp-image-223795″ src=”https://www.unite.ai/wp-content/uploads/2025/10/figure-1-1.jpg” alt=”विज़ुअल जिगसॉ एक स्व-प्रशिक्षित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल में दृष्टि-केंद्रित कौशल में सुधार करता है। छवियों, वीडियो, और 3डी डेटा पर जिगसॉ कार्यों के प्रशिक्षण से, मॉडल में छवियों में तीक्ष्ण, स्थानिक, और रचनात्मक धारणा में सुधार होता है, वीडियो में समयिक तर्क में सुधार होता है, और 3डी दृश्यों में ज्यामिति-जागरूक समझ में सुधार होता है। ऊपर दी गई रडार चार्ट में सुसंगत लाभ दिखाए गए हैं बेस क्यूवेन2.5-वीएल के साथ, मूल्य स्केल को प्रत्येक बेंचमार्क के लिए स्पष्टता के लिए समायोजित किया गया है। स्रोत: https://arxiv.org/pdf/2509.25190 शोधकर्ताओं द्वारा विकसित प्रणाली को नाम दिया गया है, (अर्थात, सीजीआई-शैलीऔर इसमें मौजूदा एमएलएलएम को टुकड़ों में विभाजित और यादृच्छिक रूप से वितरित किए गए डेटा पर प्रशिक्षित करना शामिल है। लेखकों ने इस दृष्टिकोण के लिए तीन मोडलिटी विकसित की हैं: छवि, वीडियो, और 3डी विज़ुअल जिगसॉमेश ), और पाया कि एक मध्यम अनुकूलन इसी प्रक्रिया के तीनों डोमेन में लाभकारी

विज़ुअल जिगसॉ कार्यों का प्रतिनिधित्व। छवि जिगसॉ में, एक छवि को पैच में विभाजित किया जाता है, भ्रमित किया जाता है, और मॉडल सही लेआउट का अनुमान लगाता है; वीडियो जिगसॉ में, क्लिप को भ्रमित किया जाता है और मॉडल समय में उनका क्रम बहाल करता है; 3डी जिगसॉ में, विभिन्न गहराई के बिंदुओं को भ्रमित किया जाता है और मॉडल उन्हें निकटतम से दूर तक क्रम में रखता है। मॉडल के आउटपुट को ग्राउंड ट्रुथ के खिलाफ स्कोर किया जाता है, आंशिक रूप से सही समाधानों के लिए आंशिक क्रेडिट दिया जाता है। था: विज़ुअल जिगसॉ कार्यों का प्रतिनिधित्व। छवि जिगसॉ में, एक छवि को पैच में विभाजित किया जाता है, भ्रमित किया जाता है, और मॉडल सही लेआउट का अनुमान लगाता है; वीडियो जिगसॉ में, क्लिप को भ्रमित किया जाता है और मॉडल समय में उनका क्रम बहाल करता है; 3डी जिगसॉ में, विभिन्न गहराई के बिंदुओं को भ्रमित किया जाता है और मॉडल उन्हें निकटतम से दूर तक क्रम में रखता है। मॉडल के आउटपुट को ग्राउंड ट्रुथ के खिलाफ स्कोर किया जाता है,

आंशिक रूप से सही समाधानों के लिए आंशिक क्रेडिट दिया जाता है। विज़ुअल जिगसॉ की प्रशिक्षण विधि एआई मॉडल को दृष्टि संबंधी जानकारी को समझने में सुधार करने में मदद करती है जो इन जटिल छवियों, वीडियो क्लिप, या 3डी डेटा बिंदुओं को पुनर्व्यवस्थित करके की जाती है। प्रक्रिया शब्दों पर आधारित है, न कि छवियों पर, और इसलिए मॉडल को छवियों को उत्पन्न करने या किसी अतिरिक्त घटक का उपयोग करने की आवश्यकता दृश्यनहींहै। यह विधि ( रिनफोर्समेंट लर्निंग फ्रॉम वेरिफायबल रिवार्ड्स आरएलवीआर ) नामक प्रणाली में फिट होती है, जहां मॉडल को स्पष्ट, स्वचालित नियमों के आधार पर सही उत्तरों के लिए पुरस्कृत किया जाता है; और जहां, इसलिए, मानव लेबलिंग की आवश्यकता नहीं है। यह केमहत्वपूर्ण तथ्य वास्तव में नए पत्र से कठिन है: कि प्रणाली जिगसॉ को इकट्ठा कर रही है, विवरण

नए पत्र के पूरक सामग्री से, एक उदाहरण आरएल कार्य जो पाठ-आधारित प्रक्रिया को दर्शाता है। माध्यम से, और न कि मानव जो इस तरह के पज़ल्स को हल करना सीखते हैं उस प्रकार के आकार-प्रतिनिधित्व तरीके से: सेमैंटिक रूप से नए पत्र के पूरक सामग्री से, एक उदाहरण आरएल कार्य जो पाठ-आधारित प्रक्रिया को

दर्शाता है। छवियाँ जो एमएलएलएम को दिखाई जाएंगी यहाँ नहीं दिखाई हैं, न गई हैं। हालांकि एमएलएलएम विज़न-सेंट्रिक कार्यों के साथ व्यापक रूप से सौदा करते हैं, वे आर्किटेक्चर

छवि जिगसॉ कार्य के उदाहरण। प्रत्येक पंक्ति में भ्रमित पैच दिखाए गए हैं जिन्हें मॉडल को उनके मूल लेआउट में पुनर्व्यवस्थित करना होगा, जो दाईं ओर दिखाया गया है। कि छवियों, वीडियो या आकार प्रतिनिधित्व जैसे 3डी मेश उत्पन्न करने के लिए डिज़ाइन किए गए हैं। भाषा-आधारित छवि जिगसॉ कार्य के उदाहरण। प्रत्येक पंक्ति में भ्रमित पैच दिखाए गए हैं

जिन्हें मॉडल को उनके मूल लेआउट में पुनर्व्यवस्थित करना होगा, जो दाईं ओर दिखाया गया है। किसी भी मामले में, यह प्रकार का प्रशिक्षण मुख्य शिक्षण चरण के बाद किया जाता है, जब मॉडल पहले से साथ, कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) पर, एक आधुनिक एमएलएलएम की ही कुछ छवियों को समझने में सक्षम होता है। पूर्व दृष्टिकोण जैसे 2017 के स्विस पेपर ने इस प्रकार के सुदृढ़ दृष्टिकोण का उपयोग किया था, लेकिन कम सफलता के

2017 रिलीज 'अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स' से, एक न्यूरल सिस्टम के लिए पुरस्कार-आधारित चुनौती के रूप में टुकड़ों का उपयोग करने का एक प्रारंभिक उदाहरण। स्रोत: https://arxiv.org/pdf/1603.09246 तुलना में एक अलग प्रकार की आर्किटेक्चर। अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स 2017 रिलीज ‘अनसुपरवाइज्ड लर्निंग ऑफ विज़ुअल रिप्रेजेंटेशन्स बाय सॉल्विंग जिगसॉ पज़ल्स’ से, एक न्यूरल सिस्टम के लिए पुरस्कार-आधारित चुनौती के रूप में टुकड़ों का उपयोग करने का एक प्रारंभिक उदाहरण। स्रोत: https://arxiv.org/pdf/1603.09246 परीक्षणों में, विज़ुअल जिगसॉ ने दावा किया कि वे विभिन्न बेंचमार्क पर सुसंगत और मापनीय सुधार किए हैं: छवि जिगसॉ कार्य ने बारीकी से धारणा, स्थानिक लेआउट समझ, और रचनात्मक तर्क में सुधार किया; वीडियो जिगसॉ कार्य ने मॉडल की क्षमता को बढ़ाया समयिक अनुक्रमों को ट्रैक करने और घटना क्रम के बारे में तर्क करने के लिए; और 3डी जिगसॉ कार्य ने गहराई-आधारित समझ और स्थानिक तर्क में सुधार किया, केवल तीनों मोडलिटी में, पत्र दोहराता है, नई विधि ने कई प्रतिस्पर्धी बेसलाइन को पार किया, बिना किसी वास्तुकला परिवर्तन, अतिरिक्त दृश्य मॉड्यूल, या अतिरिक्त पर्यवेक्षित डेटा की आवश्यकता

का उपयोग करके। नया ‘व्यापक प्रयोगों से यह साबित होता है कि विस्तृत धारणा, समयिक तर्क, और 3डी स्थानिक समझ में महत्वपूर्ण सुधार हुए हैं। हमारे निष्कर्ष एमएलएलएम में स्व-प्रशिक्षित दृष्टि-केंद्रित कार्यों की संभावना को उजागर करते हैं और आगे के शोध को प्रेरित करने

के: आरजीबी-डी इनपुट का लक्ष्य रखते हैं के साथ एक विज़ुअल जिगसॉ पोस्ट-ट्रेनिंगपेपर का टाइटल ‘ऑन विज़न-सेंट्रिक प्री-डिज़ाइन’ है, और यह नानयांग टेक्नोलॉजिकल यूनिवर्सिटी, लिंकोपिंग यूनिवर्सिटी और सेंसटाइम रिसर्च के छह रिसर्चर्स का है। पेपर इम्प्रूव्स एमएलएलएम प्रोजेक्ट साइट है जिसमें लाइव डेमो (और आप अपनी छवि को छवि-आधारित जिगसॉ डेमो में लोड कर सकते हैं)। प्रोजेक्ट के लिए कोड और वज़न को सामान्य रूप से उपलब्ध कराया गया है,

विधि

हालांकि हम तीन परीक्षण मोडलिटी के लिए जानकारी को कैसे विभाजित किया जाता है, इस पर एक नज़र डालेंगे, हमें पहले नई प्रणाली के लिए पुरस्कार डिज़ाइन पर विचार करना चाहिए। विज़ुअल जिगसॉ दृष्टिकोण मॉडल की प्रतिक्रियाओं को अमान्य उत्तर, जैसे कि का उपयोग करके स्कोर जाता हैकरता है, न कि केवल पास या विफल। यदि मॉडल सटीक सही क्रम का अनुमान लगाता है, तो यह पूरा पुरस्कार प्राप्त करता है; यदि उत्तर अधिकांशतः सही है, लेकिन पूरी तरह से नहीं, तो मॉडल आंशिक क्रेडिट प्राप्त करता है, जो एक ग्रेडेड पुरस्कार द्वारा स्केल किया का उपयोग ताकि निकट-मिस को अधिक मूल्य न दिया जा सके (यह मॉडल को प्रणाली को गेमिंग से रोकता है जो केवल आंशिक रूप से सही अनुमानों को दोहराता है)। छूट कारक चीट करके एक ही संख्या को दोहराना, शून्य स्कोर प्राप्त करते हैं। सुसंगत प्रारूप को प्रोत्साहित करने के लिए, मॉडल को अपने तर्क को टैग के अंदर और रखना अपने अंतिम उत्तर को <think> टैग के अंदर <answer> होगा। यह सही प्रारूप का उपयोग करने पर एक छोटा बोनस प्राप्त करता है।

छवियाँ

छवि मोडलिटी के लिए एक पज़ल के बनाने के लिए, एक छवि को पहले एक ग्रिड में विभाजित किया जाता है जो इसे बराबर आकार

सिस्टम के लिए हल करने के लिए छवि-आधारित पैच के उदाहरण। ब्लॉक में काटता है: सिस्टम के लिए हल करने के

लिए छवि-आधारित पैच के उदाहरण। पैच को एक निश्चित क्रम में व्यवस्थित किया जाता है, जैसे कि एक पृष्ठ पर पढ़ने का क्रम, trước उन्हें यादृच्छिक रूप से भ्रमित करने से। मॉडल को तब इस भ्रमित सेट को दिखाया जाता है और यह मूल लेआउट का अनुमान लगाने के लिए कहा जाता है जो मूल छवि को पुनर्स्थापित करता है। प्रशिक्षण में, सीओसीओ डेटासेट की 118,000 छवियों का उपयोग किया गया था, प्रत्येक छवि से नौ पैच (यानी, ‘पज़ल पीस’) प्राप्त हुए। सिस्टम को दिए गए प्रॉम्प्ट को इस लेख में पहले दिखाया गया है (छवि जिसमें कैप्शन शुरू होता )। ‘नए पत्र के पूरक सामग्री से’है

वीडियो

वीडियो जिगसॉ कार्य के लिए, एक वीडियो को समय के साथ समान रूप से क्लिप में विभाजित किया जाता है और फिर क्लिप को भ्रमित किया जाता है। मॉडल को तब इस भ्रमित क्रम को दिखाया जाता है और यह मूल कालानुक्रमिक क्रम में उनका

वीडियो पज़ल चुनौती के संक्षिप्त उदाहरण, पत्र की पूरक सामग्री से। अनुमान लगाने के लिए कहा जाता है: वीडियो पज़ल चुनौती के संक्षिप्त उदाहरण, पत्र

की पूरक सामग्री से। इस मोडलिटी के लिए प्रशिक्षण में, एलएलएवी-वीडियो डेटासेट का उपयोग कियागया था, जिसमें प्रत्येक वीडियो को छह क्लिप में विभाजित किया गया था। क्लिप की सीमाओं पर फ्रेम-मिलान संकेतों का शोषण करने से मॉडल को रोकने के लिए, प्रत्येक क्लिप की शुरुआत और अंत में 5% फ्रेम को ट्रिम किया गया था। क्लिप में अधिकतम 12 फ्रेम थे, प्रत्येक का अधिकतम रिज़ॉल्यूशन 128x28x28 पिक्सल था। 24 सेकंड से कम वीडियो को बाहर कर दिया गया था। इस

वीडियो कार्य के लिए सुदृढ़ शिक्षा प्रॉम्प्ट। कार्य के लिए प्रॉम्प्ट नीचे दिखाया गया है: वीडियो कार्य के लिए सुदृढ़ शिक्षा प्रॉम्प्ट, जिसमें एमएलएलएम को दिखाई जाने वाली क्लिप नहीं हैं।

3डी डेटा

एक पूर्ण 3डी जिगसॉ कार्य आमतौर पर 3डी स्पेस (जैसे वोक्सेल ब्लॉक या पॉइंट क्लाउड टुकड़े) को छोटे टुकड़ों में तोड़ने और मॉडल को उनकी मूल स्थानिक व्यवस्था को पुनर्निर्माण करने के लिए प्रशिक्षित करने को शामिल करता है। हालांकि, औसत एमएलएलएम सीधे कच्चे 3डी डेटा को संभालने में सक्षम नहीं है, बल्कि सेमैंटिक रूप से व्याख्या की गई छवि या वीडियो इनपुट पर निर्भर करता है। इसलिए, वर्तमान एमएलएलएम के साथ संगत एक कार्य बनाने के लिए जो अभी भी 3डी तर्क में टैप करता है, लेखकों ने 2डी छवियों (अर्थात, आरजीबी-डी छवियों) का उपयोग करने वाला एक अधिक ट्रैक्टेबल वेरिएंट

3डी स्पेशियल अंडरस्टैंडिंग बेंचमार्क का उपयोग करके मूल्यांकन के लिए उदाहरण प्रश्न, जो सापेक्ष दृष्टिकोण और कैमरा गति तर्क के बारे में पूछते हैं। 3डी जिगसॉ मॉडल दृश्य के बीच स्थानिक संबंध और कैमरा घूर्णन की संभावित दिशा दोनों का सही अनुमान लगाता है, क्यूवेन2.5-वीएल-7बी बेसलाइन को पार करता है। पेश किया जो प्रत्येक पिक्सेल के लिए गहराई जानकारी शामिल करता है। 3डी स्पेशियल अंडरस्टैंडिंग बेंचमार्क का उपयोग करके मूल्यांकन के लिए उदाहरण प्रश्न, जो सापेक्ष दृष्टिकोण और कैमरा गति तर्क के बारे में पूछते हैं। 3डी जिगसॉ मॉडल दृश्य के बीच स्थानिक संबंध और कैमरा घूर्णन की संभावित दिशा दोनों का

सही अनुमान लगाता है, क्यूवेन2.5-वीएल-7बी बेसलाइन को पार करता है। प्रत्येक आरजीबी-डी छवि से, मॉडल को विभिन्न गहराई के साथ बिंदुओं की एक भ्रमित सूची दी जाती है, जो निकट से दूर तक होती है, जिसका उद्देश्य केवल 2डी छवि का उपयोग करके

3डी जिगसॉ के लिए आरएल प्रॉम्प्ट। उनकी मूल गहराई-आधारित क्रम को पुनर्प्राप्त करना

है: 3डी जिगसॉ के लिए आरएल प्रॉम्प्ट। प्रत्येक बिंदु को छवि पर चिह्नित किया जाता है (जो मॉडल को दिखाया जाता है, लेकिन ऊपर दी गई छवि में सीधे दिखाया नहीं जाता है), और मॉडल को यह अनुमान लगाना होता है कि कौन सा निकटतम, दूसरा निकटतम, और इसी तरह, मूल गहराई क्रम को पुनर्निर्माण करके है। 3डी जिगसॉ कार्य को स्कैननेट डेटासेट की आरजीबी-डी छवियों पर प्रशिक्षित कियाजाता है, 300,000 नमूनों का उपयोग करके जो प्रत्येक छवि से छह गहराई बिंदुओं का यादृच्छिक

3डी जिगसॉ में उपयोग किए जाने वाले स्कैननेट डेटासेट से बिंदु बादलों के उदाहरण। स्रोत: https://arxiv.org/pdf/1702.04405 चयन करके बनाए जाते हैं। 3डी जिगसॉ में उपयोग किए जाने वाले स्कैननेट डेटासेट से बिंदु बादलों के उदाहरण। स्रोत: https://arxiv.org/pdf/1702.04405 प्रत्येक बिंदु को 0.1 से 10 मीटर की गहराई सीमा के भीतर होना आवश्यक था, और विविधता को बढ़ावा देने के लिए, किसी भी दो बिंदुओं को एक ही सेट में एक दूसरे के 40 पिक्सल से कम या 0.2 मीटर से कम गहराई में नहीं होना चाहिए।

परीक्षण

प्रारंभिक परीक्षणों के लिए, प्रणाली ने क्यूवेन2.5-वीएल-7बी-इन्सट्रक्ट को आधार बहुमोडल मॉडल के रूप में उपयोग किया। प्रशिक्षण में ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन ( जीआरपीओ ) अल्गोरिदम का उपयोगकियागया था, दोनों केएल नियमितीकरण और एंट्रोपी हानि को हटा दिया गया था। आंशिक भविष्यवाणियों के लिए, 0.2 का छूट कारक लागू किया गया था। छवि जिगसॉ प्रशिक्षण में 256 का वैश्विक प्रत्येक प्रॉम्प्ट के लिए, मॉडल ने 1.0 के डिकोडिंग बैच आकार था, जबकि वीडियो और 3डी जिगसॉ में 128 का उपयोग किया गया था। सीखने की दर 1×10⁻⁶ पर सेट की गई थी। तापमान पर 16 प्रतिक्रियाएं उत्पन्न कीं। छवि और वीडियो जिगसॉ कार्यों को 1,000 चरणों के लिए प्रशिक्षित किया गया था, जबकि 3डी जिगसॉ कार्य को 800 चरणों के लिए प्रशिक्षित किया गया था।

छवि जिगसॉ

छवि जिगसॉ मॉडल का तीन श्रेणियों के दृष्टि-केंद्रित बेंचमार्क पर परीक्षण किया गया था: विस्तृत धारणा और समझ के लिए, एमएमवीपी , एमएमस्टारका विस्तृत धारणा उपसेट; एमएमबेंच ; एचआर-बेंच ;वी* ;एमएमई-रियलवर्ल्ड (लाइट); लिसा-ग्राउंडिंग; औरओवीडी-इवल । एकल दृष्टिकोण स्थानिक समझ केलिए, बेंचमार्क वीएसआर ;ओम्निस्पेशियल ; और गहराई-वीएसआर वी2 ( डीए-2के ) थे।रचनात्मक दृश्यसमझ के लिए, परीक्षणों नेविनोग्राउंड औरसुगरक्रेप++ का उपयोग किया। तीन बेसलाइन का परीक्षण किया गया था,सभी क्यूवेन2.5-वीएल-7बी से व्युत्पन्न: थिंकलाइट-वीएल बहुमोडल तर्क के लिए; वीएल-कोगिटो सामान्य दृष्टि और वैज्ञानिक कार्यों के लिए; और एलएलएवी-क्रिटिक-आर1 छवि धारणा के लिए। सभी का मूल्यांकन लघु उत्तरों का उपयोग करके किया गया था, क्योंकि श्रृंखला के विचार (सीओटी) तर्क कभी-कभी प्रदर्शन को कम कर देता था। छवि बेंचमार्क पर मूल्यांकन परिणाम। छवि

छवि बेंचमार्क पर मूल्यांकन परिणाम। छवि जिगसॉ ने क्यूवेन2.5-वीएल-7बी बेस मॉडल पर सुधार किया सभी कार्य श्रेणियों में (अर्थात, विस्तृत धारणा और समझ; एकल दृष्टिकोण स्थानिक समझ; और रचनात्मक दृश्य तर्क), पूर्व-प्रशिक्षित बेसलाइन को पार करते हुए। जिगसॉ ने क्यूवेन2.5-वीएल-7बी बेस मॉडल पर सुधार किया सभी कार्य श्रेणियों में (अर्थात, विस्तृत धारणा और समझ; एकल दृष्टिकोण स्थानिक समझ; और रचनात्मक दृश्य तर्क), पूर्व-प्रशिक्षित बेसलाइन को पार करते हुए। छवि जिगसॉ के परिणामों के बारे में, ऊपर दिखाए गए, लेखकों का कहना

है: ‘(छवि में) यह दिखाता है कि हमारी विधि तीनों प्रकार के बेंचमार्क पर

दृष्टि-केंद्रित क्षमताओं में सुसंगत सुधार करती है। ये परिणाम पुष्टि करते हैं कि छवि जिगसॉ पोस्ट-ट्रेनिंग को शामिल करने से एमएलएलएम की दृष्टि संबंधी आधार और विस्तृत दृष्टि समझ में महत्वपूर्ण सुधार होता है, तर्क-केंद्रित पोस्ट-ट्रेनिंग रणनीतियों से परे। ‘ ‘हम इन सुधारों को इस तथ्य से जोड़ते हैं कि

छवि जिगसॉ को हल करने से मॉडल को स्थानीय पैच विवरण पर ध्यान केंद्रित करने, वैश्विक स्थानिक लेआउट का अनुमान लगाने और अंतर-पैच संबंधों के बारे में तर्क करने की आवश्यकता होती है, जो सीधे विस्तृत, स्थानिक और रचनात्मक समझ को लाभान्वित करता है।’

वीडियो जिगसॉ

वीडियो जिगसॉ के लिए, मूल्यांकन एओटीबेंच ; विनोग्राउंड ;टीओएमएटीओ ; फेवर-बेंच; टीयूएनए-बेंच; वीडियो-एमएमई ; टेम्पकॉम्पास; टीवीबेंच ;मोशनबेंच ; एलवीबेंच ;वीएसआई-बेंच ;वीडियो-टीटी ;और सीवीबेंच परकिया गयाथा। वीडियो-आर1 का उपयोगएक बेसलाइन केरूप मेंकिया गया

था, जिसे शीतल-प्रारंभ पर्यवेक्षित फाइन-ट्यूनिंग के साथ प्रशिक्षित किया गया था, उसके बाद वीडियो समझ और तर्क के लिए सुदृढ़ शिक्षा। इस मामले में, मूल्यांकन में पूरी तर्क प्रक्रिया शामिल थी, क्योंकि यह सुसंगत रूप से बेहतर परिणाम उत्पन्न करती थी niż सीधे उत्तर। सभी मॉडल को 256x28x28 पिक्सल तक सीमित किया गया था, और तीन फ्रेम सेटिंग्स – 16, 32, और 64 पर परीक्षण किया गया था: वीडियो बेंचमार्क पर

वीडियो बेंचमार्क पर मूल्यांकन परिणाम, वीडियो जिगसॉ को सभी कार्यों और फ्रेम सेटिंग्स पर बेसलाइन से बेहतर प्रदर्शन करते हुए। मूल्यांकन परिणाम, वीडियो जिगसॉ को सभी कार्यों और फ्रेम सेटिंग्स पर बेसलाइन से बेहतर प्रदर्शन करते हुए। वीडियो जिगसॉ ने सभी

वीडियो समझ बेंचमार्क और फ्रेम सेटिंग्स पर सुसंगत सुधार का उत्पादन किया, विशेष रूप से समयिक तर्क और दिशात्मकता जैसे कार्यों में लाभ जैसे एओटीबेंच में, और साथ ही साथ क्रॉस-वीडियो तर्क बेंचमार्क जैसे सीवीबेंच में: ‘ये परिणाम पुष्टि करते हैं कि वीडियो जिगसॉ कार्यों को

हल करने से मॉडल को बेहतर ढंग से समयिक निरंतरता को पकड़ने, वीडियो के साथ संबंधों को समझने, दिशात्मक संगति के बारे में तर्क करने और समग्र और सामान्य वीडियो समझ परिदृश्यों में सामान्यीकरण करने में मदद मिलती है।’

3डी डेटा

3डी मोडलिटी के लिए, मॉडल का एसएटी-रियल ; 3डीएसआरबेंच ; व्यूस्पेशियल; ऑल-एंगल्स; उपरोक्तओम्निस्पेशियल; वीएसआई-बेंच ;एसपीएआरबेंच (टीनी); और उपरोक्त डीए-2केपर मूल्यांकन किया गया था। 3डी बेंचमार्क पर

3डी बेंचमार्क पर मूल्यांकन परिणाम: 3डी जिगसॉ ने डीए-2के जैसे गहराई तुलना कार्यों पर प्रदर्शन में सुधार किया, साथ ही साथ एकल-दृश्य, बहु-दृश्य और स्व-केंद्रित वीडियो इनपुट को कवर करने वाले व्यापक 3डी धारणा बेंचमार्क पर। मूल्यांकन परिणाम: 3डी जिगसॉ ने डीए-2के जैसे गहराई तुलना कार्यों पर प्रदर्शन में सुधार किया, साथ ही साथ एकल-दृश्य, बहु-दृश्य और स्व-केंद्रित वीडियो इनपुट को कवर करने वाले व्यापक 3डी धारणा बेंचमार्क

पर। यहाँ लेखक कहते

हैं: ‘(3डी) जिगसॉ सभी बेंचमार्क पर महत्वपूर्ण सुधार प्राप्त करता है। अप्रत्याशित रूप से, सबसे बड़ा लाभ डीए-2के पर है, जो हमारे गहराई-क्रम पूर्व-प्रशिक्षण कार्य से सीधे संबंधित है। अधिक महत्वपूर्ण बात यह है कि हम एकल-दृश्य (जैसे 3डीएसआरबेंच, (ओम्निस्पेशियल)), बहु-दृश्य (जैसे व्यूस्पेशियल, ऑल-एंगल्स), और स्व-केंद्रित वीडियो इनपुट (जैसे वीएसआई-बेंच) सहित विभिन्न कार्यों पर सुसंगत सुधार देखते हैं। ‘ ‘ये परिणाम दर्शाते हैं कि हमारा दृष्टिकोण न

केवल विशिष्ट कौशल को सिखाता है गहराई क्रम, लेकिन यह भी प्रभावी ढंग से मॉडल की सामान्य क्षमता को मजबूत करता है 3डी स्थानिक संरचना की धारणा और तर्क करने के लिए।’

निष्कर्ष

यह पत्र से पूरी तरह से स्पष्ट नहीं है कि छवि और विवरण के बीच संबंध है जो एमएलएलएम प्रदर्शन में सुधार को संचालित कर रहा है। पहली नज़र में, जिगसॉ पज़ल्स के माध्यम से सीखने की प्रक्रिया हमारे अपने प्रारंभिक प्रयासों और विकास के समान लगती है। हालांकि, पत्र की एक गहरी जांच से पता चलता है कि भाषा एमएलएलएम के लिए दृश्य और सेमेंटिक वास्तविकता के बीच एक आकर्षक पुल के रूप में कार्य करती है। * कृपया ध्यान दें कि पत्र के लेखक ‘मल्टीमॉडल लार्ज लैंग्वेज मॉडल’ शब्द का उपयोग करना पसंद करते हैं, जिसे ‘एमएलएलएम’ के रूप में संक्षिप्त किया जाता है। यह एक उभरता हुआ या कम बार-बार उपयोग किया जाने वाला शब्द है, और मॉडलों पर लागू होता है जो विस्तृत रूप से छवियों को स्थानिक रूप से तर्क और विश्लेषण कर सकते हैं, लेकिन छवियों का उत्पादन नहीं करते हैं। जैसाकि नए दृष्टिकोण और मॉडल उभरते हैं, यह शब्दावली निरंतर संशोधन के अधीन है। पहली बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।पहली

बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai