Anderson का एंगल
जिगसॉ पज़ल्स बूस्ट एआई विज़ुअल रीज़निंग

नया शोध संकेत देता है कि एआई मॉडल जिगसॉ पज़ल्स को हल करके दृष्टि में सुधार कर सकते हैं। छवियों, वीडियो, और 3डी दृश्यों को पुनर्व्यवस्थित करके उन्हें अपने दृश्य कौशल को तेज करने में मदद मिलती है, बिना
अतिरिक्त डेटा, लेबल, या टूल्स की आवश्यकता के। वर्तमान मेंमल्टीमॉडललार्ज लैंग्वेज मॉडल ( एमएलएलएम *) को आगे बढ़ाने के लिए, कुछ आसान जीत और कोई मुफ्त भोजन नहीं हैं। हालांकि 2025 के कई चीनी फॉस्स रिलीज़ में शोध साहित्य में, अधिकांश कथित ‘मुफ्त’ दृष्टिकोण एआई आर्किटेक्चर के विकास में केवल छोटे क्रमिक सुधार प्रदान करते हैं; याफिर उन क्षेत्रों में सुधार भी, जो सबसे गंभीर रूप से पीछा किए जा रहे हैं नहीं हैं। फिर ‘मूलभूत सिद्धांतों’ की खोज जोएआई विकास की गति को तेज कर सकती है, बहुत आकर्षक हैं और उन्हें छोड़ना मुश्किल है। वेस्टर्न रिलीज़ अक्सर ज़्यादा डेटा वॉल्यूम, ज़्यादा इनफ़रेंस पावर और ज़्यादा पावर के साथ समस्या को हल करने की कोशिश करते हैं (हालांकि, जैसा कि हमने हाल ही में बताया, ज़्यादा असली इंसानी एनोटेटर की ज़रूरत है, क्योंकि यह $ट्रिलियन+ स्केल के जेन-AI रेवोल्यूशन के लिए बहुत महंगा है)।
पिकिंग अप द पीसेस
एक नए शोध सहयोग में, चीनी संस्थानों के बीच एक नए शोध सहयोग ने दावा किया है कि वीएलएम को जिगसॉ पज़ल्स हल करने से उनके प्रदर्शन में उल्लेखनीय सुधार होता है, हालांकि इस सुदृढ़ शिक्षा दृष्टिकोण ने पहले इस क्षेत्र में कम प्रदर्शन किया है, और यह किसी भी अतिरिक्त प्रणाली, सहायक मॉडल या ‘बोल्ट-ऑन’ प्रक्रियाओं की आवश्यकता नहीं है:


आंशिक रूप से सही समाधानों के लिए आंशिक क्रेडिट दिया जाता है। विज़ुअल जिगसॉ की प्रशिक्षण विधि एआई मॉडल को दृष्टि संबंधी जानकारी को समझने में सुधार करने में मदद करती है जो इन जटिल छवियों, वीडियो क्लिप, या 3डी डेटा बिंदुओं को पुनर्व्यवस्थित करके की जाती है। प्रक्रिया शब्दों पर आधारित है, न कि छवियों पर, और इसलिए मॉडल को छवियों को उत्पन्न करने या किसी अतिरिक्त घटक का उपयोग करने की आवश्यकता दृश्यनहींहै। यह विधि ( रिनफोर्समेंट लर्निंग फ्रॉम वेरिफायबल रिवार्ड्स आरएलवीआर ) नामक प्रणाली में फिट होती है, जहां मॉडल को स्पष्ट, स्वचालित नियमों के आधार पर सही उत्तरों के लिए पुरस्कृत किया जाता है; और जहां, इसलिए, मानव लेबलिंग की आवश्यकता नहीं है। यह केमहत्वपूर्ण तथ्य वास्तव में नए पत्र से कठिन है: कि प्रणाली जिगसॉ को इकट्ठा कर रही है, विवरण

दर्शाता है। छवियाँ जो एमएलएलएम को दिखाई जाएंगी यहाँ नहीं दिखाई हैं, न गई हैं। हालांकि एमएलएलएम विज़न-सेंट्रिक कार्यों के साथ व्यापक रूप से सौदा करते हैं, वे आर्किटेक्चर

जिन्हें मॉडल को उनके मूल लेआउट में पुनर्व्यवस्थित करना होगा, जो दाईं ओर दिखाया गया है। किसी भी मामले में, यह प्रकार का प्रशिक्षण मुख्य शिक्षण चरण के बाद किया जाता है, जब मॉडल पहले से साथ, कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) पर, एक आधुनिक एमएलएलएम की ही कुछ छवियों को समझने में सक्षम होता है। पूर्व दृष्टिकोण जैसे 2017 के स्विस पेपर ने इस प्रकार के सुदृढ़ दृष्टिकोण का उपयोग किया था, लेकिन कम सफलता के

का उपयोग करके। नया ‘व्यापक प्रयोगों से यह साबित होता है कि विस्तृत धारणा, समयिक तर्क, और 3डी स्थानिक समझ में महत्वपूर्ण सुधार हुए हैं। हमारे निष्कर्ष एमएलएलएम में स्व-प्रशिक्षित दृष्टि-केंद्रित कार्यों की संभावना को उजागर करते हैं और आगे के शोध को प्रेरित करने
के: आरजीबी-डी इनपुट का लक्ष्य रखते हैं के साथ एक विज़ुअल जिगसॉ पोस्ट-ट्रेनिंगपेपर का टाइटल ‘ऑन विज़न-सेंट्रिक प्री-डिज़ाइन’ है, और यह नानयांग टेक्नोलॉजिकल यूनिवर्सिटी, लिंकोपिंग यूनिवर्सिटी और सेंसटाइम रिसर्च के छह रिसर्चर्स का है। पेपर इम्प्रूव्स एमएलएलएम प्रोजेक्ट साइट है जिसमें लाइव डेमो (और आप अपनी छवि को छवि-आधारित जिगसॉ डेमो में लोड कर सकते हैं)। प्रोजेक्ट के लिए कोड और वज़न को सामान्य रूप से उपलब्ध कराया गया है,
विधि
हालांकि हम तीन परीक्षण मोडलिटी के लिए जानकारी को कैसे विभाजित किया जाता है, इस पर एक नज़र डालेंगे, हमें पहले नई प्रणाली के लिए पुरस्कार डिज़ाइन पर विचार करना चाहिए। विज़ुअल जिगसॉ दृष्टिकोण मॉडल की प्रतिक्रियाओं को अमान्य उत्तर, जैसे कि का उपयोग करके स्कोर जाता हैकरता है, न कि केवल पास या विफल। यदि मॉडल सटीक सही क्रम का अनुमान लगाता है, तो यह पूरा पुरस्कार प्राप्त करता है; यदि उत्तर अधिकांशतः सही है, लेकिन पूरी तरह से नहीं, तो मॉडल आंशिक क्रेडिट प्राप्त करता है, जो एक ग्रेडेड पुरस्कार द्वारा स्केल किया का उपयोग ताकि निकट-मिस को अधिक मूल्य न दिया जा सके (यह मॉडल को प्रणाली को गेमिंग से रोकता है जो केवल आंशिक रूप से सही अनुमानों को दोहराता है)। छूट कारक चीट करके एक ही संख्या को दोहराना, शून्य स्कोर प्राप्त करते हैं। सुसंगत प्रारूप को प्रोत्साहित करने के लिए, मॉडल को अपने तर्क को टैग के अंदर और रखना अपने अंतिम उत्तर को <think> टैग के अंदर <answer> होगा। यह सही प्रारूप का उपयोग करने पर एक छोटा बोनस प्राप्त करता है।
छवियाँ
छवि मोडलिटी के लिए एक पज़ल के बनाने के लिए, एक छवि को पहले एक ग्रिड में विभाजित किया जाता है जो इसे बराबर आकार

लिए छवि-आधारित पैच के उदाहरण। पैच को एक निश्चित क्रम में व्यवस्थित किया जाता है, जैसे कि एक पृष्ठ पर पढ़ने का क्रम, trước उन्हें यादृच्छिक रूप से भ्रमित करने से। मॉडल को तब इस भ्रमित सेट को दिखाया जाता है और यह मूल लेआउट का अनुमान लगाने के लिए कहा जाता है जो मूल छवि को पुनर्स्थापित करता है। प्रशिक्षण में, सीओसीओ डेटासेट की 118,000 छवियों का उपयोग किया गया था, प्रत्येक छवि से नौ पैच (यानी, ‘पज़ल पीस’) प्राप्त हुए। सिस्टम को दिए गए प्रॉम्प्ट को इस लेख में पहले दिखाया गया है (छवि जिसमें कैप्शन शुरू होता )। ‘नए पत्र के पूरक सामग्री से’है
वीडियो
वीडियो जिगसॉ कार्य के लिए, एक वीडियो को समय के साथ समान रूप से क्लिप में विभाजित किया जाता है और फिर क्लिप को भ्रमित किया जाता है। मॉडल को तब इस भ्रमित क्रम को दिखाया जाता है और यह मूल कालानुक्रमिक क्रम में उनका

की पूरक सामग्री से। इस मोडलिटी के लिए प्रशिक्षण में, एलएलएवी-वीडियो डेटासेट का उपयोग कियागया था, जिसमें प्रत्येक वीडियो को छह क्लिप में विभाजित किया गया था। क्लिप की सीमाओं पर फ्रेम-मिलान संकेतों का शोषण करने से मॉडल को रोकने के लिए, प्रत्येक क्लिप की शुरुआत और अंत में 5% फ्रेम को ट्रिम किया गया था। क्लिप में अधिकतम 12 फ्रेम थे, प्रत्येक का अधिकतम रिज़ॉल्यूशन 128x28x28 पिक्सल था। 24 सेकंड से कम वीडियो को बाहर कर दिया गया था। इस

3डी डेटा
एक पूर्ण 3डी जिगसॉ कार्य आमतौर पर 3डी स्पेस (जैसे वोक्सेल ब्लॉक या पॉइंट क्लाउड टुकड़े) को छोटे टुकड़ों में तोड़ने और मॉडल को उनकी मूल स्थानिक व्यवस्था को पुनर्निर्माण करने के लिए प्रशिक्षित करने को शामिल करता है। हालांकि, औसत एमएलएलएम सीधे कच्चे 3डी डेटा को संभालने में सक्षम नहीं है, बल्कि सेमैंटिक रूप से व्याख्या की गई छवि या वीडियो इनपुट पर निर्भर करता है। इसलिए, वर्तमान एमएलएलएम के साथ संगत एक कार्य बनाने के लिए जो अभी भी 3डी तर्क में टैप करता है, लेखकों ने 2डी छवियों (अर्थात, आरजीबी-डी छवियों) का उपयोग करने वाला एक अधिक ट्रैक्टेबल वेरिएंट

सही अनुमान लगाता है, क्यूवेन2.5-वीएल-7बी बेसलाइन को पार करता है। प्रत्येक आरजीबी-डी छवि से, मॉडल को विभिन्न गहराई के साथ बिंदुओं की एक भ्रमित सूची दी जाती है, जो निकट से दूर तक होती है, जिसका उद्देश्य केवल 2डी छवि का उपयोग करके

है: 3डी जिगसॉ के लिए आरएल प्रॉम्प्ट। प्रत्येक बिंदु को छवि पर चिह्नित किया जाता है (जो मॉडल को दिखाया जाता है, लेकिन ऊपर दी गई छवि में सीधे दिखाया नहीं जाता है), और मॉडल को यह अनुमान लगाना होता है कि कौन सा निकटतम, दूसरा निकटतम, और इसी तरह, मूल गहराई क्रम को पुनर्निर्माण करके है। 3डी जिगसॉ कार्य को स्कैननेट डेटासेट की आरजीबी-डी छवियों पर प्रशिक्षित कियाजाता है, 300,000 नमूनों का उपयोग करके जो प्रत्येक छवि से छह गहराई बिंदुओं का यादृच्छिक

परीक्षण
प्रारंभिक परीक्षणों के लिए, प्रणाली ने क्यूवेन2.5-वीएल-7बी-इन्सट्रक्ट को आधार बहुमोडल मॉडल के रूप में उपयोग किया। प्रशिक्षण में ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन ( जीआरपीओ ) अल्गोरिदम का उपयोगकियागया था, दोनों केएल नियमितीकरण और एंट्रोपी हानि को हटा दिया गया था। आंशिक भविष्यवाणियों के लिए, 0.2 का छूट कारक लागू किया गया था। छवि जिगसॉ प्रशिक्षण में 256 का वैश्विक प्रत्येक प्रॉम्प्ट के लिए, मॉडल ने 1.0 के डिकोडिंग बैच आकार था, जबकि वीडियो और 3डी जिगसॉ में 128 का उपयोग किया गया था। सीखने की दर 1×10⁻⁶ पर सेट की गई थी। तापमान पर 16 प्रतिक्रियाएं उत्पन्न कीं। छवि और वीडियो जिगसॉ कार्यों को 1,000 चरणों के लिए प्रशिक्षित किया गया था, जबकि 3डी जिगसॉ कार्य को 800 चरणों के लिए प्रशिक्षित किया गया था।
छवि जिगसॉ
छवि जिगसॉ मॉडल का तीन श्रेणियों के दृष्टि-केंद्रित बेंचमार्क पर परीक्षण किया गया था: विस्तृत धारणा और समझ के लिए, एमएमवीपी , एमएमस्टारका विस्तृत धारणा उपसेट; एमएमबेंच ; एचआर-बेंच ;वी* ;एमएमई-रियलवर्ल्ड (लाइट); लिसा-ग्राउंडिंग; औरओवीडी-इवल । एकल दृष्टिकोण स्थानिक समझ केलिए, बेंचमार्क वीएसआर ;ओम्निस्पेशियल ; और गहराई-वीएसआर वी2 ( डीए-2के ) थे।रचनात्मक दृश्यसमझ के लिए, परीक्षणों नेविनोग्राउंड औरसुगरक्रेप++ का उपयोग किया। तीन बेसलाइन का परीक्षण किया गया था,सभी क्यूवेन2.5-वीएल-7बी से व्युत्पन्न: थिंकलाइट-वीएल बहुमोडल तर्क के लिए; वीएल-कोगिटो सामान्य दृष्टि और वैज्ञानिक कार्यों के लिए; और एलएलएवी-क्रिटिक-आर1 छवि धारणा के लिए। सभी का मूल्यांकन लघु उत्तरों का उपयोग करके किया गया था, क्योंकि श्रृंखला के विचार (सीओटी) तर्क कभी-कभी प्रदर्शन को कम कर देता था। छवि बेंचमार्क पर मूल्यांकन परिणाम। छवि

है: ‘(छवि में) यह दिखाता है कि हमारी विधि तीनों प्रकार के बेंचमार्क पर
दृष्टि-केंद्रित क्षमताओं में सुसंगत सुधार करती है। ये परिणाम पुष्टि करते हैं कि छवि जिगसॉ पोस्ट-ट्रेनिंग को शामिल करने से एमएलएलएम की दृष्टि संबंधी आधार और विस्तृत दृष्टि समझ में महत्वपूर्ण सुधार होता है, तर्क-केंद्रित पोस्ट-ट्रेनिंग रणनीतियों से परे। ‘ ‘हम इन सुधारों को इस तथ्य से जोड़ते हैं कि
छवि जिगसॉ को हल करने से मॉडल को स्थानीय पैच विवरण पर ध्यान केंद्रित करने, वैश्विक स्थानिक लेआउट का अनुमान लगाने और अंतर-पैच संबंधों के बारे में तर्क करने की आवश्यकता होती है, जो सीधे विस्तृत, स्थानिक और रचनात्मक समझ को लाभान्वित करता है।’
वीडियो जिगसॉ
वीडियो जिगसॉ के लिए, मूल्यांकन एओटीबेंच ; विनोग्राउंड ;टीओएमएटीओ ; फेवर-बेंच; टीयूएनए-बेंच; वीडियो-एमएमई ; टेम्पकॉम्पास; टीवीबेंच ;मोशनबेंच ; एलवीबेंच ;वीएसआई-बेंच ;वीडियो-टीटी ;और सीवीबेंच परकिया गयाथा। वीडियो-आर1 का उपयोगएक बेसलाइन केरूप मेंकिया गया
था, जिसे शीतल-प्रारंभ पर्यवेक्षित फाइन-ट्यूनिंग के साथ प्रशिक्षित किया गया था, उसके बाद वीडियो समझ और तर्क के लिए सुदृढ़ शिक्षा। इस मामले में, मूल्यांकन में पूरी तर्क प्रक्रिया शामिल थी, क्योंकि यह सुसंगत रूप से बेहतर परिणाम उत्पन्न करती थी niż सीधे उत्तर। सभी मॉडल को 256x28x28 पिक्सल तक सीमित किया गया था, और तीन फ्रेम सेटिंग्स – 16, 32, और 64 पर परीक्षण किया गया था: वीडियो बेंचमार्क पर

वीडियो समझ बेंचमार्क और फ्रेम सेटिंग्स पर सुसंगत सुधार का उत्पादन किया, विशेष रूप से समयिक तर्क और दिशात्मकता जैसे कार्यों में लाभ जैसे एओटीबेंच में, और साथ ही साथ क्रॉस-वीडियो तर्क बेंचमार्क जैसे सीवीबेंच में: ‘ये परिणाम पुष्टि करते हैं कि वीडियो जिगसॉ कार्यों को
हल करने से मॉडल को बेहतर ढंग से समयिक निरंतरता को पकड़ने, वीडियो के साथ संबंधों को समझने, दिशात्मक संगति के बारे में तर्क करने और समग्र और सामान्य वीडियो समझ परिदृश्यों में सामान्यीकरण करने में मदद मिलती है।’
3डी डेटा
3डी मोडलिटी के लिए, मॉडल का एसएटी-रियल ; 3डीएसआरबेंच ; व्यूस्पेशियल; ऑल-एंगल्स; उपरोक्तओम्निस्पेशियल; वीएसआई-बेंच ;एसपीएआरबेंच (टीनी); और उपरोक्त डीए-2केपर मूल्यांकन किया गया था। 3डी बेंचमार्क पर

पर। यहाँ लेखक कहते
हैं: ‘(3डी) जिगसॉ सभी बेंचमार्क पर महत्वपूर्ण सुधार प्राप्त करता है। अप्रत्याशित रूप से, सबसे बड़ा लाभ डीए-2के पर है, जो हमारे गहराई-क्रम पूर्व-प्रशिक्षण कार्य से सीधे संबंधित है। अधिक महत्वपूर्ण बात यह है कि हम एकल-दृश्य (जैसे 3डीएसआरबेंच, (ओम्निस्पेशियल)), बहु-दृश्य (जैसे व्यूस्पेशियल, ऑल-एंगल्स), और स्व-केंद्रित वीडियो इनपुट (जैसे वीएसआई-बेंच) सहित विभिन्न कार्यों पर सुसंगत सुधार देखते हैं। ‘ ‘ये परिणाम दर्शाते हैं कि हमारा दृष्टिकोण न
केवल विशिष्ट कौशल को सिखाता है गहराई क्रम, लेकिन यह भी प्रभावी ढंग से मॉडल की सामान्य क्षमता को मजबूत करता है 3डी स्थानिक संरचना की धारणा और तर्क करने के लिए।’
निष्कर्ष
यह पत्र से पूरी तरह से स्पष्ट नहीं है कि छवि और विवरण के बीच संबंध है जो एमएलएलएम प्रदर्शन में सुधार को संचालित कर रहा है। पहली नज़र में, जिगसॉ पज़ल्स के माध्यम से सीखने की प्रक्रिया हमारे अपने प्रारंभिक प्रयासों और विकास के समान लगती है। हालांकि, पत्र की एक गहरी जांच से पता चलता है कि भाषा एमएलएलएम के लिए दृश्य और सेमेंटिक वास्तविकता के बीच एक आकर्षक पुल के रूप में कार्य करती है। * कृपया ध्यान दें कि पत्र के लेखक ‘मल्टीमॉडल लार्ज लैंग्वेज मॉडल’ शब्द का उपयोग करना पसंद करते हैं, जिसे ‘एमएलएलएम’ के रूप में संक्षिप्त किया जाता है। यह एक उभरता हुआ या कम बार-बार उपयोग किया जाने वाला शब्द है, और मॉडलों पर लागू होता है जो विस्तृत रूप से छवियों को स्थानिक रूप से तर्क और विश्लेषण कर सकते हैं, लेकिन छवियों का उत्पादन नहीं करते हैं। जैसाकि नए दृष्टिकोण और मॉडल उभरते हैं, यह शब्दावली निरंतर संशोधन के अधीन है। पहली बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।पहली
बार गुरुवार, 2 अक्टूबर, 2025 को प्रकाशित।












