रिपोर्ट्स

अलीबाबा ने Qwen3-VL तकनीकी रिपोर्ट जारी की, जिसमें दो घंटे के वीडियो विश्लेषण का विवरण दिया गया है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

अलीबाबा की Qwen टीम ने 26 नवंबर को Qwen3-VL तकनीकी रिपोर्ट प्रकाशित की, जिसमें सितंबर में लॉन्च हुए ओपन-सोर्स विजन-लैंग्वेज मॉडल का विस्तृत दस्तावेजीकरण किया गया है। 64 लेखकों द्वारा लिखित इस पेपर में यह बताया गया है कि यह सिस्टम 256,000-टोकन कонтेक्स्ट विंडो के भीतर दो घंटे के वीडियो को संसाधित कर सकता है, जबकि विशिष्ट फ्रेम को स्थित करने में लगभग पूर्ण सटीकता बनाए रखता है।

फ्लैगशिप Qwen3-VL-235B-A22B मॉडल ने 30 मिनट के वीडियो में “सुई-इन-ए-हेस्टैक” परीक्षण में 100% सटीकता हासिल की, और दो घंटे के वीडियो में लगभग एक मिलियन टोकन के साथ 99.5% सटीकता बनाए रखी। परीक्षण विधि लंबे वीडियो के भीतर यादृच्छिक स्थितियों में एक सेमेंटिक रूप से महत्वपूर्ण “सुई” फ्रेम डालती है, और फिर मॉडल को उस विशिष्ट फ्रेम को स्थित करने और विश्लेषण करने की चुनौती देती है।

यह क्षमता Qwen3-VL को लंबे फॉर्म वीडियो समझने में एक महत्वपूर्ण प्रगति के रूप में स्थापित करती है – एक डोमेन जहां अधिकांश विजन-लैंग्वेज मॉडल विस्तारित समय के लिए सुसंगत विश्लेषण बनाए रखने में संघर्ष करते हैं।

अग्रणी मॉडल के साथ बेंचमार्क प्रदर्शन

तकनीकी रिपोर्ट Qwen3-VL के प्रदर्शन को कई मूल्यांकन मेट्रिक्स में दस्तावेज करती है, विशेष रूप से दृश्य गणित कार्यों में। मॉडल ने MathVista पर 85.8% स्कोर किया, जो GPT-5 के 81.3% से अधिक है, और MathVision पर 74.6% सटीकता के साथ अग्रणी रहा, जो Gemini 2.5 Pro (73.3%) और GPT-5 (65.8%) से अधिक है।

दस्तावेज़ प्रसंस्करण क्षमताएं भी समान रूप से मजबूत साबित हुईं। मॉडल ने DocVQA पर 96.5% और OCRBench पर 875 पॉइंट हासिल किए, जो 39 भाषाओं में पाठ पहचान का समर्थन करता है – इसके पूर्ववर्ती Qwen2.5-VL की भाषा कवरेज से लगभग चार गुना अधिक। 32 में से 32 भाषाओं में OCR कार्यों पर 70% से अधिक सटीकता बनाए रखी।

मॉडल परिवार, जो Hugging Face और Alibaba Cloud के माध्यम से उपलब्ध है, में घने वेरिएंट (2B, 4B, 8B, 32B पैरामीटर) और मिश्रण-ऑफ-एक्सपर्ट कॉन्फ़िगरेशन (30B-A3B और 235B-A22B) शामिल हैं। 8B वेरिएंट अकेले सितंबर रिलीज़ के बाद से 2 मिलियन से अधिक डाउनलोड पार कर चुका है।

हालांकि, परिणाम एकसमान रूप से प्रभावशाली नहीं थे। MMMU-Pro पर, एक जटिल बहुस्तरीय परीक्षण में, Qwen3-VL ने GPT-5 के 78.4% की तुलना में 69.3% स्कोर किया। वाणिज्यिक प्रतियोगियों ने सामान्य वीडियो प्रश्न-उत्तर बेंचमार्क में भी लाभ बनाए रखा, जो दर्शाता है कि मॉडल दृश्य गणित और दस्तावेज़ विश्लेषण में एक विशेषज्ञ के रूप में उत्कृष्ट है, न कि एक सार्वभौमिक नेता के रूप में।

तीन वास्तुकला नवाचार

तकनीकी रिपोर्ट तीन प्रमुख वास्तुकला उन्नयनों को रेखांकित करती है जो इन क्षमताओं को चलाते हैं। पहले, “इंटरलीव्ड MRoPE” पिछले स्थिति एम्बेडिंग विधियों को प्रतिस्थापित करता है जो गणितीय प्रतिनिधित्व को समय, चौड़ाई और ऊंचाई आयामों में समान रूप से वितरित करता है, न कि आयामों द्वारा समूहीकृत। यह परिवर्तन विशेष रूप से लंबे वीडियो पर प्रदर्शन में सुधार को लक्षित करता है।

दूसरा, DeepStack एकीकरण मल्टी-लेवल विजन ट्रांसफॉर्मर सुविधाओं को एकत्रित करता है ताकि बारीक विस्तार वाले दृश्य विवरण और छवि-पाठ संरेखण को पकड़ा जा सके। तीसरा नवाचार समयिक रोटरी स्थिति एम्बेडिंग से परे जाता है और विशिष्ट पाठ-आधारित टाइमस्टैम्प संरेखण को लागू करता है, जो वीडियो सामग्री में विशिष्ट क्षणों को संदर्भित करने के लिए मॉडल को अधिक सटीक समयिक आधार प्रदान करता है।

सिस्टम दृश्य धारण से परे एजेंट क्षमताओं का भी प्रदर्शन करता है। ScreenSpot Pro पर, जो ग्राफिकल यूजर इंटरफेस के भीतर नेविगेशन का मूल्यांकन करता है, मॉडल ने 61.8% सटीकता हासिल की। AndroidWorld परीक्षण, जहां सिस्टम को स्वतंत्र रूप से एंड्रॉइड एप्लिकेशन संचालित करना होता है, में 32B वेरिएंट ने 63.7% सटीकता हासिल की।

ओपन-सोर्स प्रतिस्पर्धी परिदृश्य

सितंबर से जारी किए गए सभी Qwen3-VL मॉडल Apache 2.0 लाइसेंस के तहत खुले वजन के साथ उपलब्ध हैं। लाइनअप कॉम्पैक्ट 2B-पैरामीटर वेरिएंट से लेकर फ्लैगशिप 235B-A22B मॉडल तक है, जिसे महत्वपूर्ण कम्प्यूटेशनल संसाधनों की आवश्यकता होती है – बाद वाला 471 GB पर आता है।

इस तकनीकी दस्तावेज़ीकरण का समय उल्लेखनीय है। Google (GOOGL ) के Gemini 1.5 Pro ने 2024 की शुरुआत में लंबे वीडियो से फ्रेम-निकालने की क्षमता का प्रदर्शन किया, लेकिन Qwen3-VL इसी तरह की कार्यक्षमता को ओपन-सोर्स इकोसिस्टम में लाता है। चीन के जेनरेटिव एआई उपयोगकर्ताओं की संख्या हाल के महीनों में 515 मिलियन तक पहुंच गई है, जो दोगुनी हो गई है, और Qwen मॉडल परिवार ने विश्वभर में 300 मिलियन से अधिक डाउनलोड आकर्षित किए हैं, अलीबाबा अपने ओपन मॉडल को वैश्विक बहुमोडल एआई विकास के लिए आधार के रूप में स्थापित कर रहा है।

पिछला Qwen2.5-VL पहले ही 10 महीने से कम समय में 2,800 से अधिक उद्धरण एकत्र कर चुका है, जो मजबूत शोध ग्रहण को दर्शाता है। Qwen3-VL के लिए विस्तृत तकनीकी रिपोर्ट इस प्रवृत्ति को तेज करेगी, शोधकर्ताओं को इन क्षमताओं पर निर्माण या प्रतिस्पर्धा करने के लिए आवश्यक वास्तुकला और प्रशिक्षण विवरण प्रदान करेगी।

यह विकासकर्ताओं के लिए क्या意味 रखता है

वीडियो विश्लेषण, दस्तावेज़ बुद्धिमत्ता, या दृश्य तर्क अनुप्रयोगों पर काम करने वाली टीमों के लिए, Qwen3-VL उत्पादन-तैयार क्षमताएं प्रदान करता है जो एपीआई निर्भरता से मुक्त हैं। मॉडल की विशिष्ट ताकत दृश्य गणित में इसे तुरंत शैक्षिक प्रौद्योगिकी, वैज्ञानिक अनुसंधान उपकरण, और किसी भी अनुप्रयोग के लिए प्रासंगिक बनाती है जिसमें चित्र, आरेख, या गणितीय संकेतन की व्याख्या की आवश्यकता होती है।

ओपन और बंद मॉडल के बीच का अंतर कुछ डोमेन में संकीर्ण होता जा रहा है, जबकि अन्य में यह अभी भी महत्वपूर्ण है। Qwen3-VL दर्शाता है कि ओपन-वजन मॉडल विशिष्ट कार्यों जैसे दृश्य गणित में प्रोप्राइटरी सिस्टम को मैच या पार कर सकते हैं, जबकि व्यापक तर्क बेंचमार्क पर पीछे रहते हैं।

ओपन-सोर्स एआई समुदाय के लिए, विस्तृत तकनीकी रिपोर्ट केवल दस्तावेज़ीकरण से अधिक है – यह एक मार्गदर्शिका है जिस पर अन्य टीमें अध्ययन, आलोचना, और निर्माण कर सकती हैं। यह प्रतिस्पर्धी कार्यान्वयन या पूरक अनुसंधान की ओर ले जाता है या नहीं, यह देखा जाना बाकी है, लेकिन ओपन बहुमोडल बुद्धिमत्ता के लिए बेंचमार्क काफी उच्च हो गया है।

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।