एआई मॉडल और प्लेटफ़ॉर्म

YOLO-विश्व: रियल-टाइम ओपन-वोकैबुलरी ऑब्जेक्ट डिटेक्शन

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

ऑब्जेक्ट डिटेक्शन कंप्यूटर विजन उद्योग में एक मूलभूत चुनौती रही है, जिसमें रोबोटिक्स, इमेज समझ, स्वायत्त वाहनों और इमेज रिकग्निशन में अनुप्रयोग हैं। हाल के वर्षों में, एआई में ग्राउंडब्रेकिंग काम, विशेष रूप से गहरे तंत्रिका नेटवर्क के माध्यम से, ऑब्जेक्ट डिटेक्शन में काफी उन्नति हुई है। हालांकि, इन मॉडलों में एक निश्चित शब्दावली है, जो केवल COCO डेटासेट की 80 श्रेणियों के भीतर ऑब्जेक्ट्स का पता लगाने तक सीमित है। यह सीमा प्रशिक्षण प्रक्रिया से उत्पन्न होती है, जहां ऑब्जेक्ट डिटेक्टर्स को केवल विशिष्ट श्रेणियों को पहचानने के लिए प्रशिक्षित किया जाता है, जिससे उनकी लागू करने योग्य सीमा सीमित हो जाती है।

इसे पार करने के लिए, हम YOLO-विश्व की शुरुआत करते हैं, जो YOLO (आप केवल एक बार देखते हैं) फ्रेमवर्क को ओपन वोकैबुलरी डिटेक्शन क्षमताओं के साथ बढ़ाने के लिए एक नवाचारी दृष्टिकोण है। यह बड़े पैमाने पर डेटासेट पर प्री-ट्रेनिंग फ्रेमवर्क और दृष्टि-भाषा मॉडलिंग दृष्टिकोण को लागू करके प्राप्त किया जाता है। विशेष रूप से, YOLO-विश्व एक पुनः-पैरामीटराइज़ेबल दृष्टि-भाषा पथ एग्रीगेशन नेटवर्क (RepVL-PAN) और क्षेत्र-टेक्स्ट विरोधी हानि का उपयोग करता है ताकि भाषाई और दृश्य जानकारी के बीच बातचीत को बढ़ावा मिल सके। RepVL-PAN और क्षेत्र-टेक्स्ट विरोधी हानि के माध्यम से, YOLO-विश्व शून्य-शॉट सेटिंग में व्यापक श्रृंखला के ऑब्जेक्ट्स का सटीक और प्रभावी ढंग से पता लगाने में सक्षम है, जो खुली शब्दावली विभाजन और ऑब्जेक्ट डिटेक्शन कार्यों में उल्लेखनीय प्रदर्शन दिखाता है।

यह लेख YOLO-विश्व के तकनीकी आधार, मॉडल वास्तुकला, प्रशिक्षण प्रक्रिया और अनुप्रयोग परिदृश्यों की एक विस्तृत समझ प्रदान करने का उद्देश्य रखता है। आइए गोता लगाएं।

YOLO-विश्व: रियल-टाइम ओपन-वोकैबुलरी ऑब्जेक्ट डिटेक्शन

YOLO या आप केवल एक बार देखते हैं कंप्यूटर विजन उद्योग में आधुनिक दिन के ऑब्जेक्ट डिटेक्शन के लिए सबसे लोकप्रिय तरीकों में से एक है। इसकी अविश्वसनीय गति और दक्षता के लिए प्रसिद्ध, YOLO तंत्र का आगमन मशीनों को वास्तविक समय में छवियों और वीडियो में विशिष्ट ऑब्जेक्ट्स का व्याख्या और पता लगाने के तरीके को क्रांतिकारी बना दिया है। पारंपरिक ऑब्जेक्ट डिटेक्शन फ्रेमवर्क दो-चरण ऑब्जेक्ट डिटेक्शन दृष्टिकोण को लागू करते हैं: पहले चरण में, फ्रेमवर्क ऑब्जेक्ट को शामिल करने वाले क्षेत्रों का प्रस्ताव करता है, और फ्रेमवर्क अगले चरण में ऑब्जेक्ट को वर्गीकृत करता है। YOLO फ्रेमवर्क, दूसरी ओर, इन दोनों चरणों को एक ही तंत्रिका नेटवर्क मॉडल में एकीकृत करता है, जो फ्रेमवर्क को छवि को केवल एक बार देखने और ऑब्जेक्ट और इसके स्थान का पूर्वानुमान लगाने की अनुमति देता है, और इसलिए, नाम YOLO या आप केवल एक बार देखते हैं।

इसके अलावा, YOLO फ्रेमवर्क ऑब्जेक्ट डिटेक्शन को एक प्रगति समस्या के रूप में मानता है, और पूरी छवि से सीधे वर्ग संभावनाओं और बाउंडिंग बॉक्स का पूर्वानुमान लगाता है। इस पद्धति का कार्यान्वयन न केवल पता लगाने की प्रक्रिया की गति बढ़ाता है, बल्कि जटिल और विविध डेटा से सामान्यीकरण करने की मॉडल की क्षमता को भी बढ़ाता है, जिससे यह वास्तविक समय में काम करने वाले अनुप्रयोगों जैसे स्वायत्त ड्राइविंग, गति पता लगाने या नंबर प्लेट पहचान के लिए उपयुक्त विकल्प बन जाता है। इसके अलावा, पिछले कुछ वर्षों में गहरे तंत्रिका नेटवर्क की महत्वपूर्ण प्रगति ने भी ऑब्जेक्ट डिटेक्शन फ्रेमवर्क के विकास में महत्वपूर्ण योगदान दिया है, लेकिन ऑब्जेक्ट डिटेक्शन फ्रेमवर्क की सफलता अभी भी सीमित है क्योंकि वे केवल सीमित शब्दावली के साथ ऑब्जेक्ट्स का पता लगा सकते हैं। यह मुख्य रूप से इसलिए है क्योंकि एक बार ऑब्जेक्ट श्रेणियां परिभाषित और डेटासेट में लेबल की जाती हैं, फ्रेमवर्क में प्रशिक्षित डिटेक्टर्स केवल इन विशिष्ट श्रेणियों को पहचानने में सक्षम होते हैं, जिससे उनकी लागू करने योग्य सीमा सीमित हो जाती है।

आगे बढ़ते हुए, हाल ही में विकसित दृष्टि-भाषा मॉडल डिस्टिल्ड शब्दावली ज्ञान को भाषा एनकोडर्स से खुली शब्दावली पता लगाने के लिए नियोजित करते हैं। हालांकि ये फ्रेमवर्क पारंपरिक ऑब्जेक्ट डिटेक्शन मॉडल की तुलना में खुली शब्दावली पता लगाने में बेहतर प्रदर्शन करते हैं, वे अभी भी सीमित शब्दावली विविधता के साथ प्रशिक्षण डेटा की दुर्लभ उपलब्धता के कारण सीमित लागू करने योग्य हैं। इसके अलावा, चयनित फ्रेमवर्क खुली शब्दावली ऑब्जेक्ट डिटेक्टर्स को बड़े पैमाने पर प्रशिक्षित करते हैं और प्रशिक्षण ऑब्जेक्ट डिटेक्टर्स को क्षेत्र-स्तरीय दृष्टि-भाषा पूर्व-प्रशिक्षण के रूप में वर्गीकृत करते हैं। हालांकि, दृष्टिकोण अभी भी दो मुख्य कारणों से वास्तविक समय में ऑब्जेक्ट्स का पता लगाने में संघर्ष करता है: जटिल तैनाती प्रक्रिया के लिए एज डिवाइस, और भारी गणनात्मक आवश्यकताएं। सकारात्मक नोट पर, ये फ्रेमवर्क खुली मान्यता क्षमताओं के साथ बड़े डिटेक्टर्स को प्री-ट्रेन करने से सकारात्मक परिणाम दिखाते हैं।

YOLO-विश्व फ्रेमवर्क उच्च दक्षता वाली खुली शब्दावली ऑब्जेक्ट डिटेक्शन हासिल करने और पारंपरिक YOLO डिटेक्टर्स के लिए खुली शब्दावली ऑब्जेक्ट डिटेक्शन के लिए बड़े पैमाने पर प्री-ट्रेनिंग दृष्टिकोणों की दक्षता को बढ़ाने की संभावना का अन्वेषण करने का उद्देश्य रखता है। पिछले कार्यों के विपरीत, YOLO-विश्व फ्रेमवर्क उच्च अनुमान गति के साथ उल्लेखनीय दक्षता प्रदर्शित करता है, और यह डाउनस्ट्रीम अनुप्रयोगों पर आसानी से तैनात किया जा सकता है। YOLO-विश्व मॉडल पारंपरिक YOLO वास्तुकला का अनुसरण करता है और एक पूर्व-प्रशिक्षित CLIP पाठ एनकोडर की क्षमताओं का लाभ उठाकर इनपुट पाठ को एनकोड करता है। इसके अलावा, YOLO-विश्व फ्रेमवर्क अपनी वास्तुकला में एक पुनः-पैरामीटराइज़ेबल दृष्टि-भाषा पथ एग्रीगेशन नेटवर्क (RepVL-PAN) घटक को शामिल करता है ताकि छवि और पाठ सुविधाओं को जोड़कर दृश्य-semantic प्रतिनिधित्व को बढ़ाया जा सके। अनुमान चरण के दौरान, फ्रेमवर्क पाठ एनकोडर को हटा देता है और पुनः-पैरामीटराइज़ करता है पाठ एम्बेडिंग को RepVL-PAN वजन में परिणत करता है, जिससे प्रभावी तैनाती होती है। फ्रेमवर्क में खुली शब्दावली पूर्व-प्रशिक्षण विधियों के लिए पारंपरिक YOLO मॉडल का अध्ययन करने के लिए क्षेत्र-टेक्स्ट विरोधी सीखने की विधि भी शामिल है। क्षेत्र-टेक्स्ट विरोधी सीखने की विधि छवि-पाठ डेटा, ग्राउंडिंग डेटा और पता लगाने वाले डेटा को क्षेत्र-टेक्स्ट जोड़े में एकजुट करती है। इस पर निर्माण करते हुए, क्षेत्र-टेक्स्ट जोड़े पर प्री-ट्रेन किए गए YOLO-विश्व फ्रेमवर्क खुली और बड़ी शब्दावली पता लगाने के लिए उल्लेखनीय क्षमता प्रदर्शित करता है। इसके अलावा, YOLO-विश्व फ्रेमवर्क वास्तविक समय और वास्तविक दुनिया के दृश्यों में खुली शब्दावली ऑब्जेक्ट डिटेक्शन की दक्षता को बढ़ाने के उद्देश्य से एक प्रॉम्प्ट-फिर-पता लगाने की विधि का अन्वेषण करता है।

निम्नलिखित छवि में देखा जा सकता है, पारंपरिक ऑब्जेक्ट डिटेक्टर्स निश्चित शब्दावली के करीब सेट के साथ पता लगाने पर ध्यान केंद्रित करते हैं जिसमें पूर्व-निर्धारित श्रेणियां होती हैं, जबकि खुली शब्दावली डिटेक्टर्स पाठ एनकोडर्स के साथ उपयोगकर्ता प्रॉम्प्ट्स को एनकोड करके ऑब्जेक्ट्स का पता लगाते हैं। तुलना में, YOLO-विश्व का प्रॉम्प्ट-फिर-पता लगाने का दृष्टिकोण पहले एक ऑफलाइन शब्दावली (विभिन्न आवश्यकताओं के लिए विभिन्न शब्दावली) का निर्माण करता है जो उपयोगकर्ता प्रॉम्प्ट्स को एनकोड करके डिटेक्टर्स को वास्तविक समय में ऑफलाइन शब्दावली की व्याख्या करने की अनुमति देता है बिना प्रॉम्प्ट्स को पुनः एनकोड करने की।

YOLO-विश्व: विधि और वास्तुकला

क्षेत्र-टेक्स्ट जोड़े

पारंपरिक रूप से, ऑब्जेक्ट डिटेक्शन फ्रेमवर्क, जिनमें YOLO परिवार के ऑब्जेक्ट डिटेक्टर्स भी शामिल हैं, को उदाहरण एनोटेशन का उपयोग करके प्रशिक्षित किया जाता है जिसमें श्रेणी लेबल और बाउंडिंग बॉक्स होते हैं। इसके विपरीत, YOLO-विश्व फ्रेमवर्क उदाहरण एनोटेशन को क्षेत्र-टेक्स्ट जोड़े के रूप में पुनः-परिभाषित करता है, जहां पाठ ऑब्जेक्ट का वर्णन, संज्ञा वाक्यांश या श्रेणी नाम हो सकता है। यह ध्यान देने योग्य है कि YOLO-विश्व फ्रेमवर्क दोनों पाठ और छवियों को इनपुट और आउटपुट के रूप में उपयोग करता है और संबंधित ऑब्जेक्ट एम्बेडिंग के साथ अनुमानित बॉक्स का उत्पादन करता है।

मॉडल वास्तुकला

इसके मूल में, YOLO-विश्व मॉडल में एक पाठ एनकोडर, एक YOLO डिटेक्टर और पुनः-पैरामीटराइज़ेबल दृष्टि-भाषा पथ एग्रीगेशन नेटवर्क (RepVL-PAN) घटक शामिल है, जैसा कि निम्नलिखित छवि में दिखाया गया है।

एक इनपुट पाठ के लिए, पाठ एनकोडर घटक पाठ को पाठ एम्बेडिंग में एनकोड करता है, इसके बाद YOLO डिटेक्टर घटक द्वारा इनपुट छवि से मल्टी-स्केल फीचर्स का निष्कर्षण किया जाता है। पुनः-पैरामीटराइज़ेबल दृष्टि-भाषा पथ एग्रीगेशन नेटवर्क (RepVL-PAN) घटक तब पाठ और फीचर एम्बेडिंग के बीच क्रॉस-मॉडलिटी फ्यूजन का शोषण करता है ताकि पाठ और छवि प्रतिनिधित्व को बढ़ाया जा सके।

YOLO डिटेक्टर

YOLO-विश्व मॉडल YOLOv8 फ्रेमवर्क पर बनाया गया है, जिसमें एक डार्कनेट बैकबोन घटक, एक हेड ऑब्जेक्ट एम्बेडिंग और बाउंडिंग बॉक्स प्रगति के लिए, और एक पाथ एग्रीगेशन नेटवर्क (PAN) मल्टी-स्केल फीचर पिरामिड के लिए शामिल है।

पाठ एनकोडर

एक दिए गए पाठ के लिए, YOLO-विश्व मॉडल एक पूर्व-प्रशिक्षित CLIP ट्रांसफॉर्मर पाठ एनकोडर का उपयोग करके संबंधित पाठ एम्बेडिंग का निष्कर्षण करता है, जिसमें एक निश्चित संख्या में संज्ञाएं और एम्बेडिंग आयाम होते हैं। YOLO-विश्व फ्रेमवर्क एक CLIP पाठ एनकोडर को अपनाने का मुख्य कारण यह है कि यह दृश्य-semantic प्रदर्शन के लिए पाठ और दृश्य ऑब्जेक्ट्स को जोड़ने के लिए बेहतर प्रदर्शन करता है, जो पारंपरिक पाठ-मात्र भाषा एनकोडर्स को महत्वपूर्ण रूप से पार करता है। हालांकि, यदि इनपुट पाठ एक उपशीर्षक या संदर्भ वाक्यांश है, तो YOLO-विश्व मॉडल एक सरल n-ग्राम एल्गोरिदम का उपयोग करके वाक्यांशों का निष्कर्षण करने का विकल्प चुनता है। इन वाक्यांशों को तब पाठ एनकोडर में खिलाया जाता है।

पाठ विरोधी सिर

डीकपल्ड हेड पूर्ववर्ती ऑब्जेक्ट डिटेक्शन मॉडल द्वारा उपयोग की जाने वाली एक घटक है, और YOLO-विश्व फ्रेमवर्क एक डीकपल्ड हेड को दोहरे 3×3 कॉन्वोल्यूशनल का उपयोग करके एक निश्चित संख्या में ऑब्जेक्ट्स के लिए ऑब्जेक्ट एम्बेडिंग और बाउंडिंग बॉक्स का प्रगति करता है। YOLO-विश्व फ्रेमवर्क एक पाठ विरोधी सिर का उपयोग करके L2 सामान्यीकरण दृष्टिकोण का उपयोग करके ऑब्जेक्ट-पाठ समानता का अनुमान लगाता है और पाठ एम्बेडिंग का उपयोग करता है। इसके अलावा, YOLO-विश्व मॉडल एक समान रूपांतरण दृष्टिकोण का उपयोग करता है जिसमें एक शिफ्टिंग कारक और एक सीखने योग्य स्केलिंग कारक होता है, जिसमें L2 सामान्यीकरण और समान रूपांतरण क्षेत्र-टेक्स्ट प्रशिक्षण के दौरान मॉडल की स्थिरता को बढ़ाता है।

ऑनलाइन शब्दावली प्रशिक्षण

प्रशिक्षण चरण के दौरान, YOLO-विश्व मॉडल प्रत्येक मोज़ेक नमूने के लिए एक ऑनलाइन शब्दावली का निर्माण करता है, जिसमें प्रत्येक 4 छवियां होती हैं। मॉडल मोज़ेक छवियों में शामिल सभी सकारात्मक संज्ञाओं का नमूना लेता है और कुछ नकारात्मक संज्ञाओं को यादृच्छिक रूप से संबंधित डेटासेट से नमूना लेता है। प्रत्येक नमूने की शब्दावली में अधिकतम n संज्ञाएं होती हैं, जिसमें डिफ़ॉल्ट मान 80 होता है।

ऑफलाइन शब्दावली अनुमान

अनुमान चरण के दौरान, YOLO-विश्व मॉडल एक प्रॉम्प्ट-फिर-पता लगाने की रणनीति को ऑफलाइन शब्दावली के साथ लागू करता है ताकि मॉडल की दक्षता को और बढ़ाया जा सके। उपयोगकर्ता पहले एक श्रृंखला कस्टम प्रॉम्प्ट्स को परिभाषित करता है जो श्रेणियों या thậmाल वाक्यांशों को शामिल कर सकता है। YOLO-विश्व मॉडल तब प्रॉम्प्ट्स को एनकोड करके ऑफलाइन शब्दावली एम्बेडिंग प्राप्त करता है। परिणामस्वरूप, अनुमान के लिए ऑफलाइन शब्दावली मॉडल को प्रत्येक इनपुट के लिए गणना से बचाता है और मॉडल को आवश्यकताओं के अनुसार शब्दावली को लचीले ढंग से समायोजित करने की अनुमति देता है।

पुनः-पैरामीटराइज़ेबल दृष्टि-भाषा पथ एग्रीगेशन नेटवर्क (RevVL-PAN)

निम्नलिखित छवि में प्रस्तावित पुनः-पैरामीटराइज़ेबल दृष्टि-भाषा पथ एग्रीगेशन नेटवर्क की संरचना दिखाई गई है जो शीर्ष-नीचे और नीचे-शीर्ष पथ का अनुसरण करता है ताकि मल्टी-स्केल फीचर पिरामिड के साथ फीचर पिरामिड की स्थापना की जा सके।

पाठ और छवि सुविधाओं के बीच बातचीत को बढ़ाने के लिए, YOLO-विश्व मॉडल एक इमेज-पूलिंग ध्यान और एक पाठ-निर्देशित CSPLayer (क्रॉस-स्टेज पार्श्व लेयर) का प्रस्ताव करता है, जिसका अंतिम उद्देश्य खुली शब्दावली क्षमताओं के लिए दृश्य-semantic प्रतिनिधित्व में सुधार करना है। अनुमान के दौरान, YOLO-विश्व मॉडल ऑफलाइन शब्दावली एम्बेडिंग को रैखिक या कॉन्वोल्यूशनल परतों के वजन में पुनः-पैरामीटराइज़ करता है ताकि प्रभावी तैनाती सुनिश्चित की जा सके।

जैसा कि ऊपर दी गई छवि में देखा जा सकता है, YOLO-विश्व मॉडल शीर्ष-नीचे या नीचे-शीर्ष फ्यूजन के बाद CSPLayer का उपयोग करता है और मल्टी-स्केल छवि सुविधाओं में पाठ-निर्देशित CSPLayer को एकीकृत करता है, जिससे CSPLayer का विस्तार होता है। किसी भी दिए गए छवि सुविधा और इसके संबंधित पाठ एम्बेडिंग के लिए, मॉडल अंतिम बोतलनेक ब्लॉक के बाद मैक्स-सिग्मॉइड ध्यान का उपयोग करके पाठ सुविधाओं को छवि सुविधाओं में एकत्रित करता है। अद्यतन छवि सुविधा को तब क्रॉस-स्टेज सुविधाओं के साथ जोड़ा जाता है और आउटपुट के रूप में प्रस्तुत किया जाता है।

इसके अलावा, YOLO-विश्व मॉडल छवि सुविधाओं को एकत्रित करके पाठ एम्बेडिंग को अद्यतन करने के लिए इमेज-पूलिंग ध्यान परत को पेश करता है ताकि पाठ एम्बेडिंग को छवि जागरूक जानकारी के साथ बढ़ाया जा सके। छवि सुविधाओं पर सीधे क्रॉस-ध्यान का उपयोग करने के बजाय, मॉडल मल्टी-स्केल फीचर्स पर मैक्स पूलिंग का लाभ उठाता है ताकि 3×3 क्षेत्र प्राप्त किए जा सकें, जिससे 27 पैच टोकन प्राप्त होते हैं और मॉडल अगले चरण में पाठ एम्बेडिंग को अद्यतन करता है।

पूर्व-प्रशिक्षण योजनाएं

YOLO-विश्व मॉडल दो प्राथमिक पूर्व-प्रशिक्षण योजनाओं का अनुसरण करता है: क्षेत्र-टेक्स्ट विरोधी हानि से सीखना और छवि-पाठ डेटा के साथ पseudo लेबलिंग। प्राथमिक पूर्व-प्रशिक्षण योजना के लिए, मॉडल एक दिए गए पाठ और मोज़ेक नमूनों के लिए ऑब्जेक्ट पूर्वानुमान के साथ-साथ एनोटेशन का उत्पादन करता है। YOLO-विश्व फ्रेमवर्क कार्य-निर्धारित लेबल असाइनमेंट का पालन करके पूर्वानुमान को मेल खाने वाले ग्राउंड ट्रुथ एनोटेशन के साथ मेल खाता है और व्यक्तिगत सकारात्मक पूर्वानुमान को एक पाठ सूचकांक के साथ असाइन करता है जो वर्गीकरण लेबल के रूप में कार्य करता है। दूसरी ओर, छवि-पाठ डेटा के साथ पseudo लेबलिंग पूर्व-प्रशिक्षण योजना एक स्वचालित लेबलिंग दृष्टिकोण का प्रस्ताव करती है जो क्षेत्र-टेक्स्ट जोड़े को उत्पन्न करने के लिए छवि-पाठ जोड़े का उपयोग करती है। प्रस्तावित लेबलिंग दृष्टिकोण में तीन चरण शामिल हैं: संज्ञा वाक्यांश निकालना, पseudo लेबलिंग, और फिल्टरिंग। पहले चरण में n-ग्राम एल्गोरिदम का उपयोग करके इनपुट पाठ से संज्ञा वाक्यांश निकालना शामिल है, दूसरे चरण में एक पूर्व-प्रशिक्षित खुली शब्दावली डिटेक्टर का उपयोग करके व्यक्तिगत छवियों के लिए दिए गए संज्ञा वाक्यांश के लिए पseudo बॉक्स उत्पन्न करना शामिल है, जबकि तीसरे और अंतिम चरण में एक पूर्व-प्रशिक्षित CLIP फ्रेमवर्क का उपयोग करके क्षेत्र-टेक्स्ट और पाठ-छवि जोड़े की प्रासंगिकता का मूल्यांकन करना शामिल है, जिसके बाद मॉडल कम प्रासंगिकता वाली पseudo छवियों और एनोटेशन को फिल्टर करता है।

YOLO-विश्व: परिणाम

एक बार YOLO-विश्व मॉडल को पूर्व-प्रशिक्षित किया जाता है, तो इसे शून्य-शॉट सेटिंग में LVIS डेटासेट पर सीधे मूल्यांकन किया जाता है, जिसमें 1200 से अधिक श्रेणियां होती हैं, जो मौजूदा फ्रेमवर्क द्वारा बड़ी शब्दावली पता लगाने के प्रदर्शन का परीक्षण करने के लिए उपयोग किए जाने वाले पूर्व-प्रशिक्षण डेटासेट की तुलना में काफी अधिक है। निम्नलिखित छवि में LVIS डेटासेट पर शून्य-शॉट सेटिंग में YOLO-विश्व फ्रेमवर्क के प्रदर्शन को कुछ मौजूदा राज्य-ऑफ-द-आर्ट ऑब्जेक्ट डिटेक्शन फ्रेमवर्क के साथ तुलना की गई है।

जैसा कि देखा जा सकता है, YOLO-विश्व फ्रेमवर्क अनुमान गति और शून्य-शॉट प्रदर्शन के मामले में अधिकांश मौजूदा फ्रेमवर्क से बेहतर प्रदर्शन करता है, यहां तक कि उन फ्रेमवर्क की तुलना में भी जो अधिक डेटा को एकीकृत करते हैं, जैसे कि ग्राउंडिंग DINO, GLIP, और GLIPv2। समग्र परिणाम यह दर्शाते हैं कि छोटे ऑब्जेक्ट डिटेक्शन मॉडल जैसे YOLO-विश्व-S, जिसमें केवल 13 मिलियन पैरामीटर होते हैं, दृष्टि-भाषा कार्यों पर प्री-ट्रेनिंग के लिए उपयोग किए जा सकते हैं और उल्लेखनीय खुली शब्दावली क्षमताएं प्रदर्शित कर सकते हैं।

अंतिम विचार

इस लेख में, हमने YOLO-विश्व के बारे में बात की है, जो एक नवाचारी दृष्टिकोण है जो YOLO या आप केवल एक बार देखते हैं फ्रेमवर्क को खुली शब्दावली पता लगाने की क्षमताओं के साथ बढ़ाने का उद्देश्य रखता है, जो बड़े पैमाने पर डेटासेट पर प्री-ट्रेनिंग और दृष्टि-भाषा मॉडलिंग दृष्टिकोण को लागू करके प्राप्त किया जाता है। विशेष रूप से, YOLO-विश्व फ्रेमवर्क एक पुनः-पैरामीटराइज़ेबल दृष्टि-भाषा पथ एग्रीगेशन नेटवर्क (RepVL-PAN) और क्षेत्र-टेक्स्ट विरोधी हानि को लागू करने का प्रस्ताव करता है ताकि भाषाई और दृश्य जानकारी के बीच बातचीत को बढ़ावा मिल सके। RepVL-PAN और क्षेत्र-टेक्स्ट विरोधी हानि के माध्यम से, YOLO-विश्व फ्रेमवर्क शून्य-शॉट सेटिंग में व्यापक श्रृंखला के ऑब्जेक्ट्स का सटीक और प्रभावी ढंग से पता लगाने में सक्षम है।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।