एआई मॉडल और प्लेटफ़ॉर्म
YOLOv9: वास्तविक समय वस्तु पता लगाने में एक छलांग
वस्तु पता लगाने ने हाल के वर्षों में गहरे शिक्षण एल्गोरिदम जैसे YOLO (आप केवल एक बार देखते हैं) के कारण तेजी से उन्नति की है। नवीनतम संस्करण, YOLOv9, पिछले संस्करणों की तुलना में सटीकता, दक्षता और लागू करने योग्यता में बड़े सुधार लाता है। इस पोस्ट में, हम YOLOv9 को एक नए राज्य-ऑफ-द-आर्ट के लिए वास्तविक समय वस्तु पता लगाने के लिए बनाने वाले नवाचारों में गहराई से जाएंगे।
वस्तु पता लगाने का एक त्वरित परिचय
YOLOv9 के साथ क्या नया है, इसके बारे में जानने से पहले, आइए वस्तु पता लगाने के काम को जल्दी से देखें। वस्तु पता लगाने का लक्ष्य छवियों में वस्तुओं की पहचान करना और स्थान निर्धारित करना है, जैसे कि कारें, लोग या जानवर। यह स्व-ड्राइविंग कारों, निगरानी प्रणालियों और छवि खोज जैसे अनुप्रयोगों के लिए एक महत्वपूर्ण क्षमता है।
डिटेक्टर एक छवि को इनपुट के रूप में लेता है और पता लगाई गई वस्तुओं के चारों ओर बाउंडिंग बॉक्स के साथ आउटपुट देता है, प्रत्येक के साथ एक संबंधित वर्ग लेबल। लोकप्रिय डेटासेट जैसे MS COCO में इन मॉडलों को प्रशिक्षित करने और मूल्यांकन करने के लिए हजारों लेबल वाली छवियां प्रदान करते हैं।
वस्तु पता लगाने के दो मुख्य दृष्टिकोण हैं:
- दो-चरण वाले डिटेक्टर जैसे Faster R-CNN पहले क्षेत्र प्रस्ताव उत्पन्न करते हैं, फिर प्रत्येक क्षेत्र की सीमाओं को वर्गीकृत और परिष्कृत करते हैं। वे अधिक सटीक होने के लिए प्रवृत्त होते हैं लेकिन धीमे होते हैं।
- एकल-चरण वाले डिटेक्टर जैसे YOLO एकल पास में सीधे छवि पर मॉडल लागू करते हैं। वे कुछ सटीकता के लिए बहुत तेज़ अनुमान समय का व्यापार करते हैं।
YOLO ने एकल-चरण दृष्टिकोण का पioneered किया। आइए देखें कि यह कई संस्करणों में कैसे विकसित हुआ है ताकि सटीकता और दक्षता में सुधार किया जा सके।
पिछले YOLO संस्करणों की समीक्षा
YOLO (आप केवल एक बार देखते हैं) मॉडल का परिवार तेजी से वस्तु पता लगाने के लिए 2016 में मूल संस्करण प्रकाशित होने के बाद से अग्रणी रहा है। आइए देखें कि YOLO कैसे कई पुनरावृत्तियों में विकसित हुआ है:
- YOLOv1 ने एक एकल पास में पूरी छवियों से सीधे बाउंडिंग बॉक्स और वर्ग संभावनाओं की भविष्यवाणी करने के लिए एक एकीकृत मॉडल का प्रस्ताव दिया। यह इसे先े मॉडलों की तुलना में बहुत तेज़ बनाता है।
- YOLOv2 ने मूल को बेहतर बनाया bằng बैच सामान्यीकरण के लिए बेहतर स्थिरता का उपयोग किया, विभिन्न स्केल और पहलू अनुपात पर एंकरिंग बॉक्स का पता लगाने के लिए कई आकारों का पता लगाने के लिए, और विभिन्न अन्य अनुकूलन।
- YOLOv3 में एक नया फीचर एक्सट्रैक्टर जोड़ा गया था जिसे Darknet-53 कहा जाता है, जिसमें अधिक परतें और उनके बीच शॉर्टकट थे, जो सटीकता में और सुधार करता है।
- YOLOv4 ने अन्य वस्तु पता लगाने वालों और सेगमेंटेशन मॉडलों से विचारों को मिलाकर सटीकता को और भी अधिक बढ़ाया, जबकि अभी भी तेज़ अनुमान को बनाए रखा।
- YOLOv5 ने YOLOv4 को पूरी तरह से PyTorch में फिर से लिखा और एक नए फीचर एक्सट्रैक्शन बैकबोन को CSPDarknet के साथ जोड़ा, साथ ही कई अन्य सुधार किए।
- YOLOv6 ने वास्तुकला और प्रशिक्षण प्रक्रिया को और भी अधिक अनुकूलित किया, जिसमें बड़े बाहरी डेटासेट पर पूर्व-प्रशिक्षित मॉडल शामिल थे जो प्रदर्शन को और भी बढ़ाते हैं।
तो सारांश में, पिछले YOLO संस्करणों ने मॉडल वास्तुकला, प्रशिक्षण तकनीकों और पूर्व-प्रशिक्षण के माध्यम से उच्च सटीकता प्राप्त की। लेकिन जैसे ही मॉडल बड़े और अधिक जटिल हो जाते हैं, गति और दक्षता प्रभावित होने लगती है।
बेहतर दक्षता की आवश्यकता
वास्तविक समय में वस्तु पता लगाने के लिए कई अनुप्रयोगों को सीमित कंप्यूटिंग संसाधनों वाले उपकरणों पर चलने की आवश्यकता होती है। जैसे ही मॉडल बड़े और अधिक गणनात्मक रूप से गहन हो जाते हैं, वे तैनाती के लिए व्यावहारिक होना बंद कर देते हैं।
उदाहरण के लिए, एक स्व-ड्राइविंग कार को उच्च फ्रेम दरों पर वस्तुओं का पता लगाने की आवश्यकता होती है वाहन के भीतर प्रोसेसर का उपयोग करके। एक सुरक्षा कैमरे को अपने वीडियो फीड पर वस्तु पता लगाने को चलाने की आवश्यकता होती है अपने एम्बेडेड हार्डवेयर के भीतर। फोन और अन्य उपभोक्ता उपकरणों में बहुत तंग शक्ति और तापमान सीमाएं हैं।
हाल के YOLO संस्करण उच्च सटीकता प्राप्त करते हैं लेकिन बड़ी संख्या में पैरामीटर और गुणा जोड़ ऑपरेशन (FLOPs) के साथ। लेकिन यह गति, आकार और शक्ति दक्षता की लागत पर आता है।
उदाहरण के लिए, YOLOv5-L को एक 1280×1280 छवि को संसाधित करने के लिए 100 अरब FLOPs से अधिक की आवश्यकता होती है। यह कई वास्तविक समय उपयोग मामलों के लिए बहुत धीमा है। बड़े मॉडलों की प्रवृत्ति भी ओवरफिटिंग के जोखिम को बढ़ाती है और इसे सामान्य बनाना मुश्किल बना देती है।
तो वस्तु पता लगाने की लागू करने योग्यता को बढ़ाने के लिए, हमें दक्षता में सुधार के तरीकों की आवश्यकता है – कम पैरामीटर और गणना के साथ बेहतर सटीकता प्राप्त करना। आइए देखें कि YOLOv9 ने इस चुनौती का सामना करने के लिए किन तकनीकों का उपयोग किया।
YOLOv9 – कम संसाधनों के साथ बेहतर सटीकता
YOLOv9 के शोधकर्ताओं ने दक्षता में सुधार पर ध्यान केंद्रित किया ताकि विभिन्न उपकरणों पर वास्तविक समय प्रदर्शन प्राप्त किया जा सके। उन्होंने दो मुख्य नवाचार पेश किए:
- एक नई मॉडल वास्तुकला जिसे सामान्य कुशल परत समूहीकरण नेटवर्क (GELAN) कहा जाता है, जो न्यूनतम पैरामीटर बजट के भीतर सटीकता को अधिकतम करता है।
- एक प्रशिक्षण तकनीक जिसे प्रोग्रामेबल ग्रेडिएंट जानकारी (PGI) कहा जाता है, जो विशेष रूप से छोटे मॉडलों के लिए अधिक विश्वसनीय सीखने के ग्रेडिएंट प्रदान करता है।
आइए देखें कि प्रत्येक उन्नति कैसे दक्षता में सुधार करती है।
GELAN के साथ अधिक कुशल वास्तुकला
मॉडल वास्तुकला स्वयं अनुमान समय के दौरान सटीकता और संसाधन उपयोग के बीच संतुलन के लिए महत्वपूर्ण है। न्यूरल नेटवर्क को प्रासंगिक विशेषताओं को पकड़ने के लिए पर्याप्त गहराई और चौड़ाई की आवश्यकता होती है। लेकिन बहुत सारी परतें या फिल्टर धीमी और फुली हुई मॉडल का कारण बनते हैं।
लेखकों ने GELAN को विशेष रूप से छोटी से छोटी वास्तुकला से अधिकतम सटीकता निकालने के लिए डिज़ाइन किया था।
GELAN दो मुख्य निर्माण खंडों का उपयोग करता है जो एक साथ ढेर किए जाते हैं:
- कुशल परत समूहीकरण ब्लॉक – वे नेटवर्क शाखाओं में से एक के बाद एक परिवर्तनों को एकत्र करते हैं ताकि बहु-स्केल विशेषताओं को कुशलता से पकड़ा जा सके।
- गणनात्मक ब्लॉक – CSPNet ब्लॉक परतों में से एक के बाद एक जानकारी को प्रसारित करने में मदद करते हैं। कोई भी ब्लॉक गणना सीमाओं के आधार पर प्रतिस्थापित किया जा सकता है।
इन ब्लॉकों को सावधानी से संतुलित और संयोजित करके, GELAN प्रदर्शन, पैरामीटर और गति के बीच मीठा स्थान मारा जाता है। समान मॉड्यूलर वास्तुकला विभिन्न मॉडल आकार और हार्डवेयर के साथ ऊपर या नीचे की ओर स्केल कर सकती है।
प्रयोगों से पता चला कि GELAN ने पिछले YOLO वास्तुकला की तुलना में छोटे मॉडलों में अधिक प्रदर्शन फिट किया। उदाहरण के लिए, GELAN-Small ने 7M पैरामीटर के साथ YOLOv7-Nano के 11M पैरामीटर को पार किया। और GELAN-Medium ने 20M पैरामीटर के साथ YOLOv7 मीडियम मॉडल के 35-40M पैरामीटर के साथ प्रदर्शन किया।
तो GELAN के डिज़ाइन द्वारा एक पैरामीटरीकृत वास्तुकला विशेष रूप से दक्षता के लिए अनुकूलित, मॉडलों को तेजी से और अधिक संसाधन-सीमित उपकरणों पर चलने की अनुमति देता है। अगले हम देखेंगे कि PGI उन्हें बेहतर प्रशिक्षित करने में कैसे मदद करता है।
प्रोग्रामेबल ग्रेडिएंट जानकारी (PGI) के साथ बेहतर प्रशिक्षण
मॉडल प्रशिक्षण सटीकता को अधिकतम करने के लिए उतना ही महत्वपूर्ण है जितना कि सीमित संसाधनों के साथ। YOLOv9 के लेखकों ने छोटे मॉडलों को प्रशिक्षित करने से संबंधित मुद्दों की पहचान की जो अस्थिर ग्रेडिएंट जानकारी के कारण होते हैं।
ग्रेडिएंट निर्धारित करते हैं कि प्रशिक्षण के दौरान मॉडल के वजन कितने अद्यतन किए जाते हैं। शोर या भ्रामक ग्रेडिएंट खराब अभिसरण का कारण बनते हैं। यह समस्या छोटे नेटवर्क के लिए और भी अधिक प्रमुख हो जाती है।
गहरी पर्यवेक्षण की तकनीक इसे अतिरिक्त पक्ष शाखाओं के साथ जोड़कर संबोधित करती है जो बेहतर ग्रेडिएंट सिग्नल को प्रसारित करने के लिए नुकसान के साथ हैं। लेकिन यह अक्सर छोटे मॉडलों के लिए टूट जाता है, जिससे विभिन्न शाखाओं के बीच हस्तक्षेप और विचलन होता है।

YOLOv9: प्रोग्रामेबल ग्रेडिएंट जानकारी का उपयोग करके सीखना कि आप क्या सीखना चाहते हैं https://arxiv.org/abs/2402.13616
इस सीमा को पार करने के लिए, YOLOv9 प्रोग्रामेबल ग्रेडिएंट जानकारी (PGI) पेश करता है। PGI के दो मुख्य घटक हैं:
- ऑक्सिलरी रिवर्सिबल शाखाएं – वे ब्लॉक जैसे RevCols का उपयोग करके इनपुट में वापस रिवर्सिबल कनेक्शन प्रदान करते हैं। यह शोर ग्रेडिएंट से बचाता है।
- मल्टी-लेवल ग्रेडिएंट एकीकरण – यह एक फ्यूजन ब्लॉक के माध्यम से सभी शाखाओं से ग्रेडिएंट को एकत्र करता है इससे पहले कि यह मुख्य मॉडल में वापस फीड हो। यह विभिन्न शाखाओं के बीच विचलन को रोकता है।
अधिक विश्वसनीय ग्रेडिएंट उत्पन्न करके, PGI प्रशिक्षण अभिसरण और दक्षता में सुधार करता है:
प्रयोगों से पता चला कि PGI ने सभी मॉडल आकारों में सटीकता में सुधार किया, विशेष रूप से छोटे कॉन्फ़िगरेशन में। उदाहरण के लिए, यह YOLOv9-Small के AP स्कोर को 0.1-0.4% बेसलाइन GELAN-Small पर बढ़ाता है। गहरे मॉडल जैसे YOLOv9-E में लाभ और भी महत्वपूर्ण थे जो 55.6% mAP पर पहुंचे।
तो PGI छोटे, कुशल मॉडलों को पहले केवल अधिक पैरामीटर वाले मॉडलों द्वारा प्राप्त की गई उच्च सटीकता स्तरों तक प्रशिक्षित करने की अनुमति देता है।
YOLOv9 दक्षता के लिए एक नए राज्य-ऑफ-द-आर्ट की स्थापना करता है
GELAN की वास्तुकला उन्नति और PGI से प्रशिक्षण में सुधार को मिलाकर, YOLOv9 अप्रत्याशित दक्षता और प्रदर्शन प्राप्त करता है:
- YOLOv9 पिछले YOLO संस्करणों की तुलना में 10-15% कम पैरामीटर और 25% कम गणना के साथ बेहतर सटीकता प्राप्त करता है। यह गति और क्षमता में बड़े सुधार लाता है।
- YOLOv9 YOLO-MS और RT-DETR जैसे अन्य वास्तविक समय डिटेक्टरों को पैरामीटर दक्षता और FLOPs के मामले में पार करता है। यह एक निश्चित प्रदर्शन स्तर तक पहुंचने के लिए बहुत कम संसाधनों की आवश्यकता है।
- YOLOv9 के छोटे मॉडल甚至 RT-DETR-X जैसे बड़े पूर्व-प्रशिक्षित मॉडलों को पार करते हैं। 36% कम पैरामीटर का उपयोग करते हुए, YOLOv9-E 55.6% AP प्राप्त करता है अधिक कुशल वास्तुकला के माध्यम से।
तो दक्षता को वास्तुकला और प्रशिक्षण स्तर पर संबोधित करके, YOLOv9 सीमित संसाधनों के भीतर प्रदर्शन को अधिकतम करने के लिए एक नए राज्य-ऑफ-द-आर्ट की स्थापना करता है।
GELAN – दक्षता के लिए अनुकूलित वास्तुकला
YOLOv9 एक नई वास्तुकला पेश करता है जिसे सामान्य कुशल परत समूहीकरण नेटवर्क (GELAN) कहा जाता है, जो न्यूनतम पैरामीटर बजट के भीतर सटीकता को अधिकतम करता है। यह पिछले YOLO मॉडलों पर बनता है लेकिन विभिन्न घटकों को विशेष रूप से दक्षता के लिए अनुकूलित करता है।

YOLOv9: प्रोग्रामेबल ग्रेडिएंट जानकारी का उपयोग करके सीखना कि आप क्या सीखना चाहते हैं
https://arxiv.org/abs/2402.13616
CSPNet और ELAN पर पृष्ठभूमि
हाल के YOLO संस्करणों ने CSPNet (क्रॉस-स्टेज पार्श्व नेटवर्क) पर आधारित बैकबोन का उपयोग किया है जो दक्षता में सुधार के लिए है:
यह समानांतर नेटवर्क शाखाओं में से एक के बाद एक फीचर मैप को एकत्र करने की अनुमति देता है, जो केवल परतों को क्रमिक रूप से ढेर करने की तुलना में अधिक कुशल है।
YOLOv7 ने CSPNet को ELAN (कुशल परत समूहीकरण नेटवर्क) में अपग्रेड किया, जिसने ब्लॉक संरचना को सरल बनाया:
ELAN ने परतों के बीच शॉर्टकट कनेक्शन को हटा दिया और आउटपुट पर एक समूहीकरण नोड के साथ। यह पैरामीटर और FLOPs दक्षता में और सुधार करता है।
ELAN को लचीली दक्षता के लिए सामान्यीकरण
लेखकों ने ELAN को और भी आगे बढ़ाकर GELAN बनाया, जो YOLOv9 में उपयोग की जाने वाली बैकबोन है:
- इंटरचेंजेबल कंप्यूटेशनल ब्लॉक – पिछले ELAN में निश्चित कन्वोल्यूशनल परतें थीं। GELAN किसी भी कंप्यूटेशनल ब्लॉक जैसे ResNets या CSPNet को प्रतिस्थापित करने की अनुमति देता है, जो अधिक वास्तुकला विकल्प प्रदान करता है।
- गहराई-वार पैरामीटरीकरण – मुख्य शाखा बनाम समूहीकरण शाखा के लिए अलग-अलग ब्लॉक गहराई संसाधन उपयोग को सरल बनाती है।
- विभिन्न कॉन्फ़िगरेशन में स्थिर प्रदर्शन – GELAN विभिन्न ब्लॉक प्रकार और गहराई के साथ सटीकता बनाए रखता है, जो लचीली स्केलिंग की अनुमति देता है।
इन परिवर्तनों से GELAN एक मजबूत लेकिन कॉन्फ़िगर करने योग्य बैकबोन बन जाता है जो दक्षता को अधिकतम करता है:
प्रयोगों में, GELAN मॉडल ने लगातार पिछले YOLO वास्तुकला को प्रति पैरामीटर सटीकता में पार किया:
- GELAN-Small ने 7M पैरामीटर के साथ YOLOv7-Nano के 11M पैरामीटर को पार किया
- GELAN-Medium ने भारी YOLOv7 मॉडल के 35-40M पैरामीटर के साथ मेल खाया
तो GELAN एक अनुकूलित बैकबोन प्रदान करता है जो YOLO को विभिन्न दक्षता लक्ष्यों में स्केल करने की अनुमति देता है। अगले हम देखेंगे कि PGI उन्हें बेहतर प्रशिक्षित करने में कैसे मदद करता है।
PGI – सभी मॉडल आकारों के लिए सुधारित प्रशिक्षण
जबकि वास्तुकला चुनाव अनुमान समय के दौरान दक्षता को प्रभावित करते हैं, प्रशिक्षण प्रक्रिया भी मॉडल संसाधन उपयोग को प्रभावित करती है। YOLOv9 एक नई तकनीक का उपयोग करता है जिसे प्रोग्रामेबल ग्रेडिएंट जानकारी (PGI) कहा जाता है ताकि विभिन्न मॉडल आकारों और जटिलता पर प्रशिक्षण में सुधार किया जा सके।
अविश्वसनीय ग्रेडिएंट की समस्या
प्रशिक्षण के दौरान, एक नुकसान कार्य मॉडल आउटपुट और ग्राउंड ट्रुथ लेबल की तुलना करता है और पैरामीटर को अद्यतन करने के लिए एक त्रुटि ग्रेडिएंट गणना करता है। शोर या भ्रामक ग्रेडिएंट खराब अभिसरण और दक्षता का कारण बनते हैं।
बहुत गहरे नेटवर्क इसे जानकारी बोतलनेक के माध्यम से बढ़ाते हैं – गहरी परतों से ग्रेडिएंट भ्रामक हो जाते हैं क्योंकि संकेत खो जाते हैं या संकुचित हो जाते हैं।
गहरी पर्यवेक्षण इसे अतिरिक्त पक्ष शाखाओं के साथ जोड़कर मदद करता है जो बेहतर ग्रेडिएंट प्रदान करते हैं। लेकिन यह अक्सर छोटे मॉडलों के लिए टूट जाता है, जिससे विभिन्न शाखाओं के बीच हस्तक्षेप और विचलन होता है।
तो हमें एक तरीके की आवश्यकता है जो सभी मॉडल आकारों में विश्वसनीय ग्रेडिएंट प्रदान करता है, विशेष रूप से छोटे लोगों के लिए।
प्रोग्रामेबल ग्रेडिएंट जानकारी (PGI) की शुरुआत
अविश्वसनीय ग्रेडिएंट को संबोधित करने के लिए, YOLOv9 प्रोग्रामेबल ग्रेडिएंट जानकारी (PGI) प्रस्तावित करता है। PGI के दो मुख्य घटक हैं जो ग्रेडिएंट गुणवत्ता में सुधार करने के लिए डिज़ाइन किए गए हैं:
1. ऑक्सिलरी रिवर्सिबल शाखाएं
अतिरिक्त शाखाएं ब्लॉक जैसे RevCols का उपयोग करके इनपुट में वापस रिवर्सिबल कनेक्शन प्रदान करती हैं। यह शोर ग्रेडिएंट से बचाता है।
2. मल्टी-लेवल ग्रेडिएंट एकीकरण
एक फ्यूजन ब्लॉक सभी शाखाओं से ग्रेडिएंट को एकत्र करता है इससे पहले कि यह मुख्य मॉडल में वापस फीड हो। यह विभिन्न शाखाओं के बीच विचलन को रोकता है।
अधिक विश्वसनीय ग्रेडिएंट उत्पन्न करके, PGI प्रशिक्षण अभिसरण और दक्षता में सुधार करता है:
- लाइटवेट मॉडल गहरी पर्यवेक्षण से लाभान्वित होते हैं जो वे पहले उपयोग नहीं कर सकते थे
- बड़े मॉडल साफ ग्रेडिएंट प्राप्त करते हैं जो बेहतर सामान्यीकरण की अनुमति देते हैं
प्रयोगों से पता चला कि PGI ने छोटे और बड़े YOLOv9 कॉन्फ़िगरेशन दोनों में सटीकता में सुधार किया:
- +0.1-0.4% AP के लिए YOLOv9-Small
- +0.5-0.6% AP के लिए बड़े YOLOv9 मॉडल
तो PGI के प्रोग्रामेबल ग्रेडिएंट छोटे और बड़े मॉडल दोनों को अधिक कुशलता से प्रशिक्षित करने की अनुमति देते हैं।
YOLOv9 सटीकता के लिए एक नए राज्य-ऑफ-द-आर्ट की स्थापना करता है
GELAN से वास्तुकला में सुधार और PGI से प्रशिक्षण में सुधार को मिलाकर, YOLOv9 वास्तविक समय वस्तु पता लगाने के लिए एक नए राज्य-ऑफ-द-आर्ट परिणाम प्राप्त करता है।
COCO डेटासेट पर प्रयोग YOLOv9 को पिछले YOLO संस्करणों और YOLO-MS जैसे अन्य वास्तविक समय डिटेक्टरों को सटीकता और दक्षता में पार करते हुए दिखाते हैं:
कुछ मुख्य हाइलाइट्स:
- YOLOv9-Small YOLO-MS-Small को 10% कम पैरामीटर और गणना के साथ पार करता है
- YOLOv9-Medium YOLOv7 मॉडल को आधे से कम संसाधनों का उपयोग करके मेल खाता है
- YOLOv9-Large YOLOv8-X को 15% कम पैरामीटर और 25% कम FLOPs के साथ पार करता है
remarkably, छोटे YOLOv9 मॉडल甚至 RT-DETR-X जैसे भारी मॉडलों को पार करते हैं जो पूर्व-प्रशिक्षित हैं। 4 गुना कम पैरामीटर का उपयोग करते हुए, YOLOv9-E RT-DETR-X को सटीकता में पार करता है।
इन परिणामों से YOLOv9 की श्रेष्ठ दक्षता का प्रदर्शन होता है। सुधार वास्तविक दुनिया के उपयोग मामलों में उच्च सटीकता वाले वस्तु पता लगाने को सक्षम बनाते हैं।
YOLOv9 अपग्रेड पर मुख्य बिंदु
आइए YOLOv9 के प्रदर्शन को एक नए राज्य-ऑफ-द-आर्ट तक ले जाने वाले कुछ मुख्य उन्नति और नवाचारों पर जल्दी से नज़र डालें:
- GELAN अनुकूलित वास्तुकला – यह लचीले समूहीकरण ब्लॉक के माध्यम से पैरामीटर दक्षता में सुधार करता है। यह मॉडलों को विभिन्न लक्ष्यों के लिए स्केल करने की अनुमति देता है।
- प्रोग्रामेबल ग्रेडिएंट जानकारी – यह विश्वसनीय ग्रेडिएंट के माध्यम से प्रशिक्षण में सुधार करता है। यह मॉडल आकार में सुधार करता है।
- कम संसाधनों के साथ बेहतर सटीकता – यह YOLOv8 की तुलना में 10-15% कम पैरामीटर और 25% कम गणना के साथ बेहतर सटीकता प्राप्त करता है। यह तेज़ अनुमान को सक्षम बनाता है।
- मॉडल आकार में श्रेष्ठ परिणाम – यह हल्के, मध्यम और बड़े मॉडल कॉन्फ़िगरेशन के लिए एक नए राज्य-ऑफ-द-आर्ट की स्थापना करता है। यह भारी पूर्व-प्रशिक्षित मॉडलों को पार करता है।
- विस्तारित लागू करने योग्यता – उच्च दक्षता वास्तविक दुनिया के उपयोग मामलों में वस्तु पता लगाने के लिए अधिक व्यावहारिक बनाती है, जैसे कि एज डिवाइस पर।
YOLOv9 सटीकता, दक्षता और लागू करने योग्यता को सीधे संबोधित करके वस्तु पता लगाने को आगे बढ़ाता है। उन्नति एक मजबूत आधार प्रदान करती है भविष्य के नवाचारों के लिए इस महत्वपूर्ण कंप्यूटर दृष्टि क्षमता में।












