विचार नेता
वह विकृति जिसे आप नहीं देख सकते: क्यों ADAS कैमरा सिस्टम फ़ील्ड में विफल होते हैं और फिज़िक्स‑इनफ़ॉर्म्ड ML कैसे इसे बदलता है

मैं जो करता हूँ वह इस तरह है जैसे आप चश्मे की जोड़ी को पहनने से पहले ही यह भविष्यवाणी करना कि वह आपकी दृष्टि को कैसे विकृत करेगा — लेकिन यदि आप गलत होते हैं तो परिणाम सिरदर्द नहीं होते। वे 110 किमी/घंटा की गति पर एक विफल आपातकालीन ब्रेकिंग घटना होते हैं।
डिज़ाइन वेरिफिकेशन साइकिल के देर चरण में जब यह विफलता प्रकट हुई — ADAS फ्रंट कैमरा में गंभीर रेडियल और टैन्जेंशियल लेंस विकृति, जिसे केवल आपूर्तिकर्ता के साथ ऑप्टिकल असेंबली टॉलरेंस को लॉक करने के बाद ही पकड़ा गया। समाधान के लिए इमेजर‑टू‑लेंस‑माउंट ऑफसेट को मैन्युअली समायोजित करना, MTF और ग्रिड विकृति परीक्षणों को फिर से चलाना, और किसी भी देर‑स्तर DV विफलता के बाद उत्पन्न होने वाले क्रमिक प्रोग्राम माइलस्टोन जोखिम का प्रबंधन करना आवश्यक था। मूल कारण न तो कोई निर्माण दोष था और न ही अकेले कोई डिजाइन त्रुटि। यह कुछ अधिक संरचनात्मक था: कैमरा विकृति का वर्णन पूरी तरह प्रतिक्रियात्मक था। जब भौतिक प्रोटोटाइप मौजूद थे, तब ऑप्टिकल स्टैक को सस्ते में सुधारना बहुत देर हो चुका था।
उस घटना ने मुझे सीधे मशीन लर्निंग की ओर धकेल दिया। यदि कोई CNN, जो GAN‑सिंथेसाइज़्ड विकृति मानचित्रों पर प्रशिक्षित हो, लेंस के निर्माण से पहले ऑप्टिकल डिज़ाइन पैरामीटरों से बैरल, पिंचकशन और मूस्टैश विकृति जोखिम का पता लगा सके, तो DV आश्चर्य को पूरी तरह समाप्त किया जा सकता था। यही वह समस्या है जिस पर मैंने पिछले कई वर्षों में काम किया है: भौतिक सिमुलेशन और AI का उपयोग करके यह भविष्यवाणी करना कि गर्मी और यांत्रिक तनाव कैसे वाहन के संचालन जीवनकाल में कैमरे की ऑप्टिक्स को विकृत करेंगे, ताकि विफलताओं को अवधारणा चरण में सुधारा जा सके न कि उत्पादन द्वार पर खोजा जाए।
आगे जो है वह वह है जो मैंने सीखा है — आर्किटेक्चर, डेटा, विफलता मोड, और इस उद्योग के AI के बारे में बात करने के तरीके और उत्पादन प्रणालियों में AI के वास्तविक व्यवहार के बीच का अंतर।
आर्किटेक्चर: हार्डवेयर और ML का मिलन
सबसे गहराई से मैं जिस सिस्टम को जानता हूँ वह ADAS फ्रंट कैमरा प्लेटफ़ॉर्म है जो कई OEM प्रोग्रामों में तैनात है — एक सुरक्षा‑संकटपूर्ण मॉड्यूल जहाँ ऑप्टिकल असेंबली की भौतिकी और परसेप्शन ML पाइपलाइन का प्रदर्शन अविभाज्य हैं।
हार्डवेयर स्टैक एक मल्टी‑एलिमेंट लेंस बैरल (FOV वैरिएंट के आधार पर 6‑8 एलिमेंट डिज़ाइन) से शुरू होता है, जो सटीक मैकेनिकल हाउसिंग के माध्यम से CMOS इमेजर पर माउंट किया जाता है। मुख्य रे कोण मिलान लेंस के एग्ज़िट प्यूपिल और इमेजर माइक्रो‑लेन्स एरे के बीच एक महत्वपूर्ण संरेखण बाधा है — असंगति कोने की शेडिंग और फ़ील्ड‑निर्भर विकृति का मुख्य स्रोत है। इमेजर कच्चे Bayer‑पैटर्न फ्रेम को एक ISP को देता है जो डेमोसेइंग, शोर घटाव, और लेंस शेडिंग सुधार को संभालता है, इससे पहले कि परसेप्शन SoC को भेजा जाए।
ML विकृति पहचान पाइपलाइन भौतिक प्रोटोटाइपिंग से पहले स्थित है। डेटा प्रवाह:
- सिंथेटिक ऑप्टिकल पैरामीटर स्पेस (लेंस वक्रता त्रिज्या, एलिमेंट स्पेसिंग टोलरेंस, इमेजर टिल्ट एंगल, मुख्य रे कोण विचलन)
- भौतिक‑शर्तित cGAN U‑Net जनरेटर के साथ वास्तविक विकृत फ्रेमों को सिंथेसाइज़ करता है पूरे FOV में
- ResNet-50 CNN वर्गीकर्ता जो ग्रेडिएंट मैग्निट्यूड इमेजों पर प्रशिक्षित है, पता लगाने के लिए बैरल, पिंचकशन, और मूस्टैश विकृति पैटर्न
- विकृति जोखिम स्कोर और स्थानिक हीट मैप आउटपुट — उच्च‑जोखिम वाले FOV क्षेत्रों को संकेत करता है, इससे पहले कि कोई भौतिक लेंस निर्मित हो
वैनिला DC‑GAN की बजाय भौतिक‑शर्तित cGAN क्यों? DC‑GAN रैंडम लेटेंट वेक्टर्स से इमेज बनाता है — यह प्रशिक्षण इमेजों का मार्जिनल वितरण सीखता है, न कि किसी विशिष्ट FEA डिफॉर्मेशन स्टेट के दिए गए शर्तीय वितरण को। विकृति मानचित्र सिंथेसिस के लिए यह अंतर निर्णायक है। U‑Net जनरेटर के साथ भौतिक‑शर्तित cGAN जनरेटर और डिस्क्रिमिनेटर दोनों को इनपुट FEA डिफॉर्मेशन फ़ील्ड पर शर्तित करता है, जिससे मॉडल भौतिक डिफॉर्मेशन स्टेट से ऑप्टिकल विकृति पैटर्न तक का मैपिंग सीखता है। U‑Net की स्किप कनेक्शन कोने के FOV क्षेत्रों में सब‑पिक्सेल विकृति ग्रेडिएंट को संरक्षित रखते हैं, जो एक मानक एन्कोडर‑डिकोडर द्वारा क्रमिक डाउनसैंपलिंग से खो जाता है — और ये कोने के ग्रेडिएंट DV विफलता पूर्वानुमान के लिए मुख्य संकेत हैं।
शुद्ध रिग्रेशन CNN क्यों नहीं? रिग्रेशन मॉडल प्रशिक्षण सेट में औसत वर्ग त्रुटि को न्यूनतम करते हैं, कोनों पर पीक विकृति को व्यवस्थित रूप से कम आंकते हैं। GAN का प्रतिद्वंद्वात्मक उद्देश्य जनरेटर को तीक्ष्ण, उच्च‑कॉन्ट्रास्ट विकृति मानचित्र उत्पन्न करने के लिए प्रेरित करता है — जो अनायास ही पीक परिमाण को संरक्षित रखता है, जिसे रिग्रेशन मॉडल स्मूथ कर देता है। जब DV विफलता थ्रेशोल्ड एक कठोर सीमा होती है (कोना MTF50 < 25% या विकृति > 3 px स्थानीय), तो पीकों को कम आंकना रूढ़िवादी त्रुटि नहीं है। यह एक चूकी हुई विफलता भविष्यवाणी है।
वास्तव में महत्वपूर्ण मीट्रिक्स
ऑप्टिकल और ML प्रदर्शन मीट्रिक्स को साथ‑साथ ट्रैक किया जाता है, क्योंकि एक के बिना दूसरा अधूरा है।
ऑप्टिकल परसेप्शन गुणवत्ता
- MTF50: लक्ष्य ≥45–50% छवि केंद्र पर, ≥30% कोनों पर। DV विफलता कोने में MTF50 <25% या केंद्र‑से‑कोना गिरावट पर ट्रिगर होती है 40% से अधिक — वह बिंदु जहाँ डाउनस्ट्रीम परसेप्शन एल्गोरिदम FOV परिधि में विश्वसनीय एज डिटेक्शन खो देते हैं।
- ज्यामितीय विकृति: लक्ष्य ≤2 px RMS पूरे FOV में। DV विफलता 3 px स्थानीय विकृति या आदर्श प्रक्षेपण मॉडल से ≥1.5–2% विचलन पर — जहाँ लेन डिपार्चर और वस्तु दूरी अनुमान त्रुटियाँ सुरक्षा‑संबंधी बन जाती हैं।
- थर्मल स्थिरता: ऑपरेटिंग रेंज −40°C से +85°C। स्वीकार्य इमेज शिफ्ट ≤1–2 px (≈5–10 µm सेंसर प्लेन पर)। DV विफलता 3 px शिफ्ट या गैर‑रेखीय विकृति की शुरुआत। गैर‑रेखीयता महत्वपूर्ण संकेत है: एक रेखीय शिफ्ट फर्मवेयर‑सुधार योग्य है; गैर‑रेखीय ड्रिफ्ट अंतर्निहित कैलिब्रेशन मैट्रिक्स को पूरी तरह अमान्य कर देती है।
एमएल मॉडल प्रदर्शन
- डिटेक्शन: लक्ष्य mAP ≥0.90, IoU ≥0.75–0.80। प्राप्त mAP 0.92–0.95, IoU 0.78–0.85 बाहर रखे गए सिंथेटिक वैलिडेशन सेटों पर।
- त्रुटि दरें: FPR लक्ष्य ≤5%, FNR लक्ष्य ≤3%。 प्राप्त FPR 3–5%, FNR 2–3%。 असमानता इरादतन है — एक छूट गई विकृति विफलता (FN) एक सुरक्षा‑महत्वपूर्ण कैमरा प्रोग्राम में गलत अलार्म से उत्पन्न अनावश्यक इंजीनियरिंग समीक्षा से स्पष्ट रूप से अधिक बुरी है।
- प्रशिक्षण स्वास्थ्य: जनरेटर/डिस्क्रिमिनेटर लॉस बैलेंस को पूरे GAN प्रशिक्षण के दौरान TensorBoard द्वारा ट्रैक किया गया । एक ढहता हुआ डिस्क्रिमिनेटर सबसे खतरनाक प्रशिक्षण विफलता — मिनी‑बैचों में डिस्क्रिमिनेटर आत्मविश्वास की निगरानी द्वारा जल्दी पकड़ा गया।
मैंने हल की सबसे कठिन समस्या
मैंने निदान किया सबसे जटिल विफलता एकल दोष नहीं थी — यह एक थर्मल‑मैकेनिकल‑ऑप्टिकल कपलिंग विफलता थी जो 6–8 सप्ताह ले गई पूरी तरह से चार टीमों में विघटित होने में और अंततः अवधारणा चरण से कार्यक्रम में अंतर्निहित धारणाओं की पुनः जाँच की आवश्यकता थी।
लक्षण स्पष्ट था: कोने का MTF50 +85°C पर थर्मल सोक के दौरान 25% DV विफलता थ्रेशहोल्ड से नीचे गिर गया, और एक गैर‑रेखीय विकृति पैटर्न उभरा जो कमरे के तापमान पर अनुपस्थित था। गैर‑रेखीयता महत्वपूर्ण लाल झंडा थी — एक रैखिक थर्मल‑प्रेरित शिफ्ट अंतर्निहित कैलिब्रेशन मैट्रिक्स में सुधारा जा सकता है, लेकिन गैर‑रेखीय विकृति कैलिब्रेशन को पूरी तरह अमान्य कर देती है और उत्पादन में फर्मवेयर‑पैच नहीं किया जा सकता।
निदान क्रम
- IR थर्मोग्राफी लेन्स बैरल में असमान थर्मल ग्रेडिएंट दिखाया — विभिन्न थर्मल कंडक्टिविटी के कारण असममित हीटिंग के बीच हाउसिंग सामग्री और चिपकने वाले बंधन परत।
- FEA थर्मल विस्तार मॉडलिंग 12–15 µm लेंस डीसेंटर +85°C पर भविष्यवाणी किया, CTE असंगति UV‑क्योर एपॉक्सी और एल्युमीनियम हाउसिंग के बीच। महत्वपूर्ण रूप से, चिपकने वाला क्रीप सतत थर्मल लोड के तहत — समय‑निर्भर, अपरिवर्तनीय विकृति।
- सहिष्णुता स्टैक‑अप विश्लेषण प्रकट किया कि यह डीसेंटर, मानक इमेजर सिटिंग ऊँचाई सहिष्णुता (±8 µm), संयुक्त मुख्य किरण को कोण विचलन इमेजर माइक्रो‑लेन्स स्वीकृति शंकु से परे धकेलता है। कोई एकल योगदानकर्ता अलग‑थलग विफल नहीं हुआ।
समाधान के लिए तीन समन्वित परिवर्तन आवश्यक थे: फ़ील्ड कर्वेचर क्षतिपूर्ति को पुनर्वितरित करने के लिए लेंस प्रिस्क्रिप्शन को संशोधित किया, CTE लीवर आर्म को कम करने के लिए बंधन जॉइंट ज्योमेट्री को संशोधित किया, और हाउसिंग बंधन पॉकेट के लिए आपूर्तिकर्ता के छोटे‑स्तर के पुनः‑टूलिंग। एक अतिरिक्त DV थर्मल साइकिल ने पुनर्प्राप्ति की पुष्टि की। प्रोग्राम प्रभाव: 2–3 सप्ताह की माइलस्टोन देरी, एक अतिरिक्त DV/PV परीक्षण साइकिल।
उत्पादन तक पहुँचने वाले विफलता मोड लगभग कभी भी आपके सामान्य‑केस विश्लेषण में नहीं होते। वे आपके धारणाओं की सीमा पर होते हैं — जहाँ आपके सिस्टम मॉडल की सटीकता समाप्त हो जाती है।
यह विफलता सीधे एमएल डिटेक्शन पाइपलाइन को आकार दिया। यदि FEA थर्मल विकृति पूर्वानुमानों को CV पर प्रशिक्षित विकृति मॉडल के साथ संबंधित किया गया होता, तो चिपकने वाले क्रीप जोखिम को एकल प्रोटोटाइप बनने से पहले ही उच्च‑जोखिम वाले FOV क्षेत्र के रूप में चिन्हित किया जाता।
डेटा समस्या जिसके बारे में कोई बात नहीं करता
मैंने हल किया सबसे गड़बड़ डेटा समस्या थी सिंथेटिक GAN प्रशिक्षण डेटासेट में असंगत और अनुपस्थित लेबल — और इसे वास्तव में कठिन बनाने वाला कारण यह था कि लेबल भौतिक‑आधारित थे, मानव‑एनोटेटेड नहीं। यह अंतर लेबल त्रुटियों के व्यवहार को पूरी तरह बदल देता है।
डेटासेट में 180 FEA सिमुलेशन शामिल थे जो 18,000 सिंथेटिक इमेज पेयर उत्पन्न करते थे — थर्मल और विकृति फ़ील्ड .npy एरेज़ के रूप में, .png विकृति मानचित्रों और एक master labels.csv के साथ जोड़े गए। तीन विफलता मोड को स्पष्ट पाइपलाइन हस्तक्षेप की आवश्यकता थी:
- FEA ग्रिड रेज़ोल्यूशन असंगति: असमान मेष घनत्व ने स्थानिक असततता उत्पन्न की जब समान CNN इनपुट ग्रिड पर रास्टराइज़ किया गया। समाधान: scipy griddata के साथ क्यूबिक इंटरपोलेशन, द्विआधारी री‑सैंपलिंग को प्रतिस्थापित करता है।
- अपूर्ण सिमुलेशन निर्यात: FEA रन जल्दी समाप्त हुए और आंशिक .npy फ़ाइलें NaN फ़ील्ड्स के साथ लिखी या शून्य-विकृति एरे — शारीरिक रूप से असंभव आउटपुट जो मॉडल को सिखा देगा कि अत्यधिक के लिए कोई विकृति सही नहीं है थर्मल इनपुट। समाधान: पोस्ट-जनरेशन स्कैन जो NaN भाग को हटाता है >0.1% और शून्य-फ़ील्ड मामलों।
- निर्देशांक रूपांतरण विसंगति: FEA-से-इमेज निर्देशांक रूपांतरण में एक ऑफ-बाय-वन इंडेक्सिंग त्रुटि रूपांतरण ने ~6–8% नमूनों को प्रभावित किया — दृश्य विकृति मानचित्र ओवरले की जांच, स्वचालित जाँचों के लिए अदृश्य।
वितरण असंतुलन समान रूप से महत्वपूर्ण था: डेटासेट मध्यम थर्मल मामलों (20°C–60°C) में अधिक प्रतिनिधित्व रखता था और अत्यधिक स्थितियों (−40°C और +85°C) में गंभीर रूप से कम प्रतिनिधित्व था — ठीक वही संचालन स्थितियाँ जो DV पास/फ़ेल को निर्धारित करती हैं। 800 अतिरिक्त एज-केस नमूनों को मैन्युअल रूप से पुनः उत्पन्न किया गया ताकि अत्यधिक मामलों का प्रतिनिधित्व कुल नमूनों में 2.2% से बढ़कर 6.8% हो जाए।
मुख्य निष्कर्ष: भौतिकी-आधारित लेबल स्वचालित रूप से भरोसेमंद नहीं होते।संख्यात्मक अस्थिरता, रिज़ॉल्यूशन असंगतियां, और निर्देशांक प्रणाली त्रुटियां लेबल शोर उत्पन्न करती हैं जो विशिष्ट इनपुट स्थितियों से संबंधित होती हैं — जिससे मॉडल उन परिदृश्यों में पक्षपाती हो जाता है जहाँ आपको सबसे अधिक विश्वसनीय भविष्यवाणियों की आवश्यकता होती है।
उद्योग द्वारा अनदेखा किया गया जोखिम
वितरण परिवर्तन, एल्गोरिदमिक पक्षपात, और विरोधी हमलों के अच्छी तरह से दस्तावेज़ीकृत जोखिमों के अलावा, ADAS उद्योग प्रणालीगत रूप से कम आकलन कर रहा है थर्मल साइक्लिंग और यांत्रिक वृद्धावस्था द्वारा प्रेरित सेवा-के दौरान कैलिब्रेशन ड्रिफ्ट।
कैमरा सिस्टम को SOP स्थितियों पर मान्य किया जाता है — एक परिभाषित थर्मल, यांत्रिक, और पर्यावरणीय स्थितियों का सेट जिसे कैमरे को उत्पादन स्वीकृति पर सहना पड़ता है। यह मान्यकरण कठोर है। जो यह कवर नहीं करता वह है दोहराए गए थर्मल साइक्लिंग, सामग्री क्रीप, माउंटिंग तनाव विश्राम, और सड़क कंपन लोडिंग का संचयी प्रभाव, जो 100,000 किलोमीटर और दस वर्षों के वाहन संचालन पर होता है।
तंत्र अच्छी तरह समझा गया है: विभिन्न सामग्रियों के बीच चिपकने वाले क्रीप और CTE असमानता लेंस-से-इमेजर सापेक्ष स्थिति में धीमी, समय-निर्भर शिफ्ट्स को प्रेरित करती हैं। तीन वर्षों के तापमान साइक्लिंग (−30°C से +70°C) के बाद, लेंस बैरल इमेजर की तुलना में 8–12 µm तक क्रीप कर सकता है। ECU में संग्रहीत अंतर्निहित कैलिब्रेशन मैट्रिक्स अब भौतिक ऑप्टिक्स को सटीक रूप से दर्शाता नहीं है। ऑब्जेक्ट दूरी अनुमान प्रणालीगत रूप से पक्षपाती होते हैं — एकल फ्रेम में अदृश्य होने के लिए पर्याप्त छोटे, लेकिन हाईवे गति पर ऑटोमैटिक इमरजेंसी ब्रेकिंग सक्रियता थ्रेशोल्ड के लिए पर्याप्त बड़े।
उद्योग की प्रतिक्रिया दो विशिष्ट तरीकों में अपर्याप्त है: आवधिक पुनःकैलिब्रेशन मानकीकृत नहीं है (समय-निर्भर क्षय तंत्रों को अच्छी तरह समझते हुए भी कोई निर्धारित कैमरा पुनःकैलिब्रेशन अंतराल नहीं है), और सेवा-के दौरान निगरानी आवश्यक नहीं है (SOTIF SOP पर कार्यात्मक अपर्याप्तता को संबोधित करता है; यह संचालन जीवनकाल के दौरान कार्यात्मक क्षय को नहीं संबोधित करता।)
परिणाम एक छिपी हुई विफलता मोड जनसंख्या है: फ़ील्ड में वाहन जिनके पर्सेप्शन सिस्टम पुराने कैलिब्रेशन मैट्रिक्स पर कार्य कर रहे हैं, जो व्यक्तिगत रूप से थ्रेशोल्ड से नीचे लेकिन बड़े बेड़े में सामूहिक रूप से महत्वपूर्ण मात्रा में क्षय हो चुके हैं।
वह मिथक जो लोगों की जान ले सकता है
स्वायत्त प्रणालियों में सबसे व्यापक और खतरनाक मिथक यह है कि उच्च समग्र मॉडल सटीकता सीधे सुरक्षित सिस्टम में परिवर्तित होती है।
mAP मूल्यांकन डेटासेट की वर्ग और परिदृश्य वितरण पर औसत है। यह प्रत्येक नमूने को समान रूप से वजन देता है। एक उत्पादन ADAS सिस्टम परिदृश्यों को समान आवृत्ति से नहीं देखता — यह हाईवे लेन कीपिंग को दस हज़ार गुना अधिक बार देखता है, जबकि पार्क किए वाहन के पीछे से आंशिक रूप से बाधित बच्चे के सड़क में दौड़ने की स्थिति बहुत कम बार होती है। एक मॉडल जो mAP को 0.02 से सुधारता है, उच्च-आवृत्ति वाले सामान्य परिदृश्यों में थोड़ा बेहतर हो कर, जबकि दुर्लभ सुरक्षा-क्रिटिकल परिदृश्यों में अपरिवर्तित रहता है, वह सुरक्षा में सार्थक सुधार नहीं करता। यह केवल मीट्रिक को सुधारा है।
मैंने इसे सीधे देखा। एक मॉडल जो मानक बेंचमार्क पर mAP 0.95 उत्पन्न करता है, फिर भी सूर्य चमक कोण, लेन मार्किंग क्षरण, और वाहन ज्योमेट्री के विशिष्ट संयोजन पर, जिसे प्रशिक्षण डेटा ने पर्याप्त रूप से प्रतिनिधित्व नहीं किया, एक आत्मविश्वासी, उच्च-प्रायिकता वाला फॉल्स नेगेटिव उत्पन्न कर सकता है। 110 km/h पर वह फॉल्स नेगेटिव एक सुरक्षा घटना है। 0.95 mAP ने इसे रोक नहीं पाया।
सुरक्षा-क्रिटिकल पर्सेप्शन में विश्वसनीयता को वास्तव में निर्धारित करने वाले गुणों का एक अलग सेट है:
- विफलता मोड की गंभीरता और विफलता मोड की पहचान क्षमता — क्या मॉडल चुपचाप विफल हो जाता है या कम‑विश्वास आउटपुट उत्पन्न करता है जो फॉलबैक को ट्रिगर करता है?
- एज-केस व्यवहार ऑपरेशनल डिज़ाइन डोमेन की सीमाओं पर
- सिस्टम-स्तरीय अतिरिक्तता जो पर्सेप्शन विफलताओं को पकड़ता है इससे पहले कि वे नियंत्रण आउटपुट्स
- कैलिब्रेटेड अनिश्चितता — क्या मॉडल जानता है कि वह क्या नहीं जानता
उद्योग को mAP को मुख्य सुरक्षा संचार मीट्रिक के रूप में बदलना चाहिए और इसे परिदृश्य-स्तरीय प्रदर्शन रिपोर्टिंग — सामान्य स्थितियों, क्षीणित सेंसर स्थितियों, दुर्लभ वस्तु वर्गों, और ODD सीमा परिदृश्यों के लिए अलग मीट्रिक — के साथ मिलाकर स्पष्ट विफलता मोड विश्लेषण के साथ संयोजित करना चाहिए। जब तक यह परिवर्तन नहीं होता, कार्यक्रम ऐसे सिस्टम शिप करना जारी रखेंगे जो सांख्यिकीय रूप से प्रभावशाली होते हैं और कभी‑कभी उन परिदृश्यों में खतरनाक होते हैं जो सबसे अधिक मायने रखते हैं।
मैं एक जूनियर इंजीनियर को कल क्या बताऊँगा
सबसे महत्वपूर्ण सबक जो कोई स्नातक पाठ्यक्रम स्पष्ट रूप से नहीं सिखाता: मॉडल अकेले नहीं फेल होते। सिस्टम फेल होते हैं।
आप छह महीने खर्च करके एक परसेप्शन मॉडल बना सकते हैं जो mAP 0.93 प्राप्त करता है, साफ़ लॉस कर्व और ठोस IoU संख्याओं के साथ। फिर आप इसे वास्तविक कैमरा हार्डवेयर पर तैनात करते हैं और यह ऐसे तरीकों से फेल हो जाता है जिसका मॉडल आर्किटेक्चर से कोई संबंध नहीं है। कैमरा इंट्रिंसिक कैलिब्रेशन को आपके ऑपरेटिंग तापमान से 15°C अलग थर्मल कंडीशन पर अंतिम बार अपडेट किया गया था। डेटा पाइपलाइन में एक कोऑर्डिनेट ट्रांसफ़ॉर्म है जो कोने के FOV क्षेत्रों में 1‑पिक्सेल ऑफ़सेट जोड़ता है। इमेज प्री‑प्रोसेसिंग स्क्रिप्ट प्रशिक्षण पाइपलाइन से थोड़ा अलग नॉर्मलाइज़ेशन लागू करती है। इनमें से कोई भी मॉडल की समस्या नहीं है। सभी सिस्टम प्रदर्शन को बाधित करते हैं।
व्यावहारिक रूप से: हर नए प्रोजेक्ट के लिए, मॉडल को छूने से पहले, सेंसर आउटपुट से प्रशिक्षण लेबल तक पूरे डेटा पाथ को ट्रेस करें और हर चरण पर पूछें — इस चरण में कौन सा अनुमान लगाया गया है, और वह अनुमान कब टूटता है? उत्तर आपको उत्पादन में सिस्टम कहाँ फेल होगा, इस बारे में किसी भी आर्किटेक्चर प्रयोग से अधिक बताएगा।
वास्तविक इंजीनियरिंग प्रभाव भौतिकी, डेटा और सिस्टम प्रतिबंधों के प्रतिच्छेदन से आता है — न कि केवल मॉडल प्रदर्शन से। यही वह भाग है जो आप रिज्यूमे में नहीं देखेंगे, लेकिन यही वास्तविक इंजीनियरिंग होती है।
जहाँ यह क्षेत्र जा रहा है
तीन वर्षों में, सिंथेटिक डेटा जनरेशन और डिजिटल ट्विन एकीकरण मानक प्रथा बन जाएंगे ADAS कैमरा विकास पाइपलाइन में, न कि केवल अनुसंधान क्षमता। ऑप्टिकल और मैकेनिकल प्रथम सिद्धांतों को वास्तुशिल्पीय बाधाओं के रूप में सम्मिलित करने वाले फिज़िक्स‑इन्फॉर्म्ड ML मॉडल शुद्ध डेटा‑आधारित दृष्टिकोणों को परसेप्शन गुणवत्ता पूर्वानुमान के लिए बदल देंगे। ऑन‑डिवाइस सेल्फ‑कैलिब्रेशन — कैमरे के अपने परसेप्शन आउटपुट का उपयोग करके अंतर्निहित ड्रिफ्ट का पता लगाने और उसे सुधारने के लिए — अनुसंधान प्रोटोटाइप से उत्पादन सुविधा में बदल जाएगा।
जो समाधान नहीं होगा वह लम्बी‑पूंछ किनारे के केस समस्या है। संयोजित विफलता परिदृश्यों का संयोज्य स्थान — सेंसर क्षीणन, असामान्य सड़क ज्योमेट्री, दुर्लभ मौसम, और असामान्य रोड यूज़र व्यवहार का प्रतिच्छेदन — डेटा सेट आकार के साथ रैखिक रूप से नहीं घटता। यह अधिकतम शक्ति‑कानून के अनुसार घटता है, और पूंछ प्रभावी रूप से अनंत है। यह मानना कि स्केल इस समस्या को समाप्त कर देता है, वर्तमान उद्योग सोच में सबसे खतरनाक बात है। इंजीनियरिंग प्रतिक्रिया केवल अधिक डेटा नहीं है; यह रूढ़िवादी ऑपरेशनल डिज़ाइन डोमेन परिभाषा, मजबूत विफलता पहचान, और अंत‑उपयोगकर्ताओं को ईमानदार संचार है कि ये सिस्टम क्या विश्वसनीय रूप से संभाल नहीं सकते।
वह ईमानदार संचार ही वह भाग है जिसे उद्योग सबसे अधिक देने से हिचकिचाता है।












