एआई मॉडल और प्लेटफ़ॉर्म
AnomalyGPT: औद्योगिक विचलनों का पता लगाने के लिए एलवीएलएम का उपयोग
हाल ही में, लार्ज विजन लैंग्वेज मॉडल (एलवीएलएम) जैसे एलएवा और मिनी जीपीटी-4 ने छवियों को समझने और कई दृश्य कार्यों में उच्च सटीकता और दक्षता प्राप्त करने की क्षमता का प्रदर्शन किया है। जबकि एलवीएलएम सामान्य वस्तुओं को पहचानने में उत्कृष्ट हैं क्योंकि उनके व्यापक प्रशिक्षण डेटासेट हैं, उन्हें विशिष्ट डोमेन ज्ञान की कमी है और छवियों के भीतर स्थानीय विवरण की सीमित समझ है। यह उनकी प्रभावशीलता को औद्योगिक विचलन पता लगाने (आईएडी) कार्यों में सीमित करता है। दूसरी ओर, मौजूदा आईएडी फ्रेमवर्क केवल विचलन के स्रोतों की पहचान कर सकते हैं और सामान्य और असामान्य नमूनों के बीच अंतर करने के लिए मैनुअल थ्रेशोल्ड सेटिंग्स की आवश्यकता होती है, जिससे उनका व्यावहारिक कार्यान्वयन सीमित हो जाता है।
एक आईएडी फ्रेमवर्क का प्राथमिक उद्देश्य औद्योगिक परिदृश्यों और उत्पाद छवियों में विचलन का पता लगाना और स्थानीयकरण करना है। हालांकि, वास्तविक दुनिया के छवि नमूनों की अप्रत्याशितता और दुर्लभता के कारण, मॉडल आमतौर पर केवल सामान्य डेटा पर प्रशिक्षित होते हैं। वे असामान्य नमूनों को सामान्य नमूनों से विचलन के आधार पर अलग करते हैं। वर्तमान में, आईएडी फ्रेमवर्क और मॉडल मुख्य रूप से परीक्षण नमूनों के लिए विचलन स्कोर प्रदान करते हैं। इसके अलावा, प्रत्येक वस्तु वर्ग के लिए सामान्य और असामान्य उदाहरणों के बीच अंतर करने के लिए मैनुअल रूप से थ्रेशोल्ड निर्दिष्ट करने की आवश्यकता होती है, जो उन्हें वास्तविक दुनिया के अनुप्रयोगों के लिए उपयुक्त नहीं बनाता है।

आईएडी फ्रेमवर्क द्वारा उठाए गए चुनौतियों का सामना करने के लिए एलवीएलएम के उपयोग और कार्यान्वयन का अन्वेषण करने के लिए, एक नया आईएडी दृष्टिकोण एलवीएलएम पर आधारित अनोमली जीपीटी पेश किया गया था। अनोमली जीपीटी मैनुअल थ्रेशोल्ड सेटिंग्स की आवश्यकता के बिना विचलन का पता लगा सकता है और स्थानीयकरण कर सकता है। इसके अलावा, अनोमली जीपीटी छवि के बारे में प्रासंगिक जानकारी प्रदान कर सकता है और उपयोगकर्ताओं के साथ बातचीत करने की अनुमति देता है, जिससे वे विचलन या अपनी विशिष्ट आवश्यकताओं के आधार पर अनुवर्ती प्रश्न पूछ सकते हैं।
उद्योग विचलन पता लगाना और बड़े दृष्टि भाषा मॉडल
मौजूदा आईएडी फ्रेमवर्क को दो श्रेणियों में वर्गीकृत किया जा सकता है।
- पुनर्निर्माण-आधारित आईएडी।
- विशेषता एम्बेडिंग-आधारित आईएडी।
पुनर्निर्माण-आधारित आईएडी फ्रेमवर्क में, प्राथमिक उद्देश्य विचलन नमूनों को उनके संबंधित सामान्य प्रतिपक्ष नमूनों में पुनर्निर्माण करना है, और पुनर्निर्माण त्रुटि गणना द्वारा विचलन का पता लगाना है। एससीएडीएन, आरआईएडी, अनोडीडीपीएम, और इंट्रा विभिन्न पुनर्निर्माण फ्रेमवर्क का उपयोग करते हैं, जिनमें जनरेटिव एडवर्सेरियल नेटवर्क (जीएएन) और ऑटोएनकोडर से लेकर डिफ्यूजन मॉडल और ट्रांसफॉर्मर तक शामिल हैं।
दूसरी ओर, विशेषता एम्बेडिंग-आधारित आईएडी फ्रेमवर्क में, प्राथमिक प्रेरणा सामान्य डेटा की विशेषता एम्बेडिंग को मॉडल करना है। पैचएसएसवीडी जैसे तरीके एक हाइपरस्फियर को खोजने का प्रयास करते हैं जो सामान्य नमूनों को कसकर घेर सकता है, जबकि पाइरामिडफ्लो और सीएफएल जैसे फ्रेमवर्क सामान्य नमूनों को सामान्यीकरण प्रवाह का उपयोग करके एक गॉसियन वितरण पर प्रोजेक्ट करते हैं। सीएफए और पैचकोर फ्रेमवर्क ने पैच एम्बेडिंग से सामान्य नमूनों का एक मेमोरी बैंक स्थापित किया है, और विचलन का पता लगाने के लिए परीक्षण नमूने एम्बेडिंग और सामान्य एम्बेडिंग के बीच दूरी का उपयोग करते हैं।
दोनों तरीके “एक वर्ग एक मॉडल” सीखने के सिद्धांत का पालन करते हैं, जो प्रत्येक वस्तु वर्ग के वितरण को सीखने के लिए एक बड़ी संख्या में सामान्य नमूनों की आवश्यकता होती है। सामान्य नमूनों की बड़ी संख्या की आवश्यकता नए वस्तु वर्गों के लिए व्यावहारिक बनाती है और गतिशील उत्पाद वातावरण में इसके अनुप्रयोग सीमित हैं। दूसरी ओर, अनोमली जीपीटी फ्रेमवर्क वस्तु वर्गों के लिए एक संदर्भ सीखने के सिद्धांत का उपयोग करता है, जो इसे केवल कुछ सामान्य नमूनों के साथ हस्तक्षेप करने की अनुमति देता है।
अनोमली जीपीटी कैसे काम करता है
अनोमली जीपीटी मूल रूप से एक नया बातचीत आईएडी बड़ा दृष्टि भाषा मॉडल है जो औद्योगिक विचलन का पता लगाने और छवियों में उनके सटीक स्थान को इंगित करने के लिए डिज़ाइन किया गया है। अनोमली जीपीटी फ्रेमवर्क एक एलएलएम और एक पूर्व-प्रशिक्षित छवि एनकोडर का उपयोग करता है ताकि उत्तेजित विचलन डेटा का उपयोग करके छवियों को उनके संबंधित पाठ्य वर्णन के साथ संरेखित किया जा सके। मॉडल में एक डिकोडर मॉड्यूल और एक प्रॉम्प्ट लर्नर मॉड्यूल पेश किया जाता है ताकि आईएडी प्रणालियों के प्रदर्शन में सुधार किया जा सके और पिक्सेल-स्तरीय स्थानीयकरण आउटपुट प्राप्त किया जा सके।
मॉडल आर्किटेक्चर

उपरोक्त छवि अनोमली जीपीटी की वास्तुकला को दर्शाती है। मॉडल पहले प्रश्न छवि को जमे हुए छवि एनकोडर में पास करता है। मॉडल फिर मध्यवर्ती परतों से पैच-स्तरीय विशेषताओं को निकालता है और उन्हें एक छवि डिकोडर में खिलाता है ताकि असामान्य और सामान्य पाठ के साथ उनकी समानता की गणना की जा सके और स्थानीयकरण के परिणाम प्राप्त किए जा सकें। प्रॉम्प्ट लर्नर फिर उन्हें एलएलएम के साथ-साथ उपयोगकर्ता पाठ इनपुट के रूप में उपयोग किए जाने वाले प्रॉम्प्ट एम्बेडिंग में परिवर्तित करता है। एलएलएम मॉडल फिर प्रॉम्प्ट एम्बेडिंग, छवि इनपुट और उपयोगकर्ता-प्रदत्त पाठ इनपुट का उपयोग करके विचलन का पता लगाता है और उनके स्थान को इंगित करता है, और उपयोगकर्ता के लिए अंतिम प्रतिक्रिया बनाता है।
डिकोडर
पिक्सेल-स्तरीय विचलन स्थानीयकरण प्राप्त करने के लिए, अनोमली जीपीटी मॉडल एक हल्के विशेषता मिलान-आधारित छवि डिकोडर को तैनात करता है जो दोनों कुछ शॉट आईएडी फ्रेमवर्क और अनपर्यवेक्षित आईएडी फ्रेमवर्क का समर्थन करता है। अनोमली जीपीटी में उपयोग किए जाने वाले डिकोडर का डिज़ाइन विनसीएलआईपी, पैचकोर और एपआरआईएल-जीएन फ्रेमवर्क से प्रेरित है। मॉडल छवि एनकोडर को 4 चरणों में विभाजित करता है और प्रत्येक चरण से मध्यवर्ती पैच-स्तरीय विशेषताओं को निकालता है।
हालांकि, इन मध्यवर्ती विशेषताओं को अंतिम छवि-पाठ संरेखण से गुजरना नहीं पड़ा है, जिसका अर्थ है कि उन्हें सीधे विशेषताओं के साथ तुलना नहीं की जा सकती है। इस समस्या से निपटने के लिए, अनोमली जीपीटी मॉडल मध्यवर्ती विशेषताओं को प्रोजेक्ट करने के लिए अतिरिक्त परतें पेश करता है और उन्हें सामान्य और असामान्य अर्थों के प्रतिनिधित्व के लिए पाठ विशेषताओं के साथ संरेखित करता है।
प्रॉम्प्ट लर्नर
अनोमली जीपीटी फ्रेमवर्क एक प्रॉम्प्ट लर्नर पेश करता है जो स्थानीयकरण परिणाम को प्रॉम्प्ट एम्बेडिंग में परिवर्तित करने का प्रयास करता है ताकि छवियों से सूक्ष्म अर्थों का लाभ उठाया जा सके और डिकोडर और एलएलएम आउटपुट के बीच अर्थ संगति बनाई जा सके। इसके अलावा, मॉडल प्रॉम्प्ट लर्नर में डिकोडर आउटपुट से संबंधित नहीं होने वाले सीखने योग्य प्रॉम्प्ट एम्बेडिंग को शामिल करता है ताकि आईएडी कार्य के लिए अतिरिक्त जानकारी प्रदान की जा सके। अंत में, मॉडल एम्बेडिंग और मूल छवि जानकारी को एलएलएम में खिलाता है।
प्रॉम्प्ट लर्नर में सीखने योग्य आधार प्रॉम्प्ट एम्बेडिंग और एक कन्वोल्यूशनल न्यूरल नेटवर्क शामिल है। नेटवर्क स्थानीयकरण परिणाम को प्रॉम्प्ट एम्बेडिंग में परिवर्तित करता है और एक प्रॉम्प्ट एम्बेडिंग सेट बनाता है जो तब छवि एम्बेडिंग के साथ एलएलएम में जोड़ा जाता है।
विचलन सिमुलेशन
अनोमली जीपीटी मॉडल एनएसए विधि को विचलन डेटा को सिमुलेट करने के लिए अपनाता है। एनएसए विधि पॉइसन इमेज एडिटिंग विधि का उपयोग करके काट-चिपकाने की तकनीक का उपयोग करती है ताकि छवि सेगमेंट को चिपकाने से उत्पन्न होने वाली असंगति को कम किया जा सके। काट-चिपकाना एक सामान्य तकनीक है जो आईएडी फ्रेमवर्क में सिम्युलेटेड विचलन छवियों को उत्पन्न करने के लिए उपयोग की जाती है।
काट-चिपकाने की विधि में एक छवि से एक ब्लॉक क्षेत्र को यादृच्छिक रूप से काटना और इसे दूसरी छवि में एक यादृच्छिक स्थान पर चिपकाना शामिल है, जिससे एक सिम्युलेटेड विचलन का एक हिस्सा बनता है। ये सिम्युलेटेड विचलन नमूने आईएडी मॉडल के प्रदर्शन में सुधार कर सकते हैं, लेकिन एक कमी है क्योंकि वे अक्सर ध्यान देने योग्य असंगति पैदा कर सकते हैं। पॉइसन संपादन विधि एक वस्तु को एक छवि से दूसरी छवि में पॉइसन आंशिक दифरेंशियल समीकरणों को हल करके निर्बाध रूप से क्लोन करने का लक्ष्य रखती है।

उपरोक्त छवि पॉइसन और काट-चिपकाने वाली छवि संपादन विधि की तुलना दर्शाती है। जैसा कि देखा जा सकता है, काट-चिपकाने की विधि में दिखाई देने वाली असंगति है, जबकि पॉइसन संपादन के परिणाम अधिक प्राकृतिक लगते हैं।
प्रश्न और उत्तर सामग्री
बड़े दृष्टि भाषा मॉडल पर प्रॉम्प्ट ट्यूनिंग करने के लिए, अनोमली जीपीटी मॉडल विचलन छवि के आधार पर एक संबंधित पाठ्य प्रश्न उत्पन्न करता है। प्रत्येक प्रश्न में दो प्रमुख घटक होते हैं। प्रश्न का पहला भाग छवि में मौजूद वस्तुओं का वर्णन करता है जो छवि में मौजूद वस्तुओं के बारे में जानकारी प्रदान करता है साथ ही उनके अपेक्षित विशेषताओं के बारे में भी बताता है। प्रश्न का दूसरा भाग वस्तु में विचलन की उपस्थिति का पता लगाने के लिए है या छवि में विचलन की जांच करने के लिए है।
एलएलएम पहले यह प्रश्न का उत्तर देता है कि क्या छवि में विचलन है। यदि मॉडल विचलन का पता लगाता है, तो यह विचलन क्षेत्रों की संख्या और स्थान को निर्दिष्ट करना जारी रखता है। मॉडल छवि को 3×3 ग्रिड में विभाजित करता है ताकि एलएलएम विचलन की स्थिति को मौखिक रूप से इंगित कर सके, जैसा कि नीचे दी गई छवि में दिखाया गया है।

एलएलएम मॉडल को छवि के घटकों को बेहतर ढंग से समझने में मदद करने के लिए छवि के साथ जुड़ी मूल जानकारी प्रदान की जाती है।
डेटासेट और मूल्यांकन मेट्रिक्स
मॉडल अपने प्रयोगों को मुख्य रूप से विसए और एमवीटेक-एडी डेटासेट पर करता है। एमवीटेक-एडी डेटासेट में 3629 छवियां प्रशिक्षण के लिए और 1725 छवियां परीक्षण के लिए हैं जो 15 विभिन्न श्रेणियों में विभाजित हैं। यह आईएडी फ्रेमवर्क के लिए सबसे लोकप्रिय डेटासेट में से एक है। प्रशिक्षण छवियों में केवल सामान्य छवियां होती हैं, जबकि परीक्षण छवियों में सामान्य और विचलन दोनों छवियां होती हैं। दूसरी ओर, विसए डेटासेट में 9621 सामान्य छवियां और लगभग 1200 विचलन छवियां हैं जो 12 विभिन्न श्रेणियों में विभाजित हैं।
आगे बढ़ते हुए, मौजूदा आईएडी फ्रेमवर्क की तरह, अनोमली जीपीटी मॉडल एयूसी या रिसीवर ऑपरेटिंग चार्टरिस्टिक्स के क्षेत्र का उपयोग अपने प्रस्तावित दृष्टिकोण के प्रदर्शन का मूल्यांकन करने के लिए करता है, जिसमें पिक्सेल-स्तरीय और छवि-स्तरीय एयूसी का उपयोग क्रमशः विचलन स्थानीयकरण प्रदर्शन और विचलन पता लगाने का मूल्यांकन करने के लिए किया जाता है। हालांकि, मॉडल छवि-स्तरीय सटीकता का भी उपयोग करता है ताकि इसके प्रस्तावित दृष्टिकोण के प्रदर्शन का मूल्यांकन किया जा सके, क्योंकि यह मैनुअल रूप से थ्रेशोल्ड सेट करने की आवश्यकता के बिना विचलन की उपस्थिति का निर्धारण करने की अनुमति देता है।
परिणाम
मात्रात्मक परिणाम
कुछ शॉट औद्योगिक विचलन पता लगाना
अनोमली जीपीटी मॉडल अपने परिणामों की तुलना पिछले कुछ शॉट आईएडी फ्रेमवर्क जैसे पेडिम, एसपीएडी, विनसीएलआईपी और पैचकोर के साथ करता है।

उपरोक्त आंकड़ा अनोमली जीपीटी मॉडल के परिणामों की तुलना कुछ शॉट आईएडी फ्रेमवर्क के साथ करता है। दोनों डेटासेट पर, अनोमली जीपीटी द्वारा अपनाई गई विधि छवि-स्तरीय एयूसी और सटीकता दोनों में पिछले मॉडलों के दृष्टिकोण से बेहतर प्रदर्शन करती है।
अपर्यवेक्षित औद्योगिक विचलन पता लगाना
एक अपर्यवेक्षित प्रशिक्षण सेटिंग में एक बड़ी संख्या में सामान्य नमूनों के साथ, अनोमली जीपीटी एक ही मॉडल को डेटासेट के सभी वर्गों से नमूनों पर प्रशिक्षित करता है। अनोमली जीपीटी के विकासकर्ताओं ने यूनियाड फ्रेमवर्क को चुना क्योंकि यह同 एक ही सेटअप में प्रशिक्षित है और तुलना के लिए एक बेसलाइन के रूप में कार्य करेगा। इसके अलावा, मॉडल जेएनएलडी और पेडिम फ्रेमवर्क के साथ एक ही एकीकृत सेटिंग में तुलना करता है।

उपरोक्त आंकड़ा अनोमली जीपीटी के प्रदर्शन की तुलना अन्य फ्रेमवर्क के साथ करता है।
गुणात्मक परिणाम

उपरोक्त छवि अनोमली जीपीटी मॉडल के अपर्यवेक्षित विचलन पता लगाने विधि के प्रदर्शन को दर्शाती है, जबकि नीचे दी गई छवि मॉडल के 1-शॉट इन-कॉन्टेक्स्ट लर्निंग में प्रदर्शन को प्रदर्शित करती है।

अनोमली जीपीटी मॉडल विचलन की उपस्थिति को इंगित करने में सक्षम है, उनके स्थान को चिह्नित करने में सक्षम है, और पिक्सेल-स्तरीय स्थानीयकरण परिणाम प्रदान करता है। जब मॉडल 1-शॉट इन-कॉन्टेक्स्ट लर्निंग में होता है, तो मॉडल का स्थानीयकरण प्रदर्शन थोड़ा कम होता है क्योंकि प्रशिक्षण की अनुपस्थिति के कारण।
निष्कर्ष
अनोमली जीपीटी एक नया बातचीत आईएडी-विजन लैंग्वेज मॉडल है जो बड़े दृष्टि भाषा मॉडल की शक्तिशाली क्षमताओं का लाभ उठाने के लिए डिज़ाइन किया गया है। यह न केवल छवियों में विचलन का पता लगा सकता है, बल्कि उनके सटीक स्थान को भी इंगित कर सकता है। इसके अलावा, अनोमली जीपीटी विचलन पता लगाने पर केंद्रित बहु-मोड़ वार्ता को सुविधाजनक बनाता है और कुछ शॉट इन-कॉन्टेक्स्ट लर्निंग में उत्कृष्ट प्रदर्शन प्रदर्शित करता है। अनोमली जीपीटी विचलन पता लगाने में एलवीएलएम के संभावित अनुप्रयोगों की खोज करता है, जो आईएडी उद्योग के लिए नए विचार और संभावनाएं प्रस्तुत करता है।












