Anderson का एंगल
गहरे शिक्षण मॉडल एआई द्वारा उत्पन्न छवियों को पहचानने में संघर्ष कर सकते हैं

एक नए शोध पत्र से पता चलता है कि राज्य-ऑफ-द-आर्ट एआई एआई-सynthesized छवियों को पहचानने और व्याख्या करने में लोगों की तुलना में काफी कम सक्षम है, जो एक ऐसे माहौल में चिंता का विषय हो सकता है जहां मशीन लर्निंग मॉडल बढ़ते हुए सिंथेटिक डेटा पर प्रशिक्षित होते हैं, और जहां यह जरूरी नहीं है कि डेटा ‘वास्तविक’ है या नहीं।

यहाँ हम देखते हैं resnext101_32x8d_wsl prediction मॉडल ‘बैगेल’ श्रेणी में संघर्ष कर रहा है। परीक्षणों में, यदि मुख्य लक्ष्य शब्द (इस मामले में ‘बैगेल’) शीर्ष पांच भविष्यवाणी परिणामों में शामिल नहीं था, तो एक पहचान विफलता होने की घोषणा की गई। स्रोत: https://arxiv.org/pdf/2208.10760.pdf
नई अनुसंधान ने दो श्रेणियों के कंप्यूटर दृष्टि-आधारित पहचान फ्रेमवर्क का परीक्षण किया: वस्तु पहचान, और दृश्य प्रश्न उत्तर देना (VQA).

बाएं, वस्तु पहचान प्रणाली से अनुमान सफलता और विफलता; दाएं, VQA कार्य जो दृश्यों और छवियों की समझ को अधिक अन्वेषणात्मक और महत्वपूर्ण तरीके से जांचते हैं। स्रोत: https://arxiv.org/pdf/2105.05312.pdf और https://arxiv.org/pdf/1505.00468.pdf
छवि संश्लेषण फ्रेमवर्क DALL-E 2 और Midjourney द्वारा उत्पन्न किए गए क्यूरेटेड डेटासेट पर परीक्षण किए गए दस राज्य-ऑफ-द-आर्ट मॉडलों में, सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल केवल 60% और 80% शीर्ष-5 सटीकता हासिल कर सका, जबकि ImageNet, जो गैर-सिंथेटिक, वास्तविक दुनिया के डेटा पर प्रशिक्षित है, समान श्रेणियों में क्रमशः 91% और 99% हासिल कर सकता है, जबकि मानव प्रदर्शन आमतौर पर उल्लेखनीय रूप से उच्च होता है।
डेटा
अध्ययन स्टेबल डिफ्यूजन रिलीज से पहले का है, और प्रयोग DALL-E 2 और Midjourney द्वारा 17 श्रेणियों में उत्पन्न डेटा का उपयोग करते हैं, जिनमें हाथी, मशरूम, पिज्जा, प्रेट्ज़ेल, ट्रैक्टर और खरगोश शामिल हैं।

परीक्षण किए गए पहचान और VQA प्रणालियों के लिए सबसे महत्वपूर्ण कुंजी अवधारणा की पहचान करने के लिए जिन छवियों से चुनौती दी गई थी।
छवियां वेब खोजों और ट्विटर के माध्यम से प्राप्त की गईं, और DALL-E 2 की नीतियों (कम से कम, उस समय) के अनुसार, उनमें मानव चेहरे वाली कोई भी छवि शामिल नहीं थी। केवल उच्च गुणवत्ता वाली छवियां, जो मानव द्वारा पहचानी जा सकती थीं, का चयन किया गया था।
वस्तु पहचान और VQA कार्यों के लिए दो सेट छवियां तैयार की गईं।

वस्तु पहचान के लिए प्रत्येक परीक्षण श्रेणी में छवियों की संख्या।
वस्तु पहचान का परीक्षण
वस्तु पहचान परीक्षणों के लिए, दस मॉडल, सभी ImageNet पर प्रशिक्षित, परीक्षण किए गए: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit, और ResNext_WSL.
कुछ वर्गों में अन्य लोगों की तुलना में अधिक विस्तृत थे, जिससे औसत दृष्टिकोण के अनुप्रयोग की आवश्यकता होती है। उदाहरण के लिए, ImageNet में ‘घड़ियों’ से संबंधित तीन वर्ग हैं, और यह आवश्यक था कि कुछ प्रकार के मध्यस्थ मीट्रिक को परिभाषित किया जाए, जहां किसी भी छवि के लिए शीर्ष पांच प्राप्त लेबल में किसी भी प्रकार की ‘घड़ी’ को शामिल करना उस मामले में एक सफलता के रूप में माना जाता था।

17 श्रेणियों में प्रति-मॉडल प्रदर्शन।
इस दौर में सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल resnext101_32x8d_ws था, जिसने लगभग 60% के लिए शीर्ष-1 (अर्थात, जब इसका पसंदीदा अनुमान पांच अनुमानों में से एक था) और 80% के लिए शीर्ष-पांच (अर्थात, वांछित अवधारणा कम से कम अपने पांच अनुमानों में से एक में सूचीबद्ध थी) हासिल किया।
लेखक सुझाव देता है कि इस मॉडल का अच्छा प्रदर्शन इस तथ्य के कारण है कि यह सोशल मीडिया प्लेटफ़ॉर्म पर हैशटैग की कमजोर-पर्यवेक्षित भविष्यवाणी के लिए प्रशिक्षित किया गया था। हालांकि, ये अग्रणी परिणाम, लेखक नोट करता है, वास्तविक डेटा पर ImageNet द्वारा प्राप्त किए गए 91% और 99% से काफी कम हैं। वह सुझाव देता है कि यह ImageNet छवियों (जो भी वेब से खंगाली जाती हैं) और सिंथेटिक छवियों के वितरण के बीच एक बड़े अंतर के कारण है।
प्रणाली के लिए पांच सबसे कठिन श्रेणियां, कठिनाई के क्रम में, पतंग, कछुआ, गिलहरी, धूप का चश्मा और हेलमेट थीं। पत्र में उल्लेख किया गया है कि पतंग वर्ग अक्सर गुब्बारा, पैराशूट और छतरी के साथ भ्रमित होता है, हालांकि ये अंतर मानव दर्शकों के लिए अलग करना आसान है।
कुछ श्रेणियां, जिनमें पतंग और कछुआ शामिल हैं, सभी मॉडलों में सार्वभौमिक विफलता का कारण बने, जबकि अन्य (विशेष रूप से प्रेट्ज़ेल और ट्रैक्टर) परीक्षण किए गए मॉडलों में लगभग सार्वभौमिक सफलता का कारण बने।

ध्रुवीकरण श्रेणियां: लक्ष्य श्रेणियों में से कुछ या तो सभी मॉडलों को भ्रमित कर देती हैं, या फिर सभी मॉडलों के लिए उन्हें पहचानना आसान होता है।
लेखक का अनुमान है कि ये निष्कर्ष यह दर्शाते हैं कि सभी वस्तु पहचान मॉडल समान ताकत और कमजोरियां साझा करते हैं।
दृश्य प्रश्न उत्तर देने का परीक्षण
इसके बाद, लेखक ने खुले और स्वतंत्र दृश्य प्रश्न उत्तर देने वाले मॉडलों का परीक्षण किया, जिसमें द्विआधारी प्रश्न (अर्थात, प्रश्न जिनका उत्तर केवल ‘हां’ या ‘नहीं’ हो सकता है) शामिल थे। पत्र में उल्लेख किया गया है कि हाल के राज्य-ऑफ-द-आर्ट VQA मॉडल VQA-v2 डेटासेट पर 95% सटीकता हासिल कर सकते हैं।
इस परीक्षण चरण के लिए, लेखक ने 50 छवियों को तैयार किया और उनके आसपास 241 प्रश्न तैयार किए, जिनमें से 132 सकारात्मक उत्तर और 109 नकारात्मक थे। प्रश्न की औसत लंबाई 5.12 शब्द थी।
इस दौर में OFA मॉडल का उपयोग किया गया था, जो एक कार्य-एजेंटिक और मोडलिटी-एजेंटिक फ्रेमवर्क है जो कार्य व्यापकता का परीक्षण करने के लिए है, और हाल ही में VQA-v2 परीक्षण-मानक सेट में अग्रणी स्कोरर था। OFA ने सिंथेटिक छवियों पर 77.27% सटीकता हासिल की, जबकि VQA-v2 परीक्षण-मानक सेट में इसका अपना 94.7% स्कोर था।
लेखक का सुझाव है कि इसका एक हिस्सा यह हो सकता है कि सिंथेटिक छवियों में VQA-v2 डेटासेट में अनुपस्थित सेमांटिक अवधारणाएं हैं, और VQA परीक्षणों के लिए लिखे गए प्रश्न VQA-v2 प्रश्नों के सामान्य मानक से अधिक चुनौतीपूर्ण हो सकते हैं, हालांकि वह मानता है कि पूर्व कारण अधिक संभावना है।
डेटा स्ट्रीम में एलएसडी?
राय
एआई-संश्लेषित छवियों का नया प्रसार, जो प्राकृतिक रूप से अस्तित्व में नहीं होने वाले मूल अवधारणाओं और स abstracts के तात्कालिक संयोजन प्रस्तुत कर सकता है, और जो पारंपरिक तरीकों से उत्पादित करने के लिए निषिद्ध रूप से समय लेने वाला होगा, कमजोर पर्यवेक्षित डेटा-संग्रह प्रणालियों के लिए एक विशेष समस्या प्रस्तुत कर सकता है, जो उच्च मात्रा में अनलेबल्ड सिंथेटिक डेटा को संभालने के लिए डिज़ाइन नहीं की गई हैं।
ऐसे मामलों में, यह जोखिम हो सकता है कि ये प्रणालियां ‘अजीब’ सिंथेटिक छवियों को गलत वर्गों में डाल सकती हैं क्योंकि छवियों में वास्तव में एक साथ नहीं होने वाले विशिष्ट वस्तुएं हैं।

‘अंतरिक्ष यात्री घोड़े पर सवारी करता है’ शायद नए पीढ़ी के छवि संश्लेषण प्रणालियों के लिए सबसे प्रतिष्ठित दृश्य बन गया है – लेकिन ये ‘अवास्तविक’ संबंध वास्तविक पता लगाने वाली प्रणालियों में प्रवेश कर सकते हैं जब तक कि सावधानी नहीं बरती जाती। स्रोत: https://twitter.com/openai/status/1511714545529614338?lang=en
जब तक यह प्रशिक्षण से पहले प्रीप्रोसेसिंग चरण में रोका नहीं जाता है, तो स्वचालित पाइपलाइनें मशीन लर्निंग प्रणालियों में असंभव या भयानक संबंधों को प्रशिक्षित कर सकती हैं, जिससे उनकी प्रभावशीलता कम हो जाती है और उच्च-स्तरीय संबंधों को डाउनस्ट्रीम प्रणालियों और उप-वर्गों और श्रेणियों में जोखिम हो सकता है।
वैकल्पिक रूप से, विच्छिन्न सिंथेटिक छवियां बाद की प्रणालियों की सटीकता पर एक ‘ठंडा’ प्रभाव डाल सकती हैं, यदि नए या संशोधित वास्तुकला उत्पन्न होते हैं जो सिंथेटिक छवियों के लिए खाते हैं और बहुत व्यापक जाल डालते हैं।
दोनों मामलों में, स्टेबल डिफ्यूजन युग में सिंथेटिक छवियां कंप्यूटर दृष्टि अनुसंधान क्षेत्र के लिए एक सिरदर्द साबित हो सकती हैं जिनके प्रयासों ने इन अजीब निर्माणों और क्षमताओं को संभव बनाया है – कम से कम इसलिए कि यह क्षेत्र की आशा को खतरे में डालता है कि डेटा का संग्रह और क्यूरेशन अंततः वर्तमान से बहुत अधिक स्वचालित और कम समय लेने वाला हो सकता है।
पहली बार 1 सितंबर 2022 को प्रकाशित।













