एआई मॉडल और प्लेटफ़ॉर्म
टेक्स्टफूलर एल्गोरिदम एनएलपी एआई को बेवकूफ बनाता है
हाल के वर्षों में, प्राकृतिक भाषा प्रसंस्करण एल्गोरिदम और प्रणालियाँ बहुत प्रभावशाली हो गई हैं, लेकिन वे अभी भी एक प्रकार के शोषण के प्रति संवेदनशील हैं जिसे “विरोधी उदाहरण” के रूप में जाना जाता है। विरोधी उदाहरण सावधानी से इंजीनियर्ड वाक्यांश हैं जो एक एनएलपी प्रणाली को अप्रत्याशित और अवांछनीय तरीके से व्यवहार करने का कारण बन सकते हैं। एआई कार्यक्रमों को इन अजीब उदाहरणों के साथ गलत व्यवहार करने के लिए बनाया जा सकता है, और परिणामस्वरूप, एआई शोधकर्ता विरोधी उदाहरणों के प्रभावों के खिलाफ सुरक्षा के तरीके डिज़ाइन करने का प्रयास कर रहे हैं।
हाल ही में, हांगकांग विश्वविद्यालय और सिंगापुर में विज्ञान, प्रौद्योगिकी और अनुसंधान एजेंसी के शोधकर्ताओं की एक टीम ने विरोधी उदाहरणों के खतरे को प्रदर्शित करने वाले एक एल्गोरिदम का सहयोग किया। वायर्ड की रिपोर्ट के अनुसार, एल्गोरिदम को शोध टीम द्वारा टेक्स्टफूलर नाम दिया गया था और यह वाक्य के हिस्सों को सूक्ष्म रूप से बदलकर काम करता है, जो एनएलपी वर्गीकरणकर्ता द्वारा वाक्य की व्याख्या को प्रभावित करता है। एक उदाहरण के रूप में, एल्गोरिदम ने एक वाक्य को दूसरे समान वाक्य में परिवर्तित किया और वाक्य को एक वर्गीकरणकर्ता में डाला गया जो यह निर्धारित करने के लिए डिज़ाइन किया गया था कि समीक्षा नकारात्मक या सकारात्मक थी या नहीं। मूल वाक्य था:
“पात्र, असंभव साजिश स्थितियों में, पूरी तरह से वास्तविकता से अलग हैं।”
यह वाक्य इस वाक्य में परिवर्तित हो गया:
“पात्र, असंभव इंजीनियर्ड परिस्थितियों में, पूरी तरह से वास्तविकता से अलग हैं।”
इन सूक्ष्म परिवर्तनों ने पाठ वर्गीकरणकर्ता को समीक्षा को नकारात्मक के बजाय सकारात्मक के रूप में वर्गीकृत करने का कारण बना। शोध टीम ने कई अलग-अलग डेटासेट और पाठ वर्गीकरण एल्गोरिदम पर इसी दृष्टिकोण (कुछ शब्दों को पर्यायवाची शब्दों के साथ बदलना) का परीक्षण किया। शोध टीम के अनुसार, वे एक एल्गोरिदम की वर्गीकरण सटीकता को 90% से 10% तक कम करने में सक्षम थे। यह तब है जब लोग इन वाक्यों को पढ़ते हैं और उन्हें एक ही अर्थ के रूप में व्याख्या करते हैं।
इन परिणामों से चिंता होती है जब एनएलपी एल्गोरिदम और एआई का उपयोग अधिक से अधिक बार किया जा रहा है, और महत्वपूर्ण कार्यों जैसे चिकित्सा दावों का मूल्यांकन या कानूनी दस्तावेजों का विश्लेषण करने के लिए। यह ज्ञात नहीं है कि विरोधी उदाहरण वर्तमान में उपयोग किए जाने वाले एल्गोरिदम के लिए कितना बड़ा खतरा है। दुनिया भर के शोध दल अभी भी यह पता लगाने की कोशिश कर रहे हैं कि वे कितना प्रभाव डाल सकते हैं। हाल ही में, स्टैनफोर्ड ह्यूमन-सेंट्रेड एआई समूह द्वारा प्रकाशित एक रिपोर्ट में सुझाव दिया गया है कि विरोधी उदाहरण एआई एल्गोरिदम को धोखा दे सकते हैं और कर धोखाधड़ी को अंजाम देने के लिए उपयोग किया जा सकता है।
हाल के अध्ययन में कुछ सीमाएं हैं। उदाहरण के लिए, यूसी इरविन में कंप्यूटर विज्ञान के सहायक प्रोफेसर समीर सिंह ने उल्लेख किया कि उपयोग की जाने वाली विरोधी विधि प्रभावी थी, लेकिन यह एआई की वास्तुकला के बारे में कुछ ज्ञान पर निर्भर करती है। एआई को बार-बार जांचा जाना चाहिए जब तक कि प्रभावी शब्दों का एक समूह नहीं मिल जाता, और ऐसे बार-बार हमले सुरक्षा कार्यक्रमों द्वारा देखे जा सकते हैं। सिंह और उनके सहयोगियों ने इस विषय पर अपना शोध किया है और पाया है कि उन्नत प्रणाली जैसे ओपनएआई एल्गोरिदम नस्लवादी, हानिकारक पाठ प्रदान कर सकते हैं जब उन्हें कertain ट्रिगर वाक्यांशों के साथ प्रेरित किया जाता है।
विरोधी उदाहरण दृश्य डेटा जैसे फोटो या वीडियो के साथ भी एक संभावित समस्या है। एक प्रसिद्ध उदाहरण में एक बिल्ली की तस्वीर पर कertain सूक्ष्म डिजिटल परिवर्तन लागू करना शामिल है, जो छवि वर्गीकरणकर्ता को इसे मॉनिटर या डेस्कटॉप पीसी के रूप में व्याख्या करने का कारण बनता है। एक अन्य उदाहरण में, यूसी बर्कले के प्रोफेसर डॉन सॉन्ग द्वारा किए गए शोध में पाया गया कि विरोधी उदाहरणों का उपयोग सड़क संकेतों को स्वायत्त वाहनों के लिए संभावित रूप से खतरनाक तरीके से कंप्यूटर दृष्टि प्रणाली द्वारा व्याख्या किए जाने के तरीके को बदलने के लिए किया जा सकता है।
हांगकांग-सिंगापुर टीम द्वारा किए गए इस तरह के शोध से एआई इंजीनियरों को एआई एल्गोरिदम में कमजोरियों के प्रकार को बेहतर ढंग से समझने में मदद मिल सकती है, और संभावित रूप से इन कमजोरियों के खिलाफ सुरक्षा के तरीके डिज़ाइन कर सकते हैं। एक उदाहरण के रूप में, एग्रीगेट वर्गीकरणकर्ता का उपयोग विरोधी उदाहरण द्वारा धोखा देने की संभावना को कम करने के लिए किया जा सकता है। इस तकनीक के साथ, कई वर्गीकरणकर्ता उपयोग किए जाते हैं और इनपुट छवि में सूक्ष्म परिवर्तन किए जाते हैं। अधिकांश वर्गीकरणकर्ता आमतौर पर छवि की वास्तविक सामग्री के पहलुओं को समझेंगे, जो तब एक साथ जुड़े होते हैं। परिणाम यह है कि भले ही कुछ वर्गीकरणकर्ता धोखा खा जाते हैं, अधिकांश नहीं करेंगे और छवि ठीक से वर्गीकृत की जाएगी।












