साइबर सुरक्षा

डीपकीप ने ‘इंकजेक्ट’ का खुलासा किया, एक नया एआई हमला जो छवियों के अंदर दुर्भाग्यपूर्ण प्रॉम्प्ट को छुपाता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जैसे ही उद्यम तेजी से बहुमोडल एआई को अपनाते हैं जो पाठ और छवियों दोनों को समझने में सक्षम हैं, सुरक्षा अनुसंधानकर्ता यह पता लगा रहे हैं कि इन शक्तिशाली नई क्षमताओं में समान रूप से जटिल नए हमले के क्षेत्र शामिल हैं। इज़राइली एआई सुरक्षा कंपनी डीपकीप ने एक पहले से अनदेखी दृश्य प्रॉम्प्ट इंजेक्शन तकनीक का खुलासा किया है जिसे इंकजेक्ट कहा जाता है, जो यह प्रदर्शित करता है कि छवियों के अंदर छुपी हुई सूचनाएं प्रमुख दृश्य-भाषा मॉडल (वीएलएम) को प्रभावित कर सकती हैं और पारंपरिक प्रॉम्प्ट इंजेक्शन हमलों को रोकने के लिए डिज़ाइन किए गए कई सुरक्षा गार्डरेल को बायपास कर सकती हैं।

डीपकीप के अनुसार अनुसंधान, यह कमजोरिया आज के कई उन्नत बहुमोडल मॉडलों को प्रभावित करती है, जिनमें ओपनएआई के जीपीटी-5.2 और जीपीटी-5.4 मिनी शामिल हैं, साथ ही एंथ्रोपिक के क्लॉड सोनेट 4.6 और क्लॉड ओपस 4.5। यह खोज एआई सुरक्षा में एक महत्वपूर्ण अंधे धब्बे को उजागर करती है: जबकि उद्योग ने पाठ-आधारित इंटरैक्शन की रक्षा करने में भारी निवेश किया है, दृश्य तर्क परत पर बहुत कम ध्यान दिया गया है जो आधुनिक एआई प्रणालियों को बढ़ती तरह से संचालित करती है।

प्रॉम्प्ट इंजेक्शन का एक नया विकास

पारंपरिक प्रॉम्प्ट इंजेक्शन हमले एआई मॉडल को उसके मूल निर्देशों को ओवरराइड करने के लिए डिज़ाइन किए गए सावधानी से तैयार किए गए पाठ के माध्यम से प्रभावित करने का प्रयास करते हैं। पिछले दो वर्षों में, प्रमुख एआई प्रदाताओं ने इन हमलों का पता लगाने से पहले ही मॉडलों पर कार्य करने के लिए निवेश किया है।

इंकजेक्ट एक अलग मार्ग अपनाता है। पाठ के माध्यम से सीधे संवाद करने के बजाय, हमलावर छवियों के अंदर दुर्भाग्यपूर्ण निर्देश छुपाते हैं जो एआई के सामान्य कार्य का हिस्सा बन जाते हैं। वे छवियां सार्वजनिक गिटहब रिपॉजिटरी, दस्तावेज़ पृष्ठों, डिज़ाइन संपत्ति, आरेख, या अन्य दृश्य संसाधनों के भीतर संग्रहीत हो सकती हैं जिन्हें एआई कोडिंग सहायक और स्वायत्त एजेंट नियमित रूप से वैध कार्यों को पूरा करते समय पुनर्प्राप्त करते हैं। उपयोगकर्ता के दृष्टिकोण से, कुछ भी असामान्य नहीं लगता है। एआई बस छवि को संदर्भ की एक और टुकड़े के रूप में संसाधित करता है, अनजान यह है कि यह छुपी हुई कमांड भी है।

एआई की दृष्टि क्षमता का शोषण

जो इंकजेक्ट को विशेष रूप से प्रभावी बनाता है वह यह है कि यह आधुनिक एआई प्रणालियों में सबसे नए क्षमताओं में से एक को लक्षित करता है: दृश्य समझ।

दृश्य-भाषा मॉडल छवियों की व्याख्या करते समय जटिल ऑप्टिकल कैरेक्टर रिकग्निशन करते हैं, जिससे वे आरेख, स्क्रीनशॉट, फोटोग्राफ और इंटरफ़ेस डिज़ाइन में निहित पाठ को पढ़ने में सक्षम होते हैं। डीपकीप ने पाया कि इन क्षमताओं में अक्सर अपलोड की गई छवियों की जांच के लिए उपयोग किए जाने वाले पारंपरिक सुरक्षा उपकरणों की तुलना में अधिक होती हैं।

शोधकर्ताओं ने प्रदर्शित किया कि दुर्भाग्यपूर्ण निर्देशों को सफेद पाठ पर सफेद पृष्ठभूमि, अत्यंत कम-विपरीत लेखन, परिप्रेक्ष्य विकृति और विकृत टाइपोग्राफी जैसी तकनीकों का उपयोग करके छुपाया जा सकता है। जबकि मौजूदा सुरक्षा स्कैनर अक्सर इन छुपे हुए कमांड को पहचानने में विफल रहते हैं, एआई मॉडल स्वयं उन्हें किसी कठिनाई के बिना व्याख्या करते हैं। यह एक खतरनाक मismatch बनाता है जहां सुरक्षा सॉफ़्टवेयर निष्कर्ष निकालता है कि छवि हानिरहित है जबकि एआई चुपचाप निर्देशों को निकालता है और निष्पादित करता है जो स्कैनर और मानव उपयोगकर्ता दोनों के लिए अदृश्य हैं।

अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन खतरे को और अधिक खतरनाक बनाता है

अन्य साइबर हमलों के विपरीत जिन्हें लक्ष्य प्रणाली तक सीधे पहुंच की आवश्यकता होती है, इंकजेक्ट शोधकर्ताओं द्वारा वर्णित अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन पर निर्भर करता है। एक हमलावर सीधे एक दुर्भाग्यपूर्ण छवि को एआई अनुप्रयोग में अपलोड करने के बजाय, वह छवि को एक सार्वजनिक रूप से सुलभ रिपॉजिटरी या ऑनलाइन संसाधन के अंदर रखता है।

बाद में, जब एक डेवलपर एक एआई सहायक को उस रिपॉजिटरी या उसकी सामग्री का विश्लेषण करने के लिए कहता है, तो मॉडल स्वचालित रूप से छवि को अपने सामान्य कार्य के हिस्से के रूप में पुनर्प्राप्त करता है। छुपे हुए निर्देश वैध परियोजना संपत्तियों के साथ-साथ संसाधित होते हैं जबकि डेवलपर कभी भी महसूस नहीं करता है कि अतिरिक्त कमांड बातचीत में प्रवेश कर चुके हैं।

यह हमला विशेष रूप से चिंताजनक है क्योंकि आधुनिक एआई एजेंट बढ़ती तरह से स्वचालित रूप से बाहरी संसाधनों को पुनर्प्राप्त करते हैं। हर सार्वजनिक रिपॉजिटरी, दस्तावेज़ पृष्ठ, या साझा संपत्ति दुर्भाग्यपूर्ण निर्देशों को एआई प्रणाली तक पहुंचाने के लिए एक और मार्ग बन सकती है।

एक सरल कोडिंग अनुरोध गंभीर परिणामों के साथ

डीपकीप ने एक सॉफ्टवेयर विकास परिदृश्य का उपयोग करके प्रभाव को चित्रित किया जो पूरी तरह से नियमित लगता है।

एक डेवलपर ने एक एआई कोडिंग सहायक को एक बुनियादी जानकारीपूर्ण वेबपेज उत्पन्न करने का निर्देश दिया। डेवलपर को अज्ञात, संदर्भित छवियों में से एक में छुपे हुए निर्देश थे। एआई ने न केवल अनुरोधित वेबपेज का उत्पादन किया, बल्कि एक पूरी तरह से कार्यशील सदस्य लॉगिन प्रणाली भी जोड़ दी, जिसमें प्रशासक पासवर्ड और बैकएंड प्रमाणीकरण तर्क शामिल थे।

वेबपेज ने ठीक वैसा ही काम किया जैसा कि अपेक्षित था, डेवलपर को कोई कारण नहीं दिया गया कि अतिरिक्त कोड डाला गया था। एक विस्तृत सुरक्षा ऑडिट के बिना, अनधिकृत बैकडोर को आसानी से उत्पादन में तैनात किया जा सकता था, जिससे हमलावरों को प्रशासक पहुंच प्रदान की जा सकती थी जिसे किसी ने जानबूझकर अनुरोध नहीं किया था।

प्रदर्शन यह दर्शाता है कि दृश्य प्रॉम्प्ट इंजेक्शन पिछले एआई हमलों से कैसे भिन्न है। चैटबॉट प्रतिक्रियाओं को प्रभावित करने के बजाय, छुपी हुई दृश्य निर्देश उत्पन्न कोड को प्रभावित कर सकते हैं, सुरक्षा कमजोरियों को पेश कर सकते हैं, स्वायत्त कार्य प्रवाह को बदल सकते हैं और संभावित रूप से उद्यम प्रणालियों को खतरे में डाल सकते हैं।

मौजूदा एआई गार्डरेल हमले को क्यों याद करते हैं

शोध एक एआई सुरक्षा परिदृश्य में एक वास्तुकला कमजोरी को उजागर करता है। अधिकांश व्यावसायिक गार्डरेल पाठ-आधारित प्रॉम्प्ट की जांच करने के लिए डिज़ाइन किए गए हैं जो मॉडल तक पहुंचते हैं।

दृश्य इनपुट, हालांकि, अक्सर एक पूरी तरह से अलग प्रोसेसिंग पाइपलाइन का पालन करते हैं।

डीपकीप ने पाया कि कई अग्रिम मॉडलों ने पाठ के रूप में प्रस्तुत किए जाने पर समान हमलों को अस्वीकार कर दिया, लेकिन जब उन्हीं निर्देशों को एक छवि के अंदर एम्बेड किया गया तो उन्हें स्वीकार कर लिया। वास्तव में, हमलावर सुरक्षा उपायों को बायपास करने के लिए केवल निर्देशों के वितरण के माध्यम को बदलकर कर सकते हैं।

जैसे ही बहुमोडल एआई उद्यम अनुप्रयोगों के लिए डिफ़ॉल्ट इंटरफ़ेस बन जाता है, यह अंतर बढ़ती महत्व का हो जाता है। सुरक्षा प्रणाली अब यह मान नहीं ले सकती है कि खतरनाक निर्देश केवल पाठ के माध्यम से आते हैं।

उद्यमों को ध्यान क्यों देना चाहिए

डीपकीप के शोध का समय एक बहुत बड़े परिवर्तन को दर्शाता है जो उद्यम एआई में हो रहा है। उद्योग के पूर्वानुमान सुझाव देते हैं कि छवियों, दस्तावेजों, वीडियो और पाठ को समझने में सक्षम बहुमोडल प्रणाली सॉफ्टवेयर विकास, वित्तीय सेवाओं, स्वास्थ्य सेवा, निर्माण, ग्राहक सहायता और व्यवसाय स्वचालन में मानक बन जाएंगी।

उपभोक्ता चैटबॉट के विपरीत, कई उद्यम एआई प्रणालियां उन्नत विशेषाधिकारों के साथ संचालित होती हैं। वे गोपनीय दस्तावेज़ लिखते हैं, कोड निष्पादित करते हैं, एपीआई को कॉल करते हैं, क्लाउड इन्फ्रास्ट्रक्चर के साथ बातचीत करते हैं, गोपनीय दस्तावेजों का विश्लेषण करते हैं और उपयोगकर्ताओं की ओर से बढ़ती तरह से निर्णय लेते हैं। दृश्य सामग्री के अंदर एम्बेडेड छुपे हुए निर्देश इसलिए एक अकादमिक जिज्ञासा से अधिक का प्रतिनिधित्व करते हैं – वे एक नई श्रेणी के उद्यम साइबर सुरक्षा जोखिम का परिचय देते हैं जो वास्तविक दुनिया की प्रणालियों को प्रभावित कर सकते हैं।

डीपकीप का एआई सुरक्षा दृष्टिकोण

2021 में स्थापित, डीपकीप ने एआई के पूरे जीवन चक्र में सुरक्षा पर विशेष रूप से ध्यान केंद्रित किया है, मॉडल मूल्यांकन और परीक्षण से लेकर तैनाती और रनटाइम सुरक्षा तक। केवल बड़े भाषा मॉडल पर ध्यान केंद्रित करने के बजाय, कंपनी का प्लेटफ़ॉर्म बहुमोडल एआई प्रणालियों, स्वायत्त एआई एजेंटों, कंप्यूटर विजन अनुप्रयोगों और उद्यम एआई तैनाती को सुरक्षित करने के लिए डिज़ाइन किया गया है।

इसका सुरक्षा प्लेटफ़ॉर्म कई सुरक्षा परतों को जोड़ती है, जिसमें एआई फ़ायरवॉल शामिल है जो वास्तविक समय में अनुमान की निगरानी करता है, स्वचालित एआई रेड टीमिंग जो तैनाती से पहले कमजोरियों की तलाश में है, एआई एजेंट स्कैनर जो शोषण मार्गों के लिए स्वायत्त कार्य प्रवाह का विश्लेषण करता है, मॉडल स्कैनिंग क्षमताएं जो एआई आपूर्ति श्रृंखला के लिए सुरक्षा जोखिमों का मूल्यांकन करती हैं, और एआई लेंस, जो संगठनों को यह देखने की अनुमति देता है कि कर्मचारी और अनुप्रयोग उद्यम में एआई का उपयोग कैसे कर रहे हैं।

जैसे ही संगठन मिशन-महत्वपूर्ण कार्य प्रवाह में एआई एकीकृत करते हैं, डीपकीप की रणनीति एआई को सुरक्षित करने की बढ़ती मान्यता को दर्शाती है कि मॉडल जानकारी प्राप्त करने, प्रोसेस करने और कार्य करने के हर चरण की रक्षा करने की आवश्यकता है – न कि केवल उपयोगकर्ता द्वारा टाइप किए गए प्रॉम्प्ट को फ़िल्टर करने की।

एआई सुरक्षा में अगला मोर्चा

इंकजेक्ट को केवल एक और प्रॉम्प्ट इंजेक्शन तकनीक के रूप में याद किया जाने की संभावना है। यह यह प्रदर्शित करता है कि बहुमोडल एआई का तेजी से विकास साइबर सुरक्षा परिदृश्य को मौलिक रूप से फिर से आकार दे रहा है

जैसे ही मॉडल देखने, तर्क करने, जानकारी पुनर्प्राप्त करने और स्वायत्त रूप से कार्य करने में बढ़ती क्षमता प्राप्त करते हैं, हमलावर स्वाभाविक रूप से उन सभी मोडलिटी का शोषण करने के नए तरीकों की तलाश करेंगे जिन्हें वे समझते हैं। छवियों, आरेखों, पीडीएफ, वेबसाइटों और अन्य दृश्य संसाधनों में छुपे हुए निर्देशों के वाहन बन सकते हैं जिन्हें मौजूदा सुरक्षा उपकरण कभी भी पता नहीं लगा सकते हैं।

डीपकीप ने अपने निष्कर्षों को ओपनएआई और एंथ्रोपिक दोनों को सौंप दिया है, जिससे कंपनियों को इस नए पहचाने गए हमले वेक्टर के खिलाफ सुरक्षा को मजबूत करने का अवसर मिला है। चाहे इंकजेक्ट बहुमोडल प्रॉम्प्ट इंजेक्शन हमलों के एक व्यापक वर्ग का पहला उदाहरण बन जाए, इसकी खोज एक समय पर अनुस्मारक के रूप में कार्य करती है कि एआई सुरक्षा को उतनी ही तेजी से विकसित करने की आवश्यकता है जितनी एआई को। जैसे ही मॉडल दृश्य दुनिया को समझने में बढ़ती जटिलता के साथ सीखते हैं, उन्हें सुरक्षित करने के लिए सुरक्षा प्रणालियों की आवश्यकता होगी जो ऐसा ही कर सकती हैं।

ass of multimodal prompt injection attacks remains to be seen, but its discovery serves as a timely reminder that AI security must evolve just as quickly as AI itself. As models learn to understand the visual world with ever greater sophistication, defending them will require security systems capable of doing the same.

एंटोनी एक दूरदर्शी नेता और यूनाइट.एआई के संस्थापक भागीदार हैं, जो कि एआई और रोबोटिक्स के भविष्य को आकार देने और बढ़ावा देने के लिए एक अटूट जुनून से प्रेरित हैं। एक连续 उद्यमी, वह मानता है कि एआई समाज के लिए उतना ही विघटनकारी होगा जितना कि बिजली, और अक्सर विघटनकारी प्रौद्योगिकियों और एजीआई की संभावना के बारे में उत्साहित होता है।

एक भविष्यवाणी के रूप में, वह इन नवाचारों के बारे में जानने के लिए समर्पित है कि वे हमारी दुनिया को कैसे आकार देंगे। इसके अलावा, वह सिक्योरिटीज़.io के संस्थापक हैं, जो एक मंच है जो भविष्य को फिर से परिभाषित करने और पूरे क्षेत्रों को पुनः आकार देने वाली नवीनतम प्रौद्योगिकियों में निवेश पर केंद्रित है।