Anderson का एंगल

मशीन लर्निंग मॉडल्स की चोरी एपीआई आउटपुट के माध्यम से

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

कैनेडा से नए शोध में एक संभावित तरीका प्रस्तुत किया गया है जिससे हमलावर महंगे मशीन लर्निंग फ्रेमवर्क के परिणामों को चोरी कर सकते हैं, यहां तक कि जब केवल एक प्रोप्राइटरी सिस्टम तक पहुंच एक उच्च स्वच्छ और स्पष्ट रूप से सुरक्षित एपीआई (एक इंटरफेस या प्रोटोकॉल जो उपयोगकर्ता प्रश्नों को सर्वर-साइड प्रोसेस करता है और केवल आउटपुट प्रतिक्रिया लौटाता है) के माध्यम से हो।

जैसा कि शोध क्षेत्र मशीन लर्निंग के माध्यम से महंगे मॉडल प्रशिक्षण को मॉनेटाइज़ करने की ओर बढ़ रहा है, नए कार्य से पता चलता है कि स्व-पर्यवेक्षित शिक्षा (एसएसएल) मॉडल इस प्रकार के मॉडल एक्सफिल्ट्रेशन के लिए अधिक संवेदनशील होते हैं, क्योंकि वे लेबल के बिना प्रशिक्षित होते हैं, जो निकासी को सरल बनाता है, और आमतौर पर परिणाम प्रदान करते हैं जो किसी को भी छिपे हुए स्रोत मॉडल को पुनरुत्पादित करने के लिए बहुत सारी उपयोगी जानकारी प्रदान करते हैं।

‘ब्लैक बॉक्स’ परीक्षण सिमुलेशन में (जहां शोधकर्ताओं ने खुद को एक स्थानीय ‘पीड़ित’ मॉडल तक पहुंच प्रदान की जो एक典型 एंड-यूज़र के पास वेब एपीआई के माध्यम से हो सकती है), शोधकर्ता अपेक्षाकृत कम संसाधनों के साथ लक्ष्य प्रणालियों को पुनरुत्पादित करने में सक्षम थे:

‘[हमारे] हमले एक पीड़ित मॉडल की एक प्रति चोरी कर सकते हैं जो डाउनस्ट्रीम प्रदर्शन में काफी हद तक प्राप्त करता है जो पीड़ित को प्रशिक्षित करने के लिए उपयोग किए जाने वाले प्रश्नों की संख्या से कम है। 1.2M अनलेबल्ड नमूनों पर प्रशिक्षित एक पीड़ित मॉडल के खिलाफ, जिसमें फैशन-एमएनआईएस्ट डाउनस्ट्रीम वर्गीकरण कार्य पर 91.9% सटीकता है, हमारे प्रत्यक्ष निकासी हमले ने इन्फोन्सई हानि के साथ पीड़ित एनकोडर की एक प्रति चोरी की जो 200K प्रश्नों में 90.5% सटीकता प्राप्त करती है।

‘इसी तरह, 50K अनलेबल्ड नमूनों पर प्रशिक्षित एक पीड़ित के खिलाफ, जिसमें डाउनस्ट्रीम सीआईएफएआर10 वर्गीकरण कार्य पर 79.0% सटीकता है, हमारे प्रत्यक्ष निकासी हमले ने सॉफ्टएनएन हानि के साथ एक प्रति चोरी की जो 9,000 प्रश्नों में 76.9% सटीकता प्राप्त करती है।’

शोधकर्ताओं ने तीन हमले विधियों का उपयोग किया, पाया कि 'प्रत्यक्ष निकासी' सबसे प्रभावी थी। ये मॉडल एक स्थानीय रूप से पुनर्निर्मित सीआईएफएआर10 पीड़ित एनकोडर से 9,000 प्रश्नों के साथ चोरी किए गए थे। स्रोत: https://arxiv.org/pdf/2205.07890.pdf

शोधकर्ताओं ने तीन हमले विधियों का उपयोग किया, पाया कि ‘प्रत्यक्ष निकासी’ सबसे प्रभावी थी। ये मॉडल एक स्थानीय रूप से पुनर्निर्मित सीआईएफएआर10 पीड़ित एनकोडर से 9,000 प्रश्नों के साथ चोरी किए गए थे। स्रोत: https://arxiv.org/pdf/2205.07890.pdf

शोधकर्ता यह भी ध्यान देते हैं कि पर्यवेक्षित मॉडलों की रक्षा के लिए उपयुक्त तरीके स्व-पर्यवेक्षित मॉडलों के लिए अच्छी तरह से अनुकूल नहीं होते हैं – हालांकि ऐसे मॉडल छवि संश्लेषण क्षेत्र के सबसे प्रत्याशित और उत्साहित परिणामों में से हैं।

नई कागज़ का शीर्षक स्व-पर्यवेक्षित शिक्षा के खिलाफ मॉडल निकासी की कठिनाई पर है, और यह टोरंटो विश्वविद्यालय और वेक्टर संस्थान für कृत्रिम बुद्धिमत्ता से आया है।

स्व-जागरूकता

स्व-पर्यवेक्षित शिक्षा में, एक मॉडल को लेबल किए बिना डेटा पर प्रशिक्षित किया जाता है। लेबल के बिना, एक एसएसएल मॉडल को डेटा की आंतरिक संरचना से संबंधों और समूहों को सीखना होता है, जो डेटा की समान विशेषताओं की तलाश में होता है और धीरे-धीरे उन्हें नोड्स, या प्रतिनिधित्व में एकत्रित करता है।

जहां एक एसएसएल दृष्टिकोण व्यावहारिक है, यह अविश्वसनीय रूप से उत्पादक है, क्योंकि यह महंगी (अक्सर आउटसोर्स और विवादास्पद) वर्गीकरण की आवश्यकता को बायपास करता है जो क्राउडवर्कर्स द्वारा की जाती है, और मूल रूप से डेटा को स्वचालित रूप से तर्कसंगत बनाता है।

नई कागज़ के लेखकों द्वारा विचार किए गए तीन एसएसएल दृष्टिकोण हैं सिमसीएलआर, एक सियामीज़ नेटवर्क; सिमसियाम, एक और सियामीज़ नेटवर्क जो प्रतिनिधित्व सीखने पर केंद्रित है; और बार्लो ट्विन्स, एक एसएसएल दृष्टिकोण जिसने 2021 में रिलीज़ होने पर स्टेट-ऑफ-द-आर्ट इमेजनेट वर्गीकरणकर्ता प्रदर्शन हासिल किया।

लेबल वाले डेटा (अर्थात पर्यवेक्षित शिक्षा के माध्यम से प्रशिक्षित एक मॉडल) के लिए मॉडल निकासी एक अपेक्षाकृत सुव्यवस्थित शोध क्षेत्र है। यह भी आसान है इसका बचाव करने के लिए, क्योंकि हमलावर को पीड़ित मॉडल से लेबल प्राप्त करने की आवश्यकता होती है ताकि इसे पुनर्निर्मित किया जा सके।

एक पर्यवेक्षित शिक्षा वास्तुकला के खिलाफ एक 'नॉकऑफ़ क्लासिफायर' हमला मॉडल। स्रोत: https://arxiv.org/pdf/1812.02766.pdf

एक पिछले कागज़ से, एक पर्यवेक्षित शिक्षा वास्तुकला के खिलाफ एक ‘नॉकऑफ़ क्लासिफायर’ हमला मॉडल। स्रोत: https://arxiv.org/pdf/1812.02766.pdf

बिना व्हाइट-बॉक्स एक्सेस के, यह एक आसान काम नहीं है, क्योंकि ऐसे मॉडल से आउटपुट में आमतौर पर एक एसएसएल एपीआई की तुलना में कम जानकारी होती है।

कागज़ से*:

‘पिछला काम मॉडल निकासी पर ध्यान केंद्रित किया गया था पर्यवेक्षित शिक्षा (एसएल) सेटिंग, जहां पीड़ित मॉडल आमतौर पर एक लेबल या अन्य कम-आयामी आउटपुट जैसे विश्वास स्कोर या लॉजिट्स लौटाता है।

‘इसके विपरीत, एसएसएल एनकोडर उच्च-आयामी प्रतिनिधित्व लौटाते हैं; de facto आउटपुट एक रेसनेट-50 सिम-CLR मॉडल के लिए, एक लोकप्रिय वास्तुकला दृष्टि में, एक 2048-आयामी वेक्टर है।

‘हमें लगता है कि एनकोडर से जानकारी का यह काफी अधिक रिसाव उन्हें एसएल मॉडल की तुलना में निकासी हमलों के लिए अधिक संवेदनशील बनाता है।’

वास्तुकला और डेटा

शोधकर्ताओं ने एसएसएल मॉडल अनुमान/निकासी के लिए तीन दृष्टिकोणों का परीक्षण किया: प्रत्यक्ष निकासी, जिसमें एपीआई आउटपुट की तुलना एक पुनर्निर्मित एनकोडर के आउटपुट से एक उपयुक्त हानि फंक्शन जैसे मीन स्क्वायर्ड एरर (एमएसई) के माध्यम से की जाती है; प्रोजेक्शन हेड को पुनर्निर्मित करना, जहां मॉडल की एक महत्वपूर्ण विश्लेषणात्मक कार्यक्षमता, जो आमतौर पर तैनाती से पहले हटा दी जाती है, को पुनर्निर्मित किया जाता है और एक प्रतिकृति मॉडल में उपयोग किया जाता है; और प्रोजेक्शन हेड तक पहुंच, जो केवल तभी संभव है जब मूल विकासकर्ताओं ने वास्तुकला को उपलब्ध कराया हो।

विधि #1 में, प्रत्यक्ष निकासी, पीड़ित मॉडल के आउटपुट की तुलना एक स्थानीय मॉडल के आउटपुट से की जाती है; विधि #2 में मूल प्रशिक्षण वास्तुकला में उपयोग किए जाने वाले प्रोजेक्शन हेड को पुनर्निर्मित करना शामिल है (जो आमतौर पर एक तैनात मॉडल में शामिल नहीं होता है).

विधि #1 में, प्रत्यक्ष निकासी, पीड़ित मॉडल के आउटपुट की तुलना एक स्थानीय मॉडल के आउटपुट से की जाती है; विधि #2 में मूल प्रशिक्षण वास्तुकला में उपयोग किए जाने वाले प्रोजेक्शन हेड को पुनर्निर्मित करना शामिल है (जो आमतौर पर एक तैनात मॉडल में शामिल नहीं होता है).

शोधकर्ताओं ने पाया कि प्रत्यक्ष निकासी लक्ष्य मॉडल की एक कार्यात्मक प्रति प्राप्त करने के लिए सबसे प्रभावी तरीका था, और इसके अलावा यह सबसे कठिन है जिसे ‘हमले’ के रूप में वर्गीकृत किया जा सकता है (क्योंकि यह मूल रूप से एक मान्य और सामान्य एंड-यूज़र से अलग व्यवहार नहीं करता है).

लेखकों ने पीड़ित मॉडलों को तीन छवि डेटासेट पर प्रशिक्षित किया: सीआईएफएआर10, इमेजनेट, और स्टैनफोर्ड का स्ट्रीट व्यू हाउस नंबर्स (एसवीएचएन). इमेजनेट को रेसनेट50 पर प्रशिक्षित किया गया था, जबकि सीआईएफएआर10 और एसवीएचएन को रेसनेट18 और रेसनेट24 पर प्रशिक्षित किया गया था, जो सिमसीएलआर के एक मुफ्त पायटोर्च कार्यान्वयन पर था।

मॉडलों के डाउनस्ट्रीम (तैनात) प्रदर्शन का परीक्षण सीआईएफएआर100, एसटीएल10, एसवीएचएन, और फैशन-एमएनआईएस्ट के खिलाफ किया गया था। शोधकर्ताओं ने मॉडल की उच्चतर पहुंच वाले तरीकों के साथ भी प्रयोग किया, हालांकि यह पता चला कि प्रत्यक्ष निकासी, सबसे कम विशेषाधिकार प्राप्त दृष्टिकोण, सबसे अच्छे परिणाम दिए।

हमलों में अनुमानित और पुनरुत्पादित प्रतिनिधित्वों का मूल्यांकन करने के लिए, लेखकों ने मॉडल में एक रेखीय पूर्वानुमान परत जोड़ी, जिसे पूर्ण लेबल वाले प्रशिक्षण सेट पर परीक्षण कार्य से ठीक किया गया था, बाकी नेटवर्क परतें जमी हुई थीं। इस तरह, पूर्वानुमान परत पर परीक्षण सटीकता प्रदर्शन के लिए एक मेट्रिक के रूप में कार्य कर सकती है। चूंकि यह अनुमान प्रक्रिया में कुछ भी नहीं देता है, यह ‘व्हाइट बॉक्स’ कार्यक्षमता का प्रतिनिधित्व नहीं करता है।

परीक्षण रन पर परिणाम, जो (गैर-योगदान) रेखीय मूल्यांकन परत के माध्यम से संभव हुए। सटीकता स्कोर बोल्ड में।

परीक्षण रन पर परिणाम, जो (गैर-योगदान) रेखीय मूल्यांकन परत के माध्यम से संभव हुए। सटीकता स्कोर बोल्ड में।

परिणामों पर टिप्पणी करते हुए, शोधकर्ता कहते हैं:

‘हम पाते हैं कि पीड़ित के प्रतिनिधित्व की नकल करने का प्रत्यक्ष उद्देश्य डाउनस्ट्रीम कार्यों पर उच्च प्रदर्शन देता है,尽管 हमले को पीड़ित एनकोडर को प्रशिक्षित करने के लिए उपयोग की जाने वाली प्रश्नों की संख्या का एक अंश (कुछ मामलों में 15% से कम) की आवश्यकता होती है।’

और जारी रखते हैं:

‘[यह] एसएसएल के साथ प्रशिक्षित एनकोडर की रक्षा करना चुनौतीपूर्ण है क्योंकि आउटपुट प्रतिनिधित्व एक बड़ी मात्रा में जानकारी का रिसाव करते हैं। सबसे आशाजनक रक्षाएं प्रतिक्रियात्मक तरीके हैं, जैसे कि वॉटरमार्किंग, जो उच्च-क्षमता वाले एनकोडर में विशिष्ट ऑगमेंटेशन एम्बेड कर सकते हैं।’

 

* मेरे द्वारा कागज़ के इनलाइन उद्धरणों को हाइपरलिंक में परिवर्तित किया गया।

पहली बार 18 मई 2022 को प्रकाशित हुआ।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai