زاوية Anderson

سرقة نماذج التعلم الآلي من خلال مخرجات واجهة برمجة التطبيقات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تقدم أبحاث جديدة من كندا طريقة ممكنة من خلالها يمكن للمهاجمين سرقة ثمار الإطارات الغالية للتعلم الآلي، حتى عندما يكون الوصول الوحيد إلى نظام مملوك هو عبر واجهة برمجة تطبيقات معالجة جانب الخادم عالية التصفية ومدفوعة بشكل جيد (واجهة أو بروتوكول يقوم بمعالجة استفسارات المستخدم جانب الخادم، ويعيد فقط استجابة الإخراج).

بينما يتطلع قطاع البحث بشكل متزايد إلى تحقيق الربح من تدريب النماذج باهظة الثمن من خلال تطبيقات التعلم الآلي كخدمة (MLaaS)، تشير الأعمال الجديدة إلى أن نماذج التعلم الذاتي (SSL) أكثر عرضة لهذا النوع من استخراج النموذج، لأنها يتم تدريبها بدون علامات، مما يُبسط الاستخراج، وتقدم عادة نتائج تحتوي على الكثير من المعلومات المفيدة لمن يرغب في تكرار النموذج المصدر (المخفي).

في محاكاة الاختبارات “الsandbox” السوداء (حيث منح الباحثون أنفسهم الوصول إلى نموذج ضحية محلي بدون أي وصول أكثر مما سيكون متاح للمستخدم العادي عبر واجهة برمجة تطبيقات على الويب)، تمكن الباحثون من تكرار الأنظمة الهدف بموارد منخفضة نسبيًا:

‘يمكن لهجماتنا سرقة نسخة من نموذج الضحية الذي يحقق أداءً جيدًا في مهام أسفل الأنبوب في أقل من خمس استفسارات المستخدم لتدريب نموذج الضحية. ضد نموذج ضحية تم تدريبه على 1.2 مليون عينة غير محددة من ImageNet، مع دقة 91.9٪ في مهمة التصنيف Fashion-MNIST أسفل الأنبوب، سرقت هجوم الاستخراج المباشر لدينا مع خسارة InfoNCE نسخة من المُкод التي تحقق دقة 90.5٪ في 200 ألف استفسار.

‘على نحو مماثل، ضد نموذج ضحية تم تدريبه على 50 ألف عينة غير محددة من CIFAR10، مع دقة 79.0٪ في مهمة التصنيف CIFAR10 أسفل الأنبوب، سرقت هجوم الاستخراج المباشر لدينا مع خسارة SoftNN نسخة تحقق دقة 76.9٪ في 9 آلاف استفسار.’

استخدم الباحثون ثلاثة أساليب للهجوم، ووجدوا أن 'الاستخراج المباشر' كان الأكثر فعالية. تم سرقة هذه النماذج من نموذج محلي تم إعادة إنشائه من CIFAR10 باستخدام 9 آلاف استفسار من مجموعة اختبار CIFAR10. مصدر: https://arxiv.org/pdf/2205.07890.pdf

استخدم الباحثون ثلاثة أساليب للهجوم، ووجدوا أن ‘الاستخراج المباشر’ كان الأكثر فعالية. تم سرقة هذه النماذج من نموذج محلي تم إعادة إنشائه من CIFAR10 باستخدام 9 آلاف استفسار من مجموعة اختبار CIFAR10. مصدر: https://arxiv.org/pdf/2205.07890.pdf

يشير الباحثون أيضًا إلى أن الأساليب التي تُعتبر مناسبة لحماية النماذج الخاضعة للإشراف من الهجوم لا تُقدم أداءً جيدًا مع النماذج المُدرَّبة على أساس غير مُشرَّف – على الرغم من أن هذه النماذج تمثل بعض الفواكه الأكثر توقعًا ولاحتفالًا بقطاع合成 الصور.

الورقة الجديدة المُقدمة تحمل عنوان حول صعوبة الدفاع عن التعلم الذاتي ضد استخراج النموذج، وهي تأتي من جامعة تورنتو ومعهد فيكتور للاستخبارات الاصطناعية.

الوعي الذاتي

في التعلم الذاتي، يتم تدريب النموذج على بيانات غير محددة. بدون علامات، يجب على نموذج التعلم الذاتي تعلم الارتباطات والمجموعات من البنية الضمنية للبيانات، ويسعى لتحديد جوانب مماثلة من البيانات وترسيخها تدريجيًا في عقد أو تمثيلات.

حيثما يكون النهج القائم على التعلم الذاتي مجديًا، فهو منتج للغاية، لأنه يتجاوز حاجة التصنيف الغالية (التي غالبًا ما يتم التعاقد معها وتكون مثيرة للجدل) بواسطة العاملين في الحشود، ويعمل بشكل أساسي على ترشيد البيانات بشكل مستقل.

النهج الثلاثة للتعلم الذاتي التي أشار إليها مؤلفو الورقة الجديدة هي SimCLR، وهي شبكة سيامية؛ SimSiam، وهي شبكة سيامية أخرى تركز على تعلم التمثيل؛ وBarlow Twins، وهي نهج للتعلم الذاتي حقق أداءً ممتازًا في تصنيف ImageNet عند إصداره في عام 2021.

استخراج النموذج للبيانات المُحددة (أي نموذج تم تدريبه من خلال التعلم الخاضع للإشراف) هو مجال بحث موثق نسبيًا. كما أنه أسهل في الدفاع عنه، لأن المهاجم يجب أن يحصل على العلامات من نموذج الضحية من أجل إعادة إنشاء النموذج.

نموذج هجوم تصنيف مزيف ضد هيكل تعلم خاضع للإشراف. مصدر: https://arxiv.org/pdf/1812.02766.pdf

من ورقة سابقة، نموذج هجوم تصنيف مزيف ضد هيكل تعلم خاضع للإشراف. مصدر: https://arxiv.org/pdf/1812.02766.pdf

بدون وصول أبيض، هذه ليست مهمة بسيطة، لأن الإخراج النموذجي من طلب واجهة برمجة التطبيقات إلى مثل هذا النموذج يحتوي على معلومات أقل من الإخراج النموذجي لواجهة برمجة التطبيقات النموذجية.

من الورقة*:

‘ركزت الأعمال السابقة على استخراج النموذج على إعداد التعلم الخاضع للإشراف، حيث يُرجع نموذج الضحية عادةً علامة أو مخرجات منخفضة الأبعاد مثل درجات الثقة أو لوجيت.

‘على العكس من ذلك، تعيد معالجات التعلم الذاتي تمثيلات عالية الأبعاد؛ de facto الإخراج لمُкод ResNet-50 Sim-CLR، وهي هيكل شائع في الرؤية، هو متجه ذو أبعاد 2048.

‘نفترض أن هذا التسرب المعلوماتي الأعلى من المُкод يجعلهم أكثر عرضة للهجمات على استخراج النموذج من نماذج التعلم الخاضع للإشراف.’

الهيكل والبيانات

جرب الباحثون ثلاثة نهج لاستخراج/استدلال نموذج التعلم الذاتي: الاستخراج المباشر، حيث يتم مقارنة مخرجات واجهة برمجة التطبيقات مع مخرجات مُкод محلي من خلال دالة خسارة مناسبة مثل متوسط مربع الخطأ (MSE)؛ إعادة إنشاء رأس المشروع، حيث يتم إعادة تجميع وظيفة تحليلية حاسمة من النموذج، وعادة ما يتم التخلص منها قبل النشر، ويتم استخدامها في نموذج مكرر؛ والوصول إلى رأس المشروع، وهو ممكن فقط في الحالات التي يجعل فيها المطورون الأصليون الهيكل متاحًا.

في الطريقة الأولى، الاستخراج المباشر، يتم مقارنة مخرجات نموذج الضحية بمخرجات نموذج محلي؛ الطريقة الثانية تتضمن إعادة إنشاء رأس المشروع المستخدم في الهيكل الأصلي للتدريب (والذي يتم التخلص منه عادةً في نموذج منشور).

في الطريقة الأولى، الاستخراج المباشر، يتم مقارنة مخرجات نموذج الضحية بمخرجات نموذج محلي؛ الطريقة الثانية تتضمن إعادة إنشاء رأس المشروع المستخدم في الهيكل الأصلي للتدريب.

وجد الباحثون أن الاستخراج المباشر كان الأكثر فعالية لتحقيق نسخة وظيفية من النموذج الهدف، ويتمتع بميزة إضافية أنه أكثر صعوبة في وصفها على أنها “هجوم” (لأنه يتصرف بشكل أساسي مثل مستخدم نهاية عادي وصالح).

قام المؤلفون بتدريب نماذج الضحية على ثلاث مجموعات بيانات للصور: CIFAR10، ImageNet، وSVHN من جامعة ستانفورد. تم تدريب ImageNet على ResNet50، في حين تم تدريب CIFAR10 وSVHN على ResNet18 وResNet24 عبر تنفيذ PyTorch المتاح للجمهور من SimCLR.

تم اختبار أداء النماذج أسفل الأنبوب (أي النشر) ضد CIFAR100 وSTL10 وSVHN وFashion-MNIST. كما قام الباحثون بتجربة أساليب أكثر “بيضاء الصندوق” للاستحواذ على النموذج، على الرغم من أن الاستخراج المباشر، وهو النهج الأقل امتيازات، أعطى أفضل النتائج.

为了 تقييم التمثيلات المُستخرجة والمكررة في الهجمات، أضاف المؤلفون طبقة تنبؤ خطية إلى النموذج، والتي تم تحسينها على مجموعة التدريب الكاملة للمهمة اللاحقة (المنشورة)، مع تجميد باقي طبقات الشبكة. بهذه الطريقة، يمكن أن تعمل دقة الاختبار على طبقة التنبؤ كعامل أداء.

نتائج التشغيل، ممكنة بفضل طبقة التقييم الخطي (التي لا تساهم في عملية الاستدلال). درجات الدقة بالخط العريض.

نتائج التشغيل، ممكنة بفضل طبقة التقييم الخطي. درجات الدقة بالخط العريض.

في تعليقهم على النتائج، يقول الباحثون:

‘نجد أن الهدف المباشر من تقليد تمثيلات الضحية يعطي أداءً عاليًا في المهام أسفل الأنبوب على الرغم من أن الهجوم يتطلب فقط جزءًا (أقل من 15٪ في بعض الحالات) من عدد الاستفسارات اللازمة لتدريب المُкод المسروق في المقام الأول.’

ويستمرّون:

‘من الصعب الدفاع عن المُкод المُدرَّب بالتعلم الذاتي لأن تمثيلات الإخراج تتسرب كمية كبيرة من المعلومات. أكثر الأساليب الدفاعية وعدًا هي الأساليب التفاعلية، مثل وضع العلامات المائية، والتي يمكنها دمج تعديلات محددة في المُкод ذي السعة العالية.’

 

* تحويلي لمراجع الورقة الداخلية إلى روابط.

نُشر لأول مرة في 18 مايو 2022.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai