قادة الفكر

ثلاث تقنيات تعلم الآلة الحفاظ على الخصوصية لحل أكثر القضايا أهمية في هذا العقد

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

بواسطة Amogh Tarcar، باحث في تعلم الآلة والذكاء الاصطناعي، Persistent Systems.

الخصوصية، وفقًا للخبراء عبر مجموعة واسعة من المجالات، ستكون أهم قضية في هذا العقد. هذا صحيح بشكل خاص لتعلم الآلة (ML) حيث يتم تغذية الخوارزميات بمعلومات ضخمة.

تعتمد تقنيات نمذجة ML تقليديًا على مركزية البيانات من مصادر متعددة في مركز بيانات واحد. بعد كل شيء، تكون نماذج ML في أقوى حالاتها عندما يكون لديها إمكانية الوصول إلى كميات هائلة من البيانات. ومع ذلك، هناك مجموعة من التحديات المتعلقة بالخصوصية التي تأتي مع هذه التقنية. أصبح جمع البيانات المتنوعة من مصادر متعددة أقل قابلية للتطبيق اليوم بسبب القضايا التنظيمية مثل HIPAA وGDPR وCCPA. بالإضافة إلى ذلك، تزيد مركزية البيانات من نطاق ومقياس إساءة استخدام البيانات وتهديدات الأمان في شكل تسريبات البيانات.

为了克服这些 التحديات، تم تطوير عدة ركائز لتعلم الآلة الحفاظ على الخصوصية (PPML) مع تقنيات محددة تقلل من مخاطر الخصوصية وضمان أن تظل البيانات آمنة بشكل معقول. إليك بعض أهم هذه التقنيات:

1. التعلم الفيدرالي

التعلم الفيدرالي هو تقنية تدريب تعلم الآلة يقلب مشكلة جمع البيانات رأسًا على عقب. بدلاً من جمع البيانات لإنشاء نموذج تعلم الآلة واحد، يجمع التعلم الفيدرالي نماذج تعلم الآلة نفسها. هذا يضمن أن لا تغادر البيانات موقعها الأصلي، ويسمح للأطراف المتعددة بالتعاون وإنشاء نموذج تعلم الآلة المشترك دون مشاركة البيانات الحساسة مباشرة.

يعمل هذا النموذج كما يلي. تبدأ بنموذج تعلم الآلة الأساسي ثم تشاركه مع كل عقدة عميلة. ثم تقوم العقد العميلة بتشغيل التدريب المحلي على هذا النموذج باستخدام بياناتها الخاصة. يتم مشاركة تحديثات النموذج بشكل دوري مع عقدة التنسيق، التي تمتلك هذه التحديثات وتدمجها معًا لتحصل على نموذج عالمي جديد. بهذه الطريقة، تحصل على الرؤى من مجموعات بيانات متنوعة دون الحاجة إلى مشاركة هذه المجموعات.

مصدر: Persistent Systems

في سياق الرعاية الصحية، هذا أداة قوية ومتأمنة بشكل رائع لحفظ بيانات المرضى بأمان بينما تعطى الباحثين حكمة الجماعة. من خلال عدم جمع البيانات، يخلق التعلم الفيدرالي طبقة أمان إضافية. ومع ذلك، لا تزال النماذج وتحديثات النماذج представляет خطرًا أمنيًا إذا تم إهمالها.

2. الخصوصية التفرقية

نماذج ML غالبًا ما تكون أهدافًا للهجمات على الاستدلال بالعضوية. لنفترض أنك شاركت بياناتك الصحية مع مستشفى من أجل المساعدة في تطوير لقاح ضد السرطان. يحافظ المستشفى على بياناتك بأمان، ولكنه يستخدم التعلم الفيدرالي لتدريب نموذج ML متاح علنًا. بعد بضعة أشهر، يستخدم المخترقون هجومًا على الاستدلال بالعضوية لتحديد ما إذا كانت بياناتك قد استخدمت في تدريب النموذج أم لا. ثم يقدمون رؤى إلى شركة تأمين، التي قد ترفع أقساطك بناءً على خطر إصابتك بالسرطان.

تضمن الخصوصية التفرقية أن الهجمات على نماذج ML لن تتمكن من تحديد النقاط البيانية المحددة المستخدمة أثناء التدريب، وبالتالي تقليل خطر كشف البيانات الحساسة المستخدمة في تدريب تعلم الآلة. يتم ذلك عن طريق تطبيق “الضوضاء الإحصائية” لزعزعة البيانات أو معلمات نموذج تعلم الآلة أثناء تدريب النماذج، مما يجعل من الصعب تشغيل الهجمات وتحديد ما إذا كانت بيانات فرد معين قد استخدمت لتدريب النموذج.

على سبيل المثال، أصدرت Facebook مؤخرًا Opacus، وهي مكتبة عالية السرعة لتدريب نماذج PyTorch باستخدام خوارزمية تدريب تعلم الآلة بالخصوصية التفرقية تسمى DP-SGD. يظهر الشريط التالي كيف يستخدم الضوضاء لتخفيض البيانات.

 

يتم التحكم في هذا الضوضاء بواسطة معامل يسمى Epsilon. إذا كان قيمة Epsilon منخفضة، فإن النموذج يمتلك خصوصية بيانات مثالية ولكنها تفتقر إلى فائدة و精度. وعلى العكس، إذا كان لديك قيمة Epsilon عالية، فإن خصوصية البيانات ستنخفض بينما تزيد دقة النموذج. الحيلة هي العثور على توازن لتحسين كلا الجانبين.

3. التشفير المتجانس

التشفير التقليدي غير متوافق مع تعلم الآلة لأن البيانات المشفرة لا يمكن فهمها بواسطة خوارزمية تعلم الآلة بعد التشفير. ومع ذلك، التشفير المتجانس هو نظام تشفير خاص يسمح لنا بمواصلة بعض أنواع الحسابات.

مصدر: OpenMined

قوة هذا التشفير تكمن في أن التدريب يمكن أن يحدث في مساحة مشفرة بالكامل. لا يحمي هذا فقط أصحاب البيانات، بل يحمي أيضًا أصحاب النماذج. يمكن لمالك النموذج تشغيل الاستدلال على البيانات المشفرة دون رؤيتها أو إساءة استخدامها.

عند تطبيق التشفير المتجانس على التعلم الفيدرالي، يمكن أن يحدث اندماج تحديثات النموذج بشكل آمن لأنها تحدث في بيئة مشفرة بالكامل، مما يقلل بشكل كبير من خطر هجمات الاستدلال بالعضوية.

عقد الخصوصية

عندما ندخل عام 2021، يعتبر تعلم الآلة الحفاظ على الخصوصية مجالًا ناشئًا يتميز بنشاط بحثي كبير. إذا كان العقد السابق كان حول إزالة العوائق أمام البيانات، فإن هذا العقد سيكون حول إزالة العوائق أمام نماذج تعلم الآلة مع الحفاظ على خصوصية البيانات الأساسية من خلال التعلم الفيدرالي والخصوصية التفرقية والتشفير المتجانس. هذه التقنيات توفر طريقة واعدة جديدة لتطوير حلول تعلم الآلة بطريقة تتوافق مع الخصوصية.

Amogh هو باحث في مجال التعلم الآلي ويعمل في مختبر أبحاث الذكاء الاصطناعي في Persistent Systems. يركز بحثه الحالي على تطبيقات التعلم الموحد وإنشاء أدوات معالجة اللغة الطبيعية لاستخراج المعرفة.