زاوية Anderson

باحثو الذكاء الاصطناعي يقدرون أن 97٪ من مواقع الاتحاد الأوروبي تفتقر إلى متطلبات الخصوصية في GDPR – ولا سيما التنميط المستخدم

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

استخدم باحثون في الولايات المتحدة تقنيات التعلم الآلي لدراسة سياسات الخصوصية لآلاف المواقع على الإنترنت التابعة للاتحاد الأوروبي. وجدوا أن 97٪ من المواقع التي تمت دراستها لم تكن متوافقة مع متطلبات واحدة على الأقل من الإطار التنظيمي للاتحاد الأوروبي لعام 2018، وأنه يتوافق بشكل أقل مع المتطلبات التنظيمية حول ممارسة “التنميط المستخدم”.

الورقة تقول:

‘[منذ] سياسة الخصوصية هي القناة الأساسية للاتصال للمستخدمين لفهم وسيطرة خصوصيتهم، قامت العديد من الشركات بتحديث سياسات الخصوصية الخاصة بهم بعد تطبيق GDPR. ومع ذلك، فإن معظم سياسات الخصوصية معقدة وملئها باللغة الفنية، وتعرف بشكل غامض على ممارسات البيانات للشركات وحقوق المستخدمين. لذلك، من غير الواضح ما إذا كانت تتوافق مع GDPR.’

تستمر:

‘تظهر نتائجنا أن حتى بعد دخول GDPR حيز التنفيذ، لا تزال 97٪ من المواقع لا تتوافق مع متطلبات واحدة على الأقل من GDPR.’

الدراسة هي دراسة بعنوان الكشف التلقائي عن متطلبات الإفصاح في سياسات الخصوصية باستخدام التعلم النشط العميق، وهي من ثلاثة باحثين في جامعة فيرجينيا في شارلوتسفيل.

الخصوصية في النهاية

كانت منطقة أقل مطابقة، وفقًا للدراسة، هي متطلبات GDPR المتعلقة بالتنميط المستخدم، حيث ذكرت المؤلفون أن 15.3٪ فقط من المواقع المدروسة كانت متوافقة تمامًا مع هذه القاعدة المحددة.

رسم بياني لمدى مطابقة سياسات الخصوصية للمواقع على الإنترنت التي تمت دراستها للبحث. مصدر: https://arxiv.org/pdf/2111.04224.pdf

رسم بياني لمدى مطابقة سياسات الخصوصية للمواقع على الإنترنت التي تمت دراستها للبحث. مصدر: https://arxiv.org/pdf/2111.04224.pdf

التنميط المستخدم (حيث يتم تسجيل تفاعل الشخص مع المواقع على الإنترنت ويتم استخدامه غالبًا لاستهدافه في سياقات أخرى على الإنترنت، مثل الإعلانات) أصبح واحدًا من أكثر الجدل في التكنولوجيا منذ فضيحة كامبريدج أناليتيكا.

في يوم الثلاثاء، مرر لجنة رئيسية في البرلمان الأوروبي المرحلة الأولى من تشريع قانون الأسواق الرقمية الجديد (DMA)، الذي سيحظر الاستهداف السلوكي للأقران، مع فرض غرامات تصل إلى 20٪ من المبيعات السنوية العالمية للشركات المخالفة.

على الرغم من أن القانون تلقى استقبالًا من وسائل الإعلام على أنه رد مباشر على النفوذ المتزايد لعمالقة التكنولوجيا مثل فيسبوك وجوجل، فإن حجم عدم المطابقة المتمثلة في البحث الجديد يشير إلى أن غالبية الشركات في الاتحاد الأوروبي (بما في ذلك المكاتب المقيمة في الاتحاد الأوروبي للشركات الأمريكية التي تتعامل في أوروبا) معرضة قانونيًا لغرامات GDPR.

علاوة على ذلك، فرضت إيطاليا هذا الأسبوع أعلى غرامة مسموح بها بقيمة 10 ملايين يورو (11.2 مليون دولار أمريكي) على أبل وجوجل لاستغلال التنميط المستخدم، من بين انتهاكات أخرى.

البيانات

تم اختبار المواقع التي تم فحصها في البحث الجديد من خلال عينة من أفضل 10,000 موقع على الإنترنت مدرج في Quantcast، وتم استخراج سياسات الخصوصية باللغة الإنجليزية من خلال عمليات بحث Yandex على VPNs مقيمة في المملكة المتحدة (لضمان عدم حجب السياسات بشكل جغرافي).

كانت المواقع على الإنترنت في الاتحاد الأوروبي ملزمة بتقديم سياسات خصوصية محددة، تغطي 18 متطلبًا مركزيًا (انظر الرسم البياني أعلاه) منذ دخول قانون حماية البيانات العام حيز التنفيذ الكامل في مايو 2018.

قامت الباحثون بتحديد فترة استخراج سياسات الخصوصية إلى فترة من أغسطس 2018 فصاعدًا، لضمان حصول المجالات على وقت معقول لنشر السياسات المطلوبة (متطلب كان لديهم معرفة مسبقة به لمدة سنة على الأقل من مرحلة التطوير البالغ مدتها عامين لGDPR منذ عام 2016).

تم إنتاج مجموعة من سياسات الخصوصية البالغ عددها 9,761 سياسة، وتم اختيار 1,080 سياسة بشكل عشوائي من قبل الباحثين.

المعالجة المسبقة

استخدم الفريق خبيرين قانونيين لتدريب أربعة معنيين بالتعليم لتحديد كل واحد من 18 سياسة خصوصية ممكنة المطلوبة من قبل GDPR.

كان بعض اللغو في السياسات يغطي أكثر من واحد من المتطلبات 18، مما يجعل من الضروري استخدام شبكة عصبية تشبه القنوات لتحديد ميزات اللغة المرتبطة بكل سياسة.

حاولت محاولة أولية لتدريب نموذج لتحديد المطابقة بناءً على اللغة تحقيق 80.5٪ من النجاح. لتحسين هذه النتائج، طبق الباحثون التعلم النشط لتعزيز أداء النموذج باستخدام بيانات مخطوطة أقل. من خلال هذه الوسائل، كان من الممكن تدريب تصنيف CNN حتى دقة 89.2٪، مع درجة F1 تبلغ 0.88 (حيث ‘1’ هو النجاح التام).

为了确保 أن التضمين الكلماتي كان محددًا لسياسة الخصوصية، قام الباحثون بتدريب نموذج تضمين كلمات غير مُرقّب باستخدام مكتبة FastText باللغة البرمجة بايثون من فيسبوك.

وفقًا للممارسة المعتادة، تم تقسيم البيانات النهائية بنسبة 80/20 بين بيانات التدريب وبيانات الاختبار (أي بيانات مختارة عشوائيًا التي سيتم تقييم دقة الخوارزمية من خلالها). تمت إضافة دراسة قياس البشر في الحلقة إلى الهيكل لتقيم جودة النتائج.

هيكل نظام التصنيف.

هيكل نظام التصنيف.

في إطار سير العمل، تم إنتاج 11,271 قطعة من سياسات الخصوصية المُرقّمة من قبل البشر، وتمت مراجعتها من قبل أربعة معنيين بالتعليم تم تدريبهم من قبل الخبراء القانونيين المشاركين في الدراسة. في حالة حدوث خلاف، كانت نسبة اتفاق 75٪ ضرورية لعدم رفض البيانات من الإدراج.

البشر في الحلقة – لم يكن من الممكن تلقين تعليم التسمية للبيانات السياسية بشكل كامل، على الرغم من أن التعلم النشط تمكّن من سير عمل قائم على المجموعة الذي جعل المشروع ممكنًا.

البشر في الحلقة – لم يكن من الممكن تلقين تعليم التسمية للبيانات السياسية بشكل كامل، على الرغم من أن التعلم النشط تمكّن من سير عمل قائم على المجموعة الذي جعل المشروع ممكنًا.

إلى جانب النتائج المذكورة بالفعل، وجد المستخدمون أن النقل – الحق بموجب GDPR لنقل أو تصدير البيانات التي تحتفظ بها شركة – كان خدمة سيئة تقريبًا مثل التنميط.

يخلص الباحثون إلى:

‘[المتطلبات] مثل حق المستخدمين في النقل وتقديم معلومات الاتصال بمدير حماية البيانات (معلومات الاتصال بمدير حماية البيانات) يتم تغطيتها بواسطة 15.5٪ و 16.4٪ من المواقع على التوالي. المتطلبات الأساسية الأخرى، مثل حق المستخدمين في تقديم الشكاوى، سحب الموافقة، حق الاعتراض، وقرار الكفاءة، يتم تغطيتها بواسطة 17-20٪ من المواقع.’

… ويتواصل:

‘يبدو أن 3٪ فقط من المواقع تتوافق تمامًا مع 18 متطلبًا. تشير هذه النتائج إلى أن العديد من المواقع لا تزال لا تتبع متطلبات GDPR.’

 

 

7pm 26/11/2021 – تم توضيح تعليق الرسم البياني الأول. – MA

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai