زاوية Anderson

تحليل 25 عامًا من سياسات الخصوصية باستخدام التعلم الآلي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

استخدمت دراسة حديثة تقنيات تحليل التعلم الآلي لتحليل قابليّة القراءة وفائدة وطول و複雑ية أكثر من 50,000 سياسة خصوصية على مواقع إلكترونية شائعة في فترة تمتد لمدة 25 عامًا من 1996 إلى 2021. وتخلص البحث إلى أن القارئ العادي سيلزمه تقديم 400 ساعة من “الوقت القرائي السنوي” (أكثر من ساعة في اليوم) من أجل اختراق زيادة عدد الكلمات واللغة الغامضة واللغة الغامضة التي تتميز بها السياسات الخصوصية الحديثة لمواقع إلكترونية شائعة.

ويذكر التقرير ما يلي:

‘لقد زادت طول السياسة بเฉลّيًا تقريبًا إلى الضعف في السنوات العشر الماضية، مع 2159 كلمة في مارس 2011 و 4191 كلمة في مارس 2021، وازدادت أربع مرات تقريبًا منذ عام 2000 (1146 كلمة).’

متوسط عدد الكلمات وعدد الجمل في السياسات التي تمت دراستها، على مدى فترة 25 عامًا.

متوسط عدد الكلمات وعدد الجمل في السياسات التي تمت دراستها، على مدى فترة 25 عامًا. مصدر: https://arxiv.org/pdf/2201.08739.pdf

على الرغم من أن معدل الزيادة في الطول انخفض عندما دخلت لوائح حماية البيانات العامة (GDPR) وقانون حماية المستهلك في كاليفورنيا (CCPA) حيز التنفيذ، يرفض البحث هذه التغييرات باعتبارها “تأثيرات صغيرة” تظهر أنها غير ملحوظة مقابل الاتجاه العام على المدى الطويل. ومع ذلك، يُحدد GDPR على أنه سبب محتمل لزيادة اللغة الغامضة في السياسات (انظر أدناه).

افتراضًا أن سرعة القراءة تبلغ 250 كلمة في الدقيقة، يُدّعي البحث أن سياسة الخصوصية العادية تستغرق الآن 17 دقيقة للقراءة، بينما تستغرق السياسات الأكثر شعبية (أي السياسات المرتبطة بعدد كبير من المستخدمين) 23 دقيقة لإكمالها.

تستغرق السياسة الأطول في مجموعة البيانات، من مايكروسوفت، 152 دقيقة للاستهلاك، وفقًا للبحث، الذي استخدم عددًا من المرتجعات على موديل لغة BERT من جوجل.

زيادة معدل الساعات السنوية اللازمة لقراءة سياسات الخصوصية الحديثة، افتراضًا أن القارئ يزور 1462 موقعًا فريدًا في السنة.

زيادة معدل الساعات السنوية اللازمة لقراءة سياسات الخصوصية الحديثة، افتراضًا أن القارئ يزور 1462 موقعًا فريدًا في السنة.

ينسب البحث الكثير من الزيادة الأخيرة في الإطالة والغموض في سياسات الخصوصية إلى ردود الأفعال على محاولات فرض اللوائح على مدى العقدين الماضيين، ولكن أيضًا إلى استخدام متطلبات الامتثال للوائح بشكل غير صادق كعذر لزيادة نطاق وغموض سياسات الخصوصية بشكل خفي.

‘بشكل عام، تُظهر نتائجنا أن اللوائح الخصوصية الحديثة لم تحسن من خصوصية المستخدمين على الإنترنت بشكل كبير، ولكنها أدت إلى سياسات خصوصية أكثر امتدادًا تصف ممارسات بيانات أكثر غزوًا.’

على الرغم من أن العديد من أوراق التعلم الآلي الطبيعي قد تناولت قابليّة القراءة وجماليات أخرى لسياسات الخصوصية في السنوات الأخيرة، يعتقد المؤلف أن هذا هو أول مشروع من نوعه يقدم نظرة عامة شاملة على تطور السياسات في العقود الأخيرة.

يُسمى الورقة سياسات الخصوصية عبر العصور: محتوى و قابليّة القراءة لسياسات الخصوصية 1996-2021، ويأتي من إيزابيل فاغنر في معهد التكنولوجيا الإلكترونية في جامعة دي مونتفورت في المملكة المتحدة.

اللغة المُبهمة

كما يُشير التقرير إلى أن متوسط عدد “الكلمات المُبهمة” (أي قابل للقبول، مهم، بشكل رئيسي، وغيرها من الكلمات التي لا توفر معنى محدد) في سياسات الخصوصية ازداد بشكل مطرد حتى عام 2018، ولكن ثم ازدادت من وسطي 227 حول مارس 2018 إلى 304 في يونيو 2020.

يُدّعي المؤلف أن هذا الارتفاع يُعزى إلى آثار GDPR، ويتوصل البحث إلى أن أكثر من ثلثي الجمل (72%) في سياسات الخصوصية التي تمت دراستها تحتوي على كلمة مبهمة واحدة على الأقل.

قابليّة القراءة

عبر ثلاثة مقاييس شائعة لصعوبة القراءة، وجدت الدراسة أن سياسات الخصوصية أصبحت أكثر صعوبة في القراءة مع مرور السنوات. ويُقدر المؤلفون أن 41% من السياسات القائمة في عام 2021 كان لها وسطي فلسك للقراءة (FRE، أعلى هو أفضل) يبلغ 31.8 فقط، مع ملاحظة المؤلف هذا الرقم يُشير إلى نص صعب للغاية يُفضل فهمه من قبل خريجي الجامعة.

في الوقت نفسه، لم تصل سوى 6.7% من السياسات إلى درجة FRE تُجاوز 45 (التي يُشير التقرير إلى أنها معيار القراءة المطلوب لسياسات التأمين في ولاية فلوريدا).

إدراك التغيير في السياسة

كما يعالج البحث مدى شمول سياسات الخصوصية لأدلة حول كيفية إخطار المُوافق المحتمل في حالة التحديثات اللاحقة، والتي قد تؤثر على رغبة المستخدم في الحفاظ على الاتفاق.

يلاحظ المؤلف:

‘في عام 2021، تحتوي 73% من السياسات على بيان حول تغيير السياسة. من بينها، 34% تشير إلى أن التغييرات سوف يتم الإعلان عنها من خلال إشعار في سياسة الخصوصية، و 37% سوف تنشر إشعارًا على الموقع، و 22% سوف ترسل إشعارًا شخصيًا (تُترك أنواع الإشعارات الأخرى غير محددة).’

‘ونتيجة لذلك، من غير المحتمل أن يدرك معظم المستخدمين التغييرات في سياسات الخصوصية. ‘

‘علاوة على ذلك، يتم تقديم خيارات قليلة للمستخدمين عند تغيير السياسات. من بين السياسات التي تُخبر المستخدمين بالتغيرات، لا تُقدم سوى 12% موافقة جديدة، بينما لا تُقدم 34% أي خيار، و 54% تُتركه غير محدد.’

مما وجده البحث حول الطرق المُستخدمة لإخطار المستخدمين بتغييرات في السياسات.

مما وجده البحث حول الطرق المُستخدمة لإخطار المستخدمين بتغييرات في السياسات.

الخيارات المحدودة المتعلقة بالتتبع

وفقًا للدراسة، يتم تقديم مجموعة أوسع من الآليات في سياسات الخصوصية للوصول إلى معلومات حساب المستخدم أكثر من الوصول إلى بيانات ملف المستخدم. يمكن إنشاء بيانات ملف المستخدم وتحديثها من خلال آليات آلية وغامضة، بينما يتم منح بيانات حساب المستخدم صراحة من قبل المستخدم، ويجب أن تكون قابلة للتعديل بموجب لوائح مختلفة القوانين.

تُعالج خيارات المستهلك المتعلقة بموافقة الكوكيز في سياسات الخصوصية (موضوع جذب مناقشات حامية منذ ظهور GDPR الذي أدى إلى مئات الآلاف من نافذة موافقة الكوكيز لمواقع أوروبية ودولية) بشكل عام في السياسات، لكنها تخفي طبقة أهم من البيانات الأقل إمكانية الوصول:

‘الخيارات المتعلقة بالكوكيز غير كافية لحماية المستخدمين من جميع أنواع التتبع لأن آليات الاختيار أو التحكم نادرًا ما تُقدم لتحديد معلومات الحاسوب، معرفات الجهاز، و المعرفات الشخصية، التي تسمح بالتتبع للمستخدمين من خلال التمهيد.’

تباين واضح في مستوى التحكم المُتاح في سياسات الخصوصية بين بيانات ملف المستخدم (التي يمكن الحصول عليها بوسائل ضمنية أو خفية) وبيانات حساب المستخدم (التي يتم منحها بعض forme من التحكم بموجب GDPR وCCPA وآليات وطنية وإقليمية مماثلة).

تباين واضح في مستوى التحكم المُتاح في سياسات الخصوصية بين بيانات ملف المستخدم (التي يمكن الحصول عليها بوسائل ضمنية أو خفية) وبيانات حساب المستخدم (التي يتم منحها بعض forme من التحكم بموجب GDPR وCCPA وآليات وطنية وإقليمية مماثلة).

البيانات

为了获取研究数据,爬取了网站以查找指向其隐私政策的链接,经常需要扩大范围以超出初始结果,因为有许多非整合的政策链接到进一步的政策(每个政策都有可能与父政策或相关政策一起更改或独立更改)。

使用了 Wayback Machine 来获取历史政策,尽管在考虑结果时,需要考虑到通过 robots.txt 配置文件(一个包含指令的文本文件,指示网络爬行索引代理应排除哪些页面和实体)被阻止爬行或存档的政策。

对于每个可识别的连续适用的政策,从 Wayback Machine 的 CDX API 获取每月一个快照,使用 Firefox under Selenium。由于项目仅限于可用的 HTML 政策,因此未考虑仅以 PDF 格式提供的政策的光学字符识别。

该项目的一个有趣结果是,色情网站的清晰度和可读性实际上在所研究的期间内有所提高 – 可能是预期对其监管和清晰度的要求增加所致。为了收集这些文件,需要使用住宅 IP 地址进行额外的爬行,因为大学的内容阻止协议。

最初获得了 1,068,683 个文档,相当于 120,265 个唯一文档,包含平均 39.1 个政策文章或条款和每个链接的 4.4 个唯一政策文本。

仅限英语

与最近的类似研究一样,该项目无法解决非英语隐私政策的问题,这些政策在数据清理阶段使用 PYCLD2 包被丢弃。

为了区分隐私政策和其他类型的材料,该项目使用了 2019 年由威斯康星大学和瑞士联邦理工大学联合倡议开发的 分类器

IS-POLICY 分类器的体系结构。来源:https://arxiv.org/pdf/1809.08396.pdf

IS-POLICY 分类器的体系结构。 来源:https://arxiv.org/pdf/1809.08396.pdf

尽管 IS-POLICY 分类器是在同一 1,000 文档语料库上训练的,但作者不得不为训练获取新的非政策文件,因为原始来源不可用。

在过滤后,数据被减少到 56,416 个唯一的隐私政策。

* 该论文的内联引用在此处被转换为超链接,斜体切换来自论文。

首次发表于 2022 年 1 月 31 日。

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai