Погляд Anderson

Аналіз 25 років політики конфіденційності за допомогою машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Нещодавнє дослідження використало методи аналізу машинного навчання для вивчення читабельності, корисності, довжини та складності понад 50 000 політик конфіденційності на популярних веб-сайтах за період у 25 років з 1996 по 2021 рік. Дослідження показало, що середньому читачеві потрібно буде присвятити 400 годин “річної читання” (більше години на день), щоб проникнути в зростаючу кількість слів, заплутану мову та нечітке використання мови, які характеризують сучасні політики конфіденційності деяких найбільш відвідуваних веб-сайтів.

У звіті зазначається:

‘Середня довжина політики майже подвоїлася за останні десять років, з 2159 словами у березні 2011 року та 4191 слова у березні 2021 року, і майже потроїлася з 2000 року (1146 слів).’

Середня кількість слів і речень серед вивчених документів за 25-річний період. Джерело: https://arxiv.org/pdf/2201.08739.pdf

Середня кількість слів і речень серед вивчених документів за 25-річний період. Джерело: https://arxiv.org/pdf/2201.08739.pdf

Хоча темп зростання довжини політики спалахнув, коли набули чинності GDPR і Закон про захист конфіденційності споживачів Каліфорнії (CCPA), у роботі ці варіації відхиляються як “малі розміри ефекту”, які здаються незначними проти загальної довгострокової тенденції. Однак GDPR ідентифікується як можливий причину зростання “неясної” мови в політиках (див. нижче).

Припускаючи швидкість читання 250 слів за хвилину, у роботі стверджується, що середня політика конфіденційності тепер займає 17 хвилин на читання, тоді як більш популярні політики (тобто політики, пов’язані з великою кількістю користувачів) займають 23 хвилини на виконання.

Найдовша політика в наборі даних, від Microsoft, вимагає 152 хвилини на споживання, згідно з дослідженням, яке використовувало кілька варіантів мови моделі BERT від Google.

Ріст темпи щорічних годин, необхідних для читання сучасних політик конфіденційності, припускаючи, що читач відвідує 1462 унікальних веб-сайти на рік.

Ріст темпи щорічних годин, необхідних для читання сучасних політик конфіденційності, припускаючи, що читач відвідує 1462 унікальних веб-сайти на рік.

Багато недавнього зростання розмахливості та неясності політик конфіденційності приписується роботі як реакції на спроби впровадити регуляції за останні два десятиліття, але також на нечесне використання вимог щодо дотримання законодавства як привід для потайного збільшення обсягу та неясності політик конфіденційності.

‘Загалом, наші результати показують, що недавні регуляції конфіденційності не суттєво покращили конфіденційність користувачів в Інтернеті, а радше привели до більш розмахливих політик конфіденційності, які описують все більш і більш агресивні практики збору даних.’

Хоча ряд робіт з обробки природної мови займався читабельністю та іншими аспектами політик конфіденційності за останні роки, автор вважає, що це перше дослідження такого типу, яке надає такий широкий огляд розвитку політики за останні десятиліття.

У роботі зазначається Політики конфіденційності на різних етапах: вміст і читабельність політик конфіденційності 1996-2021, і вона походить від Ізабель Вагнер у Кібертехнологічному інституті Де Монтфорта у Великій Британії.

Еліптична мова

У звіті також зазначається, що середня кількість “заплутаних слів” (тобто прийнятного, значущого, головним чином та інших слів, які не надають визначеного значення) у політиках конфіденційності постійно зростала до 2018 року, але потім стрімко зросла з медіани 227 близько березня 2018 року до 304 у червні 2020 року.

Автор стверджує, що цей ріст є наслідком впливу GDPR, і у роботі виявлено, що понад дві третини (72%) речень у вивчених політиках конфіденційності містили щонайменше одне заплутане слово.

Читабельність

За трьома загальними мірами складності читання дослідження показало, що політики конфіденційності стали все більш важкими для читання за роки. Автори оцінюють, що 41% поточних політик, доступних у 2021 році, мали медіану індексу читабельності Флеша (FRE, вище краще) лише 31,8, при цьому автор зауважує Цей бал вказує на дуже складний текст, який найкраще розуміють університетські випускники.

У той же час лише 6,7% політик досягли балу FRE вище 45 (що, як зазначається у звіті, є стандартом читабельності для страхових політик у штаті Флорида).

Інформування про зміни політики

Робота також розглядає ступінь, у якій політики конфіденційності містять інформацію про те, як потенційний згоджувач буде повідомлений у разі подальших оновлень, які можуть вплинути на бажання користувача продовжувати угоду.

Автор зауважує:

‘У 2021 році 73% політик містять заяву про зміну політики. З них 34% зазначають, що зміни будуть оголошені повідомленням у політиці конфіденційності, 37% будуть розміщувати повідомлення на веб-сайті, а 22% будуть надсилати особисте повідомлення (інші політики не вказують тип повідомлення).’

‘В результаті більшість користувачів малоймовірно дізнаються про зміни політик конфіденційності.

‘Крім того, користувачам майже не надається жодного суттєвого вибору, коли політики змінюються. З політик, які повідомляють користувача про зміни, лише 12% пропонують нове підтвердження згоди, тоді як 34% не надають жодного вибору, а 54% залишають це невизначеним.’

Висновки роботи щодо описаних методів інформування користувачів про зміни політик.

Висновки роботи щодо описаних методів інформування користувачів про зміни політик.

Обмежений вибір щодо відстежування

Згідно з дослідженням, набагато більший діапазон механізмів надається у політиках конфіденційності для доступу до інформації про користувача, ніж для доступу до даних профайлу користувача. Дані профайлу можуть бути створені та оновлені через автоматичні та неочевидні механізми, тоді як дані про користувача не тільки явно надаються користувачем, але також зобов’язані бути редагованими згідно з регуляціями різних юрисдикцій.

Вибір споживача щодо згоди на файли cookie у політиках конфіденційності (тема, яка викликала гарячі дебати з моменту впровадження GDPR, яке призвело до появи сотень тисяч попапів щодо згоди на файли cookie для екземплярів ЄС міжнародних і європейських веб-сайтів) загалом розглядається у політиках, але ховає більш важливий шар менш доступних даних*:

‘Вибір щодо файлів cookie недостатній для захисту користувачів від усіх форм відстежування, оскільки механізми вибору або контролю рідко надаються для інформації про комп’ютер, ідентифікатори пристроїв, і особисті ідентифікатори, які дозволяють відстежувати користувачів за допомогою відбитків пальців.’

Яскравий контраст у рівні контролю, наданому політиками конфіденційності між даними профайлу (які можуть бути отримані неявними або потайними засобами) та даними про користувача (де певний рівень контролю часто вимагається GDPR, Законом про захист конфіденційності споживачів Каліфорнії (CCPA) та подібними національними та регіональними механізмами).

Яскравий контраст у рівні контролю, наданому політиками конфіденційності між даними профайлу (які можуть бути отримані неявними або потайними засобами) та даними про користувача (де певний рівень контролю часто вимагається GDPR, Законом про захист конфіденційності споживачів Каліфорнії (CCPA) та подібними національними та регіональними механізмами).

Дані

Для отримання даних для дослідження автор скрав веб-сайти на предмет посилань на їхні політики конфіденційності, часто знаходячи необхідність розширити сферу пошуку за межі початкового результату через кількість неповних політик, які посилаються на подальші політики (кожна з яких має потенціал змінитися або разом з батьківською чи пов’язаною політикою, або незалежно від неї).

Була використана Машина часу, щоб отримати історичні політики, хоча при розгляді результатів було необхідно врахувати політики, які були заблоковані від скравлінгу або архівування через конфігураційний файл robots.txt (маленький текстовий файл, що містить інструкції для веб-індексуючих агентів щодо сторінок та інших сутностей, які вони не повинні включати до публічного індексу).

Було отримано один знімок на місяць з Машини часу через CDX API для кожної ідентифікованої та безперервної чинної політики, використовуючи Firefox під Selenium. Виконання оптичного розпізнавання символів у політиках, доступних лише у форматі PDF, не розглядалося у проекті, який обмежувався (значно більшим) числом доступних HTML-політик.

Одним із цікавих результатів проекту є те, що ясність і читабельність веб-сайтів для дорослих насправді покращилися за вивчений період – можливо, у зв’язку з зростанням вимог до підвищення регулювання та ясності. Для збору цих документів було необхідно отримати їх за допомогою додаткових скравлів з житлових IP-адрес через протоколи блокування вмісту університету.

Спочатку було отримано 1 068 683 документів, що становило 120 265 унікальних документів, які містили у середньому 39,1 статті або пунктів політики та 4,4 унікальних текстів політики для кожного посилання.

Англійська лише

Як і у подібних недавніх дослідженнях, проект не міг розглянути політики конфіденційності, що не належать до англійської мови, які були видалені під час стадії очищення даних за допомогою пакету PYCLD2.

Для розрізнення політик конфіденційності від інших типів матеріалів проект використовував класифікатор розроблений у 2019 році як спільну ініціативу Університету Вісконсина та École Polytechnique Fédérale de Lausanne.

Архітектура класифікатора IS-POLICY. Джерело: https://arxiv.org/pdf/1809.08396.pdf

Архітектура класифікатора IS-POLICY. Джерело: https://arxiv.org/pdf/1809.08396.pdf

Хоча класифікатор IS-POLICY був навчений на тому ж 1000-документному корпусі, що й у вихідній роботі, автору довелося отримати нові документи, що не належать до політики, для навчання, оскільки оригінальні джерела не були доступні.

Після фільтрації дані були скорочені до 56 416 унікальних політик конфіденційності.

 

* Внутрішня цитата роботи перетворена на гіперпосилання тут, переключення курсиву з роботи.

Перша публікація 31 січня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai