Погляд Anderson
Дослідники штучного інтелекту оцінюють, що 97% веб-сайтів ЄС не відповідають вимогам GDPR щодо конфіденційності – особливо профілювання користувачів

Дослідники в США використали техніки машинного навчання для вивчення політики конфіденційності GDPR понад тисячі представницьких веб-сайтів, розташованих в ЄС. Вони виявили, що 97% досліджених сайтів не відповідали至少 одній вимозі регуляторної бази Європейського Союзу 2018 року, і що вони відповідали найменше вимогам щодо практики “профілювання користувачів”.
У статті зазначається:
‘[Оскільки] політика конфіденційності є основним засобом спілкування для користувачів, щоб зрозуміти та контролювати свою конфіденційність, багато компаній оновили свої політики конфіденційності після введення GDPR. Однак більшість політик конфіденційності є розширеними, наповнені жаргоном і нечітко описують практику даних компаній і права користувачів. Тому неясно, чи вони відповідають вимогам GDPR.’
Далі зазначається:
‘Наші результати показують, що навіть після введення GDPR 97% веб-сайтів все ще не відповідають至少 одній вимозі GDPR.’
Дослідження назване Автоматичне виявлення вимог розкриття GDPR у політиках конфіденційності за допомогою глибокого активного навчання, і проведене трьома дослідниками Університету Вірджинії в Шарлоттсвіллі.
Конфіденційність остання
Область найменшої відповідності, згідно з дослідженням, стосується вимог GDPR щодо профілювання користувачів, при цьому автори зазначають, що лише 15,3% досліджених сайтів повністю відповідали цьому конкретному правилу.

Графік відповідності серед веб-сайтів’ політики конфіденційності, досліджених для дослідження. Джерело: https://arxiv.org/pdf/2111.04224.pdf
Профілювання користувачів (де взаємодія людини з веб-сайтами реєструється і часто використовується для “цільової реклами” в інших онлайн-контекстах) стало одним з найгарячіших суперечок у сфері технологій після скандалу з Cambridge Analytica.
У вівторок ключовий комітет Європейського парламенту прийняв перший етап нового Закону про цифрові ринки (DMA), який заборонить поведінкову цільову рекламу для неповнолітніх, вводячи штрафи до 20% від глобального річного обсягу продажів для компаній, які порушують закон.
Хоча Закон сприймається ЗМІ як прямий відповідь на зростаючий вплив технологічних гігантів, таких як Facebook і Google, масштаб недотримання вимог, представлений у новому дослідженні, свідчить про те, що більша частина ЄС-компаній (включно з офісами американських компаній, які торгують в Європі) юридично підлягає штрафам GDPR.
Крім того, Італія цього тижня ввела максимально допустимий штраф у розмірі 10 мільйонів євро (11,2 мільйона доларів США) проти Apple і Google за використання профілювання користувачів, серед інших порушень.
Дані
Веб-сайти, досліджені у новому дослідженні, були вибрані з перших 10 000 веб-сайтів, перелічених у Quantcast, англомовні політики конфіденційності яких були витягнуті через пошуки Yandex на основі британських VPN (щоб забезпечити, що політики не були геоблоковані).
Веб-сайти ЄС мали обов’язок надавати передбачені політики конфіденційності, які покривають 18 центральних вимог (див. графік вище) з моменту повного введення Загального регламенту захисту даних (GDPR) у травні 2018 року.
Дослідники обмежили витяг політик конфіденційності періодом з серпня 2018 року, щоб дати достатній час для доменів, щоб опублікувати необхідні політики (вимогу, про яку вони мали попередню інформацію щонайменше рік з двох років розвитку GDPR з 2016 року).
Процес фільтрації дав політичний корпус з 9 761 політики, з яких 1 080 політик були випадково вибрані дослідниками.
Попередня обробка
Команда залучила двох юридичних експертів для навчання чотирьох людей-анотаторів для маркування кожної з 18 можливих політик конфіденційності, передбачених GDPR.
Деякі юридичні терміни у політиках покривали більш ніж одну з 18 вимог, що зробило необхідним використання Конволюційної нейронної мережі (CNN) для виявлення мовних особливостей, пов’язаних з кожною політикою.
Перша спроба тренування моделі для визначення відповідності на основі мови досягла 80,5% успіху. Для поліпшення цих результатів дослідники застосували активне навчання, щоб підвищити продуктивність моделі з меншим кільком об’єктів. За допомогою цих засобів було можливо тренувати класифікатор CNN до точності 89,2%, з коефіцієнтом F1 0,88 (де “1” означає повний успіх).
Щоб забезпечити, що вкладення слів були специфічними для політики конфіденційності, дослідники тренували несупервізовану модель вкладення слів за допомогою бібліотеки FastText від Facebook.
За стандартною практикою кінцеві дані були розділені на 80/20 між тренувальними даними та тестовими даними (тобто випадково вибраними даними, проти яких буде оцінена точність алгоритму). До архітектури було додано вимірювання якості результатів людини в циклі.

Архітектура класифікатора системи.
У ході робочого процесу було створено 11 271 людьми-анотованих сегментів політики конфіденційності, кожен з яких був переглянутий чотирма людьми-анотаторами, яких тренували два юридичні експерти, які брали участь у дослідженні. Якщо виникла розбіжність, потрібний був рівень згоди 75%, щоб не відхилити дані від включення.

Люди в циклі – не було можливості повністю автоматизувати маркування даних політики, хоча активне навчання дозволило реалізувати робочий процес, який зробив проєкт здійсненним.
Окрім вже згаданих результатів, користувачі виявили, що переносимість – право згідно з GDPR на перенесення або експорт даних, які компанія зберігає, – була майже так само погано забезпечена, як і профілювання.
Дослідники роблять висновок:
‘[Вимоги] такі, як право користувачів на переносимість та надання контактної інформації офіцера з захисту даних (контакт DPO), покриті 15,5% і 16,4% веб-сайтів відповідно. Інші основні вимоги, такі як право користувачів на подання скарги, відкликання згоди, право на заперечення та адекватне рішення, покриті 17-20% веб-сайтів.’
…і продовжують:
‘Здається, що лише 3% веб-сайтів повністю відповідають 18 вимогам. Ці висновки свідчать про те, що багато веб-сайтів все ще не відповідають вимогам GDPR.’
7 вечора 26/11/2021 – Виправлено перший графічний підпис. – MA












