Взгляд Anderson
Исследователи в области ИИ оценивают, что 97% сайтов ЕС не соответствуют требованиям GDPR по защите конфиденциальности – особенно по профилю пользователя

Исследователи в США использовали методы машинного обучения для изучения политики конфиденциальности GDPR более чем тысячи представительных сайтов, базирующихся в ЕС. Они обнаружили, что 97% изученных сайтов не соответствуют хотя бы одному требованию нормативной базы Европейского Союза 2018 года, и что они наименее соответствуют требованиям, связанным с практикой “профилирования пользователей”.
В статье говорится:
‘[Поскольку] политика конфиденциальности является основным каналом общения для пользователей, чтобы понять и контролировать свою конфиденциальность, многие компании обновили свою политику конфиденциальности после вступления GDPR в силу. Однако большинство политик конфиденциальности являются многословными, полными жаргона и неясно описывают практику данных компаний и права пользователей. Следовательно, неясно, соответствуют ли они GDPR.’
Продолжение:
‘Наши результаты показывают, что даже после вступления GDPR в силу 97% сайтов все еще не соответствуют хотя бы одному требованию GDPR.’
Исследование названо Автоматическое обнаружение требований к раскрытию информации в политиках конфиденциальности с помощью глубокого активного обучения и было проведено тремя исследователями из Университета Вирджинии в Шарлоттсвилле.
Конфиденциальность в последнюю очередь
Область наименьшего соответствия, согласно исследованию, касалась требований GDPR о профилировании пользователей, при этом авторы заявили, что только 15,3% изученных сайтов полностью соответствуют этому конкретному правилу.

График соответствия среди сайтов, изученных для исследования. Источник: https://arxiv.org/pdf/2111.04224.pdf
Профилирование пользователей (где взаимодействие человека с сайтами записывается и часто используется для “целевого” подхода в других онлайн-контекстах, таких как реклама) стало одним из самых жарких споров в технологиях с момента скандала с Cambridge Analytica.
В вторник ключевой комитет Европейского парламента принял первый этап нового законодательства о цифровых рынках (DMA), которое запретит целевую рекламу для несовершеннолетних, налагая штрафы до 20% от глобальных годовых продаж для компаний, нарушающих закон.
Хотя закон был воспринят средствами массовой информации как прямая реакция на растущее влияние технологических гигантов, таких как Facebook и Google, масштаб несоответствия, представленный новым исследованием, предполагает, что подавляющее большинство компаний ЕС (включая офисы американских компаний, торгующих в Европе) юридически подвержены штрафам GDPR.
Кроме того, Италия на этой неделе наложила максимально допустимый штраф в размере 10 миллионов евро (11,2 миллиона долларов США) на Apple и Google за эксплуатацию профилирования пользователей, среди других нарушений.
Данные
Сайты, изученные в новом исследовании, были отобраны из топ-10 000 сайтов, перечисленных в Quantcast, английские политики конфиденциальности которых были извлечены через поиски Yandex на VPN в Великобритании (чтобы обеспечить, что политики не были geo-блокированы).
Сайты ЕС были обязаны предоставлять предписанные политики конфиденциальности, покрывающие 18 центральных требований (см. график выше), с момента вступления в силу Общего регламента по защите данных (GDPR) в мае 2018 года.
Исследователи ограничили извлечение политик конфиденциальности периодом с августа 2018 года, чтобы дать разумное время для доменов, чтобы опубликовать необходимые политики (требование, о котором они имели предварительные знания не менее чем за год из двухлетней фазы разработки GDPR с 2016 года).
Процесс фильтрации произвел корпус конфиденциальности из 9761 политик, из которых 1080 политик были случайным образом выбраны исследователями.
Предварительная обработка
Команда привлекла двух юридических экспертов для обучения четырех человеческих аннотаторов для пометки каждой из 18 возможных политик конфиденциальности, предписанных GDPR.
Некоторые юридические формулировки в политиках охватывали более одного из 18 требований, что сделало необходимым использование свёрточной нейронной сети (CNN) для обнаружения языковых особенностей, связанных с каждой политикой.
Первоначальная попытка обучить модель для определения соответствия на основе языка достигла 80,5% успеха. Чтобы улучшить эти результаты, исследователи применили активное обучение, чтобы повысить производительность модели с помощью меньшего количества помеченных данных. С помощью этих средств было возможно обучить классификатор CNN до точности 89,2%, с коэффициентом F1 0,88 (где ‘1’ является полным успехом).
Чтобы обеспечить, что встроенные слова были специфичны для политики конфиденциальности, исследователи обучили модель встроенных слов без надзора с помощью библиотеки FastText от Facebook.
Как и обычно, окончательные данные были разделены на 80/20 между обучающими данными и тестовыми данными (т. е. случайными данными, против которых будет оценена точность алгоритма). В архитектуру был добавлен измерительный estudio с человеком в цикле, чтобы оценить качество результатов.

Архитектура классификатора.
В ходе рабочего процесса было произведено 11 271 человеческих аннотированных сегментов политики конфиденциальности, каждый из которых был рассмотрен четырьмя человеческими аннотаторами, обученными двумя юридическими экспертами, участвовавшими в исследовании. Если произошло несогласие, требовался коэффициент согласия 75%, чтобы не отклонить данные от включения.

Люди в цикле – было невозможно полностью автоматизировать пометку данных политики, хотя активное обучение позволило реализовать рабочий процесс на основе пула, который сделал проект осуществимым.
Помимо уже упомянутых результатов, пользователи обнаружили, что переносимость – право на перенос или экспорт данных, хранящихся компанией, было почти так же плохо обеспечено, как и профилирование.
Исследователи заключили:
‘[Требования] такие как право пользователей на переносимость и предоставление контактной информации офицера по защите данных (контакт DPO) покрываются 15,5% и 16,4% сайтов соответственно. Другие основные требования, такие как право пользователей на подачу жалобы, отзыв согласия, право на возражение и адекватное решение, покрываются 17-20% сайтов.’
…и продолжают:
‘Похоже, что только 3% сайтов полностью соответствуют 18 требованиям. Эти результаты показывают, что многие сайты все еще не соблюдают требования GDPR.’
7pm 26/11/2021 – Уточнено первое графическое подпись. – MA












