Kąt Andersona

Badacze sztucznej inteligencji szacują, że 97% witryn UE nie spełnia wymagań RODO dotyczących ochrony prywatności – zwłaszcza profilowania użytkowników

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z USA wykorzystali techniki sztucznej inteligencji do zbadania polityk ochrony prywatności ponad tysiąca reprezentatywnych witryn z UE. Stwierdzili, że 97% badanych witryn nie spełniało co najmniej jednego wymogu unijnego rozporządzenia z 2018 roku, a najmniej przestrzegały wymogów dotyczących praktyki “profilowania użytkowników”.

W artykule stwierdza się:

‘[Ponieważ] polityka prywatności jest podstawowym kanałem komunikacji dla użytkowników, aby zrozumieć i kontrolować swoją prywatność, wiele firm zaktualizowało swoje polityki prywatności po wejściu w życie RODO. Jednak większość polityk prywatności jest skomplikowana, pełna jargonu i niejasno opisuje praktyki danych firm i prawa użytkowników. Dlatego nie jest jasne, czy spełniają wymogi RODO.’

Kontynuuje:

‘Nasze wyniki pokazują, że nawet po wejściu w życie RODO, 97% witryn nadal nie spełnia co najmniej jednego wymogu RODO.’

Badanie pt. Automatyczne wykrywanie wymogów ujawniania RODO w politykach prywatności przy użyciu głębokiego aktywnego uczenia, pochodzi od trzech badaczy z Uniwersytetu Wirginii w Charlottesville.

Ochrona prywatności na końcu

Obszar, w którym najmniej przestrzegano przepisów, dotyczył przepisów RODO dotyczących profilowania użytkowników, a autorzy stwierdzili, że tylko 15,3% badanych witryn w pełni spełniało ten konkretny przepis.

Wykres zgodności z RODO wśród 9761 witryn badanych w ramach badań. Źródło: https://arxiv.org/pdf/2111.04224.pdf

Wykres zgodności z RODO wśród witryn badanych w ramach badań. Źródło: https://arxiv.org/pdf/2111.04224.pdf

Profilowanie użytkowników (gdzie interakcje użytkownika z witrynami są rejestrowane i często wykorzystywane do “celowania” w innych kontekstach online, takich jak reklamy) stało się jednym z najgorętszych kontrowersji w branży technologicznej od czasu skandalu Cambridge Analytica.

We wtorek komitet Europejskiego Parlamentu przyjął pierwszy etap nowej ustawy o rynkach cyfrowych (DMA), która zabroniłaby ukierunkowanego targetowania nieletnich, nakładając kary do 20% globalnych rocznych sprzedaży dla firm, które naruszą te przepisy.

Chociaż ustawa została przyjęta przez media jako bezpośrednia odpowiedź na rosnący wpływ gigantów technologicznych, takich jak Facebook i Google, ogromna skala niezgodności przedstawiona w nowych badaniach sugeruje, że ogromna większość firm UE (w tym biur firm amerykańskich działających w Europie) jest narażona na kary RODO.

Ponadto Włochy nałożyły w tym tygodniu maksymalną karę 10 milionów euro (11,2 miliona dolarów) na Apple i Google za wykorzystywanie profilowania użytkowników, wśród innych naruszeń.

Dane

Witryny badane w nowych badaniach zostały wybrane z pierwszych 10 000 witryn wymienionych w Quantcast, a ich polityki prywatności w języku angielskim zostały pobrane za pomocą wyszukiwarki Yandex na VPN z Wielkiej Brytanii (aby upewnić się, że polityki nie są zablokowane geograficznie).

Witryny UE musiały zapewnić przepisane polityki prywatności, obejmujące 18 centralnych wymogów (patrz wykres powyżej), od czasu wejścia w życie ogólnego rozporządzenia o ochronie danych w maju 2018 roku.

Badacze ograniczyli ekstrakcję polityk prywatności do okresu od sierpnia 2018 roku, aby umożliwić domenom opublikowanie wymaganych polityk (co było wymogiem, o którym mieli wiedzę co najmniej rok przed dwuletnim okresem rozwoju RODO od 2016 roku).

Proces filtrowania wytworzył korpus prywatności składający się z 9761 polityk, z których 1080 polityk zostało wybranych losowo przez badaczy.

Przetwarzanie wstępne

Zespół zatrudnił dwóch ekspertów prawniczych do szkolenia czterech annotatorów ludzkich w celu oznaczenia każdego z 18 możliwych polityk prywatności wymaganych przez RODO.

Pewne fragmenty językowe w politykach obejmowały więcej niż jeden z 18 wymogów, co wymagało użycia sieci neuronowej typu CNN do wykrywania cech językowych związanych z każdą polityką.

Początkowa próba przeszkolenia modelu do identyfikacji zgodności na podstawie języka osiągnęła 80,5% powodzenia. Aby poprawić te wyniki, badacze zastosowali aktywne uczenie, aby wesprzeć działanie modelu przy użyciu mniejszej ilości danych oznaczonych. Dzięki tym środkom możliwe było przeszkolenie klasyfikatora CNN do dokładności 89,2%, z wynikiem F1 0,88 (gdzie ‘1’ oznacza pełny sukces).

Aby upewnić się, że osadzanie słów jest specyficzne dla polityk prywatności, badacze przeszkolili nienadzorowany model osadzania słów przy użyciu biblioteki FastText firmy Facebook.

Zgodnie ze standardową praktyką, ostateczne dane zostały podzielone na 80/20 pomiędzy dane szkoleniowe a dane testowe (tj. losowo wybrane dane, wobec których zostanie oceniona dokładność algorytmu). Do architektury dodano studium pomiarowe z udziałem człowieka w celu oceny jakości wyników.

Architektura systemu klasyfikatora.

Architektura systemu klasyfikatora.

W trakcie przepływu pracy wytworzono 11 271 fragmentów polityk prywatności oznaczonych przez ludzi, z których każdy został przeanalizowany przez czterech annotatorów ludzkich, którzy zostali przeszkoleni przez dwóch ekspertów prawniczych biorących udział w badaniu. W przypadku niezgodności wymagano wskaźnika zgodności 75%, aby nie odrzucić danych z inclusion.

Ludzie w pętli – nie było możliwe całkowite zautomatyzowanie oznaczania danych polityk, jednak aktywne uczenie umożliwiło pulę przepływu pracy, który uczynił projekt wykonalnym.

Ludzie w pętli – nie było możliwe całkowite zautomatyzowanie oznaczania danych polityk, jednak aktywne uczenie umożliwiło pulę przepływu pracy, który uczynił projekt wykonalnym.

Ponadto użytkownicy stwierdzili, że przenośność – prawo do przeniesienia lub wyeksportowania danych przechowywanych przez firmę – była prawie tak słabo obsługiwana jak profilowanie.

Badacze stwierdzili:

‘[Wymogi] takie jak prawo użytkowników do przenośności i podawania informacji kontaktowych inspektora ochrony danych (kontakt DPO) są spełnione przez 15,5% i 16,4% witryn, odpowiednio. Inne podstawowe wymogi, takie jak prawo użytkowników do złożenia skargi, wycofania zgody, sprzeciwu i decyzji o adekwatności, są spełnione przez 17-20% witryn.’

…i kontynuują:

‘Wygląda na to, że tylko 3% witryn w pełni spełnia 18 wymogów. Te wyniki wskazują, że wiele witryn nadal nie przestrzega wymogów RODO.’

 

 

19:00 26/11/2021 – Wyjaśniono pierwszy podpis wykresu. – MA

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai