Kąt Andersona
Analiza 25 lat polityk prywatności za pomocą uczenia maszynowego

Niedawno przeprowadzono badanie, które wykorzystało techniki analizy z użyciem uczenia maszynowego, aby prześledzić czytelność, użyteczność, długość i złożoność ponad 50 000 polityk prywatności na popularnych stronach internetowych w okresie 25 lat, od 1996 do 2021 roku. Badanie wykazało, że przeciętny czytelnik musiałby poświęcić 400 godzin “rocznego czasu czytania” (ponad godzinę dziennie), aby przeniknąć rosnące liczby słów, niejasny język i mgliste sformułowania, które charakteryzują nowoczesne polityki prywatności niektórych z najczęściej odwiedzanych stron internetowych.
Raport stwierdza:
‘Przeciętna długość polityki prawie podwoiła się w ciągu ostatnich dziesięciu lat, z 2159 słowami w marcu 2011 roku i 4191 słowami w marcu 2021 roku, i prawie potroiła się od 2000 roku (1146 słów).’

Średnia liczba słów i zdań w badanych politykach prywatności w ciągu 25 lat. Źródło: https://arxiv.org/pdf/2201.08739.pdf
Mimo że tempo wzrostu długości polityk prywatności gwałtownie wzrosło, gdy weszły w życie ochrona danych osobowych (GDPR) i ustawa o ochronie konsumentów w Kalifornii (CCPA), autor pracy uważa, że te wahania są niewielkie w porównaniu z ogólnym trendem długoterminowym. Niemniej jednak, GDPR jest uznawana za możliwą przyczynę wzrostu “niejasnego” języka w politykach prywatności (patrz poniżej).
Zakładając, że czytelnik może przeczytać 250 słów na minutę, praca twierdzi, że przeciętna polityka prywatności zajmuje teraz 17 minut do przeczytania, podczas gdy polityki popularne (tj. polityki związane z dużą liczbą użytkowników) zajmują 23 minuty do ukończenia.
Najdłuższa polityka prywatności w badanej grupie, pochodząca od Microsoftu, wymaga 152 minut do przeczytania, według badań, które wykorzystały wiele wariantów modelu językowego BERT opracowanego przez Google.

Wzrost tempa rocznych godzin potrzebnych do przeczytania nowoczesnych polityk prywatności, przy założeniu, że czytelnik odwiedza 1462 unikalne strony internetowe rocznie.
Większość niedawnego wzrostu zawiłości i niejasności w politykach prywatności jest przypisywana przez autorów pracy jako reakcja na próby wprowadzenia regulacji, ale także na nieszlachetne wykorzystywanie wymogów zgodności z regulacjami jako pretekstu do ukrytego zwiększania zakresu i nieprzejrzystości polityk prywatności.
‘Ogólnie, nasze wyniki pokazują, że ostatnie regulacje dotyczące prywatności nie poprawiły znacząco prywatności użytkowników w sieci, ale doprowadziły do bardziej rozległych polityk prywatności, które opisują coraz bardziej inwazyjne praktyki danych.’
Mimo że wiele prac z dziedziny przetwarzania języka naturalnego (NLP) zajmowało się czytelnością i innymi aspektami polityk prywatności w ostatnich latach, autor uważa, że jest to pierwszy projekt, który zapewnia tak szeroką perspektywę rozwoju polityk prywatności w ostatnich dekadach.
Praca pt. Polityki prywatności na przestrzeni wieków: Zawartość i czytelność polityk prywatności 1996-2021, pochodzi od Isabel Wagner z Cyber Technology Institute of De Montfort University w Wielkiej Brytanii.
Język eliptyczny
Raport sugeruje również, że średnia liczba “zaciemniających słów” (tj. akceptowalne, znaczące, głównie i innych słów, które nie dostarczają definitywnego znaczenia) w politykach prywatności wzrosła stopniowo do 2018 roku, ale potem gwałtownie wzrosła z mediany 227 w marcu 2018 roku do 304 w czerwcu 2020 roku.
Autor twierdzi, że ten wzrost jest przypisywany skutkom GDPR, a praca wykazała, że ponad dwie trzecie (72%) zdań w badanych politykach prywatności zawierało co najmniej jedno zaciemniające słowo.
Czytelność
Przez trzy powszechne miary trudności czytania, badanie wykazało, że ‘polityki prywatności stały się coraz trudniejsze do czytania na przestrzeni lat’. Autorzy szacują, że 41% obecnie obowiązujących polityk prywatności w 2021 roku miało średni wskaźnik łatwości czytania Flescha (FRE, im wyższy, tym lepiej) tylko 31,8, przy czym autor zauważa ‘Ten wynik wskazuje na bardzo trudny tekst, który jest najlepiej zrozumiany przez absolwentów uniwersytetu’.
W tym samym czasie tylko 6,7% polityk osiągnęło wskaźnik FRE powyżej 45 (co, jak zauważa raport, jest standardem czytania wymaganym dla polityk ubezpieczeniowych w stanie Floryda).
Świadomość zmian polityki
Praca zajmuje się również zakresem, w jakim polityki prywatności zawierają szczegóły dotyczące powiadomień o późniejszych aktualizacjach, które mogą wpłynąć na chęć użytkownika do utrzymania umowy.
Autor zauważa:
‘W 2021 roku 73% polityk zawierało oświadczenie o zmianie polityki. Spośród nich 34% stwierdzało, że zmiany będą ogłaszane za pomocą powiadomienia w polityce prywatności, 37% będzie umieszczało powiadomienie na stronie internetowej, a 22% będzie wysyłało powiadomienie osobiste (pozostałe polityki pozostawiają nieokreślony typ powiadomienia).’
‘W rezultacie większość użytkowników jest mało prawdopodobna, aby dowiedzieć się o zmianach w politykach prywatności.
‘Ponadto, użytkownikom oferuje się prawie żadnego znaczącego wyboru, gdy polityki ulegają zmianie. Spośród polityk, które powiadamiają użytkownika o zmianach, tylko 12% oferuje nowe potwierdzenie, podczas gdy 34% nie daje żadnego wyboru, a 54% pozostawia to nieokreślone.’

Wyniki pracy dotyczące opisanych metod powiadamiania użytkowników o zmianach polityki.
Ograniczony wybór dotyczący śledzenia
Zgodnie z badaniem, znacznie większy zakres mechanizmów jest oferowany w politykach prywatności do dostępu do informacji o koncie użytkownika niż do danych profilowych. Dane profilowe mogą być tworzone i aktualizowane za pomocą zautomatyzowanych i niejawnych mechanizmów, podczas gdy dane konta użytkownika są nie tylko wyraźnie udzielane przez użytkownika, ale także obowiązkowo edytowalne zgodnie z regulacjami różnych jurysdykcji.
Wybór konsumenta dotyczący zgody na ciasteczka w politykach prywatności (temat, który wywołał gorącą debatę od czasu wejścia w życie GDPR, które spowodowało setki tysięcy powiadomień o ciasteczkach dla instancji UE na stronach internetowych międzynarodowych i europejskich) jest ogólnie adresowany w politykach, ale ukrywa ważniejszą warstwę mniej dostępnych danych*:
‘[Wybór] dotyczący ciasteczek jest niewystarczający, aby chronić użytkowników przed wszystkimi formami śledzenia, ponieważ mechanizmy wyboru lub kontroli są rzadko oferowane dla informacji komputerowych, identyfikatorów urządzeń i identyfikatorów osobistych, które umożliwiają śledzenie użytkowników za pomocą odcisków palców.’

Wyraźny kontrast w dostępnym poziomie kontroli przyznanej przez polityki prywatności między danymi profilowymi (które mogą być uzyskane za pomocą niejawnych lub skrytych środków) a danymi konta użytkownika (gdzie pewien poziom kontroli jest często wymagany przez GDPR, ustawę o ochronie konsumentów w Kalifornii (CCPA) i podobne mechanizmy krajowe i regionalne).
Dane
Aby uzyskać dane do badania, autor przeszukał strony internetowe w poszukiwaniu linków do polityk prywatności, często znajdując konieczne rozszerzenie zakresu poza wynik początkowy, ze względu na liczbę nieintegralnych polityk, które łączą się z dalszymi politykami (każda z nich ma potencjał do zmiany albo razem z rodzicem lub powiązaną polityką, albo niezależnie).
Urządzenie Wayback Machine zostało wykorzystane do uzyskania historycznych polityk, chociaż było konieczne uwzględnienie wyników, aby uwzględnić polityki, które zostały zablokowane przed przeszukiwaniem lub archiwizacją za pomocą pliku konfiguracyjnego robots.txt (mały plik tekstowy zawierający instrukcje dla agentów indeksujących sieć w odniesieniu do stron i innych jednostek, które nie powinny być uwzględnione w publicznym indeksie).
Jeden migawka na miesiąc został uzyskany z Wayback Machine za pomocą interfejsu API CDX dla każdej rozpoznawalnej i ciągłej polityki, przy użyciu Firefoksa z Silenium. Wykonywanie optycznego rozpoznawania znaków w politykach dostępnych tylko w formacie PDF nie zostało uwzględnione w projekcie, który ograniczył się do (znacznie większej) liczby dostępnych polityk w formacie HTML.
Jednym z ciekawych wyników projektu jest to, że klarowność i czytelność stron internetowych dla dorosłych rzeczywiście poprawiły się w badanym okresie – być może w oczekiwaniu na rosnące wezwania do zwiększenia regulacji i klarowności. Aby zebrać te dokumenty, konieczne było ich uzyskanie za pomocą dodatkowych przeszukań z adresów IP mieszkańców, ze względu na protokoły blokowania treści uniwersytetu.
Początkowo uzyskano 1 068 683 dokumentów, co odpowiada 120 265 unikalnym dokumentom zawierającym średnio 39,1 artykułów polityki lub klauzul i 4,4 unikalne teksty polityki dla każdego linku.
Tylko po angielsku
Jak w wielu podobnych badaniach, projekt nie był w stanie uwzględnić polityk prywatności w języku innym niż angielski, które zostały odrzucone podczas etapu czyszczenia danych za pomocą pakietu PYCLD2.
Aby odróżnić polityki prywatności od innych rodzajów materiałów, projekt wykorzystał klasyfikator opracowany w 2019 roku jako wspólną inicjatywę Uniwersytetu Wisconsin i École Polytechnique Fédérale de Lausanne.

Architektura klasyfikatora IS-POLICY. Źródło: https://arxiv.org/pdf/1809.08396.pdf
Mimo że klasyfikator IS-POLICY został opracowany na tym samym korpusie 1000 dokumentów, co w oryginalnej pracy, autor musiał uzyskać nowe dokumenty niebędące politykami do szkolenia, ponieważ oryginalne źródła nie były dostępne.
Po filtrowaniu dane zostały zmniejszone do 56 416 unikalnych polityk prywatności.
* Odnośnik wewnętrzny w pracy został przekonwertowany na hiperlink tutaj, przełączanie kursywy jest z pracy.
Pierwotnie opublikowane 31 stycznia 2022.












