Andersons vinkel

Analyse af 25 års privatpolitikker med maskinlæring

mm
Føj Unite.AI til dine foretrukne kilder på Google

En ny studie har brugt maskinlæringsteknikker til at analysere læseligheden, nyttigheden, længden og kompleksiteten af mere end 50.000 privatpolitikker på populære websites over en periode på 25 år fra 1996 til 2021. Studiet konkluderer, at den gennemsnitlige læser ville behøve at bruge 400 timers “årlig læsetid” (mere end en time om dagen) for at gennemtrænge den voksende ordmængde, forvirrende sprog og vagt sprogbrug, der kendetegner de moderne privatpolitikker på nogle af de mest besøgte websites.

Rapporten siger:

‘Den gennemsnitlige politiklængde er næsten fordoblet i de sidste ti år, med 2159 ord i marts 2011 og 4191 ord i marts 2021, og næsten firedoblet siden 2000 (1146 ord).’

Gennemsnitsordmængde og gennemsnitsætningstal blandt den undersøgte korpus over en 25-årig periode. Kilde: https://arxiv.org/pdf/2201.08739.pdf

Gennemsnitsordmængde og gennemsnitsætningstal blandt den undersøgte korpus over en 25-årig periode. Kilde: https://arxiv.org/pdf/2201.08739.pdf

Selv om stigningen i længde accelererede, da GDPR og den californiske forbrugerbeskyttelseslov (CCPA) trådte i kraft, afviser rapporten disse variationer som “små effektstørrelser”, der synes at være ubetydelige i forhold til den bredere langsigtede trend. Dog identificeres GDPR som en mulig årsag til den voksende “vage” sprogbrug i politikkerne (se nedenfor).

Under antagelse af en læsehastighed på 250 ord pr. minut, fastslår rapporten, at den gennemsnitlige privatpolitik nu tager 17 minutter at læse, mens mere populære politikker (dvs. politikker forbundet med et stort antal brugere) tager 23 minutter at gennemføre.

Den længste politik i datasettet, fra Microsoft, kræver 152 minutter at forbruge, ifølge studiet, der udnyttede en række varianter af Googles BERT-sprogmodel.

Vækst i antallet af årlige timer, der er nødvendige for at læse moderne privatpolitikker, under antagelse af, at læseren besøger 1462 unikke websites om året.

Vækst i antallet af årlige timer, der er nødvendige for at læse moderne privatpolitikker, under antagelse af, at læseren besøger 1462 unikke websites om året.

Meget af den seneste stigning i verbositet og tvetydighed i privatpolitikker tilskrives af rapporten som en reaktion på forsøg i de sidste to årtier på at pålægge reguleringer, men også på den uærlige brug af krav om overholdelse af reguleringer som en undskyldning for at øge omfanget og uigennemsigtigheden af privatpolitikker.

‘Samlet set viser vores resultater, at de seneste privatreguleringer ikke væsentligt har forbedret privatlivets beskyttelse for brugerne online, men i stedet har ført til mere opblæste privatpolitikker, der beskriver mere og mere invasive dataprocesser.’

Selv om en række Natural Language Processing (NLP)-artikler har behandlet læseligheden og andre aspekter af privatpolitikker i de seneste år, mener forfatteren, at dette er det første projekt af sin art, der giver en så bred oversigt over politikudviklingen i de seneste årtier.

Den rapport har titlen Privatpolitikker over årene: Indhold og læselighed af privatpolitikker 1996–2021 og stammer fra Isabel Wagner ved Cyber Technology Institute på De Montfort University i Storbritannien.

Elliptisk sprog

Rapporten foreslår også, at den gennemsnitlige antal “forvirrende ord” (dvs. acceptabel, betydelig, primært og andre ord, der ikke giver en definitiv betydning) i privatpolitikker er steget jævnt op til 2018, men derefter skudt op fra en median på 227 omkring marts 2018 til 304 i juni 2020.

Forfatteren mener, at denne stigning kan tilskrives effekterne af GDPR, og rapporten finder, at over to tredjedele (72%) af sætningerne i de undersøgte privatpolitikker indeholdt mindst ét forvirrende ord.

Læselighed

På tværs af tre almindelige målinger af læsedifficultet fandt studiet, at ‘privatpolitikker er blevet mere svære at læse over årene’. Forfatterne estimerer, at 41% af de nuværende privatpolitikker havde en median Flesch-læselighed (FRE, højere er bedre) på kun 31,8, og forfatteren bemærker ‘Dette score indikerer en meget svær tekst, der bedst forstås af universitetsuddannede’.

Samtidig opnåede kun 6,7% af politikkerne en FRE-score over 45 (hvad rapporten bemærker er læsestandarden for forsikringspolitikker i delstaten Florida).

Ændring af politik

Arbejdet behandler også, i hvilken udstrækning privatpolitikker indeholder oplysninger om, hvordan den potentielle samtykker vil blive underrettet i tilfælde af efterfølgende opdateringer, der kan påvirke brugerens villighed til at opretholde aftalen.

Forfatteren bemærker:

‘I 2021 indeholdt 73% af politikkerne en erklæring om ændring af politik. Af disse angav 34% ændringer vil blive annonceret gennem en meddelelse i privatpolitikken, 37% vil poste en meddelelse på website, og 22% vil sende en personlig meddelelse (de resterende politikker efterlader meddelelsestype uspecificeret).’

‘Som resultat er de fleste brugere usandsynlige at blive klar over ændringer i privatpolitikker.

‘Desuden tilbydes brugerne næsten ingen meningsfuld valg, når politikker ændres. Af politikkerne, der underretter brugeren om ændringer, tilbyder kun 12% en ny opt-in, mens 34% giver ingen valg og 54% efterlader valget uspecificeret.’

Rapportens resultater omkring de beskrevne metoder for at underrette brugere om ændringer af politik.

Rapportens resultater omkring de beskrevne metoder for at underrette brugere om ændringer af politik.

Begrænset valg i forhold til sporing

Ifølge studiet tilbydes et langt større udvalg af mekanismer i privatpolitikker for adgang til bruger-kontooplysninger end for adgang til brugerprofildata. Profildata kan oprettes og opdateres gennem automatiserede og ikke-åbenlyse mekanismer, mens bruger-kontooplysninger ikke kun gives eksplicit af brugeren, men også er forpligtet til at være redigerbar under reguleringer i forskellige jurisdiktioner.

Forbrugerens valg om cookie-samtykke i privatpolitikker (et emne, der har været genstand for heftig debat siden indførelsen af GDPR, der har ført til hundredtusinder af cookie-samtykkeskærme for EU-forekomster af internationale og europæiske websites) behandles generelt i politikkerne, men skjuler en vigtigere lag af mindre tilgængelige data*:

‘[Valget] omkring cookies er utilstrækkeligt til at beskytte brugere mod al sporing, fordi valg eller kontrolmekanismer sjældent tilbydes for computerinformation, enhedsidentifikatorer, og personlige identifikatorer, der tillader sporing af brugere via fingeraftryk.’

En markant kontrast i niveauet af kontrol, der gives af privatpolitikker mellem profildata (der kan opnås gennem implicit eller snigende midler) og bruger-kontooplysninger (hvor nogen måde af kontrol ofte er påkrævet af GDPR, den californiske forbrugerbeskyttelseslov (CCPA) og lignende nationale og regionale mekanismer).

En markant kontrast i niveauet af kontrol, der gives af privatpolitikker mellem profildata (der kan opnås gennem implicit eller snigende midler) og bruger-kontooplysninger (hvor nogen måde af kontrol ofte er påkrævet af GDPR, den californiske forbrugerbeskyttelseslov (CCPA) og lignende nationale og regionale mekanismer).

Data

For at opnå data til studiet crawlede forfatteren websites for links til deres privatpolitikker, ofte fandt det nødvendigt at udvide omfanget ud over det første resultat, på grund af antallet af ikke-integrale politikker, der linker ud til yderligere politikker (hver af disse har potentiale til at ændre enten i takt med eller uafhængigt af den overordnede eller relaterede politik).

Wayback Machine Wayback Machine blev brugt til at opnå historiske politikker, selv om det var nødvendigt at tage hensyn til politikker, der var blokeret for crawling eller arkivering via en robots.txt-konfigurationsfil (en lille tekstfil, der indeholder instruktioner til web-crawling-indexeringsagenter omkring sider og andre enheder, der ikke skal medtages i en offentlig indeks).

Én snapshot pr. måned blev opnået fra Wayback Machine via dets CDX-API for hver identificerbar og kontinuerlig anvendelig politik, ved hjælp af Firefox under Selenium. At udføre optisk tegnkendelse på politikker, der kun var tilgængelige i PDF-format, blev ikke overvejet i projektet, der begrænsede sig til (det langt større) antal tilgængelige HTML-politikker.

Én interessant resultater fra projektet er, at klarheden og læseligheden af pornosites faktisk er forbedret over den undersøgte periode – muligvis i forventning om en stigende krav om øget regulering og klarhed. For at indsamle disse dokumenter var det nødvendigt at opnå dem med yderligere crawls fra residential IP-adresser på grund af universitetets indholdsblokeringsprotokoller.

Initialt blev 1.068.683 dokumenter opnået, svarende til 120.265 unikke dokumenter, der indeholdt i gennemsnit 39,1 politikartikler eller klausuler og 4,4 unikke politiktekster pr. link.

Engelsk kun

Som i lignende nyere studier kunne projektet ikke behandle ikke-engelske privatpolitikker, der blev afvist under datarensningstrinnet ved hjælp af PYCLD2-pakken.

For at skelne privatpolitikker fra andre typer materiale brugte projektet en klassifikator udviklet i 2019 som et fælles initiativ fra University of Wisconsin og École Polytechnique Fédérale de Lausanne.

Arkitektur af IS-POLICY-klassifikatoren. Kilde: https://arxiv.org/pdf/1809.08396.pdf

Arkitektur af IS-POLICY-klassifikatoren. Kilde: https://arxiv.org/pdf/1809.08396.pdf

Selv om IS-POLICY-klassifikatoren blev trænet på samme 1.000-dokumentkorpus som i den oprindelige artikel, måtte forfatteren opnå nye ikke-politikdokumenter til træning, da de oprindelige kilder ikke var tilgængelige.

Efter filtrering blev data reduceret til 56.416 unikke privatpolitikker.

 

* Rapportens inline-citation er konverteret til en hyperlink her, og kursivtoggling er fra rapporten.

Først udgivet den 31. januar 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai