Andersons vinkel

Analyse av 25 års personvernpolitikk med maskinlæring

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

En nylig studie har brukt maskinlæringsteknikker til å analysere lesbarheten, nytten, lengden og kompleksiteten til over 50 000 personvernpolitikk på populære nettsider i en periode på 25 år fra 1996 til 2021. Studien konkluderer med at den gjennomsnittlige leseren ville trenge å bruke 400 timer med “årlig lesetid” (mer enn en time om dagen) for å gjennomtrekke den økende ordtellingen, forkledde språk og vag språkbruk som kjennetegner de moderne personvernpolitikkene til noen av de mest besøkte nettsidene.

Rapporten sier:

‘Den gjennomsnittlige politikklengden har nesten doblet seg de siste ti årene, med 2159 ord i mars 2011 og 4191 ord i mars 2021, og nesten firedoblet siden 2000 (1146 ord).’

Gjennomsnittlig ordtelling og setningstelling blant de studerte politikker, over en periode på 25 år. Kilde: https://arxiv.org/pdf/2201.08739.pdf

Gjennomsnittlig ordtelling og setningstelling blant de studerte politikker, over en periode på 25 år. Kilde: https://arxiv.org/pdf/2201.08739.pdf

Selv om økningstakten i lengde skjøt opp når GDPR og California Consumer Privacy Act (CCPA) kom i kraft, diskonterer papiret disse variasjonene som “små effektstørrelser” som synes å være ubetydelige i forhold til den bredere langtidsutviklingen. Imidlertid identifiseres GDPR som en mulig årsak til økende “vage” språk i politikker (se under).

Under antagelse av en lesehastighet på 250 ord per minutt, hevder papiret at den gjennomsnittlige personvernpolitikken nå tar 17 minutter å lese, mens mer populære politikker (dvs. politikker assosiert med et stort antall brukere) tar 23 minutter å fullføre.

Den lengste politikken i datasettet, fra Microsoft, krever 152 minutter å forbruke, ifølge forskningen, som utnyttet en rekke varianter på Googles BERT-språkmodell.

Økning i raten av årlige timer nødvendig for å lese moderne personvernpolitikk, under antagelse av at leseren besøker 1462 unike nettsider per år.

Økning i raten av årlige timer nødvendig for å lese moderne personvernpolitikk, under antagelse av at leseren besøker 1462 unike nettsider per år.

Mye av den nylige økningen i verbositet og tvetydighet i personvernpolitikk tilskrives av papiret som en reaksjon på forsøk de siste to tiårene på å pålegge reguleringer, men også på den uærlige bruken av krav til reguleringssamsvar som en unnskyldning for å hemmelig øke omfanget og uklarheten i personvernpolitikkene.

‘Samlet sett viser våre resultater at nyere personvernsreguleringer ikke har vesentlig forbedret personvernet til brukerne på nettet, men har ført til mer oppblåste personvernpolitikk som beskriver mer og mer invasive dataprosesser.’

Selv om en rekke Natural Language Processing (NLP)-papirer har behandlet lesbarheten og andre aspekter av personvernpolitikk de siste årene, mener forfatteren at dette er det første prosjektet av denne typen som gir en så bred oversikt over politikkuutviklingen de siste tiårene.

Papiret het Personvernpolitikk gjennom årene: Innhold og lesbarhet av personvernpolitikk 1996–2021, og kommer fra Isabel Wagner ved Cyber Technology Institute ved De Montfort University i Storbritannia.

Forkledt språk

Rapporten foreslår også at den gjennomsnittlige antallet “forkledde ord” (dvs. akseptabelt, betydelig, hovedsakelig og andre ord som ikke gir definitive betydninger) i personvernpolitikk økte jevnt opp til 2018, men så skjøt opp fra en median på 227 rundt mars 2018 til 304 i juni 2020.

Forfatteren hevder at denne økningen kan tilskrives effektene av GDPR, og papiret finner at over to tredeler (72%) av setningene i de studerte personvernpolitikkene inneholdt minst ett forkledt ord.

Lesbarhet

Over tre vanlige målinger av lesevanskeligheter, fant studien at personvernpolitikk har blitt stadig vanskeligere å lese over årene. Forfatterne estimerer at 41% av de nåværende personvernpolitikkene hadde en median Flesch Reading Ease (FRE, høyere er bedre) på bare 31,8, med forfatteren observerer ‘Dette resultatet indikerer en svært vanskelig tekst som bare kan forstås av universitetsutdannede’.

Samtidig oppnådde bare 6,7% av politikker en FRE-score over 45 (som rapporten bemerker er lesestandarden som kreves for forsikringspolitikk i delstaten Florida).

Endringsvarsel for personvernpolitikk

Arbeidet behandler også i hvilken grad personvernpolitikk inkluderer detaljer om hvordan den potensielle samtykker eventuelt vil bli underrettet i tilfelle senere oppdateringer, som kan påvirke brukerens villighet til å opprettholde avtalen.

Forfatteren observerer:

‘I 2021 inkluderte 73% av politikker en uttalelse om endring av politikk. Av disse, 34% opplyser at endringer vil bli kunngjort gjennom en melding i personvernpolitikken, 37% vil poste en melding på nettsiden, og 22% vil sende en personlig melding (de gjenværende politikker lar meldingstypen ubestemt).’

‘Som resultat er de fleste brukerne usannsynlig å bli klar over endringer i personvernpolitikk.

‘I tillegg tilbys brukerne nesten ingen meningsfull valg når politikker endres. Av politikker som underretter brukeren om endringer, tilbyr bare 12% et nytt samtykke, mens 34% gir ingen valg og 54% lar det ubestemt.’

Papirets funn om de beskrevne metodene for å underrette brukerne om endringer i personvernpolitikk.

Papirets funn om de beskrevne metodene for å underrette brukerne om endringer i personvernpolitikk.

Begrenset valg når det gjelder sporingsverktøy

Ifølge studien tilbys et langt større spekter av mekanismer i personvernpolitikk for å få tilgang til bruker-konto-informasjon enn for å få tilgang til brukerprofil-data. Profildata kan opprettes og oppdateres gjennom automatiserte og ikke-åpenbare mekanismer, mens bruker-konto-data ikke bare uttrykkelig er gitt av brukeren, men også er pliktig å være redigerbar under reguleringer i forskjellige jurisdiksjoner.

Brukerens valg når det gjelder samtykke til informasjonskapsler i personvernpolitikk (et tema som har vært heftig debatt siden innføringen av GDPR og hundredtusenvis av informasjonskapsel-samtykkeskjermer for EU-eksemplarer av internasjonale og europeiske nettsider) behandles vanligvis i politikker, men skjuler et viktigere lag av mindre tilgjengelig data*:

‘[Valg] når det gjelder informasjonskapsler er utilstrekkelige for å beskytte brukerne mot all sporingsverktøy, fordi valg eller kontrollmekanismer sjelden tilbys for datamaskinformasjon, enhetidentifikatorer, og personlige identifikatorer, som tillater sporingsverktøy via fingeravtrykk.’

En skarp kontrast i tilgjengelig kontrollnivå gitt av personvernpolitikk mellom profildata (som kan bli oppnådd gjennom implisitte eller hemmelige midler) og bruker-konto-data (hvor noen mål med kontroll ofte er pålagt av GDPR, California Consumer Privacy Act (CCPA) og lignende nasjonale og regionale mekanismer).

En skarp kontrast i tilgjengelig kontrollnivå gitt av personvernpolitikk mellom profildata (som kan bli oppnådd gjennom implisitte eller hemmelige midler) og bruker-konto-data (hvor noen mål med kontroll ofte er pålagt av GDPR, California Consumer Privacy Act (CCPA) og lignende nasjonale og regionale mekanismer).

Data

For å få tak i dataene for studien, crawlet forfatteren nettsider for lenker til deres personvernpolitikk, ofte måtte det utvide søkeområdet utover det opprinnelige resultatet, på grunn av antallet ikke-integrale politikker som lenker ut til videre politikker (hver av disse har potensial til å endre seg enten i sammenheng med eller uavhengig av foreldre- eller relatert politikk).

Wayback Machine ble brukt for å få tak i historiske politikker, selv om det var nødvendig å ta hensyn til politikker som hadde blitt blokkert fra crawling eller arkivering via en robots.txt-konfigurasjonsfil (en liten tekstfil som inneholder instruksjoner til web-crawling-indeksertingsagenter om sider og andre enheter som de ikke skal inkludere i en offentlig indeks).

En snapshot per måned ble hentet fra Wayback Machine via CDX API for hver identifiserbar og kontinuerlig gjeldende politikk, ved hjelp av Firefox under Selenium. Utføring av optisk tegngjenkjenning på politikker bare tilgjengelig i PDF-format ble ikke vurdert for prosjektet, som begrenset seg til (langt større) antall tilgjengelige HTML-politikker.

En interessant result fra prosjektet er at klarheten og lesbarheten til pornosider faktisk har forbedret seg over den studerte intervallet – kanskje i forventning av økt regulering og klarhet. For å samle inn disse dokumentene, var det nødvendig å hente dem med ekstra crawls fra residential IP-adresser, på grunn av universitetets innhold-blokkeringsprotokoller.

Opprinnelig ble 1 068 683 dokumenter hentet, som tilsvarer 120 265 unike dokumenter som inneholder en gjennomsnittlig på 39,1 politikkartikler eller klausuler og 4,4 unike politikktekster for hver lenke.

Engelsk kun

Som i lignende nylige studier, kunne prosjektet ikke behandle ikke-engelske personvernpolitikk, som ble forkastet under data-rengjøringsstadiet ved hjelp av PYCLD2-pakken.

For å skille personvernpolitikk fra andre typer materiale, brukte prosjektet en klassifikator utviklet i 2019 som et felles initiativ fra University of Wisconsin og École Polytechnique Fédérale de Lausanne.

Arkitektur av IS-POLICY-klassifikatoren. Kilde: https://arxiv.org/pdf/1809.08396.pdf

Arkitektur av IS-POLICY-klassifikatoren. Kilde: https://arxiv.org/pdf/1809.08396.pdf

Selv om IS-POLICY-klassifikatoren ble trent på samme 1000-dokumentkorpus som i opprinnelig papir, måtte forfatteren få tak i nye ikke-politikkdokumenter for trening, siden de opprinnelige kildene ikke var tilgjengelige.

Etter filtrering ble dataene redusert til 56 416 unike personvernpolitikk.

 

* Papirets inline-citater er konvertert til en hyperlink her, og kursivt skifter fra papiret.

Først publisert 31. januar 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai