Andersons vinkel

Analys av 25 år av sekretesspolicys med maskinlärande

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En nylig studie har använt maskinlärande analysmetoder för att kartlägga läsbarheten, användbarheten, längden och komplexiteten hos mer än 50 000 sekretesspolicys på populära webbplatser under en period som täcker 25 år från 1996 till 2021. Forskningen visar att den genomsnittlige läsaren skulle behöva ägna 400 timmar av “årlig lästid” (mer än en timme per dag) för att tränga igenom de växande ordantal, förvirrande språk och vaga uttryck som kännetecknar de moderna sekretesspolicysen för några av de mest besökta webbplatserna.

Rapporten säger:

‘Den genomsnittliga policyslängden har nästan dubblats under de senaste tio åren, med 2159 ord i mars 2011 och 4191 ord i mars 2021, och nästan fyrdubblats sedan 2000 (1146 ord).’

Den genomsnittliga ordmängden och meningsmängden bland de studerade dokumenten, under en period av 25 år.

Den genomsnittliga ordmängden och meningsmängden bland de studerade dokumenten, under en period av 25 år. Källa: https://arxiv.org/pdf/2201.08739.pdf

Även om ökningstakten i längd sköt i höjden när GDPR och den kaliforniska konsumentdataskyddslagen (CCPA) trädde i kraft, avfärdar rapporten dessa variationer som “små effektstorlekar” som verkar vara obetydliga mot den bredare långsiktiga trenden. Men GDPR identifieras som en möjlig orsak till ökningen av “vaga” uttryck i policys (se nedan).

Antagande en läshastighet på 250 ord per minut, hävdar rapporten att den genomsnittliga sekretesspolicyn nu tar 17 minuter att läsa, medan mer populära policys (dvs. policys som är associerade med ett stort antal användare) tar 23 minuter att slutföra.

Den längsta policyn i datamängden, från Microsoft, kräver 152 minuter att konsumera, enligt forskningen, som utnyttjade ett antal varianter på Googles BERT-språkmodell.

Ökningen av den årliga tiden som behövs för att läsa moderna sekretesspolicys, under antagandet att läsaren besöker 1462 unika webbplatser per år.

Ökningen av den årliga tiden som behövs för att läsa moderna sekretesspolicys, under antagandet att läsaren besöker 1462 unika webbplatser per år.

Mycket av den senaste ökningen av verbositet och tvetydighet i sekretesspolicys tillskrivs av rapporten som en reaktion på försök under de senaste två decennierna att införa regleringar, men också på det ohederliga användandet av kraven på regelefterlevnad som en ursäkt för att smygande öka omfattningen och otydligheten i sekretesspolicys.

‘Sammanfattningsvis visar våra resultat att de senaste sekretessregleringarna inte har förbättrat sekretessen för användare på internet i någon större utsträckning, utan snarare lett till mer svullna sekretesspolicys som beskriver alltmer invasiva datapraxis.’

Även om ett antal Natural Language Processing (NLP)-artiklar har behandlat läsbarheten och andra aspekter av sekretesspolicys under de senaste åren, tror författaren att detta är det första projektet av sitt slag som ger en sådan bred översikt av policyutvecklingen under de senaste decennierna.

Den rapporten heter Sekretesspolicys genom åren: Innehåll och läsbarhet av sekretesspolicys 1996–2021, och kommer från Isabel Wagner vid Cyber Technology Institute of De Montfort University i Storbritannien.

Elliptiskt språk

Rapporten föreslår också att det genomsnittliga antalet “förvirrande ord” (dvs. acceptabelt, signifikant, huvudsakligen, och andra ord som inte ger någon bestämd betydelse) i sekretesspolicys ökade stadigt fram till 2018, men sedan sköt i höjden från en median på 227 runt mars 2018 till 304 i juni 2020.

Författaren hävdar att denna ökning kan tillskrivas effekterna av GDPR, och rapporten visar att över två tredjedelar (72%) av meningarna i de studerade sekretesspolicysen innehöll minst ett förvirrande ord.

Läsbarhet

Över tre vanliga mått på lässvårighet, fann studien att sekretesspolicys har blivit allt svårare att läsa över åren. Författarna uppskattar att 41% av de tillämpliga sekretesspolicysen som fanns tillgängliga 2021 hade en median Flesch Reading Ease (FRE, högre är bättre) på bara 31,8, med författaren som observerar ‘Detta betyder en mycket svår text som bäst förstås av universitetsutbildade’.

Samtidigt uppnådde endast 6,7% av policysen en FRE-poäng över 45 (vilket, enligt rapporten, är den läsnivå som krävs för försäkringspolicys i delstaten Florida).

Policyändringsmedvetenhet

Arbetet behandlar också i vilken utsträckning sekretesspolicys innehåller information om hur den potentiella samtyckaren kommer att meddelas i händelse av efterföljande uppdateringar, som kan påverka användarens villighet att upprätthålla avtalet.

Författaren observerar:

‘I 2021 innehöll 73% av policysen en uttalande om policyändring. Av dessa angav 34% att ändringar skulle meddelas genom ett meddelande i sekretesspolicyn, 37% skulle publicera ett meddelande på webbplatsen, och 22% skulle skicka ett personligt meddelande (de återstående policysen lämnade meddelandetypen obestämd).’

‘Som ett resultat är de flesta användare osannolika att bli medvetna om ändringar i sekretesspolicys.

‘Dessutom erbjuds användarna nästan inget meningsfullt val när policysen ändras. Av de policys som meddelar användaren om ändringar, erbjuder endast 12% ett nytt samtycke, medan 34% ger inget val och 54% lämnar det obestämt.’

Rapportens resultat om de beskrivna metoderna för att meddela användare om policyändringar.

Rapportens resultat om de beskrivna metoderna för att meddela användare om policyändringar.

Begränsat val avseende spårning

Enligt studien erbjuds ett mycket större antal mekanismer i sekretesspolicys för att komma åt användarkontoinformation än för att komma åt användarprofildata. Profildata kan skapas och uppdateras genom automatiserade och outtalade mekanismer, medan användarkontodata inte bara uttryckligen beviljas av användaren, utan också måste vara redigerbart enligt regleringar i olika jurisdiktioner.

Användarval avseende cookie-samtycke i sekretesspolicys (ett ämne som har väckt hett debatt sedan införandet av GDPR som har lett till hundratusentals cookie-samtyckespopup-fönster för EU-instanser av internationella och europeiska webbplatser) behandlas vanligtvis i policysen, men döljer en viktigare lager av mindre tillgängliga data*:

‘[Valet] avseende cookies är otillräckligt för att skydda användare från all spårning eftersom val- eller kontrollmekanismer sällan erbjuds för datorinformation, enhetidentifierare, och personidentifierare, som tillåter spårning av användare via fingeravtryck.’

En skarp kontrast i den tillgängliga kontrollnivån som beviljas av sekretesspolicys mellan profildata (som kan erhållas genom implicita eller smygande medel) och användarkontodata (där viss kontroll ofta krävs av GDPR, den kaliforniska konsumentdataskyddslagen (CCPA) och liknande nationella och regionala mekanismer).

En skarp kontrast i den tillgängliga kontrollnivån som beviljas av sekretesspolicys mellan profildata (som kan erhållas genom implicita eller smygande medel) och användarkontodata (där viss kontroll ofta krävs av GDPR, den kaliforniska konsumentdataskyddslagen (CCPA) och liknande nationella och regionala mekanismer).

Data

För att erhålla data för studien, kryllade författaren webbplatser för länkar till deras sekretesspolicys, ofta med nödvändighet att utöka omfattningen bortom det initiala resultatet, på grund av antalet icke-integrerade policys som länkar till ytterligare policys (var och en med potential att ändras antingen i takt med eller oberoende av den överordnade eller relaterade policyn).

Wayback Machine användes för att erhålla historiska policys, även om det var nödvändigt att ta hänsyn till policys som hade blockerats från kryllning eller arkivering via en robots.txt-konfigurationsfil (en liten textfil som innehåller instruktioner till web-crawling-indexeringsagenter om sidor och andra enheter som de inte ska inkludera i en offentlig index).

En ögonblicksbild per månad erhölls från Wayback Machine genom dess CDX API för varje identifierbar och kontinuerlig tillämplig policy, med Firefox under Selenium. Att utföra optisk teckenigenkänning på policys som endast fanns tillgängliga i PDF-format ansågs inte för projektet, som begränsade sig till det (mycket större) antalet tillgängliga HTML-policys.

En intressant resultaten från projektet är att tydlig och läsbarheten hos pornografiska webbplatser faktiskt har förbättrats under den studerade perioden – möjligen i förväntan på ökande krav på ökad reglering och tydlig läsbarhet. För att samla in dessa dokument var det nödvändigt att erhålla dem med ytterligare kryllningar från bostads-IP-adresser, på grund av universitetets innehållsblockeringsprotokoll.

Initialt erhölls 1 068 683 dokument, vilket motsvarade 120 265 unika dokument som innehöll i genomsnitt 39,1 policyartiklar eller klausuler och 4,4 unika policytexter för varje länk.

Endast engelska

Som är vanligt i liknande nyliga studier, kunde projektet inte behandla icke-engelska sekretesspolicys, som kasserades under datarengöringssteget med hjälp av PYCLD2-paketet.

För att skilja sekretesspolicys från andra typer av material, använde projektet en klassificerare utvecklad 2019 som ett gemensamt initiativ från University of Wisconsin och École Polytechnique Fédérale de Lausanne.

Arkitektur för IS-POLICY-klassificeraren. Källa: https://arxiv.org/pdf/1809.08396.pdf

Arkitektur för IS-POLICY-klassificeraren. Källa: https://arxiv.org/pdf/1809.08396.pdf

Även om IS-POLICY-klassificeraren tränades på samma 1 000-dokumentkorpus som i den ursprungliga artikeln, var författaren tvungen att erhålla nya icke-policydokument för utbildning, eftersom de ursprungliga källorna inte var tillgängliga.

Efter filtrering reducerades data till 56 416 unika sekretesspolicys.

 

* Rapportens inline-citats konverteras till en hyperlänk här, kursivt växling är från rapporten.

Publicerad första gången den 31 januari 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai