Andersonův úhel

Analýza 25 let zásad ochrany soukromí pomocí strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nová studie použila techniky analýzy strojového učení k mapování čitelnosti, užitečnosti, délky a složitosti více než 50 000 zásad ochrany soukromí na populárních webových stránkách v období 25 let od roku 1996 do roku 2021. Výzkum dospívá k závěru, že průměrný čtenář by musel věnovat 400 hodin “ročního čtení” (více než hodinu denně), aby pronikl do rostoucích počtů slov, zamlžujícího jazyka a vágního jazykového použití, které charakterizují moderní zásady ochrany soukromí některých nejnavštěvovanějších webových stránek.

Zpráva uvádí:

‘Průměrná délka zásad se téměř zdvojnásobila za posledních deset let, s 2159 slovy v březnu 2011 a 4191 slovy v březnu 2021, a téměř zčtyřnásobila od roku 2000 (1146 slov).’

Průměrný počet slov a vět ve studovaném korpusu, za období 25 let.

Průměrný počet slov a vět ve studovaném korpusu, za období 25 let. Source: https://arxiv.org/pdf/2201.08739.pdf

Ačkoli tempo růstu délky zásad vzrostlo, když vstoupily v platnost nařízení GDPR a zákona o ochraně spotřebitelů v Kalifornii (CCPA), studie tyto variace odmítá jako “malé efektivní velikosti”, které se zdají být zanedbatelné ve srovnání s širším dlouhodobým trendem. Nicméně, GDPR je identifikován jako možný důvod rostoucího “vágního” jazyka v zásadách (viz níže).

Předpokládá-li se čtení rychlost 250 slov za minutu, studie tvrdí, že průměrná zásada ochrany soukromí nyní trvá 17 minut na přečtení, zatímco více populární zásady (tj. zásady spojené s velkým počtem uživatelů) trvají 23 minut na dokončení.

Nejdelší zásada v datové sadě, od Microsoftu, vyžaduje 152 minut na spotřebu, podle výzkumu, který využil řadu variant na Googleho BERT jazykovém modelu.

Růst tempa ročních hodin potřebných na přečtení moderních zásad ochrany soukromí, předpokládá-li se, že čtenář navštíví 1462 unikátních webových stránek ročně.

Růst tempa ročních hodin potřebných na přečtení moderních zásad ochrany soukromí, předpokládá-li se, že čtenář navštíví 1462 unikátních webových stránek ročně.

Velká část nedávného nárůstu verbality a nejistoty v zásadách ochrany soukromí je přisuzována studií jako reakce na pokusy o uložení předpisů, ale také na neupřímné použití požadavků na soulad s předpisy jako omluvu pro skryté zvýšení rozsahu a neprůhlednosti zásad ochrany soukromí.

‘Celkově naše výsledky ukazují, že nedávná nařízení o ochraně soukromí podstatně nezlepšila soukromí uživatelů online, ale vedla k více nafouknutým zásadám ochrany soukromí, které popisují více a více invazivních praktik shromažďování dat.’

Ačkoli řada prací o zpracování přirozeného jazyka (NLP) se zabývala čitelností a dalšími aspekty zásad ochrany soukromí v posledních letech, autor se domnívá, že tato studie je prvním projektem svého druhu, který poskytuje tak široký přehled vývoje zásad v posledních desetiletích.

Studie paper je nazvaná Zásady ochrany soukromí napříč věky: Obsah a čitelnost zásad ochrany soukromí 1996–2021, a pochází od Isabel Wagner z Cyber Technology Institute of De Montfort University ve Spojeném království.

Elipsní jazyk

Zpráva také naznačuje, že průměrný počet “zamlžujících slov” (tj. přijatelný, významný, hlavně, a další slova, která neposkytují definitivní význam) v zásadách ochrany soukromí neustále rostl do roku 2018, ale poté prudce vzrostl z mediánu 227 kolem března 2018 na 304 v červnu 2020.

Autor tvrdí, že tento růst je přisuzován účinkům GDPR, a studie zjistila, že více než dvě třetiny (72%) vět v zásadách ochrany soukromí studovaných obsahovaly alespoň jedno zamlžující slovo.

Čitelnost

Across tří běžných měřítek čtenářské obtížnosti, studie zjistila, že ‘zásady ochrany soukromí se staly stále obtížněji čitelnými v průběhu let’. Autoři odhadují, že 41% aktuálně platných zásad dostupných v roce 2021 mělo medián Flesch Reading Ease (FRE, vyšší je lepší) pouze 31,8, s autorem pozorujícím ‘Tento skóre označuje velmi obtížný text, který je nejlépe pochopitelný univerzitními absolventy’.

V téže době pouze 6,7% zásad dosáhlo skóre FRE nad 45 (což, podle zprávy, je standard čtení vyžadovaný pro pojistné politiky ve státě Florida).

Povědomí o změnách zásad

Práce se také zabývá rozsahem, v jakém zásady ochrany soukromí obsahují podrobnosti o tom, jak bude potenciální souhlasící osoba informována v případě následujících aktualizací, které mohou ovlivnit ochotu uživatele dodržovat dohodu.

Autor poznamenává:

‘V roce 2021 73% zásad obsahuje prohlášení o změně zásad. Z nich 34% uvádí, že změny budou oznámeny oznámením v zásadách ochrany soukromí, 37% bude zveřejňovat oznámení na webu a 22% bude zasílat osobní oznámení (zbylé zásady ponechávají typ oznámení nespecifikovaný).’

‘V důsledku toho je většina uživatelů nepravděpodobně se dozví o změnách v zásadách ochrany soukromí. ‘

‘Kromě toho uživatelé jsou nabízeni téměř žádnou významnou volbu, když se zásady mění. Z zásad, které informují uživatele o změnách, pouze 12% nabízí novou možnost souhlasu, zatímco 34% nedává žádnou volbu a 54% ponechává ji nespecifikovanou.’

Zjištění studie o metodách informování uživatelů o změnách v zásadách.

Zjištění studie o metodách informování uživatelů o změnách v zásadách.

Omezená volba ohledně sledování

Podle studie je nabízeno mnohem více mechanismů v zásadách ochrany soukromí pro přístup k informacím o uživatelském účtu než pro přístup k uživatelským profilovým údajům. Profilová data mohou být vytvořena a aktualizována prostřednictvím automatizovaných a nejasných mechanismů, zatímco údaje o uživatelském účtu jsou nejen výslovně uděleny uživatelem, ale také povinny být editovatelné podle předpisů různých jurisdikcí.

Volba spotřebitelů ohledně souhlasu s cookies v zásadách ochrany soukromí (téma, které vyvolalo horkou debatu od zavedení GDPR, které vedlo k stovkám tisíc oken souhlasu s cookies pro evropské a mezinárodní webové stránky) je obecně řešena v zásadách, ale skrývá důležitější vrstvu méně přístupných dat*:

‘Volby týkající se cookies jsou nedostatečné k ochraně uživatelů před všemi sledováními, protože mechanismy volby nebo kontroly jsou zřídka nabízeny pro počítačové informace, identifikátory zařízení, a osobní identifikátory, které umožňují sledování uživatelů prostřednictvím fingerprintingu.’

Ostrý kontrast v dostupné úrovni kontroly udělené zásadami ochrany soukromí mezi profilovými údaji (které mohou být získány implicitními nebo skrytými prostředky) a údaji o uživatelském účtu (kde je často vyžadována určitá míra kontroly podle GDPR, zákona o ochraně spotřebitelů v Kalifornii (CCPA) a podobných národních a regionálních mechanismů).

Ostrý kontrast v dostupné úrovni kontroly udělené zásadami ochrany soukromí mezi profilovými údaji (které mohou být získány implicitními nebo skrytými prostředky) a údaji o uživatelském účtu (kde je často vyžadována určitá míra kontroly podle GDPR, zákona o ochraně spotřebitelů v Kalifornii (CCPA) a podobných národních a regionálních mechanismů).

Data

Pro získání dat pro studii, autor procházel webové stránky pro odkazy na jejich zásady ochrany soukromí, často nacházel nutné rozšířit rozsah beyond počáteční výsledek, kvůli počtu neintegrálních zásad, které odkazují na další zásady (každá z nich má potenciál změnit se buď společně s nebo nezávisle na rodičovské nebo související zásadě).

Wayback Machine byl použit pro získání historických zásad, ačkoli to bylo nutné při zvažování výsledků zohlednit zásady, které byly zablokovány procházením nebo archivací prostřednictvím konfiguračního souboru robots.txt (malý textový soubor obsahující instrukce pro webové procházení a indexování agentů týkající se stránek a dalších entit, které by neměly být zahrnuty do veřejného indexu).

Jedna snímek za měsíc byl získán z Wayback Machine pomocí jeho CDX API pro každou identifikovatelnou a nepřetržitou platnou zásadu, pomocí Firefox pod Selenium. Provádění optického rozpoznávání znaků na zásadách dostupných pouze ve formátu PDF nebylo zvažováno pro projekt, který omezil se na (mnohem větší) počet dostupných HTML zásad.

Jedním zajímavým výsledkem projektu je, že jasnost a čitelnost webových stránek s pornografickým obsahem se vlastně zlepšily v průběhu studovaného intervalu – možná v očekávání rostoucích požadavků na větší regulaci a jasnost. Pro shromáždění těchto dokumentů bylo nutné je získat s dodatečnými procházeními z rezidenčních IP adres, kvůli protokolům blokujícímu obsah univerzity.

Počátečně 1 068 683 dokumentů bylo získáno, což odpovídalo 120 265 unikátním dokumentům obsahujícím průměrně 39,1 článků nebo klauzulí zásad a 4,4 unikátními texty zásad pro každý odkaz.

Pouze angličtina

Jako je obvyklé v podobných nedávných studiích, projekt nebyl schopen řešit neanglické zásady ochrany soukromí, které byly vyřazeny během fáze čištění dat pomocí PYCLD2 balíčku.

Pro rozlišení zásad ochrany soukromí od jiných typů materiálů, projekt použil klasifikátor vyvinutý v roce 2019 jako společnou iniciativu University of Wisconsin a École Polytechnique Fédérale de Lausanne.

Architektura klasifikátoru IS-POLICY. Source: https://arxiv.org/pdf/1809.08396.pdf

Architektura klasifikátoru IS-POLICY. Source: https://arxiv.org/pdf/1809.08396.pdf

Ačkoli klasifikátor IS-POLICY byl vyškolován na stejném korpusu 1 000 dokumentů jako v původním článku, autor musel získat nová nepolitická dokumenty pro školení, protože původní zdroje nebyly dostupné.

Po filtrování byla data snížena na 56 416 unikátních zásad ochrany soukromí.

 

* Zpráva převedla vnitřní citaci na hypertextový odkaz, kurzíva je z paperu.

Poprvé zveřejněno 31. ledna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai