Andersonův úhel
Výzkumníci v oblasti AI odhadují, že 97% evropských webových stránek nesplňuje požadavky GDPR na ochranu soukromí – zejména profilování uživatelů

Výzkumníci ve Spojených státech použili techniky strojového učení ke studiu zásad ochrany soukromí více než tisíce reprezentativních webových stránek se sídlem v EU. Zjistili, že 97 % zkoumaných stránek nesplňovalo alespoň jeden požadavek evropského regulačního rámce z roku 2018, a že nejméně se shodovaly s regulačními požadavky týkajícími se praxe “profilování uživatelů”.
Studie uvádí:
‘[Jelikož] zásada ochrany soukromí je základním komunikačním kanálem pro uživatele, aby pochopili a ovládli své soukromí, mnoho společností aktualizovalo své zásady ochrany soukromí po uplatnění GDPR. Nicméně, většina zásad ochrany soukromí je rozsáhlá, plná odborných termínů a vágně popisuje datové postupy společností a práva uživatelů. Proto není jasné, zda splňují GDPR.’
Pokračuje:
‘Naše výsledky ukazují, že i po uplatnění GDPR 97 % webových stránek stále nesplňuje alespoň jeden požadavek GDPR.’
Studie s názvem Automated Detection of GDPR Disclosure Requirements in Privacy Policies using Deep Active Learning pochází od tří výzkumníků z University of Virginia v Charlottesville.
Poslední soukromí
Oblast nejnižší shody, podle studie, se týkala ustanovení GDPR o profilování uživatelů, s tím, že autoři uvedli, že pouze 15,3 % zkoumaných stránek bylo plně v souladu s tímto konkrétním pravidlem.

Graf shody mezi webovými stránkami studovanými pro výzkum. Zdroj: https://arxiv.org/pdf/2111.04224.pdf
Profilování uživatelů (kde je zaznamenávána interakce osoby s webovými stránkami a často se používá k “cílenému” reklamnímu obsahu) se stalo jedním z nejžhavějších kontroverzí v technologiích od skandálu Cambridge Analytica.
V úterý schválila klíčový výbor Evropského parlamentu první fázi nové legislativy Digitální trh (DMA), která by zakázala behaviorální cílení na nezletilé, s pokutami až do 20 % celosvětových ročních tržeb za porušující společnosti.
Ačkoli byl zákon přijat médii jako přímá reakce na rostoucí vliv technologických gigantů, jako je Facebook a Google, rozsáhlá míra nesouladu představovaná novým výzkumem naznačuje, že většina evropských společností (včetně evropských poboček amerických společností obchodujících v Evropě) je právně vystavena pokutám GDPR.
Navíc Itálie uložila v tomto týdnu maximální přípustnou pokutu 10 milionů eur (11,2 milionu USD) proti Apple a Google za využívání profilování uživatelů, kromě dalších porušení.
Data
Webové stránky zkoumané v novém výzkumu byly vybrány z top 10 000 webových stránek uvedených v Quantcast, z nichž byly extrahovány anglické zásady ochrany soukromí prostřednictvím vyhledávání Yandexu na VPN v UK (aby se zajistilo, že zásady nejsou geo-blokované).
Evropské webové stránky jsou povinny poskytovat předepsané zásady ochrany soukromí, které pokrývají 18 centrálních požadavků (viz graf výše), od kdy vstoupila v platnost obecná nařízení o ochraně osobních údajů (GDPR) v květnu 2018.
Výzkumníci omezili extrakci zásad ochrany soukromí na období od srpna 2018, aby umožnili rozumný čas pro domény, aby zveřejnily požadované zásady (požadavek, o kterém měli předchozí znalosti po dobu nejméně jednoho roku z dvouleté fáze vývoje GDPR od roku 2016).
Proces filtrování vytvořil sbírku zásad ochrany soukromí o 9 761 politikách, z nichž 1 080 politik bylo náhodně vybráno výzkumníky.
Předzpracování
Tým zaměstnal dva právní odborníky, aby vyškolili čtyři lidské anotátory, aby označili každou z 18 možných zásad ochrany soukromí stanovených GDPR.
Některá odborná terminologie v zásadách ochrany soukromí pokrývala více než jeden z 18 požadavků, což vyžadovalo použití konvoluční neuronové sítě (CNN) k detekci jazykových funkcí spojených s každou politikou.
Původní pokus o výcvik modelu k identifikaci souladu na základě jazyka dosáhl 80,5% úspěchu. Pro zlepšení těchto výsledků výzkumníci použili aktivní učení, aby posílili výkon modelu pomocí méně označených dat. Díky těmto prostředkům bylo možné vyškolit klasifikátor CNN až do přesnosti 89,2 %, s F1 skóre 0,88 (kde ‘1’ je kompletní úspěch).
Aby se zajistilo, že word embeddings jsou specifické pro zásady ochrany soukromí, výzkumníci vyškolili nesupervizovaný model word embeddings pomocí knihovny Facebooku FastText v Pythonu.
Podle standardní praxe byly konečné údaje rozděleny 80/20 mezi trénovací data a testovací data (tj. náhodně vybraná data, proti kterým bude hodnocena přesnost algoritmu). Do architektury byl přidán měřicí studijní výzkum s lidskou účastí, aby se vyhodnotila kvalita výsledků.

Architektura klasifikátoru.
Během pracovního postupu bylo vytvořeno 11 271 lidsky označených segmentů zásad ochrany soukromí, z nichž každý byl přezkoumán čtyřmi lidskými anotátory, kteří byli vyškoleni dvěma právními odborníky zapojenými do studie. Pokud došlo k nesouladu, byl vyžadován poměr souhlasu 75 %, aby se data nezamítla.

Lidé v procesu – nebylo možné zcela automatizovat označení dat politik, ale aktivní učení umožnilo poolový pracovní postup, který učinil projekt proveditelným.
Kromě již zmíněných výsledků zjistili uživatelé, že přenositelnost – právo podle GDPR přenášet nebo vyvézt data držená společností – byla téměř stejně špatně obsluhována jako profilování.
Výzkumníci uzavírají:
‘[Požadavky] jako právo uživatelů na přenositelnost a poskytování kontaktních informací odpovědného pracovníka (kontakt DPO) jsou pokryty 15,5 % a 16,4 % webových stránek, resp. Další primární požadavky, jako právo uživatelů podat stížnost, odvolat souhlas, právo vznést námitku a rozhodnutí o dostatečnosti, jsou pokryty 17-20 % webových stránek.’
… a pokračují:
‘Zdá se, že pouze 3 % webových stránek plně splňují 18 požadavků. Tyto výsledky naznačují, že mnoho webových stránek stále nesplňuje požadavky GDPR.’
19:00 26. 11. 2021 – Upřesněna první grafická popiska. – MA












