Andersonův úhel

Výzkumníci v oblasti AI odhadují, že 97% evropských webových stránek nesplňuje požadavky GDPR na ochranu soukromí – zejména profilování uživatelů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci ve Spojených státech použili techniky strojového učení ke studiu zásad ochrany soukromí více než tisíce reprezentativních webových stránek se sídlem v EU. Zjistili, že 97 % zkoumaných stránek nesplňovalo alespoň jeden požadavek evropského regulačního rámce z roku 2018, a že nejméně se shodovaly s regulačními požadavky týkajícími se praxe “profilování uživatelů”.

Studie uvádí:

‘[Jelikož] zásada ochrany soukromí je základním komunikačním kanálem pro uživatele, aby pochopili a ovládli své soukromí, mnoho společností aktualizovalo své zásady ochrany soukromí po uplatnění GDPR. Nicméně, většina zásad ochrany soukromí je rozsáhlá, plná odborných termínů a vágně popisuje datové postupy společností a práva uživatelů. Proto není jasné, zda splňují GDPR.’

Pokračuje:

‘Naše výsledky ukazují, že i po uplatnění GDPR 97 % webových stránek stále nesplňuje alespoň jeden požadavek GDPR.’

Studie s názvem Automated Detection of GDPR Disclosure Requirements in Privacy Policies using Deep Active Learning pochází od tří výzkumníků z University of Virginia v Charlottesville.

Poslední soukromí

Oblast nejnižší shody, podle studie, se týkala ustanovení GDPR o profilování uživatelů, s tím, že autoři uvedli, že pouze 15,3 % zkoumaných stránek bylo plně v souladu s tímto konkrétním pravidlem.

Graf shody mezi 9761 webovými stránkami studovanými pro výzkum. Zdroj: https://arxiv.org/pdf/2111.04224.pdf

Graf shody mezi webovými stránkami studovanými pro výzkum. Zdroj: https://arxiv.org/pdf/2111.04224.pdf

Profilování uživatelů (kde je zaznamenávána interakce osoby s webovými stránkami a často se používá k “cílenému” reklamnímu obsahu) se stalo jedním z nejžhavějších kontroverzí v technologiích od skandálu Cambridge Analytica.

V úterý schválila klíčový výbor Evropského parlamentu první fázi nové legislativy Digitální trh (DMA), která by zakázala behaviorální cílení na nezletilé, s pokutami až do 20 % celosvětových ročních tržeb za porušující společnosti.

Ačkoli byl zákon přijat médii jako přímá reakce na rostoucí vliv technologických gigantů, jako je Facebook a Google, rozsáhlá míra nesouladu představovaná novým výzkumem naznačuje, že většina evropských společností (včetně evropských poboček amerických společností obchodujících v Evropě) je právně vystavena pokutám GDPR.

Navíc Itálie uložila v tomto týdnu maximální přípustnou pokutu 10 milionů eur (11,2 milionu USD) proti Apple a Google za využívání profilování uživatelů, kromě dalších porušení.

Data

Webové stránky zkoumané v novém výzkumu byly vybrány z top 10 000 webových stránek uvedených v Quantcast, z nichž byly extrahovány anglické zásady ochrany soukromí prostřednictvím vyhledávání Yandexu na VPN v UK (aby se zajistilo, že zásady nejsou geo-blokované).

Evropské webové stránky jsou povinny poskytovat předepsané zásady ochrany soukromí, které pokrývají 18 centrálních požadavků (viz graf výše), od kdy vstoupila v platnost obecná nařízení o ochraně osobních údajů (GDPR) v květnu 2018.

Výzkumníci omezili extrakci zásad ochrany soukromí na období od srpna 2018, aby umožnili rozumný čas pro domény, aby zveřejnily požadované zásady (požadavek, o kterém měli předchozí znalosti po dobu nejméně jednoho roku z dvouleté fáze vývoje GDPR od roku 2016).

Proces filtrování vytvořil sbírku zásad ochrany soukromí o 9 761 politikách, z nichž 1 080 politik bylo náhodně vybráno výzkumníky.

Předzpracování

Tým zaměstnal dva právní odborníky, aby vyškolili čtyři lidské anotátory, aby označili každou z 18 možných zásad ochrany soukromí stanovených GDPR.

Některá odborná terminologie v zásadách ochrany soukromí pokrývala více než jeden z 18 požadavků, což vyžadovalo použití konvoluční neuronové sítě (CNN) k detekci jazykových funkcí spojených s každou politikou.

Původní pokus o výcvik modelu k identifikaci souladu na základě jazyka dosáhl 80,5% úspěchu. Pro zlepšení těchto výsledků výzkumníci použili aktivní učení, aby posílili výkon modelu pomocí méně označených dat. Díky těmto prostředkům bylo možné vyškolit klasifikátor CNN až do přesnosti 89,2 %, s F1 skóre 0,88 (kde ‘1’ je kompletní úspěch).

Aby se zajistilo, že word embeddings jsou specifické pro zásady ochrany soukromí, výzkumníci vyškolili nesupervizovaný model word embeddings pomocí knihovny Facebooku FastText v Pythonu.

Podle standardní praxe byly konečné údaje rozděleny 80/20 mezi trénovací data a testovací data (tj. náhodně vybraná data, proti kterým bude hodnocena přesnost algoritmu). Do architektury byl přidán měřicí studijní výzkum s lidskou účastí, aby se vyhodnotila kvalita výsledků.

Architektura klasifikátoru.

Architektura klasifikátoru.

Během pracovního postupu bylo vytvořeno 11 271 lidsky označených segmentů zásad ochrany soukromí, z nichž každý byl přezkoumán čtyřmi lidskými anotátory, kteří byli vyškoleni dvěma právními odborníky zapojenými do studie. Pokud došlo k nesouladu, byl vyžadován poměr souhlasu 75 %, aby se data nezamítla.

Lidé v procesu – nebylo možné zcela automatizovat označení dat politik, ale aktivní učení umožnilo poolový pracovní postup, který učinil projekt proveditelným.

Lidé v procesu – nebylo možné zcela automatizovat označení dat politik, ale aktivní učení umožnilo poolový pracovní postup, který učinil projekt proveditelným.

Kromě již zmíněných výsledků zjistili uživatelé, že přenositelnost – právo podle GDPR přenášet nebo vyvézt data držená společností – byla téměř stejně špatně obsluhována jako profilování.

Výzkumníci uzavírají:

‘[Požadavky] jako právo uživatelů na přenositelnost a poskytování kontaktních informací odpovědného pracovníka (kontakt DPO) jsou pokryty 15,5 % a 16,4 % webových stránek, resp. Další primární požadavky, jako právo uživatelů podat stížnost, odvolat souhlas, právo vznést námitku a rozhodnutí o dostatečnosti, jsou pokryty 17-20 % webových stránek.’

… a pokračují:

‘Zdá se, že pouze 3 % webových stránek plně splňují 18 požadavků. Tyto výsledky naznačují, že mnoho webových stránek stále nesplňuje požadavky GDPR.’

 

 

19:00 26. 11. 2021 – Upřesněna první grafická popiska. – MA

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai