Andersons vinkel
AI-forskere estimerer at 97% av EU-nettsteder ikke oppfyller GDPR-kravene til personvern – spesielt brukerprofiler

Forskere i USA har brukt maskinlæringsmetoder til å studere GDPR-personvernpolitikken for over tusen representative nettsteder basert i EU. De fant ut at 97% av nettstedene som ble studert ikke oppfylte minst ett krav i Den europeiske unions 2018-reguleringsramme, og at de oppfylte kravene minst av alle når det gjelder “brukerprofilerings”-praksisen.
Rapporten sier:
‘[Ettersom] personvernspolitikken er det essensielle kommunikasjonskanalen for brukere å forstå og kontrollere sitt personvern, har mange selskaper oppdatert sine personvernspolitikker etter at GDPR ble innført. Men de fleste personvernspolitikker er verbale, fulle av jargon og beskriver vagt selskapets dataprosesser og brukernes rettigheter. Derfor er det uklart om de oppfyller GDPR.’
Det fortsetter:
‘Våre resultater viser at selv etter at GDPR trådte i kraft, oppfyller 97% av nettstedene ikke minst ett krav i GDPR.’
Studien het Automatisk oppdaging av GDPR-krav i personvernspolitikker ved hjelp av dyp aktiv læring, og kommer fra tre forskere ved University of Virginia i Charlottesville.
Personvern sist
Området med minst overholdelse, ifølge studien, var GDPR-bestemmelsene om brukerprofiler, hvor forfatterne fastslo at bare 15,3% av nettstedene som ble studert var fullt i overensstemmelse med denne bestemmelsen.

En graf over overholdelse blant nettsteders GDPR-politikker som ble studert for forskningen. Kilde: https://arxiv.org/pdf/2111.04224.pdf
Brukerprofiler (hvor en persons interaksjon med nettsteder blir registrert og ofte brukt til å “målrette” dem i andre nettbaserte sammenhenger, som reklame) har blitt en av de heteste kontroversene i teknologi siden Cambridge Analytica-skandalen.
Tirsdag godkjente et viktig utvalg i Den europeiske union godkjente den første fasen av den nye Digital Markets Act (DMA) lovgivning, som ville forbudt atferdsmessig målretting av mindreårige, med bøter på opp til 20% av global årlig omsetning for selskaper som overtrådte.
Selv om loven har blitt mottatt av media som en direkte respons på den økende innflytelsen av teknologigigantene som Facebook og Google, viser skalaen av ikke-overholdelse representert av den nye forskningen at de fleste EU-selskaper (inkludert EU-baserte kontorer for amerikanske selskaper som handler i Europa) er juridisk utsatt for GDPR-bøter.
I tillegg har Italia denne uken pålagt den maksimale tillatte bot på 10 millioner euro (11,2 millioner dollar) mot Apple og Google for å utnytte brukerprofiler, blant annet.
Data
Nettstedene som ble undersøkt i den nye forskningen ble samplet fra de 10 000 beste nettstedene i Quantcast, der de engelske personvernspolitikkene ble hentet gjennom Yandex-søk på UK-baserte VPN-er (for å sikre at politikken ikke var geo-blokkert).
EU-nettsteder har vært pålagt å tilby foreskrevne personvernspolitikker, som dekker 18 sentrale krav (se graf ovenfor) siden Den generelle personvernforordningen (GDPR) trådte i kraft i mai 2018.
Forskerne begrenset uttrekket av personvernspolitikker til en periode fra august 2018 og utover, for å gi rimelig tid for domener å ha publisert de nødvendige politikker (et krav som de hadde forhåndskunnskap om for minst ett år av de to årene med GDPR-utvikling siden 2016).
Filtreringsprosessen produserte en personvernkorpus på 9 761 politikker, av hvilke 1 080 politikker ble tilfeldig valgt av forskerne.
Førbehandling
Teamet ansatte to juridiske eksperter for å trene fire menneskelige annotatorer til å merke hver av de 18 mulige personvernspolitikkene som pålagt av GDPR.
Noen av de juridiske uttrykkene i politikken dekket mer enn ett av de 18 kravene, og det var nødvendig å bruke en Convolutional Neural Network (CNN) til å oppdage språklig funksjoner assosiert med hver politikk.
En første forsøk på å trene en modell til å identifisere overholdelse basert på språk oppnådde 80,5% suksess. For å forbedre disse resultater, anvendte forskerne aktiv læring for å forbedre modellens ytelse ved hjelp av mindre merket data. Ved disse midlene var det mulig å trene klassifiserings-CNN opp til en nøyaktighet på 89,2%, med en F1-poeng på 0,88 (der ‘1’ er full suksess).
For å sikre at ordinnbefalingene var spesifikke for personvernspolitikker, trente forskerne en uovervåket ordinnbefalingmodell ved hjelp av Facebooks FastText Python-bibliotek.
Som standard praksis ble den endelige datoen splittet 80/20 mellom treningsdata og testdata (dvs. tilfeldig valgt data mot hvilket algoritmens nøyaktighet vil bli vurdert). En menneske-i-løkken målingsstudie ble lagt til i arkitekturen for å evaluere kvaliteten på resultater.

Arkitekturen for klassifiseringsystemet.
I løpet av arbeidsflyten ble 11 271 menneske-merkede personvernspolitikk-segmenter produsert, hver av hvilke ble gjennomgått av fire menneskelige annotatorer som hadde blitt trent av de to juridiske eksperter som deltok i studien. Hvor uenighet oppstod, var en 75% enighetsratio nødvendig for å ikke avvise data fra inklusjon.

Mennesker-i-løkken – det var ikke mulig å fullstendig automatisere merking av politikkdata, selv om aktiv læring enablet en pool-basert arbeidsflyt som gjorde prosjektet gjennomførbart.
Foruten de resultater som allerede er nevnt, fant brukerne ut at portabilitet – retten under GDPR til å flytte eller eksportere data holdt av et selskap – var nesten like dårlig betjent som profilering.
Forskerne konkluderer:
‘[Krav] som brukernes rett til portabilitet og å gi kontaktinformasjon til personvernombud (DPO-kontakt) er dekket av 15,5% og 16,4% nettsteder, henholdsvis. Andre primære krav, som brukernes rett til å klage, trekke tilbake samtykke, rett til å motsi, og adequat beslutning, er dekket av 17-20% nettsteder.’
…og fortsetter:
‘Det ser ut til at bare 3% av nettstedene fullt ut oppfyller 18 krav. Disse funnene indikerer at mange nettsteder fortsatt ikke følger GDPR-kravene.’
19.00 26/11/2021 – Klargjort første grafikk-beskrivelse. – MA












