Andersons vinkel

AI-forskere estimerer, at 97% af EU-websider ikke overholder GDPR’s privatlivskrav – især brugerprofiler

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere i USA har brugt maskinelæringsmetoder til at studere GDPR’s privatlivspolitik på over 1.000 repræsentative websider i EU. De fandt ud af, at 97% af de undersøgte sider ikke overholdt mindst ét krav i Den Europæiske Unions regulativ fra 2018, og at de overholdt kravene omkring “brugerprofiler” mindst af alle.

Rapporten siger:

‘[Da] privatlivspolitikken er den essentielle kommunikationskanal for brugere til at forstå og kontrollere deres privatliv, har mange virksomheder opdateret deres privatlivspolitik efter, at GDPR blev gennemført. Men de fleste privatlivspolitikker er svært at forstå, fyldt med fagudtryk, og beskriver virksomhedernes dataprocesser og brugernes rettigheder på en vag måde. Derfor er det uklart, om de overholder GDPR.’

Det fortsætter:

‘Vores resultater viser, at selv efter, at GDPR trådte i kraft, ikke overholder 97% af websiderne mindst ét krav i GDPR.’

Studiet er titlen Automatisk registrering af GDPR-krav i privatlivspolitikker ved hjælp af dyb aktiv læring og kommer fra tre forskere ved University of Virginia i Charlottesville.

Privatliv sidst

Området med lavest overholdelse, ifølge studiet, vedrører GDPR’s bestemmelser om brugerprofiler, hvor forfatterne siger, at kun 15,3% af de undersøgte sider var i fuld overensstemmelse med denne bestemt regel.

Et diagram over overensstemmelse mellem 9761 websider, der blev studeret i forbindelse med forskningen. Kilde: https://arxiv.org/pdf/2111.04224.pdf

Et diagram over overensstemmelse mellem websider, der blev studeret i forbindelse med forskningen. Kilde: https://arxiv.org/pdf/2111.04224.pdf

Brugerprofiler (hvor en persons interaktion med websider bliver registreret og ofte brugt til at “målrette” dem i andre online-kontekster, såsom reklamer) er blevet en af de mest kontroversielle emner i tech siden Cambridge Analytica-skandalen.

Tirsdag vedtog et vigtigt udvalg i Europa-Parlamentet det første trin i den nye lovgivning om digitale markeder (DMA), som ville forbyde målretning af mindreårige, med bøder på op til 20% af globale årlige salg for selskaber, der overtræder loven.

Selv om loven er blevet modtaget af medierne som en direkte reaktion på de voksende tech-giganter som Facebook og Google, viser den nye forskning, at det overvældende flertal af EU-virksomheder (herunder EU-residentkontorer for amerikanske virksomheder, der handler i Europa) er juridisk udsat for GDPR-bøder.

Desuden har Italien denne uge pålagt den maksimale tilladte bøde på 10 millioner euro (11,2 millioner USD) til Apple og Google for at udnytte brugerprofiler, blandt andet overtrædelser.

Data

De websider, der blev undersøgt i den nye forskning, blev valgt fra de 10.000 bedste websider i Quantcast, og deres engelsksprogede privatlivspolitikker blev hentet gennem Yandex-søgninger på UK-baserede VPN’er (for at sikre, at politikkerne ikke var geo-blokeret).

EU-websider har været forpligtede til at levere foreskrevne privatlivspolitikker, der dækker 18 centrale krav (se diagram ovenfor), siden Den Generelle Databeskyttelsesforordning (GDPR) trådte i kraft i maj 2018.

Forskerne begrænsede deres udtrækning af privatlivspolitikker til en periode fra august 2018 og frem, for at give websiderne rimelig tid til at have offentliggjort de nødvendige politikker (et krav, de havde forhåndskendskab til i mindst et år af GDPR’s to-årige udviklingsfase siden 2016).

Filtreringsprocessen resulterede i en privatlivskorpus på 9.761 politikker, hvoraf 1.080 politikker blev tilfældigt valgt af forskerne.

Forbearbejdning

Holdet ansatte to juridiske eksperter til at træne fire menneskelige annotatorer til at mærke hver af de 18 mulige privatlivspolitikker, der er påkrævet af GDPR.

Noget af fagudtrykket i politikkerne dækkede mere end ét af de 18 krav, hvilket gjorde det nødvendigt at bruge en Convolutional Neural Network (CNN) til at registrere sprogtræk, der er forbundet med hver politik.

En første forsøg på at træne en model til at identificere overensstemmelse baseret på sprog opnåede 80,5% succes. For at forbedre disse resultater anvendte forskerne aktiv læring for at styrke modellens præstation med mindre mærket data. Ved disse midler var det muligt at træne klassificator-CNN op til en nøjagtighed på 89,2%, med en F1-score på 0,88 (hvor ‘1’ er fuld succes).

For at sikre, at ordindlejninger var specifikke for privatlivspolitik, trænede forskerne en usuperviseret ordindlejningsmodel ved hjælp af Facebooks FastText-bibliotek i Python.

Som standardpraksis blev den endelige data delt 80/20 mellem træningsdata og testdata (dvs. tilfældigt valgt data, som algoritmens nøjagtighed vil blive vurderet imod). En menneske-i-løkken-målingsstudie blev tilføjet til arkitekturen for at evaluere resultaternes kvalitet.

Arkitekturen for klassificatorsystemet.

Arkitekturen for klassificatorsystemet.

I løbet af arbejdsgangen blev 11.271 menneske-mærkede privatlivspolitik-segmenter produceret, hver af dem blev gennemgået af fire menneskelige annotatorer, der var blevet trænet af de to juridiske eksperter, der deltog i studiet. Når der opstod uenighed, var en 75%-enighedsratio nødvendig for ikke at afvise data fra inklusion.

Mennesker-i-løkken – det var ikke muligt at fuldstændigt automatisere mærkning af politikdata, selv om aktiv læring enablede en pool-baseret arbejdsgang, der gjorde projektet gennemførligt.

Mennesker-i-løkken – det var ikke muligt at fuldstændigt automatisere mærkning af politikdata, selv om aktiv læring enablede en pool-baseret arbejdsgang, der gjorde projektet gennemførligt.

Foruden de allerede nævnte resultater fandt brugerne ud af, at portabilitet – retten til at overføre eller eksportere data, der er holdt af en virksomhed – var næsten lige så dårligt betjent som profilering.

Forskerne konkluderer:

‘[Krav] såsom brugernes ret til portabilitet og angivelse af kontakinformation for Data Protection Officer (DPO-kontakt) er dækket af 15,5% og 16,4% websider, respectively. Andre primære krav, såsom brugernes ret til at indgive klage, tilbagekaldelse af samtykke, ret til at modsætte sig og beslutning om tilstrækkelighed, er dækket af 17-20% websider.’

…og fortsætter:

‘Det ser ud til, at kun 3% af websiderne fuldt ud overholder 18 krav. Disse resultater viser, at mange websider stadig ikke følger GDPR’s krav.’

 

 

19:00 26/11/2021 – Klaret første diagram-underskrift. – MA

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai