Andersons vinkel

Maskinlärning vs. Samtyckessystem för Kakor

mm
Lägg till Unite.AI bland dina föredragna källor på Google
One of the cryptic cubes from the Hellraiser franchise.

En ny forskningssamarbete mellan University of Wisconsin och Google sätter maskinlärning mot en av de mest irriterande webbanvändarbesvär under det senaste decenniet – opaciteten och den cyniska missbruket av GDPR-kompatibla samtyckesbanner för kakor.

Den nya ramen, som kallas CookieEnforcer, använder Semantisk textförståelse för att tolka betydelsen och nyttan av den underliggande koden bakom samtyckespopuppen eller -bannern, för att ge användaren den saknade “en-klick”-lösningen för att inaktivera alla verkligen “icke-nödvändiga” kakor – inklusive de som domänägare kan presentera som “väsentliga”, även om de inte är det.

CookieEnforcer undersöker samtyckeskod från webbplatsen www.askubuntu.com. Källa: https://arxiv.org/pdf/2204.04221.pdf

CookieEnforcer undersöker samtyckeskod från webbplatsen www.askubuntu.com. Källa: https://arxiv.org/pdf/2204.04221.pdf

Systemet implementeras via en webbläsartillägg som kan installeras av användaren, som kan tillämpa användardefinierade regler med ett enda klick. När en samtyckesram visas på webbplatsen kan användaren aktivera tillägget, som sedan kommer att söka igenom samtyckeskoden för potentiella åtgärder innan den genererar lämplig JavaScript för att verkställa användarens val.

Tillägget kan ställas in för att automatiskt tillämpa användarpreferenser, eller också ta fallen individuellt, vilket tillåter användaren att justera inställningar innan slutlig inlämning.

CookieEnforcer i aktion. Om önskat kan Chrome-tillägget helt automatisera denna process, utan ytterligare användarbidrag. Se den ingraverade videon för mer information. Källa: https://www.youtube.com/watch?v=5NI6Q981quc

CookieEnforcer i aktion. Om önskat kan Chrome-tillägget helt automatisera denna process, utan ytterligare användarbidrag. Se den ingraverade videon för mer information. Källa: https://www.youtube.com/watch?v=5NI6Q981quc

Utmaningen att tolka de möjliga “icke-samtyckes”-alternativen, som vanligtvis är dolda i arkana och mödosamma grupper av inställningar (i stället för den användarvänliga acceptera allt som är typisk för samtyckesramar) modelleras som en sekvens-till-sekvens-uppgift.

I en slutgiltig utvärdering av noggrannhet kunde CookieEnforcer generera alla nödvändiga steg för att undvika kryptiska samtyckesförfaranden i 91% av de fall som studerades, på domäner som inte hade setts under utbildning av systemets maskinlärningsmodell. En användarstudie visade dessutom att systemet signifikant minskar användarens ansträngning för att navigera i samtyckesmodulerna.

Den artikeln som presenterar metoden heter CookieEnforcer: Automatiserad analys och tillämpning av samtyckesmeddelanden, och kommer från tre forskare vid University of Wisconsin i Madison, och en från Google Inc.

Arkana vägar till samtycke för kakor

Sedan införandet av den allmänna dataskyddsförordningen (GDPR) 2016 och California Consumer Privacy Act (CCPA) 2018, har webbplatser som vill engagera användare från områden som omfattas av sådan lagstiftning varit tvungna att tillhandahålla mekanismer för kakpreferenser (vanligtvis baserat på upptäckt av användarens IP-adress som en proxy för deras ursprungsland).

Men eftersom domänägare länge hade vant sig vid att samla in värdefull och användbar användardata från den opaca och vanligtvis osynliga implementeringen av kakor, visade de sig ovilliga att tillhandahålla enkla avstängningsalternativ för sina nyligen befogenade användare.

Standardgränssnittet för samtyckesgränssnitt (som visas första gången en användare besöker en domän, eller om användaren har tagit bort kakor för den domänen) etablerade sig snabbt i mörka mönster som var avsedda att trötta ut tittaren med detaljerade, tidskrävande och omfattande val, om de ville utöva sina rättigheter till samtycke; eller också ett enkelt och lättillgängligt knapp som valde användaren in i alla kakor som domänägaren önskade köra. Denna kultur av labyrintiska UI-val beskrevs i en studie från 2020 som ‘en skattjakt’.

Den nya artikeln kommenterar:

‘[Användare] kan ha svårt att utöva informerat kakkontroll för webbplatser med komplicerade meddelanden. De är mycket mer benägna att förlita sig på standardkonfigurationer än att finjustera sina kakinställningar för varje [webbplats]. I flera fall är dessa standardinställningar integritetskränkande och gynnar tjänsteleverantörerna, vilket resulterar i integritetsrisker.’

En kommentar på ett populärt inlägg om dessa metoder karakteriserade dem som ‘elakartad efterlevnad’. Användarirritation över samtyckesramar är ett ämne som står i konflikt med stora utgivare, som annars skulle kunna tillhandahålla ytterligare täckning om de inte var så personligen utsatta av sina egna metoder i detta avseende.

En typisk labyrint av alternativ som presenteras, i detta fall av webbplatsen TechCrunch, ironiskt nog som en inledning till en artikel om EU:s förändrade attityd till vad som utgör samtycke för kakor. De bifogade URL-identifierarna och krokarna som är avsedda att ytterligare möjliggöra spårning uppgick till 262 tecken (raderade här). En 'avvisa allt'-knapp, medan den är tillgänglig för vissa kategorier av kakor, är inte tillgänglig för hela uppsättningen av möjliga kakor; i de undantagna fallen måste användaren operera varje 'växel'.

En typisk labyrint av alternativ som presenteras, i detta fall av webbplatsen TechCrunch, ironiskt nog som en inledning till en artikel om EU:s förändrade attityd till vad som utgör samtycke för kakor. De bifogade URL-identifierarna och krokarna som är avsedda att ytterligare möjliggöra spårning uppgick till 262 tecken (raderade här). En ‘avvisa allt’-knapp, medan den är tillgänglig för vissa kategorier av kakor, är inte tillgänglig för hela uppsättningen av möjliga kakor; i de undantagna fallen måste användaren operera varje ‘växel’.

En artikel från 2019 från Tyskland fann att en majoritet av webbplatsbesökare i de studerade domänerna “nudgades” mot bredt samtycke, och att endast en tredjedel av webbplatserna faktiskt förklarade syftet med datainsamlingspraxis.

Ett antal webbläsartillägg, tillägg och utvidgningar har dykt upp för att hantera problemet under de senaste åren, såsom Cookie Quick Manager-tillägget för Firefox, och en bred uppsättning av Chrome-alternativ, medan Europeiska unionen försöker stänga de efterlevnadshåligheter runt samtyckesarkitekturer för kakor.

Metod och data

Forskarna bakom den nya artikeln var beslutna att skapa en mer robust ram för hantering av samtycke för kakor genom att undvika beroende av nyckelord eller handgjorda regler, den centrala metoden för ett antal nyliga liknande ML-stödda projekt.

CookieEnforcer har tre mål: att översätta samtyckesmeddelanden och gränssnitt till en maskinläsbar form; att identifiera kakkonfigurationen på ett sätt som inaktiverar icke-väsentliga kakor; och att automatiskt tillämpa ytterligare begränsningar utan ytterligare användarbidrag, om så önskas av användaren.

Systemet består av en bakre komponent som upptäcker och analyserar samtyckesmeddelanden, och en främre komponent, i form av ett webbläsartillägg, som genererar och kör inaktiveringen av icke-väsentliga kakor (dvs. kakor som inte kommer att hindra navigering eller åtkomst till domänen om de blockeras).

Ramen är inkapslad i ett Chrome-specifikt lokalt installerat tillägg som använder Selenium-biblioteket för webbtestning under ChromeDriver-ramen.

Den bakre delen består av moduler för upptäckt, analys och beslutsmodell. Analysmodulen tar hänsyn till förändringar i kod som introduceras av användarinteraktion, så att den ursprungliga koddumpen inte blir ogiltig av simulerad användarutforskning.

Naturlig språkförståelse

Med koden avslöjad är det viktigt att CookieEnforcer förstår den befintliga tillståndet av möjliga åtgärder den kan vidta, eftersom språket bakom växelknappar kan vara tvetydigt i termer av nytta för slutanvändaren.

För detta ändamål tränade forskarna en Text-To-Text Transfer Transformer (T5)-modell för sin beslutskomponent. T5-Large-modellen, som innehåller 770 miljoner parametrar, finjusterades på en anpassad databas med in-/utkod (dvs. kod som beskriver och möjliggör funktionen för växlingsalternativ).

Exempel på formatering (ovan) och träningsdata (nedan) för T5-modellen. Dataexemplet är från www.askubuntu.com.

Exempel på formatering (ovan) och träningsdata (nedan) för T5-modellen. Dataexemplet är från www.askubuntu.com.

Databasen skapades genom att sampla 300 webbplatser med samtyckesmeddelanden valda från Tranco’s top-50k populära webbplatser-lista. Upptäckts- och analysmodulerna extraherade samtyckesalternativen från deras källkod och utvärderade deras standardtillstånd.

En av forskarna märkte sedan manuellt de tolkade serierna av klick som krävdes för att inaktivera icke-väsentliga kakor för alla studerade webbplatser, vilket resulterade i 300 fullständigt märkta domäner.

Variation i källkodsdisposition över exempel från den anpassade databasen.

Variation i källkodsdisposition över exempel från den anpassade databasen.

60 webbplatser avsattes som en testuppsättning, och T5-Large-modellen tränades med en inlärningshastighet på 0,003 vid en batchstorlek på 16 under 20 epoker, med en maximal inmatningssekvenslängd på 256 token och en maximal målsekvenslängd på 64. Token bildades av subord som etablerades av Googles SentencePiece-tokenisator.

Slutligen lagras den bearbetade informationen i en lokal databas och görs tillgänglig för systemets främre del. Författarna föredrog querySelector()-funktionen över XML Path Language (XPath)-metoden som användes av vissa tidigare liknande projekt, eftersom XPaths för samtyckesmeddelanden är sårbara för DOM-uppdateringar (dvs. koden kan ändras efter initial inläsning i samband med användarinteraktion). På detta sätt kan elementvägarna behållas även när de är dynamiska och svarar på yttre faktorer.

Testning och prestanda

I praktiken visade sig CookieEnforcer kunna navigera i några av de mörkaste mörka mönstren i databasen, såsom ett dolt alternativ i samtyckesramen för The New Scientist som döljs av JavaScript tills användaren uttryckligen begär att se det.

Författarna kommenterar:

‘Detta alternativ kan lätt missas av användarna eftersom de måste expandera en extra ram för att se det. CookieEnforcer hittar inte bara detta alternativ, utan förstår också semantiken och beslutar att invända. Dessa exempel visar att modellen lär sig sammanhanget och generaliserar till nya exempel.’

Forskarna utförde tre tester, inklusive en slutgiltig utvärdering av ramens prestanda över 500 osedda domäner (dvs. webbplatser som CookieEnforcer inte specifikt tränades för), där författarna rapporterar att den kunde inaktivera icke-väsentliga kakor för 91% av webbplatserna.

Det andra testet bestod av en online-användarstudie som omfattade 14 webbplatser och använde System Usability Scale (poäng) mot en manuell baslinje. För detta test rapporterar författarna att CookieEnforcer fick en 15% högre poäng än baslinjen.

CookieEnforcer möjliggör en 15% högre poäng än baslinjen (icke-assisterad) användning, samtidigt som den automatiserar en besvärlig process.

CookieEnforcer möjliggör en 15% högre poäng än baslinjen (icke-assisterad) användning, samtidigt som den automatiserar en besvärlig process.

Slutligen testades CookieEnforcers tränade parametrar mot de 5000 bästa webbplatserna i USA och Europa för att bestämma dess förmåga att navigera i samtyckesmeddelanden. Författarna påstår:

‘Medan mätningar i sådan skala har utförts tidigare, möjliggör CookieEnforcer en djupare förståelse av alternativen utöver nyckelordsbaserade heuristiker. I synnerhet finner vi att 16,7% av webbplatserna i Storbritannien som visar samtyckesmeddelanden har aktiverat minst en icke-väsentlig kaka. Samma siffra för webbplatser i USA är 22%.’

Författarna har släppt en kort YouTube-video som visar CookieEnforcer i aktion:

 

Publicerad första gången den 12 april 2022.

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai