Andersons vinkel
En maskinlärningsmetod för att blockera annonser baserat på lokal webbläsaraktivitet

Forskare i Schweiz och USA har utvecklat en ny maskinlärningsansats för att upptäcka webbannonsmaterial som baseras på hur sådant material interagerar med webbläsaren, snarare än genom att analysera dess innehåll eller nätverksbeteende – två metoder som visat sig vara ineffektiva på lång sikt i mötet med CNAME-kloaking (se nedan).
Den så kallade WebGraph-ramverket använder en grafbaserad AI-annonsblockeringsmetod för att upptäcka reklammaterial genom att fokusera på sådana väsentliga aktiviteter i nätverksreklam – inklusive telemetrik och lokal webbläsarlagring – att den enda effektiva undvikandetekniken vore att inte utföra dessa aktiviteter.
Även om tidigare metoder har uppnått något högre upptäcktsfrekvenser än WebGraph, är alla dessa känsliga för undvikandetekniker, medan WebGraph kan uppnå 100% integritet i mötet med motståndare, inklusive mer avancerade hypotetiska svar som kan uppstå i mötet med denna nya annonsblockeringsmetod.
Arbetet leds av två forskare från det schweiziska federala tekniska universitetet, i samarbete med forskare från University of California, Davis och University of Iowa.
Bortom AdGraph
Arbetet är en utveckling från en forskningsinitiativ från 2020 med Brave-webbläsaren som kallades AdGraph, som inkluderade två av forskarna från den nya artikeln.

Jämförelse av AdGraph och WebGraph, med streckade linjer som representerar arkitektoniska innovationer på den tidigare metoden. Källa: https://arxiv.org/pdf/2107.11309.pdf
AdGraph förlitar sig på (annons)innehålls funktioner, som hämtats från analys av URL:er, som en nyckel till upptäckten av kommersiellt material. Men dessa funktioner representerar en enda potentiell svaghet för motståndare som försöker upptäcka närvaron av annonsupptäckningssystem, och utforma metoder för att undvika dem. Denna tillit till innehålls egenskaper gör AdGraph i princip till en mekaniserad version av manuellt kuraterade filterlistbaserade metoder, som delar deras svagheter.
CNAME-kloaking
Material som kommer från en webbplats eget domän hamnar i en “pålitlig” kategori, så länge domänen i sig är pålitlig. För en webbplats med hög auktoritet finns det ett värdefullt premium i att köra annonskampanjer som innehåller material som verkar vara värd för webbplatsen själv, eftersom sådan reklam är immun mot filterbaserad annonsblockering och till och med mot AdGraph-metoden från 2020.
Men anpassade kampanjer är svåra att förhandla, dyra att implementera och strider mot de grundläggande principerna för nätverksreklammodellen som utvecklats under de senaste 25 åren, där en tredjepartsplattform infogar kod direkt i värdwebbplatsen, vanligtvis “auktionerar” annonsplatsen på mikrosekunder baserat på nyckelordsönskvärdhet och olika andra faktorer.
Sedan nästan alla annonsblockeringssystem är beroende av tredjepartsmaterial i webbsidor (dvs. element som är värd för “främmande” domäner), har annonsörer kämpat tillbaka med CNAME-kloakningstekniker under de senaste fem åren. CNAME-kloaking bedrar spårare att tro att en underdomän för värdwebbplatsen (t.ex. information.example.com istället för example.com) är en äkta tillägg till webbplatsen, när det i själva verket är ett proxysystem för annonsleverantörer som är arrangerat med tredjepartsannonsörer.
I mars 2021 avslöjade en studie att CNAME-kloakningstillfällen ökade med 22% mellan 2018 och 2020, med nästan 10% av Trancos topp 10 000 webbplatser som använder minst en CNAME-baserad spårare i oktober 2020.
Att avskriva förtroende för URL:er
CNAME-bedrägeritekniker innefattar manipulation av URL:er som är inblandade i annonsleveransprocessen. Alla annonsblockeringssystem som litar på URL-kedjan kommer att vara föremål för manipulation och undvikande. Därför ändrar WebGraph slumpmässigt de tillhandahållna URL:erna i en process (inklusive frågesträngar, antal parametrar och parameter namn), letar efter mönster för användning snarare än specifika förbjudna eller accepterade URL:er.
Systemet måste ta hänsyn till två vanliga konfigurationer i en annonsarkitektur: en där värden samarbetar direkt med annonsören; och en annan (mer vanlig) scenario där annonsören ger begränsat samarbete på grund av behovet att skydda sig mot manipulation av sina kunder.
I listbaserade metoder, inklusive AdGraph, är lyckad URL-manipulation av annonsleverantören nästan en fullständig seger, eftersom den tilldelar “lokal” ursprung till annonsen och därmed undviker nästan alla försök att systematiskt blockera annonsinnehåll.
Vad är kvar, i form av signatur? WebGraph fokuserar istället på annonsystemens behov av att dela information genom olika semi-förvrängda medel, såsom webb-spårare, kommunikation mellan iframes och webb-“lyssnare”, som ständigt pollar den live-tillståndet för värdwebbplatsen för aktivitet som är meningsfull i termer av webb-mätvärden för annonsen. Sådan aktivitet inkluderar lagring av variabler i cookies eller HTML5-baserad lokal lagring.
WebGraph använder Mozillas Web Privacy Measurement (OpenWPM-ramverk) för att spåra sådan aktivitet i Firefox. Det fångar all aktivitet på JavaScript-lagret och alla utgående nätverksbegäranden och deras svar på nätverkslagret.
Denna ytterligare granskning introducerar nya “informationsflödes”-kanter till graf-nätverket som tidigare föreslogs av AdGraph, vilket möjliggör för WebGraph att explicit spela in och kvantifiera informationsdelningsmönster baserat på lokal aktivitet, och oavsett ursprungs- och mål-URL:er för telemetri eller andra typer av interna kommunikationer i annonsleverantörssystem.
Resultat
Forskarna använde en utökad version av OpenWPM för att systematiskt crawla 10 000 webbplatser från Alexa-toppen 100 000 webbplatser, och ett slumpmässigt urval av 9 000 webbplatser rankade mellan 1 000-100 000, lagrade deras grafiska representationer innan de skickade resultaten till en besluts-trädklassificerare som modellerats efter AdGraphs ursprungliga design, och använde populära annonsfilterlistor som grund-sanning. På detta sätt konstruerades en datamängd för utbildning av kärnmodellen.
Systemet uppnådde jämförbara resultat med AdGraph, med 92,33% noggrannhet. Men det nya systemets motståndskraft mot motståndare ökar från en nästan fullständig misslyckandefrekvens för AdGraph till bara 8% känslighet under WebGraph.
Framtida riktningar
Artikeln hävdar att annonsnätverk skulle behöva omfattande omstrukturera sina system för att undvika upptäckt i mötet med WebGraph-metoden, och föreslår att sådana förändringar skulle kräva en översyn av det nuvarande försiktiga förtroendeförhållandet mellan tredjepartsannonsörer och värdwebbplatserna som deras annonser visas på.
Artikeln noterar också att WebGraph inte tar hänsyn till tillståndslösa spårningstekniker som webbläsarfingeravtryck (via Canvas-elementet), som använder sig av API:er som systemet för närvarande inte övervakar. Forskarna föreslår att WebGraph kan utökas i framtiden för att också ta hänsyn till sådana typer av interaktioner och lokala lagringsindikatorer.












