Andersons vinkel

Bekämpning av Adblock-blocking med maskinlärning

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En ny forskningsinitiativ från USA och Pakistan har utvecklat en maskinlärningsbaserad metod för att identifiera webbplatser som är resistenta mot adblocking och andra integritetsbevarande tekniker, samt för att dekonstruera de tekniker som sådana webbplatser använder för att “blanda” ursprunget för annonser och riktigt innehåll, så att innehållet inte kan visas om annonser blockeras.

Nya adblocking-tekniker som utvecklats från resultaten kan sätta stopp för incidenter där den centrala innehållet i en artikel inte kan visas när annonser blockeras, och tillhandahåller en automatiserad metod för att separera annons- och skriptresurser, snarare än den manuella metod som för närvarande används av populära adblocking-ramverk.

Författarna genomförde en stor studie av “blandade resurser” på 100 000 webbplatser och fann att 17% av domänerna, 48% av värdnamnen, 6% av skripten och 9% av innehållsleveransmetoderna medvetet blandar spårning (dvs. annonsfunktion) med processer som levererar riktigt innehåll. I sådana fall kommer artikelns innehåll att försvinna för användare som använder adblocking- eller anti-spårningprogramvara, vilket tvingar användaren att inaktivera dessa åtgärder för att kunna visa innehållet.

I de flesta fall innebär detta inte bara att annonserna kommer att vara synliga igen, utan också att användarna kommer att tvingas tillbaka till de tvärdomänsbaserade spårningssystem som har inflammerat integritetsförespråkare under de senaste åren.

Den nya forskningen erbjuder ett system som kan separera komponenterna i dessa “blandade” webbresurser med 98% noggrannhet, vilket ger adblocking- och anti-spårningssystem en chans att lösgöra strömmarna i senare iterationer av sin programvara, och återigen möjliggöra innehållsåtkomst på adblockerade sidor.

Den nya artikeln heter TrackerSift: Untangling Mixed Tracking and Functional Web Resources och kommer från forskare vid Virginia Tech och UoC Davis i USA, samt FAST NUCES och Lahore University of Management Sciences (LUMS) i Pakistan.

Adblock-krigen

Adblocking-system är i allmänhet beroende av att annonsinnehåll på en webbsida måste komma från specifika, dedikerade domäner – vanligtvis adtech-plattformar med domännamn och/eller IP-adresser som kan klassificeras som “tredjepartsannonsering”, vilket möjliggör utveckling av blocklistor som inte kommer att rendera innehåll från dessa ursprung inom en webbsida.

Dessutom kan namnen på annonsrelaterade resurser, såsom skript, läggas till i blocklistor så att de inte körs även i fall där deras ursprung har dolts. Namngivningsschemat för sådana systematiskt genererade skript är ofta konsekvent, vilket möjliggör igenkänning och blockering.

Eftersom en annons som visas på en webbsida ofta väljs i de sista millisekunderna av en sidinläsning via dynamiska auktioner (baserat på nyckelord som hittats på sidan, kampanjmål och många andra faktorer), är det inte praktiskt att lagra annonser på värd-domänen, vilket i teorin skulle förhindra adblockers från att dölja kommersiellt innehåll.

Allt fler webbplatser kämpar mot adblocking genom CNAME Cloaking – användningen av underdomäner av den “äkta” domänen som proxy till annonservrar (dvs. innehåll.example.com kommer att tjäna annonser till example.com, även om underdomänen inte har något annat syfte än att tjäna annonser och inte underhålls av webbplatsen, utan snarare av dess annonsörer).

Men denna metod kan kvantifieras och blockeras genom att skilja på underdomänens innehåll som annonsering, eller genom att använda nätverksanalystekniker för att identifiera underdomänens onormala och oregelbundna relation till kärndomänen.

TrackerSift

Författarnas artikel föreslår TrackerSift, en plattform för att analysera nätverksresurser som hämtas av webbplatser, och sedan omklassificera blandade resurser till “innehåll” och “annonsering”. På den mest allmänna analysnivån registrerar TrackerSift grundläggande nätverksbegäranden för resurser, såsom annonsinnehåll som hämtas från en Content Delivery Network (CDN) eller en annonsplattform; men den gräver sedan djupare i innehållet i de hämtade resurserna, genomför kodnivåanalys och skiljer på funktionerna för olika typer av kodanrop och procedurer.

TrackerSifts analyshierarki, från spårningsresurser (röd) till nödvändiga funktionsresurser (grön). Blandade resurser, som sannolikt leder till innehållsoskurerande (gul), är föremål för djupare analys. Källa: https://arxiv.org/pdf/2108.13923.pdf

TrackerSifts analyshierarki, från spårningsresurser (röd) till nödvändiga funktionsresurser (grön). Blandade resurser, som sannolikt leder till innehållsoskurerande (gul), är föremål för djupare analys. Källa: https://arxiv.org/pdf/2108.13923.pdf

Data

För att erhålla datamängden som driver TrackerSift, genomsökte författarna 100 000 slumpmässigt valda webbplatser från 2018 års Tranco top-million lista. Selenium webbläsarautomatisering användes tillsammans med Google Chrome för att utföra uppgiften.

Web-crawling-nätverket baserades på universitetssidor i Nordamerika, bestående av en 13-nodkluster med 112 kärnor, 52 terabyte lagring och 823 gigabyte operativt RAM i hela systemet.

Varje nod var baserad i en Docker-container och dedikerad till att crawla en undermängd av de 100 000 webbsidor som valdes, med programmatiska pauser för hållbarhet och fullständig radering av alla cookies och identifierare när en ny domän laddades, för att säkerställa att tidigare sessioner och tillstånd inte påverkade läsbarheten av nästa domän.

Blandade skript

Resultaten visar omfattande användning av skriptbundling, där annonsplattformar och innehållsvärdar medvetet konkatenerar innehållsbaserade och annonsbaserade skript till “uberskript” som kommer att förhindra innehållsvisning om de blockeras. Till exempel noterar författarna att pressl.co serverar ett webbskript som bundlats via WebPack JavaScript-konkateneringsplattformen, som innehåller en Facebook-spårningspixel och även kod som möjliggör rendering av faktiskt innehåll.

Dessutom noterar artikeln att ett antal domäner är villiga att infoga skript direkt i webbsidornas kod, vilket gör det nödvändigt för adblocking-ramverk att hantera funktionen inom skripten, snarare än att bara förhindra att skriptet laddas baserat på dess tredjepartsursprung-URL.

Genom att lokalisera dessa metoder är vägen klar för systematiskt splittrande av sådan kod i innehålls- och annonskategorier, och den potentiella återställningen av innehållsvisning i adblockerade miljöer.

Även om befintliga adblocking-lösningar, såsom NoScript, AdGuard, uBlock Origin och Firefox Smartblock, använder surrogatskript som demonterar sådana sammanslagna skript till blockbara komponentskript, är dessa beroende av manuell omskrivning av skript, vilket leder till ett pågående kallt krig mellan blockerna och de ständigt förändrade tekniker som bryter dem. I kontrast erbjuder TrackerSift en potentiell programmatisk metod för blandat innehållsdekomposition.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai