Andersons hoek
De Adblock-oorlog met Machine Learning bestrijden

Een nieuw onderzoeksinitiatief van de VS en Pakistan heeft een machine learning-gebaseerde methode ontwikkeld om websites te identificeren die resistent zijn tegen adblockers en andere privacy-beschermende technologieën, evenals de technieken die dergelijke sites gebruiken om de oorsprong van advertenties en echte inhoud te “vermengen”, zodat inhoud niet zichtbaar is als advertenties geblokkeerd worden.
Nieuwe adblock-technologieën die zijn ontwikkeld op basis van de resultaten, kunnen een einde maken aan incidenten waarbij de centrale inhoud van een artikel niet zichtbaar is wanneer advertenties geblokkeerd worden, door een geautomatiseerde methode te bieden om advertentie- en scriptbronnen te scheiden, in plaats van de huidige manuele benadering die wordt gebruikt door populaire adblock-frameworks.
De auteurs voerden een grootschalige studie uit van “gemengde bronnen” op 100.000 websites en vonden dat 17% van de domeinen, 48% van de hostnamen, 6% van de scripts en 9% van de contentleveringsmethoden advertentiefuncties (d.w.z. tracking)willen vermengen met processen die echte inhoud leveren. In dergelijke gevallen zal de artikelinhoud verdwijnen voor gebruikers die adblockers of anti-trackingsoftware gebruiken, waardoor de gebruiker genoodzaakt wordt om deze maatregelen uit te schakelen om de inhoud te kunnen bekijken.
In de meeste gevallen betekent dit niet alleen dat advertenties weer zichtbaar worden, maar ook dat gebruikers weer worden teruggedreven in de cross-domeintracking-systemen die in recente jaren hebben geleid tot verontwaardiging onder privacy-activisten.
Het nieuwe onderzoek biedt een systeem dat in staat is om de componenten van deze “gemengde” webbronnen te scheiden met een nauwkeurigheid van 98%, waardoor adblockers en anti-trackingoplossingen de kans krijgen om de stromen in latere iteraties van hun software te ontwarren en opnieuw inhoudtoegang mogelijk te maken op geblokkeerde pagina’s.
Het nieuwe artikel is getiteld TrackerSift: Untangling Mixed Tracking and Functional Web Resources en komt van onderzoekers aan Virginia Tech en UoC Davis in de VS, en FAST NUCES en de Lahore University of Management Sciences (LUMS) in Pakistan.
De Adblock-oorlog
Adblock-systemen zijn in het algemeen afhankelijk van de noodzaak voor advertentie-inhoud op een webpagina om af te komen van specifieke, toegewijde domeinen – meestal adtech-platforms met domeinnamen en/of IP-adressen die kunnen worden geclassificeerd als ‘derde partij advertenties’, waardoor blocklists kunnen worden ontwikkeld die geen inhoud van die oorsprong binnen een webpagina zullen weergeven.
Daarnaast kunnen de namen van advertentie-specifieke bronnen, zoals scripts, aan blocklists worden toegevoegd, zodat deze niet zullen worden uitgevoerd, zelfs in gevallen waarin hun oorsprong bewust is verhuld. De naamgevingschema’s van dergelijke systematisch gegenereerde scripts zijn vaak consistent, waardoor herkenning en blocklisting mogelijk zijn.
Aangezien een advertentie die op een webpagina wordt weergegeven, vaak in de laatste paar milliseconden van een paginabelading via dynamische veilingprocessen (op basis van trefwoorden die zijn gevonden in de pagina, campagne-doelmetrics en vele andere factoren) wordt gekozen, is het niet praktisch om advertenties op te slaan op het hostdomein, wat in theorie adblockers zou belemmeren om commerciële inhoud te verbergen.
Steeds meer websites vechten terug tegen adblockers door CNAME Cloaking – het gebruik van subdomeinen van het ‘authentieke’ domein als proxies voor ad-servers (d.w.z. content.example.com zal advertenties serveren aan example.com, zelfs als het subdomein geen andere doel heeft dan het serveren van advertenties en niet wordt onderhouden door de host-website, maar door de adverteerders).
Echter, deze methode kan worden gekwantificeerd en geblokkeerd door het onderscheiden van de subdomeininhoud als advertenties, of door het gebruik van netwerkanalysetechnieken om de anonieme en onregelmatige relatie van de subdomein met het kern-domein te identificeren.
TrackerSift
Het artikel van de auteurs stelt TrackerSift voor, een platform om netwerkbronnen te analyseren die door websites worden opgehaald en vervolgens gemengde bronnen te herclassificeren in ‘inhoud’ en ‘advertenties’. Op het meest algemene analyseniveau registreert TrackerSift basisnetwerkverzoeken voor bronnen, zoals advertentie-inhoud die wordt opgehaald van een Content Delivery Network (CDN) of een advertentieplatform; maar het boort vervolgens dieper in de inhoud van de opgehaalde bronnen, voert code-niveau-analyse uit en onderscheidt de functies van verschillende soorten code-aanroepen en -procedures.

TrackerSift’s analysehiërarchie, van trackingbronnen (rood) tot noodzakelijke functionele bronnen (groen). Gemengde bronnen, die waarschijnlijk leiden tot inhoudsverduistering (geel), worden onderworpen aan diepere analyse. Bron: https://arxiv.org/pdf/2108.13923.pdf
Gegevens
Om de dataset te verkrijgen die TrackerSift aandrijft, hebben de auteurs 100.000 willekeurig gekozen websites uit de Tranco top-miljoenlijst van 2018 getrawld. Selenium browser-automatisering werd gebruikt samen met Google Chrome om de taak uit te voeren.
Het web-crawling-netwerk was gebaseerd op universiteitsites in Noord-Amerika, bestaande uit een 13-knooppuntcluster met 112 kernen, 52 terabyte aan opslag en 823 gigabyte aan operationeel RAM in het hele systeem.
Elk knooppunt was gebaseerd in een Docker-container en was gewijd aan het crawlen van een subset van de 100.000 webpagina’s die waren geselecteerd, met programmatische pauzes voor duurzaamheid en complete verwijdering van alle cookies en identificatoren bij het laden van een nieuwe domein, om ervoor te zorgen dat eerdere sessies en staten de leesbaarheid van het volgende domein niet zouden beïnvloeden.
Gemengde scripts
De resultaten laten een uitgebreid gebruik zien van scriptbundeling, waarbij ad-platforms en inhoudshosts bewust inhoud-gebaseerde en ad-gebaseerde scripts samenvoegen tot ‘uberscripts’ die de weergave van inhoud zullen belemmeren als ze worden geblokkeerd. Als voorbeeld merken de auteurs op dat pressl.co een web-script serveert dat is samengevoegd via het WebPack JavaScript-concatenator-platform, dat een Facebook-trackingpixel bevat en ook code die de weergave van echte inhoud mogelijk maakt.
Daarnaast merkt het artikel op dat een aantal domeinen bereid zijn om scripts rechtstreeks in de code van webpagina’s in te bedden, waardoor het noodzakelijk is voor adblock-frameworks om de functionaliteit binnen de scripts aan te pakken, in plaats van alleen het script te voorkomen op basis van de derde partij-bron-URL.
Door deze methoden te localiseren, is de weg vrij voor systematische splitsing van dergelijke code in inhoud- en advertentiecategorieën en het potentieel herstel van inhoudweergave in geblokkeerde omgevingen.
Hoewel bestaande adblock-oplossingen, zoals NoScript, AdGuard, uBlock Origin en Firefox Smartblock, surrogate-scripts gebruiken die dergelijke samengevoegde scripts ontleden in blokkeerbare component-scripts, zijn deze afhankelijk van handmatige herschrijving van scripts, wat leidt tot een voortdurende koude oorlog tussen de blockers en de steeds veranderende technieken die ze breken. In tegenstelling tot TrackerSift biedt TrackerSift een potentieel programmatische methode voor gemengde inhoudsontleding.












