Andersonův úhel

Boj proti blokování reklam s pomocí strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nová výzkumná iniciativa z USA a Pákistánu vyvinula metodu založenou na strojovém učení pro identifikaci webových stránek, které jsou odolné vůči blokování reklam a jiným technologiím chránícím soukromí, a také pro rozbor technik, které tyto stránky používají k “smíchání” původu reklam a skutečného obsahu, takže obsah není viditelný, pokud jsou reklamy zablokovány.

Nové technologie blokování reklam vyvinuté z těchto zjištění by mohly ukončit případy, kdy je hlavní obsah článku neviditelný, když jsou reklamy zablokovány, a poskytnout automatizovaný způsob, jak oddělit reklamní a skriptové zdroje, místo ručního přístupu, který používají současné populární rámce pro blokování reklam.

Autoři provedli rozsáhlou studii “smíšených zdrojů” na 100 000 webových stránkách a zjistili, že 17 % domén, 48 % hostitelských názvů, 6 % skriptů a 9 % metod doručování obsahu záměrně kombinují sledovací (tj. reklamní) funkčnost s procesy, které dodávají skutečný obsah. V takových případech zmizí obsah článku pro uživatele, kteří používají software pro blokování reklam nebo anti-sledování, a uživatelé budou nuceni vypnout tyto opatření, aby mohli obsah zobrazit.

Většinou to neznamená pouze to, že reklamy budou opět viditelné, ale také to, že uživatelé budou nuceni vrátit se do systémů pro sledování napříč doménami, které vzbudily vášně mezi zastánci ochrany soukromí v posledních letech.

Nový výzkum nabízí systém, který je schopen rozdělit složky těchto “smíšených” webových zdrojů s přesností 98 %, což umožňuje řešení pro blokování reklam a anti-sledování šanci rozplést tyto proudy v pozdějších iteracích svého softwaru a opětovně umožnit přístup k obsahu na stránkách zablokovaných reklam.

Nová práce nese název TrackerSift: Rozplétání smíšených sledovacích a funkčních webových zdrojů a pochází od výzkumníků z Virginia Tech a UoC Davis v USA a FAST NUCES a Lahore University of Management Sciences (LUMS) v Pákistánu.

Války o blokování reklam

Systémy pro blokování reklam se obecně spoléhají na potřebu, aby reklamní obsah na webové stránce pocházel z konkrétních, specializovaných domén – obvykle adtech platforem s doménovými názvy a/nebo IP adresami, které lze klasifikovat jako “třetí strany reklam”, což umožňuje vývoj blocklistů, které nebudou zobrazovat obsah z těchto zdrojů uvnitř webové stránky.

Kromě toho lze názvy reklamně specifických zdrojů, jako jsou skripty, přidat do blocklistů, aby tyto skripty neběhaly ani v případech, kdy jejich původ byl záměrně zakryt. Názevové schéma takto systematicky generovaných skriptů je často konzistentní, což umožňuje rozpoznání a přidání do blocklistů.

Pokud je reklama zobrazena na webové stránce, je často vybrána v posledních několika milisekundách před načtením stránky prostřednictvím dynamických aukčních procesů (založených na klíčových slovech nalezených na stránce, cílových metrikách kampaní a mnoha dalších faktorech), není praktické ukládat reklamy na hostitelskou doménu, což by teoreticky bránilo blokování reklam.

Stále více webových stránek bojuje proti blokování reklam pomocí CNAME Cloaking – použití subdomén “autentické” domény jako proxy serverů pro reklamní servery (tj. content.example.com bude sloužit reklamy pro example.com, i když subdoména nemá žádný jiný účel než sloužit reklamám a není udržována hostitelskou webovou stránkou, ale spíše jejími inzerenty).

Avšak tato metoda může být kvantifikována a zablokována rozlišením obsahu subdomény jako reklamy nebo pomocí síťové analýzy k identifikaci anomálního a nepravidelného vztahu subdomény k hlavní doméně.

TrackerSift

Práce autorů navrhuje TrackerSift, platformu pro analýzu síťových zdrojů načtených webovými stránkami, a poté překlasifikuje smíšené zdroje do “obsahu” a “reklamy”. Na nejzákladnější úrovni analýzy TrackerSift zaznamenává základní síťové požadavky na zdroje, jako je reklamní obsah načtený z Content Delivery Network (CDN) nebo reklamní platformy; poté se však prokope do obsahu načtených zdrojů, provádí analýzu na úrovni kódu a rozlišuje funkce různých typů volání kódu a procedur.

Hierarchie analýzy TrackerSift, od sledovacích zdrojů (červená) až po nezbytné funkční zdroje (zelená). Smíšené zdroje, které pravděpodobně povedou k zamlžení obsahu (žlutá), jsou podrobeny hlubší analýze. Zdroj: https://arxiv.org/pdf/2108.13923.pdf

Hierarchie analýzy TrackerSift, od sledovacích zdrojů (červená) až po nezbytné funkční zdroje (zelená). Smíšené zdroje, které pravděpodobně povedou k zamlžení obsahu (žlutá), jsou podrobeny hlubší analýze. Zdroj: https://arxiv.org/pdf/2108.13923.pdf

Data

Pro získání datového souboru, který pohání TrackerSift, autoři procházeli 100 000 náhodně vybraných webových stránek z Tranco top-million listu z roku 2018. Selenium browser automation byl použit společně s Google Chrome k provedení úkolu.

Webová procházková síť byla založena na univerzitních stránkách v Severní Americe, tvořena 13-uzlovým clusterem s 112 jádry, 52 terabajty úložiště a 823 gigabajty operační paměti v celém systému.

Každý uzel byl založen v kontejneru Docker a věnován procházení podmnožiny 100 000 webových stránek vybraných programově, s programovými pauzami pro udržitelnost a kompletní mazání všech souborů cookie a identifikátorů při načtení nové domény, aby se zajistilo, že předchozí relace a stavy neovlivní čitelnost další domény.

Smíšené skripty

Výsledky ukazují rozsáhlé použití skriptového svazku, kde reklamní platformy a hostitelé obsahu záměrně spojují obsahové a reklamní skripty do “nadoskriptů”, které brání zobrazení obsahu, pokud jsou zablokovány. Autoři například uvádějí, že pressl.co slouží webový skript svázaný prostřednictvím WebPack JavaScript konkatenační platformy, který obsahuje Facebook sledovací pixel a také kód, který umožňuje rendering skutečného obsahu.

Kromě toho práce uvádí, že řada domén je ochotna vkládat skripty přímo do kódu webových stránek, což vyžaduje, aby rámce pro blokování reklam řešily funkčnost uvnitř skriptů, místo aby jednoduše bránily načtení skriptu na základě jeho třetí strany URL.

Localizací těchto metod je jasná cesta pro systematické rozdělení takového kódu do kategorií obsahu a reklamy a potenciální obnovení zobrazení obsahu v prostředích zablokovaných reklam.

Ačkoli stávající řešení pro blokování reklam, jako je NoScript, AdGuard, uBlock Origin a Firefox Smartblock, používají náhradní skripty, které rozdělují takové spojené skripty na blokovatelné komponentní skripty, tyto závisí na ručním přepisování skriptů, což vede k neustálé studené válce mezi blokováním a neustále se měnícími technikami, které je porušují. Naopak TrackerSift nabízí potenciální programatický způsob pro rozdělení smíšených obsahu.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai