Kąt Andersona

Walka z blokadą reklam za pomocą uczenia maszynowego

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowy projekt badawczy z USA i Pakistanu opracował metodę opartą na uczeniu maszynowym do identyfikacji stron internetowych, które są odporne na blokowanie reklam i inne technologie chroniące prywatność, a także do dekonstrukcji technik stosowanych przez te strony w celu “zmieszania” pochodzenia reklam i treści, tak aby treść nie była widoczna, gdy reklamy są zablokowane.

Nowe technologie blokowania reklam opracowane na podstawie tych wyników mogą położyć kres zdarzeniom, w których główna treść artykułu nie jest widoczna, gdy reklamy są zablokowane, zapewniając zautomatyzowaną metodę separacji zasobów reklamowych i skryptów, zamiast stosowanej obecnie ręcznej metody stosowanej przez popularne frameworki blokowania reklam.

Autorzy przeprowadzili badanie na dużą skalę “zmieszanych zasobów” na 100 000 stronach internetowych, stwierdzając, że 17% domen, 48% nazw hostów, 6% skryptów i 9% metod dostarczania treści celowo łączy funkcjonalność śledzenia (tj. reklam) z procesami dostarczającymi treści. W takich przypadkach treść artykułu zniknie dla użytkowników, którzy korzystają z oprogramowania blokującego reklamy lub przeciwdziałającego śledzeniu, zmuszając użytkownika do wyłączenia tych środków, aby móc wyświetlić treść.

W większości przypadków nie oznacza to tylko, że reklamy będą ponownie widoczne, ale także, że użytkownicy będą zmuszeni powrócić do systemów śledzenia międzydomenowych, które wzbudziły kontrowersje wśród aktywistów na rzecz prywatności w ostatnich latach.

Nowe badanie oferuje system, który jest w stanie oddzielić składniki tych “zmieszanych” zasobów internetowych z dokładnością 98%, dając rozwiązaniom blokującym reklamy i przeciwdziałającym śledzeniu szansę na rozplątaną strumieni w późniejszych wersjach oprogramowania i ponowne umożliwienie dostępu do treści na stronach zablokowanych.

Nowy artykuł nosi tytuł TrackerSift: Untangling Mixed Tracking and Functional Web Resources i pochodzi od badaczy z Virginia Tech i UoC Davis w USA, oraz FAST NUCES i Lahore University of Management Sciences (LUMS) w Pakistanie.

Wojny o blokadę reklam

Systemy blokujące reklamy opierają się generalnie na potrzebie, aby treść reklamowa na stronie internetowej pochodziła z określonych, dedykowanych domen – zwykle platform adtech z nazwami domen i/lub adresami IP, które mogą być sklasyfikowane jako “trzecia strona reklamowa”, umożliwiając rozwój listy blokowania, które nie wyświetlą treści z tych źródeł w ramach strony internetowej.

Dodatkowo, nazwy zasobów specyficznych dla reklam, takich jak skrypty, mogą być dodane do listy blokowania, tak aby nie uruchamiały się nawet w przypadku, gdy ich pochodzenie zostało celowo zatarcie. Schematy nazewnicze takich systematycznie generowanych skryptów są często spójne, umożliwiając rozpoznanie i blokowanie.

Ponieważ reklama wyświetlana na stronie internetowej jest często wybierana w ostatnich milisekundach przed załadowaniem strony za pomocą dynamicznych aukcji (opartych na słowach kluczowych znalezionych na stronie, metrykach kampanii i wielu innych czynnikach), nie jest praktyczne przechowywać reklamy na domenie hosta, co teoretycznie utrudniłoby blokerom ukrywanie treści komercyjnej.

Coraz częściej strony internetowe walczą z blokadą reklam za pomocą CNAME Cloaking – użycia poddomen “autentycznej” domeny jako serwerów proxy do serwerów reklam (tj. content.example.com będzie służyć reklamom do example.com, nawet jeśli poddomena nie ma innego celu niż służyć reklamom i nie jest utrzymywana przez stronę internetową, ale raczej przez jej reklamodawców).

Jednak ta metoda może być zmierzona i zablokowana przez rozróżnienie zawartości poddomeny jako reklamy lub za pomocą technik analizy sieciowej w celu identyfikacji nieprawidłowego i nieregularnego związku poddomeny z domeną główną.

TrackerSift

Artykuł autorów proponuje TrackerSift, platformę do analizy zasobów sieciowych pobieranych przez strony internetowe, a następnie ponownej kategoryzacji zmieszanych zasobów na “treść” i “reklamę”. Na najbardziej ogólnym poziomie analizy TrackerSift rejestruje podstawowe żądania sieciowe dotyczące zasobów, takich jak treść reklamowa pobierana z sieci dostarczania treści (CDN) lub platformy reklamowej; ale następnie przechodzi do zawartości pobranych zasobów, wykonując analizę na poziomie kodu i rozróżniając funkcje różnych typów wywołań kodu i procedur.

TrackerSift's analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf

TrackerSift’s analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf

Dane

Aby uzyskać zestaw danych napędzających TrackerSift, autorzy przeszukali 100 000 losowo wybranych stron internetowych z listy Tranco top-million z 2018 roku. Selenium browser automation został użyty wraz z Google Chrome do wykonania zadania.

Sieć web-crawling była oparta na uniwersyteckich stronach w Ameryce Północnej, składającej się z 13-węzłowego klastra z 112 rdzeniami, 52 terabajtami pamięci i 823 gigabajtami pamięci operacyjnej w całym systemie.

Każdy węzeł był oparty w kontenerze Docker i dedykowany do przeszukiwania podzbioru 100 000 stron internetowych wybranych, z programowymi przerwami na rzecz zrównoważonego rozwoju, oraz całkowitym usunięciem wszystkich ciasteczek i identyfikatorów przy ładowaniu nowej domeny, aby upewnić się, że poprzednie sesje i stany nie wpłyną na czytelność następnej domeny.

Zmieszane skrypty

Wyniki pokazują szerokie zastosowanie skryptów zagnieżdżonych, gdzie platformy reklamowe i hosty treści celowo łączą skrypty oparte na treści i reklamach w “uberskrypty”, które utrudnią wyświetlanie treści, jeśli zostaną zablokowane. Przykładowo, autorzy zauważają, że pressl.co służy skrypt internetowy zagnieżdżony za pomocą platformy WebPack do łączenia skryptów JavaScript, który zawiera piksel śledzący Facebooka, oraz kod, który umożliwia wyświetlanie rzeczywistej treści.

Dodatkowo, artykuł zauważa, że wiele domen jest skłonnych do osadzania skryptów bezpośrednio w kodzie stron internetowych, co wymaga od frameworków blokujących reklamy, aby zajęły się funkcjonalnością w ramach skryptów, a nie tylko uniemożliwiły załadowanie skryptu na podstawie jego adresu URL trzeciej strony.

Poprzez zlokalizowanie tych metod, droga jest otwarta do systematycznego podziału takiego kodu na kategorie treści i reklam, oraz potencjalnego przywrócenia wyświetlania treści w środowiskach zablokowanych.

Mimo że istniejące rozwiązania blokujące reklamy, takie jak NoScript, AdGuard, uBlock Origin i Firefox Smartblock, używają skryptów zastępczych, które rozmontowują takie połączone skrypty w blokowalne składniki, te skrypty zależą od ręcznego przepisywania skryptów, co prowadzi do nieustannej wojny pomiędzy blokerami a ciągle zmieniającymi się technikami, które je łamią. W przeciwieństwie do tego, TrackerSift oferuje potencjalną programową metodę dekompozycji treści zmieszanych.

ipty które rozmontowują takie połączone skrypty w blokowalne składniki, te skrypty zależą od ręcznego przepisywania skryptów, co prowadzi do nieustannej wojny pomiędzy blokerami a ciągle zmieniającymi się technikami, które je łamią. W przeciwieństwie do tego, TrackerSift oferuje potencjalną programową metodę dekompozycji treści zmieszanych.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai