Взгляд Anderson
Машинный метод блокировки рекламы на основе локального поведения браузера

Исследователи в Швейцарии и США разработали новый машинный метод обнаружения рекламного материала на веб-сайтах, основанный на взаимодействии такого материала с браузером, а не на анализе его содержания или сетевого поведения – двух подходах, которые оказались неэффективными в долгосрочной перспективе в условиях CNAME-маскировки (см. ниже).
Эта система, получившая название WebGraph, использует графический подход к обнаружению рекламного контента на основе искусственного интеллекта, чтобы обнаруживать рекламный материал, фокусируясь на таких важных действиях сетевой рекламы – включая попытки телеметрии и локального хранения браузера – что единственный эффективный метод обхода будет заключаться в отказе от этих действий.
Хотя предыдущие подходы достигли немного более высоких показателей обнаружения, чем WebGraph, все они подвержены обходным методам, тогда как WebGraph может достичь почти 100% целостности в условиях противостояния ответам, включая более сложные гипотетические ответы, которые могут появиться в условиях этого нового метода блокировки рекламы.
Работа возглавляется двумя исследователями из Швейцарского федерального технологического института, в сотрудничестве с исследователями из Университета Калифорнии в Дэвисе и Университета Айовы.
За пределами AdGraph
Эта работа является развитием исследовательской инициативы 2020 года с браузером Brave под названием AdGraph, в которой участвовали два исследователя из новой статьи.

Сравнение AdGraph и WebGraph, где пунктирные линии представляют архитектурные инновации предыдущего подхода. Источник: https://arxiv.org/pdf/2107.11309.pdf
AdGraph полагается на (рекламный) контент функции, полученные из анализа URL-адресов, как на ключ к обнаружению коммерческого материала. Однако эти функции представляют собой единственную потенциальную точку отказа для противников, стремящихся обнаружить присутствие систем обнаружения рекламы, и разработки методов, чтобы обойти их. Эта зависимость от функций свойств делает AdGraph по сути механизированной версией подходов, основанных на вручную курируемых фильтровых списках, разделяя их слабости.
CNAME-маскировка
Материал, исходящий от собственного домена веб-сайта, попадает в категорию “доверенный”, поскольку сам домен считается доверенным. Для веб-сайта с высоким авторитетом существует ценная премия за проведение рекламных кампаний, которые включают материал, кажущийся размещенным на самом веб-сайте, поскольку такая реклама не подвергается фильтровым спискам блокировки рекламы и даже подходу AdGraph 2020 года.
Однако индивидуальные кампании трудно согласовать, дорого обслуживать и противоречат основным принципам модели сетевой рекламы, разработанной за последние 25 лет, когда третья сторона вставляет код напрямую на хост-сайт, обычно “аукционируя” рекламное место за микросекунды на основе желательности ключевых слов и других факторов.
Поскольку почти все системы блокировки рекламы полагаются на материал третьих сторон на веб-страницах (т. е. элементы, размещенные на “чужих” доменах), рекламодатели борются с методами CNAME-маскировки в течение последних пяти лет. CNAME-маскировка обманывает отслеживающие системы, заставляя их верить, что поддомен хост-сайта (т. е. information.example.com вместо example.com) является настоящим дополнением к сайту, когда на самом деле это прокси-механизм обслуживания рекламы, организованный с третьими сторонами.
В марте 2021 года одно исследование показало, что случаи CNAME-маскировки увеличились на 22% между 2018 и 2020 годами, и почти 10% из 10 000 лучших веб-сайтов Tranco использовали как минимум один CNAME-трекер к октябрю 2020 года.
Не доверять URL-адресам
Методы CNAME-маскировки включают манипуляции с URL-адресами, участвующими в процессе обслуживания рекламы. Любая система блокировки рекламы, которая доверяет цепочке URL-адресов, будет подвержена манипуляциям и обходу. Поэтому WebGraph случайным образом меняет предоставленные URL-адреса в процессе (включая строку запроса, количество параметров и имена параметров), ищет закономерности использования, а не конкретные запрещенные или принятые URL-адреса.
Система должна учитывать два распространенных конфигурации в архитектуре обслуживания рекламы: одну, где хост напрямую сотрудничает с рекламодателем; и вторую (более распространенную) ситуацию, где рекламодатель предоставляет ограниченное сотрудничество из-за необходимости защиты себя от манипуляций со стороны своих клиентов.
В подходах, основанных на списках, включая AdGraph, успешная манипуляция URL-адресами системой обслуживания рекламы почти является полной победой, присваивая “локальное” происхождение рекламе и таким образом обходя почти все попытки систематически блокировать рекламный контент.
Что остается в качестве сигнатуры? WebGraph фокусируется вместо этого на необходимости рекламных систем делиться информацией различными полу-замаскированными методами, такими как веб-трекеры, коммуникации между iframe и веб-“слушателями”, которые постоянно опрашивают текущее состояние хост-страницы для активности, имеющей значение в терминах веб-метрик для рекламы. Такая активность включает хранение переменных в cookie или локальном хранилище HTML5.
WebGraph использует фреймворк Mozilla Web Privacy Measurement (OpenWPM) для отслеживания такой активности в Firefox. Он захватывает все активность на уровне JavaScript и все исходящие сетевые запросы, а также их ответы, на уровне сети.
Эта дополнительная проверка вводит новые “информационные потоки” в графическую сеть, ранее предложенную AdGraph, позволяя WebGraph явно записывать и количественно оценивать закономерности обмена информацией на основе локальной активности, независимо от происхождения и назначения URL-адресов для телеметрии или других видов коммуникаций в системах обслуживания рекламы.
Результаты
Исследователи использовали расширенную версию OpenWPM для систематического обхода 10 000 веб-сайтов, взятых из 100 000 лучших сайтов Alexa, и случайной выборки из 9 000 сайтов, ранжированных между 1 000 и 100 000, храня их графические представления перед передачей результатов классификатору на основе дерева решений, смоделированному по исходному дизайну AdGraph, и используя популярные фильтровые списки как эталон. Таким образом, был построен набор данных для обучения основной модели.
Система достигла результатов, сравнимых с AdGraph, с точностью 92,33%. Однако устойчивость новой системы к противостоянию ответам возросла с почти полной скорости неудачи для AdGraph до только 8% восприимчивости под WebGraph.
Будущие направления
Статья утверждает, что рекламным сетям необходимо существенно изменить свою архитектуру, чтобы избежать обнаружения в условиях подхода WebGraph, и предполагает, что такие изменения потребуют пересмотра текущих отношений доверия между третьими сторонами и хост-сайтами, на которых появляются их рекламные объявления.
Статья также отмечает, что WebGraph не учитывает методы отслеживания без состояния, такие как браузерная отпечатковка (через элемент Canvas), которые используют API, которые система в настоящее время не отслеживает. Исследователи предлагают, что WebGraph можно расширить в будущем, чтобы также учитывать такие взаимодействия и локальные хранилища.












