Взгляд Anderson

Машинный метод блокировки рекламы на основе локального поведения браузера

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи в Швейцарии и США разработали новый машинный метод обнаружения рекламного материала на веб-сайтах, основанный на взаимодействии такого материала с браузером, а не на анализе его содержания или сетевого поведения – двух подходах, которые оказались неэффективными в долгосрочной перспективе в условиях CNAME-маскировки (см. ниже).

Эта система, получившая название WebGraph, использует графический подход к обнаружению рекламного контента на основе искусственного интеллекта, чтобы обнаруживать рекламный материал, фокусируясь на таких важных действиях сетевой рекламы – включая попытки телеметрии и локального хранения браузера – что единственный эффективный метод обхода будет заключаться в отказе от этих действий.

Хотя предыдущие подходы достигли немного более высоких показателей обнаружения, чем WebGraph, все они подвержены обходным методам, тогда как WebGraph может достичь почти 100% целостности в условиях противостояния ответам, включая более сложные гипотетические ответы, которые могут появиться в условиях этого нового метода блокировки рекламы.

Работа возглавляется двумя исследователями из Швейцарского федерального технологического института, в сотрудничестве с исследователями из Университета Калифорнии в Дэвисе и Университета Айовы.

За пределами AdGraph

Эта работа является развитием исследовательской инициативы 2020 года с браузером Brave под названием AdGraph, в которой участвовали два исследователя из новой статьи.

Сравнение AdGraph и WebGraph, где пунктирные линии представляют архитектурные инновации предыдущего подхода. Источник: https://arxiv.org/pdf/2107.11309.pdf

Сравнение AdGraph и WebGraph, где пунктирные линии представляют архитектурные инновации предыдущего подхода. Источник: https://arxiv.org/pdf/2107.11309.pdf

AdGraph полагается на (рекламный) контент функции, полученные из анализа URL-адресов, как на ключ к обнаружению коммерческого материала. Однако эти функции представляют собой единственную потенциальную точку отказа для противников, стремящихся обнаружить присутствие систем обнаружения рекламы, и разработки методов, чтобы обойти их. Эта зависимость от функций свойств делает AdGraph по сути механизированной версией подходов, основанных на вручную курируемых фильтровых списках, разделяя их слабости.

CNAME-маскировка

Материал, исходящий от собственного домена веб-сайта, попадает в категорию “доверенный”, поскольку сам домен считается доверенным. Для веб-сайта с высоким авторитетом существует ценная премия за проведение рекламных кампаний, которые включают материал, кажущийся размещенным на самом веб-сайте, поскольку такая реклама не подвергается фильтровым спискам блокировки рекламы и даже подходу AdGraph 2020 года.

Однако индивидуальные кампании трудно согласовать, дорого обслуживать и противоречат основным принципам модели сетевой рекламы, разработанной за последние 25 лет, когда третья сторона вставляет код напрямую на хост-сайт, обычно “аукционируя” рекламное место за микросекунды на основе желательности ключевых слов и других факторов.

Поскольку почти все системы блокировки рекламы полагаются на материал третьих сторон на веб-страницах (т. е. элементы, размещенные на “чужих” доменах), рекламодатели борются с методами CNAME-маскировки в течение последних пяти лет. CNAME-маскировка обманывает отслеживающие системы, заставляя их верить, что поддомен хост-сайта (т. е. information.example.com вместо example.com) является настоящим дополнением к сайту, когда на самом деле это прокси-механизм обслуживания рекламы, организованный с третьими сторонами.

В марте 2021 года одно исследование показало, что случаи CNAME-маскировки увеличились на 22% между 2018 и 2020 годами, и почти 10% из 10 000 лучших веб-сайтов Tranco использовали как минимум один CNAME-трекер к октябрю 2020 года.

Не доверять URL-адресам

Методы CNAME-маскировки включают манипуляции с URL-адресами, участвующими в процессе обслуживания рекламы. Любая система блокировки рекламы, которая доверяет цепочке URL-адресов, будет подвержена манипуляциям и обходу. Поэтому WebGraph случайным образом меняет предоставленные URL-адреса в процессе (включая строку запроса, количество параметров и имена параметров), ищет закономерности использования, а не конкретные запрещенные или принятые URL-адреса.

Система должна учитывать два распространенных конфигурации в архитектуре обслуживания рекламы: одну, где хост напрямую сотрудничает с рекламодателем; и вторую (более распространенную) ситуацию, где рекламодатель предоставляет ограниченное сотрудничество из-за необходимости защиты себя от манипуляций со стороны своих клиентов.

В подходах, основанных на списках, включая AdGraph, успешная манипуляция URL-адресами системой обслуживания рекламы почти является полной победой, присваивая “локальное” происхождение рекламе и таким образом обходя почти все попытки систематически блокировать рекламный контент.

Что остается в качестве сигнатуры? WebGraph фокусируется вместо этого на необходимости рекламных систем делиться информацией различными полу-замаскированными методами, такими как веб-трекеры, коммуникации между iframe и веб-“слушателями”, которые постоянно опрашивают текущее состояние хост-страницы для активности, имеющей значение в терминах веб-метрик для рекламы. Такая активность включает хранение переменных в cookie или локальном хранилище HTML5.

WebGraph использует фреймворк Mozilla Web Privacy Measurement (OpenWPM) для отслеживания такой активности в Firefox. Он захватывает все активность на уровне JavaScript и все исходящие сетевые запросы, а также их ответы, на уровне сети.

Эта дополнительная проверка вводит новые “информационные потоки” в графическую сеть, ранее предложенную AdGraph, позволяя WebGraph явно записывать и количественно оценивать закономерности обмена информацией на основе локальной активности, независимо от происхождения и назначения URL-адресов для телеметрии или других видов коммуникаций в системах обслуживания рекламы.

Результаты

Исследователи использовали расширенную версию OpenWPM для систематического обхода 10 000 веб-сайтов, взятых из 100 000 лучших сайтов Alexa, и случайной выборки из 9 000 сайтов, ранжированных между 1 000 и 100 000, храня их графические представления перед передачей результатов классификатору на основе дерева решений, смоделированному по исходному дизайну AdGraph, и используя популярные фильтровые списки как эталон. Таким образом, был построен набор данных для обучения основной модели.

Система достигла результатов, сравнимых с AdGraph, с точностью 92,33%. Однако устойчивость новой системы к противостоянию ответам возросла с почти полной скорости неудачи для AdGraph до только 8% восприимчивости под WebGraph.

Будущие направления

Статья утверждает, что рекламным сетям необходимо существенно изменить свою архитектуру, чтобы избежать обнаружения в условиях подхода WebGraph, и предполагает, что такие изменения потребуют пересмотра текущих отношений доверия между третьими сторонами и хост-сайтами, на которых появляются их рекламные объявления.

Статья также отмечает, что WebGraph не учитывает методы отслеживания без состояния, такие как браузерная отпечатковка (через элемент Canvas), которые используют API, которые система в настоящее время не отслеживает. Исследователи предлагают, что WebGraph можно расширить в будущем, чтобы также учитывать такие взаимодействия и локальные хранилища.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai