Взгляд Anderson

Борьба с блокировкой рекламы с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Новая исследовательская инициатива из США и Пакистана разработала метод, основанный на машинном обучении, для выявления веб-сайтов, которые устойчивы к блокировке рекламы и другим технологиям, сохраняющим конфиденциальность, а также для разбора методов, с помощью которых такие сайты “смешивают” происхождение рекламы и реального контента, чтобы контент не был виден, если реклама заблокирована.

Новые технологии блокировки рекламы, разработанные на основе этих результатов, могут положить конец инцидентам, когда основной контент статьи не отображается, когда реклама заблокирована, обеспечивая автоматический метод разделения рекламных и скриптовых ресурсов, а не ручной подход, который в настоящее время используется популярными фреймворками блокировки рекламы.

Авторы провели масштабное исследование “смешанных ресурсов” на 100 000 веб-сайтах и обнаружили, что 17% доменов, 48% хостов, 6% скриптов и 9% методов доставки контента намеренно смешивают функциональность отслеживания (т.е. рекламу) с процессами, которые доставляют реальный контент. В таких случаях контент статьи исчезнет для пользователей, которые используют программное обеспечение для блокировки рекламы или против отслеживания, заставляя пользователя отключить эти меры, чтобы просмотреть контент.

В большинстве случаев это не только означает, что реклама будет видна снова, но и что пользователи будут вынуждены вернуться в системы отслеживания между доменами, которые воспламенили кампании по защите конфиденциальности в последние годы.

Новое исследование предлагает систему, которая может разделить компоненты этих “смешанных” веб-ресурсов с точностью 98%, давая программному обеспечению для блокировки рекламы и против отслеживания шанс распутать потоки в более поздних версиях своего программного обеспечения и снова включить доступ к контенту на страницах с заблокированной рекламой.

Новая статья озаглавлена TrackerSift: Untangling Mixed Tracking and Functional Web Resources и исходит от исследователей из Virginia Tech и UoC Davis в США, а также FAST NUCES и Lahore University of Management Sciences (LUMS) в Пакистане.

Войны с блокировкой рекламы

Системы блокировки рекламы в целом полагаются на необходимость для рекламного контента на веб-странице иметь определенные, выделенные домены – обычно платформы adtech с именами доменов и/или IP-адресами, которые можно классифицировать как “третья сторона рекламы”, что позволяет разработать блок-листы, которые не будут отображать контент из этих источников внутри веб-страницы.

Кроме того, имена рекламных ресурсов, таких как скрипты, можно добавить в блок-листы, чтобы они не запускались даже в случаях, когда их происхождение намеренно скрыто. Схемы именования таких систематически сгенерированных скриптов часто последовательны, что позволяет распознавать и добавлять их в блок-листы.

Поскольку реклама, представленная на веб-странице, часто выбирается в последние миллисекунды загрузки страницы через динамические аукционные процессы (на основе ключевых слов, найденных на странице, метрик целевой кампании и многих других факторов), нецелесообразно хранить рекламу на хост-домене, что теоретически помешало бы блокировщикам рекламы скрывать коммерческий контент.

Все чаще веб-сайты борются с блокировкой рекламы через CNAME Cloaking – использование субдоменов “аутентичного” домена в качестве прокси-серверов для рекламных серверов (т.е. content.example.com будет служить рекламой для example.com, даже если субдомен не имеет другой цели, кроме как служить рекламой, и не поддерживается хост-веб-сайтом, а его рекламодателями).

Однако этот метод можно количественно оценить и заблокировать, различая контент субдомена как рекламу или используя методы сетевого анализа для выявления аномальных и нерегулярных отношений между субдоменом и основным доменом.

TrackerSift

Статья авторов предлагает TrackerSift, платформу для анализа сетевых ресурсов, полученных веб-сайтами, и затем перекатегоризации смешанных ресурсов в “контент” и “рекламу”. На самом общем уровне анализа TrackerSift записывает базовые сетевые запросы на ресурсы, такие как рекламный контент, полученный из сети доставки контента (CDN) или рекламной платформы; но затем углубляется в содержание полученных ресурсов, выполняя анализ на уровне кода и различая функции различных типов вызовов кода и процедур.

TrackerSift's analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf

Иерархия анализа TrackerSift, от ресурсов отслеживания (красный) до необходимых функциональных ресурсов (зеленый). Смешанные ресурсы, которые, вероятно, приведут к неясности контента (желтый), подвергаются более глубокому анализу. Source: https://arxiv.org/pdf/2108.13923.pdf

Данные

Чтобы получить набор данных, который питает TrackerSift, авторы проанализировали 100 000 случайно выбранных веб-сайтов из списка Tranco top-million за 2018 год. Selenium browser automation был использован вместе с Google Chrome для выполнения этой задачи.

Веб-кравлинг сети был основан на университетских сайтах в Северной Америке, состоящей из 13-узлового кластера с 112 ядрами, 52 терабайтами хранилища и 823 гигабайтами оперативной памяти во всей системе.

Каждый узел был основан в контейнере Docker и был посвящен кравлингу подмножества из 100 000 веб-страниц, выбранных с программными паузами для устойчивости, и полным удалением всех файлов cookie и идентификаторов при загрузке нового домена, чтобы обеспечить, что предыдущие сеансы и состояния не влияли на читаемость следующего домена.

Смешанные скрипты

Результаты показывают обширное использование связывания скриптов, когда платформы рекламы и хосты контента намеренно объединяют контент-ориентированные и рекламно-ориентированные скрипты в “суперскрипты”, которые будут препятствовать отображению контента, если они заблокированы. Например, авторы отмечают, что pressl.co служит веб-скриптом, объединенным через платформу WebPack для объединения JavaScript, который содержит пиксель отслеживания Facebook, и также код, который позволяет отображать реальный контент.

Кроме того, статья отмечает, что ряд доменов готовы встроить скрипты напрямую в код веб-страниц, что делает необходимым для фреймворков блокировки рекламы решать функциональность внутри скриптов, а не просто предотвращать загрузку скрипта на основе его URL-адреса третьей стороны.

Локализируя эти методы, становится ясен путь для систематического разделения такого кода на категории контента и рекламы, и потенциального восстановления отображения контента в средах с заблокированной рекламой.

Хотя существующие решения для блокировки рекламы, такие как NoScript, AdGuard, uBlock Origin и Firefox Smartblock, используют суррогатные скрипты, которые разбирают такие объединенные скрипты на блокируемые компонентные скрипты, они полагаются на ручное переписывание скриптов, что приводит к постоянной “холодной войне” между блокировщиками и постоянно меняющимися методами, которые нарушают их. Напротив, TrackerSift предлагает потенциальный программный метод для декомпозиции смешанного контента.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai