Погляд Anderson

Машинний метод навчання для блокування реклами на основі локальної поведінки браузера

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники в Швейцарії та США розробили новий підхід машинного навчання для виявлення матеріалів реклами на сайті, заснований на взаємодії такого матеріалу з браузером, а не на аналізі його вмісту або мережевого поведінки – двох підходах, які виявилися неефективними в довгостроковій перспективі перед обличчям CNAME-клоакінгу (див. нижче).

Названий WebGraph, цей каркас використовує графічний підхід до виявлення рекламного вмісту, зосереджуючись на таких важливих діяльності мережевої реклами – включаючи спроби телеметрії та локального сховища браузера – що єдиним ефективним способом ухилення було б не проводити ці дії.

Хоча попередні підходи досягли稍 вищого рівня виявлення, ніж WebGraph, всі вони схильні до ухилення, тоді як WebGraph здатний наблизитися до 100% цілісності перед обличчям ворогих відповідей, включаючи більш складні гіпотетичні відповіді, які можуть виникнути перед обличчям цього нового методу блокування реклами.

Паперу керують два дослідники з Федеральної вищої технічної школи Швейцарії, разом з дослідниками з Університету Каліфорнії, Девіс і Університету Айови.

Поза AdGraph

Ця робота є розвитком дослідження 2020 року з браузером Brave під назвою AdGraph, яке включало двох дослідників з нової статті.

Порівняння AdGraph vs. WebGraph, з пунктирними лініями, що представляють архітектурні інновації попереднього підходу. Джерело: https://arxiv.org/pdf/2107.11309.pdf

Порівняння AdGraph vs. WebGraph, з пунктирними лініями, що представляють архітектурні інновації попереднього підходу. Джерело: https://arxiv.org/pdf/2107.11309.pdf

AdGraph залежить від (рекламного) вмісту функцій, отриманих з аналізу URL-адрес, як ключа до виявлення комерційного матеріалу. Однак ці функції представляють єдину потенційну точку відмови для ворогів, які намагаються виявити присутність систем виявлення реклами, і формулюють методи для обходу їх. Ця залежність від властивостей вмісту робить AdGraph по суті механізованим варіантом підходів, заснованих на ручному підборі списків фільтрів, з їхніми слабкостями.

CNAME-клоакінг

Матеріал, що походять з власної домени сайту, потрапляє до категорії “довіреного”, оскільки сама домена вважається довіреною. Для сайту високої авторитетності існує цінна премія за проведення рекламних кампаній, які включають матеріал, що видимо розміщений на сайті самому, оскільки така реклама є імунною до фільтрувального блокування реклами та навіть до підходу AdGraph 2020 року.

Однак, індивідуальні кампанії важко домовлятися, дорого реалізовувати, і суперечать основним принципам моделі мережевої реклами, розробленої за останні 25 років, коли третя сторона вставляє код безпосередньо на хост-сайт, зазвичай “аукціонуючи” рекламний слот за мікросекунди на основі бажаності ключових слів та інших факторів.

Відтак, рекламодавці борються з CNAME-клоакінг-техніками протягом останніх п’яти років. CNAME-клоакінг обманює трекери, заставляючи їх вірити, що піддомен хост-сайту (тобто information.example.com замість example.com) є справжнім доповненням до сайту, хоча насправді це проксі-ад-сервер, домовлений з третіми сторонами.

У березні 2021 року одне дослідження виявило, що випадки CNAME-клоакінгу збільшилися на 22% між 2018 і 2020 роками, при цьому майже 10% сайтів Tranco з першої десятки тисяч використовували принаймні одну CNAME-трекер до жовтня 2020 року.

Дискредитація довіри до URL-адрес

CNAME-обманювальні техніки включають маніпуляцію URL-адресами, що беруть участь у процесі подачі реклами. Будь-яка система блокування реклами, яка довіряє ланцюгу URL-адрес, буде підлягати маніпуляціям та ухиленню. Тому WebGraph випадково змінює надані URL-адреси в процесі (включаючи рядкові параметри, кількість параметрів та імена параметрів), шукаючи закономірності використання замість конкретних заборонених або прийнятих URL-адрес.

Система повинна враховувати дві загальні конфігурації в архітектурі подачі реклами: одну, де хост безпосередньо співпрацює з рекламодавцем; і другу (більш поширений випадок), де рекламодавець надає обмежену співпрацю через необхідність захисту себе від маніпуляцій клієнтами.

У підходах, заснованих на списках, включаючи AdGraph, успішна маніпуляція URL-адресами системою подачі реклами майже повністю перемагає, наділяючи “локальне” походження рекламного матеріалу та ухиляючись майже від усіх спроб систематично блокувати рекламний вміст.

Що залишається у вигляді підпису? WebGraph зосереджується натомість на потребі систем реклами у обміні інформацією різними напівзакритими засобами, такими як веб-трекери, комунікації між iframe та веб-слухачами, які постійно опитують стан сторінки для діяльності, що має значення у термінах веб-метрик для реклами. Така діяльність включає зберігання змінних у файлах cookie або локальному сховищі HTML5.

WebGraph використовує каркас Mozilla Web Privacy Measurement (OpenWPM) для відстеження такої діяльності у Firefox. Він захоплює всю діяльність на рівні JavaScript та всі вихідні мережеві запити та їхні відповіді на рівні мережі.

Ця додаткова увага вводить нові “інформаційні потоки” до графічної мережі, раніше запропонованої AdGraph, дозволяючи WebGraph явно реєструвати та кількісно оцінювати закономірності обміну інформацією на основі локальної діяльності, незалежно від походження та призначення URL-адрес для телеметрії або інших видів внутрішніх комунікацій у системах подачі реклами.

Результати

Дослідники використали розширений варіант OpenWPM для систематичного огляду 10 000 сайтів з першої сотні тисяч сайтів Alexa та випадкової вибірки з 9 000 сайтів, ранжованих між 1 тис. та 100 тис., зберігаючи їх графічні представлення перед тим, як передати результати до класифікатора на основі дерева рішень, змодельованого за оригінальним дизайном AdGraph, та використовуючи популярні списки фільтрів реклами як основу для навчання основної моделі.

Система досягла результатів, порівнянних з AdGraph, з точністю 92,33%. Однак стійкість нової системи до ворогих реакцій зростає з майже повної втрати для AdGraph до лише 8% сприйнятливості під WebGraph.

Майбутні напрямки

Стаття стверджує, що рекламні мережі повинні суттєво змінити свої системи, щоб уникнути виявлення перед обличчям підходу WebGraph, і припускає, що такі зміни вимагатимуть перегляду поточного довірчого стосунку між третіми рекламодавцями та хост-сайтами, на яких їхні рекламні матеріали з’являються.

Стаття також зазначає, що WebGraph не враховує безстанційні техніки відстеження, такі як фінгерпрінтинг браузера (через елемент Canvas), які використовують API, які система зараз не контролює. Дослідники пропонують, що WebGraph можна розширити в майбутньому, щоб враховувати також такі взаємодії та локальні ознаки сховища.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai