Погляд Anderson
Боротьба з блокуванням реклами за допомогою машинного навчання

Нова дослідницька ініціатива з США та Пакистану розробила метод, заснований на машинному навчанні, для ідентифікації веб-сайтів, що є стійкими до блокування реклами та інших технологій захисту приватності, а також для розбирання технік, які такі сайти використовують для “змішування” походження реклами та реального вмісту, так що вміст не відображається, якщо реклама блокується.
Нові технології блокування реклами, розроблені на основі цих результатів, можуть покласти край інцидентам, коли центральний вміст статті не відображається, коли реклама блокується, забезпечуючи автоматичний метод для розділення ресурсів реклами та скриптів, а не ручний підхід, який зараз використовується популярними фреймворками блокування реклами.
Автори провели великомасштабне дослідження “змішаних ресурсів” на 100 000 веб-сайтах і виявили, що 17% доменів, 48% імен хостів, 6% скриптів і 9% методів доставки вмісту свідомо змішують функціональність відстежування (тобто рекламу) з процесами, які доставляють реальний вміст. У таких випадках вміст статті зникне для користувачів, які використовують блокування реклами або анти-трекінг-програмне забезпечення, що змушує користувача вимкнути ці заходи, щоб переглянути вміст.
У більшості випадків це не означає лише те, що реклама знову стане видимою, але також і те, що користувачі будуть змушені повернутися до систем відстежування між доменами, які підігріли кампанії за приватність в останні роки.
Нове дослідження пропонує систему, яка здатна розділити компоненти цих “змішаних” веб-ресурсів з точністю 98%, що дозволяє рішенням блокування реклами та анти-трекінгу розрізнити потоки в пізніших ітераціях свого програмного забезпечення та знову дозволити доступ до вмісту на сторінках з блокованою рекламою.
Нова стаття називається TrackerSift: Розпутування змішаних трекінгових і функціональних веб-ресурсів і походить від дослідників з Virginia Tech і UoC Davis у США, а також FAST NUCES і Lahore University of Management Sciences (LUMS) у Пакистані.
Війни з блокуванням реклами
Системи блокування реклами一般 базуються на необхідності рекламного вмісту на веб-сторінці походити з конкретних, присвячених доменів – зазвичай платформ адтехнологій з іменами доменів і/або IP-адресами, які можна класифікувати як “третю сторону реклами”, що дозволяє розробляти блок-листи, які не відображатимуть вміст з цих походжень всередині веб-сторінки.
Крім того, імена ресурсів, специфічних для реклами, таких як скрипти, можна додати до блок-листів, так що вони не будуть виконуватися навіть у випадках, коли їх походження було свідомо замасковано. Схеми іменування таких систематично згенерованих скриптів часто є послідовними, що дозволяє розпізнавати та блокувати їх.
Оскільки реклама, представлена на веб-сторінці, часто вибирається в останні кілька мілісекунд завантаження сторінки через динамічні аукціони (на основі ключових слів, знайдених на сторінці, метрик цільової кампанії та багатьох інших факторів), не є практичним зберігати рекламу на домені хоста, що теоретично завадить блокуванню реклами.
Все частіше веб-сайти борються проти блокування реклами за допомогою CNAME Cloaking – використання піддоменів “автентичного” домену як проксі до серверів реклами (тобто, content.example.com буде служити рекламою example.com, навіть якщо піддомен не має іншої мети, окрім як служити рекламою, і не підтримується веб-сайтом, а його рекламодавцями).
Однак, цей метод можна кількісно оцінити та заблокувати, відрізняючи вміст піддомену як рекламу або використовуючи техніки мережевого аналізу для ідентифікації аномальної та нерегулярної взаємодії піддомену з основним доменом.
TrackerSift
Стаття авторів пропонує TrackerSift, платформу для аналізу мережевих ресурсів, запрошених веб-сайтами, а потім перекатегоризації змішаних ресурсів на “вміст” та “рекламу”. На найбільш загальному рівні аналізу TrackerSift реєструє базові мережеві запити ресурсів, таких як рекламний вміст, запрошений з Content Delivery Network (CDN) або платформи реклами; але потім деталізує вміст запрошених ресурсів, виконуючи аналіз на рівні коду та розрізняючи функції різних типів викликів коду та процедур.

Ієрархія аналізу TrackerSift, від ресурсів відстежування (червоний) до необхідних функціональних ресурсів (зелений). Змішані ресурси, які ймовірно призведуть до обфускації вмісту (жовтий), піддаються глибшому аналізу. Джерело: https://arxiv.org/pdf/2108.13923.pdf
Дані
Для отримання набору даних, який живить TrackerSift, автори проаналізували 100 000 випадково вибраних веб-сайтів з списку Tranco top-million 2018 року. Selenium автоматизація браузера була використана разом з Google Chrome для виконання завдання.
Веб-кравлінг мережа була заснована на університетських сайтах у Північній Америці, що складається з 13-노д кластера з 112 ядрами, 52 терабайтами сховища та 823 гігабайтами оперативної пам’яті серед усієї системи.
Кожен вузол був заснований у контейнері Docker і присвячений кравлінгу підмножини з 100 000 веб-сторінок, вибраних з програмними паузами для сталості, та повним знищенням усіх файлів cookie та ідентифікаторів при завантаженні нового домену, щоб забезпечити, що попередні сесії та стани не впливали на читаність наступного домену.
Змішані скрипти
Результати показують широке використання бандлінгу скриптів, де платформи реклами та хости вмісту свідомо конкатенують вмісто-орієнтовані та рекламо-орієнтовані скрипти в “убер-скрипти”, які завадять відображенню вмісту, якщо блокується. Наприклад, автори відзначають, що pressl.co служить веб-скрипт, зібраний за допомогою платформи конкатенації JavaScript WebPack, який містить піксель відстежування Facebook, а також код, який дозволяє відображати реальний вміст.
Крім того, у статті зазначається, що ряд доменів готові вбудовувати скрипти безпосередньо в код веб-сторінок, що робить необхідним для фреймворків блокування реклами звертатися до функціональності всередині скриптів, а не просто запобігати завантаженню скрипту на основі його URL-адреси третьої сторони.
Відокремлюючи ці методи, стає можливим систематичне розділення такого коду на категорії вмісту та реклами, а також потенційне відновлення відображення вмісту в середовищах з блокованою рекламою.
Хоча існуючі рішення блокування реклами, такі як NoScript, AdGuard, uBlock Origin та Firefox Smartblock, використовують заміщувальні скрипти, які розбирають такі зібрані скрипти на блоковані компоненти, вони залежать від ручної переписування скриптів, що призводить до тривалої “холодної війни” між блокувальниками та постійно змінюються техніками, які їх розбивають. Натомість, TrackerSift пропонує потенційний програмний метод для декомпозиції змішаного вмісту.












