Angle d’Anderson

Lutter contre les bloqueurs de publicités avec l’apprentissage automatique

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une nouvelle initiative de recherche menée aux États-Unis et au Pakistan a développé une méthode basée sur l’apprentissage automatique pour identifier les sites Web qui résistent aux bloqueurs de publicités et à d’autres technologies de préservation de la vie privée, ainsi que pour déconstruire les techniques utilisées par ces sites pour « mélanger » les origines des publicités et du contenu réel, de sorte que le contenu ne soit pas visible si les publicités sont bloquées.

De nouvelles technologies de bloqueurs de publicités développées à partir de ces résultats pourraient mettre fin aux incidents où le contenu principal d’un article n’est pas visible lorsque les publicités sont bloquées, en fournissant une méthode automatisée pour séparer les ressources publicitaires et les ressources de script, plutôt que l’approche manuelle actuellement utilisée par les cadres de bloqueurs de publicités populaires.

Les auteurs ont mené une étude à grande échelle sur les « ressources mélangées » sur 100 000 sites Web, constatant que 17 % des domaines, 48 % des noms d’hôte, 6 % des scripts et 9 % des méthodes de distribution de contenu mélangent délibérément la fonctionnalité de suivi (c’est-à-dire publicitaire) avec les processus qui livrent du contenu réel. Dans de tels cas, le contenu de l’article disparaîtra pour les utilisateurs qui emploient des logiciels de bloqueurs de publicités ou de protection de la vie privée, les forçant à désactiver ces mesures pour afficher le contenu.

Dans la plupart des cas, cela ne signifie pas seulement que les publicités seront à nouveau visibles, mais également que les utilisateurs seront reconduits dans les systèmes de suivi interdomaines qui ont inflamé les défenseurs de la vie privée ces dernières années.

La nouvelle recherche propose un système capable de séparer les composants de ces ressources Web « mélangées » avec une précision de 98 %, permettant aux solutions de bloqueurs de publicités et de protection de la vie privée de désentortiller les flux dans les prochaines itérations de leur logiciel, et de rétablir à nouveau l’accès au contenu sur les pages bloquées.

Le nouvel article est intitulé TrackerSift: Untangling Mixed Tracking and Functional Web Resources, et provient de chercheurs de Virginia Tech et UoC Davis aux États-Unis, ainsi que de FAST NUCES et de l’Université de gestion de Lahore (LUMS) au Pakistan.

Les guerres des bloqueurs de publicités

Les systèmes de bloqueurs de publicités reposent en général sur la nécessité pour le contenu publicitaire d’une page Web d’originer de domaines dédiés spécifiques – généralement des plateformes d’adtech avec des noms de domaine et/ou des adresses IP qui peuvent être classés comme « publicité tierce », permettant le développement de listes de blocage qui n’afficheront pas de contenu provenant de ces origines à l’intérieur d’une page Web.

En outre, les noms de ressources spécifiques aux publicités, tels que les scripts, peuvent être ajoutés aux listes de blocage afin qu’ils ne s’exécutent pas même dans les cas où leurs origines ont été intentionnellement obscurcies. Les schémas de dénomination de ces scripts générés de manière systématique sont souvent cohérents, permettant la reconnaissance et le blocage.

Étant donné qu’une publicité présentée dans une page Web est souvent choisie dans les derniers millisecondes d’un chargement de page via des processus d’enchères dynamiques (basés sur les mots clés trouvés dans la page, les métriques cibles de campagne et de nombreux autres facteurs), il n’est pas pratique de stocker des publicités sur le domaine hôte, ce qui empêcherait en théorie les bloqueurs de publicités de masquer le contenu commercial.

De plus en plus, les sites Web luttent contre les bloqueurs de publicités via CNAME Cloaking – l’utilisation de sous-domaines du domaine « authentique » en tant que proxys pour les serveurs de publicités (c’est-à-dire que le sous-domaine servira des publicités à example.com, même si le sous-domaine n’a d’autre but que de servir des publicités et n’est pas maintenu par le site Web hôte, mais plutôt par ses annonceurs).

Cependant, cette méthode peut être quantifiée et bloquée en distinguant le contenu du sous-domaine comme publicitaire, ou en utilisant des techniques d’analyse de réseau pour identifier la relation anormale et irrégulière du sous-domaine avec le domaine principal.

TrackerSift

L’article des auteurs propose TrackerSift, une plateforme pour analyser les ressources réseau fetchées par les sites Web, puis re-catégoriser les ressources mélangées en « contenu » et « publicité ». Au niveau d’analyse le plus général, TrackerSift enregistre les demandes de réseau de base pour les ressources, telles que le contenu publicitaire fetché à partir d’un réseau de distribution de contenu (CDN) ou d’une plateforme publicitaire; mais il creuse plus profondément dans le contenu des ressources fetchées, effectuant une analyse au niveau du code, et distinguant les fonctions des différents types d’appels de code et de procédures.

TrackerSift's analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf

TrackerSift’s analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf

Données

Pour obtenir le jeu de données qui alimente TrackerSift, les auteurs ont parcouru 100 000 sites Web choisis au hasard à partir de la liste Tranco top-million de 2018. Selenium browser automation a été utilisé avec Google Chrome pour effectuer la tâche.

Le réseau de crawling Web était basé sur des sites universitaires en Amérique du Nord, comprenant un cluster de 13 nœuds avec 112 cœurs, 52 téraoctets de stockage et 823 gigaoctets de RAM opérationnelle dans l’ensemble du système.

Chaque nœud était basé dans un conteneur Docker et dédié au crawling d’un sous-ensemble des 100 000 pages Web sélectionnées, avec des pauses programmatiques pour la durabilité, et la suppression complète de tous les cookies et identifiants lors du chargement d’un nouveau domaine, pour s’assurer que les sessions et états précédents n’influencent pas la lisibilité du prochain domaine.

Scripts mélangés

Les résultats montrent un usage étendu de script bundling, où les plateformes publicitaires et les hôtes de contenu concatènent délibérément des scripts basés sur le contenu et des scripts basés sur les publicités en « uberscripts » qui entraveront l’affichage du contenu si ils sont bloqués. Par exemple, les auteurs notent que pressl.co sert un script Web concaténé via la plateforme de concaténation de code JavaScript WebPack, qui contient un pixel de suivi Facebook, et également du code qui permet le rendu de contenu réel.

En outre, l’article note qu’un certain nombre de domaines sont prêts à intégrer des scripts directement dans le code des pages Web, ce qui oblige les cadres de bloqueurs de publicités à aborder la fonctionnalité au sein des scripts, plutôt que de simplement empêcher le script de charger en fonction de son URL de source tierce.

En localisant ces méthodes, la voie est claire pour une division systématique d’un tel code en catégories de contenu et de publicité, et le potentiel de restauration de l’affichage de contenu dans des environnements bloqués.

Bien que les solutions de bloqueurs de publicités existantes, telles que NoScript, AdGuard, uBlock Origin et Firefox Smartblock utilisent des scripts de substitution qui démontent de tels scripts mélangés en scripts de composants bloquables, ceux-ci dépendent de réécriture manuelle de scripts, conduisant à une guerre froide permanente entre les bloqueurs et les techniques qui les brisent. En revanche, TrackerSift offre une méthode programmatique potentielle pour la décomposition de contenu mélangé.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai