Ángulo de Anderson
Luchando contra el bloqueo de anuncios con aprendizaje automático

Una nueva iniciativa de investigación de EE. UU. y Pakistán ha desarrollado un método basado en aprendizaje automático para identificar sitios web que son resistentes a la bloqueo de anuncios y otras tecnologías de privacidad, así como para descomponer las técnicas que utilizan estos sitios para “mezclar” el origen de los anuncios y el contenido real, de modo que el contenido no sea visible si se bloquean los anuncios.
Nuevas tecnologías de bloqueo de anuncios desarrolladas a partir de los hallazgos podrían poner fin a los incidentes en los que el contenido central de un artículo no es visible cuando se bloquean los anuncios, proporcionando un método automatizado para separar los recursos de anuncios y scripts, en lugar del enfoque manual actualmente utilizado por los marcos de bloqueo de anuncios populares.
Los autores realizaron un estudio a gran escala de “recursos mixtos” en 100,000 sitios web, encontrando que el 17% de los dominios, el 48% de los nombres de host, el 6% de los scripts y el 9% de los métodos de entrega de contenido intencionalmente mezclan la funcionalidad de seguimiento (es decir, publicidad) con procesos que entregan contenido real. En tales casos, el contenido del artículo desaparecerá para los usuarios que emplean software de bloqueo de anuncios o anti-seguimiento, lo que obliga al usuario a desactivar estas medidas para ver el contenido.
En la mayoría de los casos, esto no solo significa que los anuncios serán visibles nuevamente, sino que los usuarios también serán obligados a regresar a los sistemas de seguimiento entre dominios que han inflamado a los activistas de la privacidad en años recientes.
La nueva investigación ofrece un sistema que puede separar los componentes de estos “recursos mixtos” con una precisión del 98%, lo que permite a las soluciones de bloqueo de anuncios y anti-seguimiento una oportunidad de desenredar las corrientes en iteraciones posteriores de su software y, una vez más, habilitar el acceso al contenido en páginas bloqueadas por anuncios.
El nuevo documento se titula TrackerSift: Untangling Mixed Tracking and Functional Web Resources, y proviene de investigadores de Virginia Tech y UoC Davis en EE. UU., y FAST NUCES y la Universidad de Gestión de Lahore (LUMS) en Pakistán.
Las guerras de bloqueo de anuncios
Los sistemas de bloqueo de anuncios dependen en general de la necesidad de que el contenido publicitario en una página web provenga de dominios específicos y dedicados – generalmente plataformas de publicidad tecnológica con nombres de dominio y/o direcciones IP que pueden ser clasificados como “publicidad de terceros”, lo que permite el desarrollo de listas de bloqueo que no renderizarán contenido de esos orígenes dentro de una página web.
Además, los nombres de recursos específicos de anuncios, como scripts, se pueden agregar a listas de bloqueo para que no se ejecuten incluso en casos en que sus orígenes hayan sido intencionalmente oscurecidos. Los esquemas de nombres de scripts generados sistemáticamente suelen ser coherentes, lo que permite el reconocimiento y la lista de bloqueo.
Dado que un anuncio presentado en una página web a menudo se elige en los últimos milisegundos de la carga de la página a través de procesos de subasta dinámicos (basados en palabras clave encontradas en la página, métricas de campaña de destino y muchos otros factores), no es práctico almacenar anuncios en el dominio de host, lo que en teoría impediría que los bloqueadores de anuncios oculten el contenido comercial.
Cada vez más, los sitios web están luchando contra el bloqueo de anuncios a través de CNAME Cloaking – el uso de subdominios del dominio “auténtico” como proxies para servidores de anuncios (es decir, content.example.com servirá anuncios a example.com, incluso si el subdominio no tiene otro propósito que servir anuncios y no es mantenido por el sitio web de host, sino por sus anunciantes).
Sin embargo, este método se puede cuantificar y bloquear distinguiendo el contenido del subdominio como publicidad, o utilizando técnicas de análisis de red para identificar la relación anormal e irregular del subdominio con el dominio principal.
TrackerSift
El documento de los autores propone TrackerSift, una plataforma para analizar recursos de red obtenidos por sitios web y luego recategorizar recursos mixtos en “contenido” y “publicidad”. En el nivel de análisis más general, TrackerSift registra solicitudes de red básicas para recursos, como contenido de anuncios obtenido de una Red de Entrega de Contenido (CDN) o una plataforma de publicidad; pero luego se profundiza en el contenido de los recursos obtenidos, realizando un análisis de código a nivel y distinguiendo las funciones de varios tipos de llamadas de código y procedimientos.

TrackerSift’s analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf
Datos
Para obtener el conjunto de datos que alimenta a TrackerSift, los autores barrieron 100,000 sitios web elegidos al azar de la lista de los mil mejores de Tranco de 2018. Selenium la automatización del navegador se utilizó junto con Google Chrome para realizar la tarea.
La red de rastreo web se basó en sitios universitarios de Norteamérica, que comprendía un clúster de 13 nodos con 112 núcleos, 52 terabytes de almacenamiento y 823 gigabytes de RAM operativa en todo el sistema.
Cada nodo se basó en un contenedor de Docker y se dedicó a rastrear un subconjunto de las 100,000 páginas web seleccionadas, con pausas programáticas para la sostenibilidad y la eliminación completa de todas las cookies y identificadores al cargar un nuevo dominio, para garantizar que las sesiones y estados anteriores no influyeran en la legibilidad del siguiente dominio.
Scripts mixtos
Los resultados muestran un uso extensivo de empaquetado de scripts, donde las plataformas de anuncios y los anfitriones de contenido intencionalmente concatenan scripts basados en contenido y anuncios en “super-scripts” que impedirán la visualización del contenido si se bloquean. Por ejemplo, los autores señalan que pressl.co sirve un script web empaquetado a través de la plataforma de concatenador de JavaScript WebPack, que contiene un píxel de seguimiento de Facebook y también código que permite la visualización de contenido real.
Además, el documento señala que una serie de dominios están dispuestos a incrustar scripts directamente en el código de las páginas web, lo que hace necesario que los marcos de bloqueo de anuncios aborden la funcionalidad dentro de los scripts, en lugar de simplemente prevenir que el script se cargue en función de su URL de origen de terceros.
Al localizar estos métodos, el camino está claro para la división sistemática de dicho código en categorías de contenido y anuncios, y el potencial de restaurar la visualización de contenido en entornos bloqueados por anuncios.
Aunque las soluciones de bloqueo de anuncios existentes, como NoScript, AdGuard, uBlock Origin y Firefox Smartblock utilizan scripts sustitutos que desensamblan dichos scripts fusionados en scripts de componentes bloqueables, estos dependen de reescritura manual de scripts, lo que lleva a una guerra fría continua entre los bloqueadores y las técnicas cambiantes que los rompen. Por el contrario, TrackerSift ofrece un método potencialmente programático para la descomposición de contenido mixto.












