Andersonの視点
アドブロックを阻止するためのマシンラーニング

米国とパキスタンの新しい研究イニシアチブは、アドブロックとプライバシー保護技術に対して抵抗力を持ち、広告と実際のコンテンツの起源を「ブレンド」する技術を使用するウェブサイトを特定するためのマシンラーニングベースの方法を開発しました。
これらの研究結果から開発された新しいアドブロック技術は、アドブロックが有効になっている場合に、記事の中心的なコンテンツが表示されないという事象を終わらせる可能性があり、広告とスクリプトのリソースを自動的に分離する方法を提供します。
著者は、100,000のウェブサイトを対象とした大規模な研究を実施し、17%のドメイン、48%のホスト名、6%のスクリプト、および9%のコンテンツ配信方法が、トラッキング(広告)機能と実際のコンテンツを提供するプロセスを意図的に「ブレンド」していることを発見しました。これらの場合、ユーザーがアドブロックまたはアンチトラッキングソフトウェアを使用している場合、記事のコンテンツは表示されず、ユーザーはコンテンツを表示するためにこれらのソフトウェアを無効にする必要があります。
大多数の場合、これは単に広告が再び表示されることを意味するだけでなく、ユーザーが最近のプライバシー活動家を炎上させたクロスドメイントラッキングシステムにも戻されることを意味します。
新しい研究では、98%の精度でこれらの「混合」ウェブリソースのコンポーネントを分離することができるシステムを提供し、アドブロックとアンチトラッキングソリューションが将来のソフトウェアのバージョンでこれらのストリームを解決する機会を得ることができます。
新しい論文は、TrackerSift:混合トラッキングと機能的なウェブリソースの解析と題され、米国のバージニア工科大学とカリフォルニア大学デービス校、およびパキスタンのFAST NUCESとラホール経営大学(LUMS)からの研究者によって執筆されています。
アドブロック戦争
アドブロックシステムは一般的に、ウェブページ内の広告コンテンツが特定の専用ドメインから発信される必要があるという要件に依存しています。通常、これらのドメインはアドテクノロジープラットフォームであり、ドメイン名と/またはIPアドレスが「第三者広告」として分類されるため、ブロックリストを作成できます。
さらに、アド特有のリソース(スクリプトなど)の名前をブロックリストに追加できます。これにより、これらのリソースは、起源が意図的に隠された場合でも実行されません。こうしたシステム的に生成されたスクリプトの命名スキーマは、通常一貫性があり、認識とブロックリスト化が可能です。
ウェブページ内の広告は、通常、ページの読み込みの最後の数ミリ秒で、動的オークションプロセス(ページ内のキーワード、キャンペーンのターゲットメトリックなどに基づく)によって選択されます。したがって、広告ブロッカーが商業コンテンツを隠すことを妨げるため、ホストドメインに広告を保存することは実用的ではありません。
ウェブサイトは、CNAME Cloakingを使用して、アドブロックに対抗しています。つまり、「本物の」ドメインのサブドメインをアドサーバーのプロキシとして使用します(例:content.example.comはexample.comに広告を提供しますが、サブドメインは広告を提供する以外の目的を持たず、ホストウェブサイトによってではなく、広告主によって維持されます)。
しかし、この方法は、サブドメインのコンテンツを広告として区別したり、ネットワーク分析技術を使用してサブドメインとコアドメインの異常で規則的な関係を特定したりすることで、量化およびブロックできます。
TrackerSift
著者の論文では、TrackerSiftと呼ばれるプラットフォームを提案しています。これは、ウェブサイトによってフェッチされるネットワークリソースを分析し、混合リソースを「コンテンツ」と「広告」に再分類します。最も一般的な分析レベルでは、TrackerSiftは、コンテンツ配信ネットワーク(CDN)または広告プラットフォームからフェッチされた広告コンテンツなどの基本的なネットワークリクエストを記録します。さらに、フェッチされたリソースのコンテンツを分析し、コードレベルの分析を実行し、さまざまなタイプのコード呼び出しと手順の機能を区別します。

TrackerSiftの分析階層、トラッキングリソース(赤)から必要な機能リソース(緑)まで。コンテンツの不明瞭化につながる可能性のある混合リソース(黄色)は、より深い分析の対象となります。ソース:https://arxiv.org/pdf/2108.13923.pdf
データ
TrackerSiftを動作させるデータセットを取得するために、著者は2018年のTranco top-million listからランダムに選択された100,000のウェブサイトをクロールしました。Seleniumブラウザ自動化とGoogle Chromeを使用してこのタスクを実行しました。
ウェブクローリングネットワークは、北米の大学サイトに基づいて構築され、13ノードのクラスターで、112コア、52テラバイトのストレージ、823ギガバイトのオペレーティブRAMを備えていました。
各ノードはDockerコンテナに基づいており、選択された100,000のウェブページのサブセットをクロールすることに専念し、持続可能性のためにプログラムによる一時停止と、新しいドメインを読み込むときにすべてのCookieと識別子を完全に消去することで、前のセッションと状態が次のドメインの読み込みに影響しないようにしました。
混合スクリプト
結果は、広告プラットフォームとコンテンツホストがコンテンツベースのスクリプトと広告ベースのスクリプトを「uber scripts」に意図的に連結する、広告のバンドル化の広範な使用を示しています。これにより、ブロックされた場合、コンテンツの表示が妨げられます。例として、著者は、pressl.coが、WebPack JavaScript連結プラットフォームを使用してバンドルされたウェブスクリプトを提供していることを指摘しています。このスクリプトには、Facebookのトラッキングピクセルと、実際のコンテンツのレンダリングを可能にするコードが含まれています。
さらに、論文では、多くのドメインが、実際のコンテンツをレンダリングするために必要な機能を提供するスクリプトを、ウェブページのコードに直接埋め込むことを了承していることを示しています。したがって、アドブロックフレームワークは、スクリプトの起源に基づいてスクリプトの読み込みを防ぐのではなく、スクリプト内の機能に対処する必要があります。
これらの方法を特定することで、コンテンツと広告のカテゴリに分割するためのコードをシステム的に分割するための道筋が明らかになり、ブロックされた環境でのコンテンツの表示が再び可能になる可能性があります。
現存するアドブロックソリューション、たとえばNoScript、AdGuard、uBlock Origin、Firefox Smartblockは、スクリプトを分割してブロック可能なコンポーネントスクリプトに分解するための代理スクリプトを使用していますが、これらはスクリプトの手動での書き換えに依存しており、アドブロッカーとそれらを破壊する不断に変化する技術の間で、冷戦が続いています。一方、TrackerSiftは、混合コンテンツの分解のためのプログラム的な方法を提供します。ipts which disassemble such merged scripts into blockable component scripts, these depend on manual rewriting of scripts, leading to an ongoing cold war between the blockers and the ever-shifting techniques that break them. By contrast, TrackerSift offers a potential programmatic method for mixed-content decomposition.












