Andersonの視点
CAPTCHAを機械学習で解くことでダークウェブ研究を可能にする

米国の学術研究プロジェクトは、CAPTCHA*テストを破る方法を開発しました。Generative Adversarial Networks(GANs)を使用して、視覚的に複雑なチャレンジを解読することで、同様の最先端の機械学習ソリューションを上回ることができました。
新しいシステムをベストなフレームワークに対してテストした結果、研究者は、94.4%以上の成功率を達成し、非常にCAPTCHA保護された新興ダークネットマーケットプレースをナビゲートする際に、人間の関与を排除することができました。CAPTCHAチャレンジは最大3回の試行で自動的に解決されました。
著者は、サイバーセキュリティ研究者にとって、従来、CAPTCHAを手動で解くために人間を必要としてきたという点で、自分のアプローチがブレークスルーであると主張しています。
システムが適応性と回復力を持っている場合、自動化された監視システムやTORネットワークのインデックス付けとウェブスクレイピングの道をさらに開く可能性があります。これにより、大規模な分析や、新しいサイバーセキュリティアプローチの開発が可能になります。
論文は、Counteracting Dark Web Text-Based CAPTCHA with Generative Adversarial Learning for Proactive Cyber Threat Intelligenceと題され、アリゾナ大学、サウスフロリダ大学、ジョージア大学の研究者によって執筆されています。
影響
DW-GANシステムは、以前のシステムよりもはるかにパフォーマンスが高いという点で、標準的なウェブのCAPTCHAを破るための一般的な方法として使用される可能性があります。ただし、GitHubでのストレージの制限により、現在、リードオーサーのニング・チャンに連絡してフレームワークに関連するデータを取得する必要があります。
DW-GANには、TORネットワークを機械分析に対してより脆弱にするための「陽性」の使命があり、CAPTCHAは、CloudFlareなどのCDN巨大企業によって頻繁に使用されるため、正当な防御手段であり、同時に、違法なダークウェブマーケットプレイスによって好まれるツールでもあります。
著者たちは、DW-GANには、より広範な用途があることを認めています:
「この研究は主に、より挑戦的な問題であるダークウェブのCAPTCHAに焦点を当てていますが、この研究で提案された方法は、一般性を失うことなく、他の種類のCAPTCHAにも適用できることが期待されます。」
おそらく、DW-GANまたは同様のシステムが広く普及して、ダークウェブマーケットが機械で解決できる解決策を探すように促されるまで、あるいはCAPTCHA構成を周期的に進化させるように強制されるまで、時間がかかるでしょう。
動機
論文では、ダークウェブがサイバー攻撃に関するハッカーインテリジェンスの主な源であると述べられており、サイバー攻撃は2025年までに世界経済に10兆ドルの損失をもたらすと推定されています。したがって、オニオンネットワークは、セッションタイムアウト、クッキー、ユーザー認証などのさまざまな方法でボーダーを撃退できるため、違法なダークネットコミュニティにとって比較的安全な環境のままです。

ぼかした背景と傾斜した文字を使用する2種類のCAPTCHA
しかし、著者は、ダークウェブコミュニティの「デリケート」な体験の中で、CAPTCHAが最も大きな障害であると指摘しています:
「これらの対策のほとんどは、クローラープログラムに自動化された対策を実装することで効果的に迂回できますが、CAPTCHAは、通常、自動化ツールが持たない高度な認知能力があるため、ダークウェブで簡単に迂回できない最も妨害的なアンチクローラーメジャーです。」
テキストベースのCAPTCHAは、唯一の選択肢ではありません。多くの人々がよく知っているように、ビデオ、オーディオ、特に画像を解釈するようにユーザーに挑戦するバリエーションがあります。ただし、著者は、テキストベースのCAPTCHAが現在、ダークウェブマーケットプレイスで使用されるチャレンジの選択肢であると指摘しています。
アーキテクチャ
中国のノースウェスト大学からの以前のアプローチでは、GANを使用してCAPTCHAプラットフォームから特徴パターンを導出しましたが、著者は、この方法はラスタライズされた画像の解釈に依存しているのに対し、DW-GANの有効性は、ダークウェブのCAPTCHAで通常見られる意味のない単語や数字の可変長に影響されないことを指摘しています。
DW-GANは、4段階のパイプラインを使用します。まず、画像をキャプチャし、次に、CAPTCHAサンプルに注釈を付けたGANを使用する背景ノイズ除去モジュールに画像を提供し、画像上に配置されている文字を認識することができます。GANベースの抽出後、抽出された文字は、残りのノイズからさらにフィルタリングされます。
次に、抽出されたテキストに対してセグメンテーションが実行され、輪郭検出アルゴリズムを使用して、構成要素である文字に分割されます。

文字セグメンテーションは、ピクセルグループを分離し、ボーダートレーシングを使用して認識を試みます。
最後に、推測された文字セグメントは、畳み込みニューラルネットワーク(CNN)を使用して文字認識を実行します。

文字が重なり合うことがあります。これは、機械システムを欺くために特に設計されたハイパーカーニングです。DW-GANは、ボーダーを分離して文字を分離するために、間隔ベースのセグメンテーションを使用します。単語は通常意味をなさないため、このプロセスを支援するための意味的なコンテキストはありません。

結果
DW-GANは、3つのさまざまなダークウェブデータセットと人気のあるCAPTCHAシンセサイザーからの画像に対してテストされました。画像の元になったダークマーケットは、2つのカードショップ、Rescator-1とRescator-2、および新しく登場したYellow Brick Market(後にDarkMarketの摘発後に消滅したと報告された)でした。

3つのデータセットおよびオープンソースのCAPTCHAシンセサイザーのサンプルCAPTCHA
著者によると、テストに使用されたデータは、サイバー脅威インテリジェンス(CTI)専門家によって、ダークネットマーケット全体で広く普及しているという理由で推奨されました。
各データセットのテストには、TOR向けのスパイダーを開発して、500個のCAPTCHA画像を収集し、CTIアドバイザーによってラベル付けおよびキュレーションされたものでした。
3つの実験が行われました。最初の実験では、DW-GANの一般的なCAPTCHA破壊性能を、標準的な最先端方法と比較しました。対抗方法は、イランとイギリスからの共同学術的取り組みである、前処理を伴う画像レベルのCNN、ガウシアンぼかしの適用、正規化、グレースケール変換を含むものでした。また、イギリスのオックスフォード大学からの画像レベルのCNN、イギリスとイランからのキャラクターレベルのCNN、間隔ベースのセグメンテーションを使用しました。

DW-GANの最初の実験の結果、前の最先端アプローチと比較して
研究者は、DW-GANが、すべてのテストケースで以前の結果を上回ったことを発見しました(上の表を参照してください)。
2番目の実験は、有効なフレームワークのさまざまなコンポーネントを削除または無効にして、外部要因または二次要因が結果に影響を与えていないことを確認するための消去法研究でした。

消去法研究の結果
ここでも、著者は、重要なセクションのアーキテクチャを無効にすると、ほぼすべてのケースでDW-GANのパフォーマンスが低下することを発見しました(上の表を参照してください)。
3番目のオフライン実験では、DW-GANの有効性を、ベンチマーク画像ベースの方法と2つのキャラクターレベルの方法と比較して、CAPTCHAの長さが4から7文字の場合に、DW-GANのキャラクタ評価がどの程度役立つかを判断するために行われました。
この実験では、著者は、50,000個のCAPTCHA画像で構成されるトレーニングセットを使用し、5,000個の画像をテストに予約しました。これは、典型的な90/10の分割です。
ここでも、DW-GANは以前のアプローチを上回りました:

ダークネットマーケットでのライブテスト
最後に、DW-GANは、当時ライブだったYellow Brickダークネットマーケットに対してテストされました。このテストでは、TOR向けのウェブブラウザが開発され、DW-GANがブラウジング機能に統合され、CAPTCHAチャレンジを自動的に解決しました。
このシナリオでは、CAPTCHAが15回のHTTPリクエストごとに自動化されたクローラーに提示され、平均して、CTIアドバイザーによってラベル付けおよびキュレーションされた500個のCAPTCHA画像を収集しました。クローラーは、Yellow Brickで販売されている1,831個の違法アイテム、包括して1,223個の薬物関連製品(オピオイドやコカインを含む)、44個のハッキングパッケージ、9個の偽造文書スキャンをインデックス化することができました。合計で、286個のサイバーセキュリティ関連アイテム、102個の盗まれたクレジットカード、131個の盗まれたアカウントログインが特定されました。
著者は、DW-GANが3回以下の試行でCAPTCHAを破ることができ、1,831個の製品を保護するCAPTCHAにアクセスするために76分の処理時間が必要だったと述べています。人間の介入は必要ではなく、エンドポイントの故障は発生しませんでした。
著者は、テキストCAPTCHAよりも高度な複雑さを持つチャレンジの出現、特にチューリングテストをモデルにしたものを観察し、DW-GANがこれらの新しい傾向に適応できる可能性があることを指摘しています。
2022年1月11日初めて公開。













