Andersonの視点
スパムドメインの予測を可能にするマシンラーニング

フランスの研究者は、大量のスパムメールを送信するために使用される可能性のある新しく登録されたドメインを特定する方法を開発しました。時には、スパマーが未送信の場合でも、すでにそのドメインを使用しています。
この技術は、送信者のポリシー・フレームワーク(SPF)を使用して、電子メールの出所を検証する方法に基づいています。SPFは、電子メールの送信者が本物であることを確認するために使用されるメカニズムです。
シアトルに本拠を置くファーサイト社のパッシブDNSセンサーを使用して、研究者は新しく登録されたドメインのSPFアクティビティに関する近乎リアルタイムのDNSデータを取得しました。
不均衡な医療データを処理するために最初に設計されたクラス重みアルゴリズムを使用して、研究者はスパムドメインの3/4を検出できました。検出は、スパムキャンペーンの開始前に行われました。
論文では、次のように述べられています。
‘単一のTXTレコード要求で、スパムドメインの75%を検出します。可能なら、スパムキャンペーンの開始前に検出します。したがって、当システムは重要な反応速度を提供します。メールの送信前に、またはDNSトラフィックの急増前に、スパマーを良好な性能で検出できます。’
研究者は、スパムドメインの検出に使用される特徴を、既存のスパム検出システムに追加して性能を向上させることができると主張しています。
この論文は、パッシブDNSとSPFを使用したスパムドメインの早期検出というタイトルで、グレノーブル大学の3人の研究者によって執筆されました。
SPFアクティビティ
SPFは、電子メールアドレスのスプーフィングを回避するために設計されています。登録されたIPアドレスが電子メールを送信するために使用されたことを検証することで機能します。
SPFは、電子メールの送信者が本物であることを確認するために使用されるメカニズムです。
他の電子メール検証方法には、DomainKeys Identified Mail(DKIM)シグネチャとDomain-based Message Authentication、Reporting、and Conformance(DMARC)があります。
これらの方法はすべて、ドメインレジストラにTXTレコードとして登録する必要があります。
スパムとバーン
スパマーは、ドメインとそのIPアドレスの評判を低下させることを目的としています。大量のスパムメールを送信することで、ドメインとIPアドレスを「焼き」ます。
スパマーは、ドメインとIPアドレスを使用不能にするまで、スパムメールを送信し続けます。次に、新しいドメインとIPアドレスに移行して、同じプロセスを繰り返します。
データと方法
研究対象となったドメインは、2021年5月から8月までの間に登録されたもので、ファーサイト社から提供されました。新しく登録されたドメインのみが検討されました。
ドメインリストは、ICANN Central Zone Data Service(CZDS)から取得したデータを使用して構築されました。SURBLとSpamHausプロジェクトのブラックリスト情報を使用して、潜在的に問題のある新しいドメイン登録を近乎リアルタイムで特定しました。
新しく登録されたドメインに対するDNS TXTクエリをキャプチャした後、有効なSPFデータのみが保持され、アルゴリズムの基礎となりました。
SPFには、いくつかの使用可能な特徴があります。新しい論文では、ベニーニュードメイン所有者が最も一般的に使用する+includeメカニズムに対して、スパマーが使用する+ptr機能の使用率が高いことがわかりました。
+ptrルックアップは、送信メールのIPアドレスをホスト名(例:GoDaddy )と関連付けることによって機能します。ホスト名が見つかった場合、そのドメインは、最初に使用されたSPFレコードのドメインと比較されます。
スパマーは、+ptrの厳格さを利用して、より信頼性の高いもののように見せることができます。実際には、+ptrルックアップに必要なリソースは多く、多くのプロバイダーはチェックを完全にスキップします。
スパマーがSPFを使用して、スパムキャンペーンを開始する前に「爆撃と焼き」作戦を実行するウィンドウを確保するという方法は、機械学習によって推測できます。
結果
研究者は、50時間の期間中に、スパムドメインの検出遅延を、SpamHausとSURBLと比較しました。彼らは、70%のスパムドメインで、自分のシステムがより速かったと報告しています。
著者は、単一のDNSクエリに基づいて、79%のF1スコアを主張しています。Exposureなどの他の方法では、1週間の予備分析が必要です。
著者は、次のように述べています。
‘当システムは、ドメインのライフサイクルの初期段階で適用できます。パッシブ(またはアクティブ)DNSを使用して、新しく登録されたドメインのSPFルールを取得し、すぐに分類するか、TXTクエリを検出して、ハードルが高くて回避が難しい時間ベースの特徴を使用して分類を改良できます。’
そして、次のように続けています。
‘私たちのベストクラシファイアは、85%のスパムドメインを検出しながら、偽陽性率を1%以下に抑えています。検出結果は、分類に使用されるのはドメインのSPFルールとその関係、およびDNSトラフィックに基づく回避が難しい特徴のみであるという事実に照らして、注目に値します。’
‘クラシファイアの性能は、高いままです。クラシファイアが静的特徴のみを受け取った場合でも、静的特徴は、単一のTXTクエリ(パッシブまたはアクティブにクエリされた)から収集できます。’
新しい方法のプレゼンテーションを見るには、以下の埋め込みビデオを参照してください。
2022年5月5日に初めて公開されました。












