AIモデルとプラットフォーム
ビジネス・アノマリー:アノマリー検出で不正を防ぐ
MIDASを用いたアノマリー検出
アノマリー検出は、過去5年間で最も有用な機械学習ツールの1つになりました。不正検出から品質管理まで、幅広い分野で利用されています。オンラインレビューサイトで不正なレビューを検出できるでしょうか。金融取引で不正な取引を検出できるでしょうか。センサーからのリアルタイムデータで電力網の故障を予測できるでしょうか。
アノマリー検出は、これらの質問に答えることができます。データ内のアノマリーを特定することは、データ理解の重要なタスクです。大量のデータセットを機械学習ツールと統計方法に適用することで、データ内の正常なパターンを学習できます。不一致なイベントが発生すると、アノマリー検出アルゴリズムは異常な動作を特定し、学習したパターンに一致しないイベントをフラグできます。这种機能は、多くのビジネス用途で重要です。アノマリー検出は、セキュリティから金融まで、IoTモニタリングを含む多くの分野で応用できます。
ウェブスケールグラフは現在普遍的であり、大規模なデータ構造の一般的な表現です。オンラインおよびオフラインのアプリケーションを両方とも動かします。オンラインの例としては、大規模なソーシャルネットワーク、製品レコメンデーションエンジン、金融取引グラフがあります。オフラインでは、道路ネットワーク、IoTプラットフォーム、電力網の電圧センサーなどが、大量のグラフのようなデータの源となります。データをグラフとして表現することで、データの所有者にはメリットと課題の両方がもたらされます。一方では、多次元空間でデータポイントとその関係を表現することができます。他方では、データ分析と解釈のためのスケーラブルなアルゴリズムが必要です。これにより、グラフデータでのアノマリー検出などの方法に対する研究の焦点が高まりました。
ここで、動的グラフデータでのアノマリー検出のための最新アルゴリズムを詳しく見てみましょう。
MIDAS
マイクロクラスターを用いたエッジストリームのアノマリー検出(MIDAS)は、動的グラフデータでのアノマリー検出を扱うアルゴリズムです。シンガポール国立大学の研究者によって開発され、彼らの方法は最先端のアプローチを上回ると主張しています。その方法は、以前のアノマリー検出実装の最も一般的な欠点を軽減します。
以下は、シンガポール大学のSiddarth Bhatiaと彼のチームによって開発された、新しいアノマリー検出の基準です

グラフでのアノマリー検出の新しい基準:MIDAS。画像ソース:ブログ
静的グラフでのデータの表現
静的グラフには、接続性に関する情報のみが含まれ、時間情報は無視されます。グラフスナップショットとも呼ばれ、通常、不審なグラフエンティティ(例:不審なノード、エッジ、サブグラフ)を特定するためにのみ使用できます。ただし、多くの実用的なアプリケーションでは、時間的側面も同等に重要です:グラフ構造がいつ変更されたかを知ることは重要です。例として、ネットワークトラフィックストリームを表す静的グラフでは、エッジはソースIPアドレスと宛先IPアドレスの間の接続のみを示しますが、2つのアドレスが接続された時刻は不明です。静的グラフでは、時間情報をモデル化できないため、静的グラフ上に構築されたアノマリー検出方法は、現実世界のアプリケーションに対して限られたサポートのみを提供します。
一方で、MIDASは、動的グラフに格納されたデータを処理します。グラフ内の各要素には、要素がグラフに追加された時刻を表すタイムスタンプが関連付けられています。上記の例を続けると、動的ネットワークトラフィックグラフは、2つのIPアドレス間の接続がいつ発生したかについても情報を提供します。タイムスタンプは、既存のエッジまたはノードが更新されたとき、または新しいエッジがグラフに追加されたときに変更されます。したがって、動的グラフは、時間の経過とともに変化する構造であり、多くの現実世界のアプリケーションに適しています。これにより、接続性と時間情報の両方を使用して、不審なグラフエンティティを検出できます。MIDASはリアルタイムでアノマリーを検出できるため、多くのビジネス用途をサポートします。
MIDASは、動的グラフデータで動作するように最適化されています。上記のように、動的グラフは時間変化データを表現することを可能にします。ただし、これはグラフ構造自体も時間の経過とともに変化することを意味します。これにより、リアルタイムアプリケーションで使用することを目的としたアノマリー検出アルゴリズムには、特定の課題が生じます。例として、グラフの特性の変化に対する方法のスケーラビリティがあります。大規模なデータボリュームを持つアプリケーションの場合、アルゴリズムはグラフのサイズに対して線形にスケーラブルである必要があります。MIDASはオンラインで実行され、各エッジを定数時間と定数メモリで処理します。著者は、アルゴリズムが「162-633倍高速」であると報告しています。これにより、アルゴリズムは、高ボリュームのデータストリームを処理する必要があるリアルタイムアプリケーションに適しています。
MIDASが必要なビジネス用途は?
今日のビジネス世界でアノマリー検出を利用していることをより深く理解するために、カナダを拠点とする仮想通貨プロバイダーNDAXにインタビューしました。NDAXは、ビジネスの3つの分野でアノマリー検出を使用しています。一般的なビジネス運営、市場部門、コンプライアンスチームです。アノマリー検出により、バグを特定し、ウェブサイトのパフォーマンスとクライアントのオンボーディングプロセスを改善できます。また、ソフトウェア開発とバックオフィス運用チームに、これらの問題を解決する方法についての指針を提供できます。ウェブサイトトラフィックも、アノマリー検出の力を利用できる分野です。ウェブサイトトラフィックの外れ値を理解することで、マーケティングチームに洞察とより深い理解を提供し、マーケティングキャンペーンが機能しているかどうかを判断できます。したがって、集中すべき最も重要な分野について、より明確なภาพを提供します。最後の例は、クライアントのサインアップアノマリーがコンプライアンスチームに潜在的な不正とクライアントリスクの軽減を特定するのに役立つ方法です。
NDAXのチーフコンプライアンスオフィサーのJulia Baranovskayaとの議論では、アノマリー検出の重要性が現在のパンデミックの間で強調されていることを強調しています。過去数ヶ月で、検出された不正が300%増加しました。困難な時期と高レベルのオンライントラフィックは、失業者や高齢者を標的にしたすべての種類の詐欺を誘発します。アノマリー検出を使用すると、これらの外れ値を不正またはトレンドの指標に変えることができます。以下のグラフは、今年前半に不正がどのように変動したかを示しています。
NDAXは、特に高齢者を標的にした詐欺や偽の求人投稿を含む、2四半期に不正の増加を発見しました。
あなたのビジネスについては?
アノマリー検出アルゴリズムは、さまざまなシナリオで、ビジネスが通常のデータポイントから外れたデータポイントを特定し、対応できるように支援できます。銀行のセキュリティシステムでは、不正な取引の特定にアノマリー検出を使用することができます。同様に、製造工場の所有者は、機器の故障に対処し、予測メンテナンス措置を実施するためにアノマリー検出に頼っています。IoTセンサーネットワークでは、アノマリー検出は、状態モニタリングソリューションの一部として、およびマルウェアの配布を防ぐために使用されます。重要な点は、多くのデータにアクセスできるビジネスが、MIDAS(および他のアノマリー検出アルゴリズム)を使用して、リアルタイムで通常のパターンを特定できることです。
あなたのデータはどのように構造化されていますか?また、現代的なアノマリー検出ソリューションを設定するのをどのように支援できますか?
お気軽にお問い合わせください。Blue Orange Digitalのデータサイエンスチームは、あなたのためにアノマリー検出を活用できるように支援することを嬉しく思います!
メイン画像ソース:Canva












