Andersonの視点

マルチモーダルな悪意のあるオンラインレビューの検出

mm
Unite.AI を Google の優先ソースに追加

中国と米国の新しい研究協力により、競合他社を損なうために、または脅迫を行うために設計された悪意のあるEコマースレビューを検出する方法が提供され、悪意のあるレビューアーの行動の特徴を利用することにより、悪意のあるレビューを検出することができる。

このシステムは、悪意のあるユーザー検出モデル (MMD) と呼ばれ、メトリック学習という手法を使用し、コンピュータビジョンやレコメンデーションシステムでよく使用される技術と、再帰型ニューラルネットワーク (RNN) を組み合わせて、悪意のあるレビューアーの出力を識別してラベル付けする。論文では、これらのユーザーを プロフェッショナルな悪意のあるユーザー (PMU) と呼んでいる。

グレート!1スタ

オンラインEコマースレビューは、通常、2つの形式のユーザーフィードバックを提供する:スターランキング(または10点中の点数)とテキストベースのレビューであり、通常、これらは論理的に対応している(例えば、悪いレビューは低いランキングに伴う)。

しかし、PMUは、論理を破り、悪いテキストレビューを高いランキングで、または低いランキングを伴う良いレビューを残すことがある。

これにより、ユーザーのレビューは評判を損なうことができるが、Eコマースサイトが悪意のあるレビューアーを識別して対処するために使用する比較的単純なフィルタをトリガーすることはない。自然言語処理 (NLP) に基づくフィルタがレビューのテキストに悪意のある言葉を識別すると、その ‘フラグ’ は、PMU が割り当てた高いスターランキング (または小数点ランキング) によって効果的にキャンセルされ、悪意のあるコンテンツは ‘中立’ になる。

悪意のあるレビューを統計的に検出するためのコラボレーティブフィルタリングシステムの観点からの悪意のあるレビューの例。ソース:https://arxiv.org/pdf/2205.09673.pdf

悪意のあるレビューを統計的に検出するためのコラボレーティブフィルタリングシステムの観点からの悪意のあるレビューの例。ソース:https://arxiv.org/pdf/2205.09673.pdf

新しい論文では、PMUの意図は、オンライン小売業者から金銭を脅し取ること、または悪意のあるレビューを投稿しないことを約束することであると述べている。また、場合によっては、アドホック 個人である割引を求める 人もいるが、頻繁に、PMUは被害者の競合他社によって雇用されている

悪意のあるレビューの隠蔽

現在の自動検出システムは、コラボレーティブフィルタリングまたはコンテンツベースモデルを使用しており、明確で曖昧性のない ‘アウトライア’ を検索している:両方のフィードバック方法で一貫して悪意のあるレビューであり、一般的なレビューの感情とランキングから著しく乖離しているものである。

これらのフィルタが注目するもう一つの古典的な特徴は、高い投稿頻度であるが、PMUは戦略的に投稿し、各レビューは個別の依頼または長期的な戦略の一部であるため、まれにしか投稿しない。

したがって、新しい論文の研究者は、プロフェッショナルな悪意のあるレビューの奇妙な極性を専用のシステムに統合し、アルゴリズムを開発した。これは、人間のレビューアーが ‘悪意のあるレビュー’ を検出する能力とほぼ同等である。

MMDの概念アーキテクチャ:Malicious User Profiling (MUP) とAttention Metric Learning (MLC、グレー) の2つの中央モジュールで構成される。

MMDの概念アーキテクチャ:Malicious User Profiling (MUP) とAttention Metric Learning (MLC、グレー) の2つの中央モジュールで構成される。

以前のアプローチとの比較

MMDは、PMUを識別するための最初のシステムであるため、直接比較できる以前の研究はない。したがって、研究者は、従来の自動フィルタが頻繁に依存するコンポーネントアルゴリズムと比較した:K-means++ クラスタリング;Statistic Outlier Detection (SOD);HysadSemi-sadCNN-sad;および Slanderous user Detection Recommender System (SDRS)。

AmazonとYelpのラベル付きデータセットでテストされたMMDは、プロフェッショナルなオンラインデトラクターを最高の精度で識別できるという主張である。太字はMMDを表し、アスタリスク(*)は最も優れたパフォーマンスを表す。上記のケースでは、MMDは2つのタスクでスタンドアロン技術(MUP)によってのみ超過されたが、これは既にMMDに組み込まれているが、デフォルトではタスクにツール化されていない。

Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] とYelpのラベル付きデータセットでテストされたMMDは、プロフェッショナルなオンラインデトラクターを最高の精度で識別できるという主張である。太字はMMDを表し、アスタリスク(*)は最も優れたパフォーマンスを表す。上記のケースでは、MMDは2つのタスクでスタンドアロン技術(MUP)によってのみ超過されたが、これは既にMMDに組み込まれているが、デフォルトではタスクにツール化されていない。

この場合、MMDはTaobaoとJindongのラベル付けされていないデータセットと比較され、基本的に教師なし学習タスクとなった。再び、MMDはタスクに高度に適応された自らの構成要素技術によってのみ超過された。

この場合、MMDはTaobaoとJindongのラベル付けされていないデータセットと比較され、基本的に教師なし学習タスクとなった。再び、MMDはタスクに高度に適応された自らの構成要素技術によってのみ超過された。

研究者は次のように述べている:

‘すべての4つのデータセットで、提案されたMMDモデル(MLC + MUP)は、Fスコアの点ですべてのベースラインを上回った。MMDはMLCとMUPの組み合わせであり、一般的に教師ありモデルと教師なしモデルを超える優位性がある。’

論文では、MMDは従来の自動フィルタシステムの事前処理方法としても役立つ可能性があることも示唆しており、ユーザーベースのコラボレーティブフィルタリング (UBCF)、アイテムベースのコラボレーティブフィルタリング (IBCF)、行列因子分解 (MF-eALS)、ベイジアンパーソナライズドランキング (MF-BPR)、および ニューラルコラボレーティブフィルタリング (NCF) などのデータセットに関する実験結果を提供している。

結果の ヒットレート (HR) と 正規化ディスカウント累積利得 (NDCG) について、著者は次のように述べている:

‘すべての4つのデータセットで、MMDはHRとNDCGの点で推奨モデルを大幅に改善した。具体的には、MMDはHRのパフォーマンスを平均28.7%、NDCGのパフォーマンスを平均17.3%向上させることができる。 ‘

‘プロフェッショナルな悪意のあるユーザーを削除することで、MMDはデータセットの品質を向上させることができる。プロフェッショナルな悪意のあるユーザーの偽のフィードバックなしで、データセットはより 直感的 になる。’

論文は メトリック学習を使用したレコメンデーションシステムにおけるプロフェッショナルな悪意のあるユーザーの検出 と題されており、吉林大学のコンピューターサイエンスとテクノロジー学部、中国科学アカデミーの北京にあるインテリジェント情報処理キーラボラトリー、ニュージャージーのラトガース大学ビジネススクールの研究者によるものである。

データとアプローチ

PMUを検出することは、2つの非等価なパラメータ(数値値のスターランキングまたは10点中の点数とテキストベースのレビュー)を考慮する必要があるため、マルチモーダルな課題である。著者は、以前の研究ではこの課題に対処していないと主張している。

MMDは、階層型デュアルアテンション再帰型ニューラルネットワーク (HDAN) を使用して、レビューのコンテンツを感情スコアに統合する。

HDANを使用してレビューを感情スコアに投影し、単語埋め込みと文埋め込みを使用して感情スコアを取得する。

HDANを使用してレビューを感情スコアに投影し、単語埋め込みと文埋め込みを使用して感情スコアを取得する。

HDANは、各単語と各文に重みを付けるためのアテンションメカニズムを使用する。上の画像では、著者は、poorer という単語が他の単語よりも明らかに重みが大きいはずであると述べている。

プロジェクトでは、HDANはAmazon.com、Yelp for RecSys (2013)、およびTaobaoとJindongからの ‘リアルワールド’ データセットからの製品の評価を基準として使用した。

MMDは、エンティティ間の正確な距離を推定し、データの関係の全体的なグループを特徴付けることを目的としたメトリック学習を利用する。

MMDは、ワンホットエンコーディングから始まり、ユーザーとアイテムを選択し、潜在的因子モデル (LFM) を使用して基準評価スコアを取得する。同時に、HDANはレビューのコンテンツを感情スコアに投影する。

結果は、悪意のあるユーザープロファイリング (MUP) モデルに処理され、感情ギャップベクトル を出力する。これは、評価とレビューのテキストコンテンツの推定感情スコアの間の乖離である。これにより、PMUを最初にカテゴリ化してラベル付けすることができる。

クラスタリングのためのアテンションベースのメトリック学習。

クラスタリングのためのアテンションベースのメトリック学習。


機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai