Andersonの視点

レビューを使用して機能するレコメンダーシステムを作成する

mm
Unite.AI を Google の優先ソースに追加

オンラインで製品を購入し、購入および販売後のプロセスで「関連アイテム」の不合理性や無関係性に驚いたことがある場合は、人気のあるレコメンダーシステムが購入の関係性を理解することに短所があることをすでに理解しているはずです。

不確実でまれなアイテム、例えばオーブンを購入すると、他のオーブンの推奨は余分なものになる可能性がありますが、最悪のレコメンダーシステムはこれを認識できません。レコメンダーシステム。2000年代には、TiVOのレコメンダーシステムがこの分野で初期の論争を引き起こし、ユーザーの認識された性別を再割り当てしました。その後、ユーザーはプロフィールを「再男性化」するために戦争映画を選択しようとしました。アルゴリズムの修正に対する粗いアプローチでした。

もっとひどいのは、Amazonのようなサイトで実際に何かを購入する必要はなく、メジャーなストリーミングプラットフォームで動画の説明を閲覧している間に情報に飢えたレコメンダーアルゴリズムが間違った道に進み始めることがあります。検索、滞在、クリック、詳細ページへのクリックは十分であり、これらのスキャント情報は将来のブラウジングセッション中に継続される可能性があります。

レコメンダーシステムを忘れさせるために

時々は介入することができます。Netflixには「親指アップ/ダウン」システムがあり、理論的にはマシンラーニングアルゴリズムがレコメンダーションのプロファイルから特定の概念やワードを除去するのに役立ちます(ただし、その有効性は疑問視されており、スクラッチからパーソナライズされたレコメンダーアルゴリズムを作成することは、望ましくないオントロジーを削除するよりもはるかに簡単です)、そしてAmazonではタイトルを削除できるため、歓迎されないドメインがレコメンダーションに侵入した場合、それらをダウングレードする必要があります。

Huluには同様の機能がありますが、HBO Maxは現在の短所のためにアルゴリズムのみのレコメンダーシステムから部分的に撤退しています。

これらの消費者レベルの経験は、広く批判されている「受動的な」広告プラットフォームのレコメンダーシステム(注目すべき変更が一般的な怒りにより進行中です)や、YouTubeTwitterFacebookなどのサイトで非関連または有害なレコメンダーションに対する批判に直面しているソーシャルメディアAIレコメンダーションのトピックには触れません。

マシンは私たちが何を欲しいのかを理解できないようです。私たちが検索したアイテムの隣のアイテムを除いて、たとえば私たちが購入したアイテムと同じ、または代替のアイテムです。

レビュー データを使用した正確なレコメンダーション

中国とオーストラリアの新しい研究コラボレーションは、ショッピング セッションでのアイテム間の実際の関係をよりよく理解するために、外部ユーザー レビューを使用する新しい方法を提供しています。テストでは、アーキテクチャは現在の最先端の方法をすべて上回り、レコメンダーシステムがアイテムの依存関係をよりよく理解できることを示唆しています。

RI-GNNは、アイテム間の関係の正確性において主要な競合他社を上回り、5つを超えるアイテムを持つセッションで最もよく機能します。システムは、Amazon Review Data (2018) のペット用品と映画/テレビデータセットに対してテストされました。 ソース: https://arxiv.org/pdf/2201.12532.pdf

RI-GNNは、アイテム間の関係の正確性において主要な競合他社を上回り、5つを超えるアイテムを持つセッションで最もよく機能します。システムは、Amazon Review Data (2018) のペット用品と映画/テレビデータセットに対してテストされました。 ソース: https://arxiv.org/pdf/2201.12532.pdf

さらに、このプロジェクトは、レコメンダーシステムがユーザーの購入履歴や過去の購入に関するユーザーのレビューにアクセスできない匿名セッションでレコメンダーションを作成するという著名な課題に取り組んでいます。

新しい論文は、セッションベースのレコメンダーションにおける隣接依存関係の再考と呼ばれ、中国の済南大学と北京理工大学、オーストラリアのメルボルンのRMIT大学、シドニーのオーストラリア人工知能研究所の研究者によって書かれています。

次に何が起こるか?

セッションベースのレコメンダーション (SBR) の中心的なタスクは、現在のアイテムとの関係に基づいて、次のアイテムを決定することです。実際には、これは電子商取引 Web サイトのアイテム ページに表示される「関連アイテム」のリストとして現れます。

鳥かごを購入する場合、他のどんなものが必要になるでしょうか。少なくとも、鳥かごに入れる鳥が必要です – これは真の依存関係です。しかし、鳥かごはペット用品のオントロジーに表示されますが、そこには鳥は売られていません。猫の餌は同じオントロジーにありますが、鳥かご製品の関連レコメンダーションとして猫の給餌ボウルを追加することは誤った依存関係です – 間違った関連付けです。

論文からの真の関係と偽の関係の間のアイテム間の関係、右側のアイテム間グラフとして視覚化されています。

論文からの真の関係と偽の関係の間のアイテム間の関係、右側のアイテム間グラフとして視覚化されています。

機械学習アーキテクチャの場合と同様に、レコメンダーシステムに、遠隔 エンティティ (bird はペット製品に全く表示されません) がアイテムに関連している可能性があることを納得させることは課題です。機能や中心概念で近いアイテム (たとえば、猫の給餌ボウル) は、購入に直面しているアイテムとは直交するか、または反対である可能性があります。

これらの「非隣接」エンティティ間のマッピングを作成する唯一の方法は、クラウドソーシングを使用することです。関係は人間の経験の側面であり、プログラムで推測することはできません。伝統的なアプローチ (たとえば、Amazon Mechanical Turk) でのデータセット ラベルのスコープや資金では、恐らく手が届きません。

したがって、研究者は、製品のレビューから重要な単語を抽出するために自然言語処理 (NLP) メカニズムを使用し、これらの分析からの頻度を使用して、明らかに異なるアイテムを「一致」させることができる埋め込みを作成しました。

レビュー精製インターアイテムグラフニューラルネットワーク (RI-GNN) のアーキテクチャ。

レビュー精製インターアイテムグラフニューラルネットワーク (RI-GNN) のアーキテクチャ。

アーキテクチャとデータ

新しい論文では、同様の性質の以前の研究は、ログインユーザーの自分のレビュー履歴を使用して基本的なマッピングを提供しました。 DeepCONNRNS は両方ともこのアプローチを使用しました。ただし、ユーザーがレビューを書いていない、または特定のアイテムに関連するレビューを書いていない可能性があることを無視しています。さらに、これは「ホワイトボックス」アプローチです。ユーザーがアカウントを作成し、ログインしていることを前提としています。

研究者が提案する拡張グラフニューラルネットワーク (GNN) は、よりオラクル駆動型のアプローチを取り、a priori で真の依存関係を導出し、匿名またはログアウトしているユーザーが最小限の入力で関連性の高いレコメンダーションを体験できるようにします。

レビューを強化したシステムは、レビュー精製インターアイテムグラフニューラルネットワーク (RI-GNN) と呼ばれます。研究者は、Amazon の 2 つのデータセットペット用品映画とテレビ に対してこれをテストしました。レビューの可用性の問題はこれで解決されますが、実際の実装では、適切なレビューデータベースを見つけてスクラップする必要があります。データセットのソースは、ソーシャルネットワークの投稿や Quora の回答など、実際には何でもかもしれません。

このような高レベルの関係マッピングは、レコメンダーシステムを超えて、多くの機械学習アプリケーションに貴重なものになります。多くの現在のプロジェクトは、資金とスコープの制限により、ドメイン間およびドメイン内のマッピングが不足していますが、真正な知識とクラウドソーシングされた電子商取引レコメンダーシステムの商業的推進力により、このギャップを埋めることができます。

メトリックとテスト

著者は、RI-GNN を 2 つのバージョンの各データセットに対してテストしました。各データセットには、ユーザーの購入履歴と製品の一般的なレビューが含まれています。5 回未満表示されるアイテムは除外され、ユーザーの履歴は 1 週間の単位に分割されました。最初のデータセット バージョンには、アイテムが 1 つ以上含まれるすべてのセッションが含まれ、2 番目のバージョンには、アイテムが 5 つ以上含まれるすべてのセッションが含まれました。

プロジェクトでは、P@K (精度) と MRR@K (平均逆順位) を評価メトリックとして使用しました。対抗するアーキテクチャとしてテストされたものは、S-KNNGRU4RecS-POPSTAMPBERT4RecDHCNGCE-GNNSR-GNNNARM でした。

フレームワークは、Adam でバッチサイズ 100、学習率 0.001 でトレーニングされ、トピック数はそれぞれ ペット用品映画とテレビ に対して 24 と 20 に設定されました。

 

 

2022 年 2 月 1 日に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai