Andersonの視点
アリババ、リアルタイムデータを使用する検索エンジンシミュレーションAIを開発

アリババは、中国の学術研究者と共同で、リアルタイムのデータを使用する検索エンジンシミュレーションAIを開発しました。このAIは、電子商取引の巨大企業であるアリババのライブインフラストラクチャからのリアルワールドデータを使用して、新しいランキングモデルを開発しています。これらのモデルは、歴史的なまたは古い情報によって制限されません。
このエンジンは、AESimと呼ばれています。AESimは、AIシステムがリアルタイムのデータを評価し、取り込む必要性を認める、1週間以内に2回目の大きな発表となります。1回目の発表は、Facebookからでした。Facebookは、先週、BlenderBot 2.0を発表しました。BlenderBot 2.0は、ユーザーのクエリに応じてインターネット検索結果をリアルタイムでポーリングするNLPインターフェースです。
AESimプロジェクトの目的は、商用情報検索システムにおける新しいLearning-To-Rank(LTR)ソリューション、アルゴリズム、モデルを開発するための実験環境を提供することです。フレームワークをテストした結果、オンラインパフォーマンスを有用で実用的パラメータ内で正確に反映していることがわかりました。
論文の著者である、南京大学とアリババの研究部門の代表者は、LTRシミュレーションに対する新しいアプローチが必要だったと主張しています。理由は2つあります。1つは、最近のディープラーニングの類似の取り組みが、再現可能な技術を作成することに失敗したことです。もう1つは、システムの初期のトレーニングデータと新しいデータのパフォーマンスの移転性が不足していることです。
ライブへの移行
論文によると、AESimは、ライブユーザーとアクティビティのデータに基づく最初の電子商取引シミュレーションプラットフォームであり、ライブデータを単独で使用してオンラインパフォーマンスを正確に反映できるということです。AESimは、後の研究者がLTR方法論と革新を評価するためのブルースカイトレーニングプレイグラウンドを提供します。
モデルは、産業用検索エンジンの典型的なスキーマに新しいアプローチを取り入れています。最初のステージは、ユーザーのクエリに関連するアイテムの取得であり、ユーザーに提示されるのではなく、重み付けLTRモデルによってソートされます。次に、ソートされた結果は、会社が結果を提供する目的を考慮するフィルタを通過します。目標には、広告や多様性の要因が含まれる場合があります。
AESimのアーキテクチャ
AESimでは、クエリはカテゴリインデックスに置き換えられ、システムはカテゴリインデックスからアイテムを取得し、カスタマイズ可能な再ランキングアルゴリズムに渡して最終的なリストを生成します。フレームワークは、複数のモデルを横断するランキングの影響を研究することを可能にしますが、この側面は今後の作業として残されています。現在の実装では、単一のモデルに基づいて理想的な評価を自動的に探します。

AESimは、仮想ユーザーとそのクエリをカプセル化する埋め込み(機械学習アーキテクチャ内の仮想的な表現)を作成し、Wasserstein Generative Adversarial Network with Gradient Penalty(WGAN-GP)アプローチを使用します。
アーキテクチャは、カテゴリ別に並べられた数百万のアイテムのデータベース、カスタマイズ可能なランキングシステム、フィードバックモジュール、およびGANベースのコンポーネントによって生成された合成データセットで構成されています。フィードバックモジュールは、ワークフローの最後のステージであり、最新のランキングモデルのパフォーマンスを評価することができます。
生成的対抗的模倣学習
「仮想ユーザーモジュール」の意思決定ロジックをモデル化するために、フィードバックモジュール(最終的な結果を提供する)は、生成的対抗的模倣学習(GAIL)でトレーニングされます。GAILは、スタンフォード大学の研究者によって2016年に最初に提案された理論です。GAILは、データから直接ポリシーを開発することができる、モデルフリーのパラダイムです。
トレーニングセットは、以前の監督学習モデルと同様の静的歴史データセットと本質的に同じです。AESimの違いは、静的データセットに依存してフィードバックを得るのではなく、トレーニングデータがコンパイルされたときに生成されたアイテムの順序に制限されることなく、ライブネットワークからのデータを使用することです。
AESimの生成的な側面は、WGAN-GPを使用して仮想ユーザーを作成することに中心があります。WGAN-GPは、「偽」のユーザーとクエリの特性を出力し、次にこれらの偽のデータをライブネットワークから提供される本物のユーザーデータと区別しようとします。
テスト
研究者は、ペアワイズ、ポイントワイズ、ListMLEのインスタンスをシステムに展開してAESimをテストしました。各インスタンスは、リランキングアルゴリズムのコンテキストで、ランダムな検索クエリの非交差スライスを提供する必要がありました。
この時点で、AESimは、Facebookの新しい言語モデルと同様に、急速に変化する多様なライブデータによって課題に直面しています。したがって、結果は全体的なパフォーマンスの観点から検討されています。
10日間テストされたAESimは、3つのモデルを横断して驚くほどの一貫性を示しました。ただし、研究者は、ドキュメントコンテキスト言語モデル(DLCM)モジュールの追加テストがオフライン環境では悪く機能したが、ライブ環境では非常に良く機能したと指摘しています。システムは、構成とテスト中のモデルに応じて、ライブカウンターパートとギャップを示すことになるでしょう。













