Andersonの視点
AIがより良い製品の勧めを提供していない理由

あなたが珍しいものに興味がある場合、あなたのアイテムや製品の検索は、主流の仲間よりもあなたの興味に関係しない可能性が高い。理由は2つあります。1つは、あなたが金銭的購買力を上位カテゴリに持っている場合にのみ、利益を生み出す「エッジケース」であることです。例えば、「富の管理」に関連する製品やサービスです。もう1つは、使用している検索アルゴリズムがコラボレーティブフィルタリング(CF)を使用していることです。CFは、多数の利益を優先します。
コラボレーティブフィルタリングは、他のアルゴリズムやフレームワークよりも安価で確立されているため、両方のケースが当てはまる可能性があります。
CFベースの検索結果は、「あなたのような人」が認識しているアイテムを優先します。ホストフレームワークがあなたがどのような消費者であるかを理解できる限りです。
あなたがホストシステムにデータプロファイリング情報を提供することを躊躇する場合、たとえばNetflixなどのビデオコンテンツサービスで「いいね」ボタンを押さない場合、あなたは初期のシステムとのやり取りでかなり一般的に分類される可能性があり、受け取る勧めは最も人気のあるトレンドを反映します。
ストリーミングプラットフォームでは、現時点で「ホット」なショーと映画、たとえばリアリティTVや法医学のドキュメンタリーが勧められる可能性があります。あなたの興味に関係なく、同様に本の勧めプラットフォームも、現在および最近のベストセラーを提供する傾向があります。
理論的には、データを慎重に扱うユーザーでも、システムを使用する方法や検索するものに基づいて、最終的にはより良い結果が得られるはずです。ほとんどの検索フレームワークでは、ユーザーが使用履歴を編集する機能を提供しているからです。
好みの色はどれでもよい、ただし黒でなければならない
しかし、オーストリアの新しい研究によると、コンテンツベースのフィルタリング(コラボレーティブフィルタリングが多数の利益を優先するのではなく、製品間の関係を定義することを目指す)や他の代替アプローチよりも、コラボレーティブフィルタリングの優位性は、検索システムを長期的な人気バイアスに向かわせる傾向があります。明らかに人気のある結果が、熱心に支持する可能性の低いエンドユーザーに向けて推奨されるからです。
研究では、人気のないアイテムに興味のないユーザーは、人気のあるアイテムに中程度または高く興味があるユーザーよりも「著しく悪い」勧めを受けることがわかりました。また、人気のあるアイテムは、人気のないアイテムよりも頻繁に勧められることもわかりました。研究者はさらに、人気のあるアイテムにあまり興味のないユーザーは、より大きなユーザープロファイルを持っていることが多く、勧めシステムを改善する可能性があるが、システムが「群れ」の指標から脱却できない限りは、という結論に至りました。

人気とユーザープロファイルの複雑さを比較すると、主流コンテンツに興味のない「周辺」ユーザーは、実際には勧めシステムが利用できるより多くのコンテンツを持っていることがわかります。しかし、ユーザーがトレンドに従わない限り、勧めシステムはこの機会を逃しているようです。 ソース:https://arxiv.org/pdf/2203.00376.pdf
この研究は、コラボレーティブフィルタリングベースのマルチメディア勧めシステムにおける人気バイアスというタイトルで、オーストリアのnow-Center GmbHとグラーツ工科大学の研究者によって行われました。
対象ドメイン
個々のセクター(たとえば、書籍の勧め)を研究した以前の研究に基づいて、この新しい研究では、4つのドメインを調査しました。デジタルブック(BookCrossingデータセットを使用)、映画(MovieLensを使用)、音楽(Last.fmを使用)、アニメ(MyAnimeListを使用)です。
研究では、4つの人気のあるマルチメディア勧めシステムのコラボレーティブフィルタリングアルゴリズムを、分割されたデータセットに対して適用しました。データセットは、ユーザーが「人気」結果を受け入れる可能性に基づいて3つのユーザーグループに分割されました。LowPop、MedPop、HighPopです。ユーザーグループは、最も、平均的、そして最も「人気」結果を受け入れる可能性が高いユーザーに基づいて、1000個の同等のサイズのグループに絞り込まれました。
研究者は結果について次のように述べています。
「私たちは、メディアアイテムが勧められる可能性はその人気と強く相関していること、そして人気のないアイテムに興味のないユーザー(LowPop)は、人気のあるアイテムに中程度または高く興味があるユーザー(MedPopおよびHighPop)よりも「著しく悪い」メディアの勧めを受けることを発見しました…」
「私たちの結果は、人気のあるアイテムにあまり興味のないユーザーは、実際には勧めシステムを改善する可能性のあるより大きなユーザープロファイルを持っているにもかかわらず、最も低い勧めの精度を受け取っていることを示しています。したがって、将来的には、メディアの勧めシステムにおける人気バイアスを緩和するために、アイテムレベルとユーザーレベルでの研究が必要です。」
評価されたアルゴリズムの中には、K-Nearest Neighbors(KNN)の2つのバリアント、UserKNNとUserKNNAvgがありました。前者は、ターゲットユーザーとアイテムの平均評価を生成しません。また、非負の行列因子分解バリアント(NMF)もテストされました。さらに、CoClusteringアルゴリズムも使用されました。
評価プロトコルでは、勧めタスクを予測課題として扱い、平均絶対誤差(MAE)で測定しました。5倍交差検証プロトコルを使用し、通常の80/20のトレーニングとテストデータの分割を超えました。
結果は、コラボレーティブフィルタリングにおける人気バイアスのほぼ保証を示しています。疑問は、多国籍企業が現在CFを検索アルゴリズムに組み込んでいるので、人気バイアスが問題と認識されているかどうかです。
「簡単」な解決策
コラボレーティブフィルタリングは、より広範な検索アルゴリズム戦略の1つの柱として使用されることが増えていますが、検索部門では強い地位を占めています。さらに、その論理と潜在的な利益は、理解しやすいものです。
コラボレーティブフィルタリングは、コンテンツの価値を評価するタスクをエンドユーザーに委ね、コンテンツの価値と他の顧客にとっての魅力の指標として、コンテンツの使用状況を使用します。アナロジーとして、基本的に「水 cooler buzz」の地図です。
コンテンツベースのフィルタリング(CBF)はより難しいものですが、より関連性の高い結果を提供する可能性があります。コンピュータビジョンの分野では、現在、動画コンテンツを分類し、ドメイン、特徴、ハイレベルな概念を分析して、映画やテレビの出力からより賢い「隣接」な勧めを生成するために、多大な研究が行われています。

過去5年間で、映画のコンテンツからセマンティック特徴を導き出し、より賢い「隣接」な勧めを生成することを目指した多数の研究プロジェクトの1つ。 ソース:https://arxiv.org/pdf/1701.00199.pdf
しかし、これはまだ比較的新しい取り組みであり、現在の、より広範な、高レベルの概念や特徴をドメイン知識から抽出して利用するための闘争に結びついています。
誰がコラボレーティブフィルタリングを使用しているか
現在、Netflixの批判されている勧めエンジンは、さまざまな付随技術を適用しながら、コラボレーティブフィルタリングアプローチに依然として焦点を当てています。
Amazonの検索エンジンは、初期のユーザーベースのコラボレーティブフィルタリングの採用から、アイテム間のコラボレーティブフィルタリング方法に進化しました。これにより、顧客の購入履歴に重点が置かれます。当然、これにより、フィルターバブルや、希薄なデータへの過度な重視などの異なる種類の不正確さが生じる可能性があります。後者の場合、まれにAmazonを利用する顧客が「オペラ好きの友人」のためにオペラのセットを購入した場合、顧客自身の好みを反映する代替購入がない可能性があり、購入が勧めに影響を与える可能性があります。
コラボレーティブフィルタリングは、他のアプローチと組み合わせて、Facebookでも広く使用されています。さらに、LinkedIn、YouTube、Twitterでも使用されています。
最初に公開:2022年3月2日。













