Andersonの視点

期限切れの「真実」を機械学習で下げる

mm
Unite.AI を Google の優先ソースに追加

時々、真実には期限切れがある。検索エンジンのランキングで、時間限定の主張(例:「公共の交通機関ではマスクの着用が義務付けられている」)が現れると、そのような主張は、検索エンジンアルゴリズムが「長期的な」決定的な解決策を特定し、推進しようとすること、および、時間の経過とともにトラフィックを維持することの好みの結果として、その主張は、後から出てきたより正確なコンテンツよりも優先される可能性がある。

これは、検索エンジンアルゴリズムが「長期的な」決定的な解決策を特定し、推進しようとすること、および、時間の経過とともにトラフィックを維持することの好みの結果として生じるものである。また、検索エンジンアルゴリズムは、新しいコンテンツに対して、フェイクニュースの時代に、ますます慎重な態度を取る傾向にある。

一方で、コンテンツのタイムスタンプが任意の「有効期限」ウィンドウを過ぎたという理由だけで、有用なウェブコンテンツの価値を下げることは、実際には有用なコンテンツの世代が、より低い標準の後続の資料に自動的に下げられることを意味する。

この症候群を是正するために、イタリア、ベルギー、デンマークの研究者による新しい論文では、さまざまな機械学習技術を使用して、時間に応じた証拠ランキングの方法論を開発した。

古い答えを超えて

この論文は、ヨーロッパ委員会のイプラにあるジョイント・リサーチ・センター(JRC)、ルーベン・カトリック大学、コペンハーゲン大学の研究者によって執筆された。

この研究では、3つのファクトチェック手法にわたる4つの時間ランキング方法を検討し、証拠のタイムスタンプを「金標準」として使用する新しいランキング方法論を提供する。研究によると、時間に応じた証拠ランキングは、結果の洞察力と、時間に敏感な事実や主張の権威と真実性の予測を向上させる。

この研究は、後続のシステムや既存のシステムの補助として提供され、研究を支援し、新しい検索エンジンアルゴリズムの開発における潜在的な要素として設計されている。

この研究では、コンテンツベースのファクトチェックのための証拠の時間的ダイナミクスをモデル化し、典型的な検索エンジンランキングアルゴリズムで採用されている「意味的類似性」アプローチを上回る。研究者によってトレーニングされたモデルは、最適化されたランキング学習関数を使用し、既存のファクトチェックアーキテクチャに簡単に重ねることができる。研究者は、このシステムが自動ファクトチェックへの新しい貢献であると主張する。

複数のファクトチェックアーキテクチャの修正

研究者は、3つの既存のファクトチェックアーキテクチャに時間制約要素を課した。最初のアーキテクチャは、2019年にリリースされたMultiFCデータセットで提案された、双方向ロングショートタームメモリ(BiLSTM)モデルである。

2番目のアーキテクチャは、最初のアーキテクチャの修正版で、LSTMコンポーネントを置き換えるために、単方向の再帰型ニューラルネットワーク(RNN)を使用する。

研究者が使用した3番目のモデルは、DistilBERTトランスフォーマーで、Hugging FacesライブラリからGoogleのBERT NLPモデルの蒸留版である。

3つのアーキテクチャすべてで、研究者は、過去2十年間で新しいファクトチェック研究に貢献してきたマイクロソフト主導の研究によるListMLEロスを適用した。

研究チームが権限とランキング値のフィルタとして時間コンポーネントを追加した2つの主要なファクトチェックモデル。ソース:https://arxiv.org/pdf/2009.06402.pdf

研究チームが権限とランキング値のフィルタとして時間コンポーネントを追加した2つの主要なファクトチェックモデル。ソース:https://arxiv.org/pdf/2009.06402.pdf

トレーニングメタデータからタイムスタンプ値を抽出し、各モデルでランキング要因として含めた。

テスト

システムの実験的評価には、MultiFCデータセットの使用が含まれた。これは、現在、この特定の研究関心のための唯一のオープンソースの高容量データセットである。MultiFCには、Snopesやワシントン・ポストを含む26の異なるファクトチェックドメインから得られた34,924のリアルワールドの主張が含まれる。

各主張の真実性の予測は、Google Search APIによって提供される10の証拠スニペットによって補強され、スピーカー、タグ、カテゴリなどの要素の融合によって得られる。

関連するタイムスタンプは、必ずしもメタデータに含まれているものではなく、記事は過去のイベントを参照する場合があり、その場合、研究者のシステムはテキストから直接そのデータを抽出して変換する必要があった。そうでない場合、古いニュースの「再実行」は、新しい光彩を与える傾向があり、特に権限の高いサイトの場合、古いデータを広める。

日付はPythonルーチンで抽出され、公式のメタデータ日付はフォーマットの一貫性をテストした(例:米国と英国は日付の書式設定が異なる)。手動で検証すると、タイムスタンプメタデータにエラーは見つからなかった。

結果

研究者は、自動結果の手動チェックに対して、時間に応じた証拠ランキングが、純粋な意味的類似性またはSERPsランキングに基づく関連性の仮定を著しく改善することを発見した。彼らはまた、時間に敏感な主張(例:ニュース状況が急速に変化し、最新の情報を優先することが重要な状況)に対する真実性の予測が改善されることを確認する。

研究者は、このアプローチが、政治やエンターテインメントなどの変動するトピックのランキングモデルを改善することには大きな価値があると指摘する。情報は急速に変化し、ランキングのトップスポットに達した開発には、自動的に降格するためのフレームワークが必要である。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai