Andersonの視点
NLPが誤った質問に挑戦する方法

一部の質問は、誤った情報を含んでいるため、回答できないものがあります。これは、質問を聞く人がフィルタリングして却下する必要がある前提条件を含む場合です。当然、これは、質問自体を情報源として使用するのではなく、正しい情報を持っていることを前提としています。
NLPシステム、たとえばGPT-3は、情報を「hallucinate」して会話を維持する傾向があります。
現在、GPT-3に「マリーキュリーはいつウランを発見したか」と聞くと、「マリーキュリーは1898年にウランを発見した」という回答が返される可能性があります。

ソース:https://beta.openai.com/playground (Da Vinci instruct beta).
実際、ウランは1789年にドイツの化学者マーティン・ハインリヒ・クラプロートによって発見されました。キュリー夫妻の1898年の発見は、ラジウムの分離でした。
NLPシステムが誤った前提条件を無視する問題は、今年いくつかの宣伝活動で注目されてきました。たとえば、GoogleのAI支援検索結果は、質問「ニール・アームストロングはいつ火星に着陸したか」という誤った情報を無視します。この誤りは、現在でも表示されています。また、トイ・ストーリーのバズ・ライトイヤーも、1969年7月21日に月に着陸したと表示されています。
トム・ハンクスも、トイ・ストーリーの出演者であり、クレジットされています。彼は、1970年に月に着陸したとされています。しかし、彼のApollo 13の役、ジム・ラヴェルは、月に着陸しなかったことで最も有名です。

NLP交流における前提条件の問題に対処する
Google Researchとジョンズ・ホプキンス大学、ブラウン大学の研究者は、NLPシステムが事実的に誤った質問に挑戦できるようにするための新しい機械学習方法を調査しています。
最近の論文 Which Linguist Invented the Lightbulb? Presupposition Verification for Question-Answeringでは、前提条件を識別し、その真実性を検証するための新しいシステムを開発するための取り組みについて説明しています。
新しいアルゴリズムは、質問を事前に処理してから会話に戻り、質問の「認証」を3つのステップで分解します。

Does not compute! 左側は、質問が意味をなさない場合に発生する「ロードブロック」。右側は、提案されたアルゴリズムのブレークダウン。ソース:https://arxiv.org/pdf/2101.00391.pdf
これは、単純な検証ルーチンであるように思えるかもしれませんが、NLPシステムは、誤った前提条件を無視する傾向があります。
これは、誤った「ニュース」を社会的なメディアを通じて拡散させることで、機械学習の一般化の論理によって権威を与える可能性があるため、信頼できる事実の情報源をコンセンサスによって識別することが重要です。
質問に答えるための最良のアプローチを決定する
誤った情報を含む質問に答えるための適切なアプローチを決定するために、研究者は、100の質問を4つのQ&Aモデルで実行し、人間の被験者に最良または最も問題のない解決策を選択するよう求めました。
4つの可能なアーキテクチャの結果は、「答えられない」、「前提条件の失敗に基づく説明」、「抽出による説明」、「オープンドメインの書き換え」でした。

この、質問に答えることができないように見える質問の4つの可能な回答の例は、競争的なドメインベースの解決策の複雑さを示しています。
テストの結果、5人の参加者(Googleの内部クラウドソーシングプラットフォームで募集)は、前提条件に基づく回答を好みました。
新しいシステムでは、質問から言語的トリガーを取得して、事実の仮定的なステートメントに分解します。
データセット
初期段階で生成された前提条件は、検証データセットを作成するために手動で修正されました。
2人の著者は、462の前提条件を、はい/いいえの検証可能性に基づいて手動で注釈しました。
研究者は、ゼロショットNLIを使用しました。
結果と回答の生成
最も効果的な結果は、最も労力的な解決策によって得られました。

検証モデルのパフォーマンス。
このシステムでは、Wikipediaから事実を取得して、質問に答えることができないことを示すテンプレートシステムを開発しました。
影響
このアプローチは、将来的に、質問に答えるシステムがより柔軟で協調的なものになる可能性があります。
研究者は、将来的に、この研究を基にして、質問に答えるシステムを開発することを計画しています。
例えば、誰がエステラの母親であるとピップは信じているかは、非事実の動詞believeの下にある所有格を含みますが、私たちのジェネレーターは、「エステラ」が「母親」を持っていることを生成します。
システムは現在、テキストの意味的側面の解析に関する制限を持っています。
将来的に、私たちはこの研究を基にして、質問に答えるシステムを開発することを計画しています。例えば、ユニーク性の前提条件の違反は、すべての可能な回答を提供することでより適切に処理できます。












