Andersonの視点
GPT-3およびその他の複雑な言語モデルにおける「ホールユシネーション」の防止

「フェイクニュース」の特徴の一つは、虚偽の情報を事実的に正確な情報の文脈で提示し、虚偽のデータが文学的な浸透によって権威を得ることである。これは、半真半偽の力の不安定な示唆である。
高度な生成的な自然言語処理(NLP)モデルであるGPT-3も、このような欺瞞的なデータを「ホールユシネーション」する傾向がある。これは、言語モデルが長く複雑なテキストを再phraseし、要約する能力が必要であり、イベントや事実を保護するためのアーキテクチャ上の制約がないためである。
したがって、事実はNLPモデルにとって神聖なものではなく、特に複雑な文法や専門的な資料が言語構造から離散的なエンティティを区別することを困難にする場合、セマンティック・レゴ・ブロックとして扱われる可能性がある。

GPT-3のような複雑な言語モデルが混乱するように、うねうねと表現されたソース資料の観察。ソース:Paraphrase Generation Using Deep Reinforcement Learning
この問題は、テキストベースの機械学習からコンピュータビジョン研究にまで広がり、特にセマンティック・ディスクリミネーションを使用してオブジェクトを識別または記述する分野で顕現する。

ホールユシネーションと不正確な「コスメティック」再解釈は、コンピュータビジョン研究にも影響する。
GPT-3の場合、モデルはすでに回答したトピックについて繰り返し質問されると挫折することがある。最善のシナリオでは、モデルは敗北を認める。

GPT-3の基本的なDavinciエンジンを使用した私の最近の実験。モデルは最初の回答で正解するが、2回目に質問されると挫折する。モデルは前の回答の短期的な記憶を保持しており、繰り返しの質問を前の回答の拒否として扱うため、敗北を認める。ソース:https://www.scalr.ai/post/business-applications-for-gpt-3
DaVinciとDaVinci Instruct(ベータ)は、GPT-3の他のモデルよりもこの点で優れている。ここでは、Curieモデルは誤った回答を与え、Babbageモデルは自信を持って誤った回答を拡張する。

アインシュタインが言ったことのないこと
GPT-3のDaVinci Instructエンジン(現在最も能力の高いモデルである)にアインシュタインの有名な引用「神は宇宙をダイスで遊ぶ」という言葉を求めたところ、モデルは引用を発見できずに、存在しない引用を発明し、さらに3つの比較的妥当で完全に存在しない引用(アインシュタインまたは誰か他の人物による)を、類似の質問に対して生成する。

GPT-3は、4つの妥当なアインシュタインの引用を生成するが、インターネット検索では全く結果が得られない。ただし、いくつかの引用は「想像力」に関するアインシュタインの他の(実在する)引用をトリガーする。
もしGPT-3が一貫して引用を誤って生成していたら、そのホールユシネーションをプログラム的に無視することが容易になる。しかし、引用が広く知られていれば、GPT-3はそれを正しく生成する可能性が高くなる。

GPT-3は、引用が寄与データでよく表現されている場合、正しい引用を発見する。
2つ目の問題は、GPT-3のセッション履歴データが新しい質問に影響を与えることがある。

アインシュタインは、自分にこの言葉が帰属されることを恥ずかしいと思うだろう。この引用は、ウィンストン・チャーチルの実在のアフォリズムの妥当なホールユシネーションのようです。GPT-3の前のセッションの質問はチャーチル(アインシュタインではない)に関するものであり、モデルはそのセッション・トークンを使用して回答を生成したようです。
ホールユシネーションに対する経済的な対策
ホールユシネーションは、洗練されたNLPモデルを研究ツールとして採用する上での大きな障害である。特に、出力が形成されたソース資料から高度に抽象化されているため、引用や事実の真実性を確立することが困難になるからである。
したがって、NLPにおける現在の一般的な研究課題は、事実を離散的なエンティティとして定義し、認証する新しいNLPモデルを想像することなく、ホールユシネーションされたテキストを識別する方法を確立することである。
ホールユシネーションされたコンテンツの識別と生成
カーネギーメロン大学とFacebook AI Researchの新しい共同研究は、ホールユシネーション問題に対する新しいアプローチを提供する。ホールユシネーションされた出力を識別する方法を提案し、合成されたホールユシネーションされたテキストを使用して、将来のフィルタやメカニズムの基準となるデータセットを作成する。

ソース:https://arxiv.org/pdf/2011.02593.pdf
上の画像では、ソース資料が単語ごとにセグメント化されており、正しい単語には「0」ラベルが、ホールユシネーションされた単語には「1」ラベルが割り当てられている。以下に、入力情報に関連しているが、非認証のデータで増補されたホールユシネーションされた出力の例を示す。
システムは、ホールユシネーションされた文字列を、生成された汚れたバージョンのもとになった元のテキストにマッピングできる事前トレーニング済みのノイズ除去オートエンコーダを使用する。具体的には、FacebookのBARTオートエンコーダモデルを使用して汚れた文を生成する。

ラベル割り当て。
ホールユシネーションをソースにマッピングするプロセスは、一般的なNLPモデルでは不可能であるが、編集距離のマッピングを可能にし、ホールユシネーションされたコンテンツを識別するためのアルゴリズム的なアプローチを提供する。
研究者は、このシステムがトレーニング中に利用可能な参照資料にアクセスできない場合でも、概念モデルが健全で、広く再現可能であることを発見した。
オーバーフィッティングに対する対策
オーバーフィッティングを避け、広く展開可能なアーキテクチャに到達するために、研究者はトークンをランダムにドロップし、さらにパラフレーズ化やノイズ関数を使用した。
マシン翻訳(MT)もこのぼかしのプロセスの一部である。テキストを言語間で翻訳することは、意味を堅牢に保存する可能性が高く、オーバーフィッティングをさらに防ぐ。したがって、ホールユシネーションは、プロジェクトのために二言語話者によって手動で注釈付けされた層で翻訳され、識別された。
この取り組みは、標準的なセクターのテストで新しい最高の結果を達成し、10百万トークンを超えるデータで受け入れ可能な結果を達成した最初のものである。
このプロジェクトのコード、Detecting Hallucinated Content in Conditional Neural Sequence Generationは、GitHubで公開されており、ユーザーがBARTを使用して任意のテキスト・コーパスから合成データを生成できるようにし、ホールユシシネーション検出モデルを生成するための準備も整えている。












