Andersonの視点
NLPモデルは再帰的名詞句を理解するのに苦労する
米国と中国の研究者は、主要な自然言語処理(NLP)モデルが、再帰的名詞句(NPs)を含む英語の文をデフォルトで解釈することができないことを発見しました。また、私の好きな新しい映画や私の好きな映画などの密接に関連した例では、中心的な意味を区別するのに苦労しています(各例には異なる意味があります)。

論文の見出し例:子供たちが頻繁に解決できない小さなパズル。2番目のボールは緑ですが、5番目のボールは「2番目の緑のボール」です。出典:https://arxiv.org/pdf/2112.08326.pdf
研究者は、ローカルにインストールされたオープンソース言語生成モデルであるOpenAIのGPT-3*、GoogleのBERT、FacebookのRoBERTaとBARTに再帰的名詞句チャレンジ(RNPC)を設定し、これらの最先端モデルが「偶然」のパフォーマンスしか達成できなかったことを発見しました。彼らは次のように結論付けています:†:
結果は、標準的なベンチマークで事前トレーニングされた最先端の言語モデルが、すべて私たちのデータセットで苦労していることを示しています。これは、ターゲットとなる知識が容易に利用できないことを示唆しています。

最先端モデルがエラーを犯したRNPCチャレンジの最小ペアの例。
上記の例では、モデルは、死んだ危険な動物(例:死んだ捕食者で、脅威を与えない)と危険な死んだ動物(例:有害なウイルスを含む死んだリスで、現在の脅威となる)の間の意味の違いを区別することに失敗しました。
(さらに、論文では触れられていませんが、「死んだ」はしばしば副詞としても使用され、どちらの場合にも該当しません)
しかし、研究者は、RNPC資料を含む追加のトレーニングや補足的なトレーニングを行うことで、この問題を解決できることも発見しました:
事前トレーニングされた言語モデルは、NLUベンチマークで最先端のパフォーマンスを発揮していますが、この知識を十分に身につけていません。しかし、RNPCからの少量のデータに触れることで、それを学習することができます。
研究者は、言語モデルのこのタイプの再帰構造をナビゲートする能力は、言語分析、翻訳、有害性検出ルーチンなどのダウンストリームタスクに不可欠であると主張しています:
ユーザーがタスク指向のエージェント(SiriまたはAlexaなど)とやり取りし、エージェントがユーザーのクエリに含まれるアクティビティが潜在的に有害であるかどうかを判断する必要があるシナリオを考えてみましょう。私たちはこのタスクを選択しました。なぜなら、多くの誤陽性は再帰的名詞句から来ているからです。
例えば、自作爆弾を作る方法は明らかに有害ですが、自作バスボムを作る方法は無害です。
論文は、「私の好きな新しい映画は私の好きな映画ですか?再帰的名詞句の理解を調査する」というタイトルで、ペンシルベニア大学の5人の研究者と北京大学の1人の研究者によって書かれています。
データと方法
過去の研究では、再帰的名詞句の構文構造と修飾子の意味論的分類を研究していますが、研究者によると、これらのアプローチはこの課題に十分に対応できません。
したがって、研究者は2つの修飾子を持つ再帰的名詞句を使用して、最先端のNLPシステムに必要な知識が存在するかどうか、存在しない場合はそれを教えることができるかどうか、NLPシステムが再帰的名詞句から何を学び、どのようにしてダウンストリームアプリケーションに利益をもたらすかを調査しようとしました。
研究者が使用したデータセットは、4つの段階で作成されました。まず、689の例からなる修飾子レキソンを構築しました。これには、過去の文献と新しい研究からの例が含まれていました。
次に、文学、既存のコーパス、そして研究者の発明から再帰的名詞句を収集しました。テキストリソースには、ペン・ツリー・バンクとアノテーション・ギガワード・コーパスが含まれていました。
次に、事前に選別された大学生を雇用して、言語モデルが対処する3つのタスクの例を作成し、その後8,260の有効なインスタンスに検証しました。
最後に、アマゾン・メカニカル・タークを通じて事前に選別された大学生を再び雇用し、各インスタンスを人間の知能タスク(HIT)として注釈付けし、多数決で紛争を解決しました。これにより、インスタンスは4,567に絞り込まれ、さらに3,790のバランスの取れたインスタンスにフィルタリングされました。
研究者は、MNLI、SNLI、MPE、ADEPTなどの既存のデータセットを適応させて、テスト仮説の3つのセクションを公式化しました。HuggingFaceモデルを除き、すべての最先端モデルを自分でトレーニングしました。HuggingFaceモデルでは、チェックポイントを使用しました。
結果
研究者は、すべてのモデルがRNPCタスクで「苦労している」ことを発見しました。対照的に、人間は90%以上の精度を達成しました。最先端モデルは「偶然」のレベルでパフォーマンスしました(つまり、ランダムな偶然性に対する固有の能力の証拠はありませんでした)。
二次的な調査結果は、これらの欠陥を補うことができることを示しています。NLPモデルのパイプラインのトレーニングまたはファインチューニング段階で、再帰的名詞句の知識を特に含めることで、これらの欠陥を補うことができます。補足的なトレーニングが行われた後、モデルは外insic有害性検出タスクで「強力なゼロショット・パフォーマンス」を達成しました。
研究者は、この研究のコードをhttps://github.com/veronica320/Recursive-NPsで公開する予定です。
元の記事は2021年12月16日に公開され、2021年12月17日6:55 GMT+2に修正された:壊れたハイパーリンクを修正しました。
* GPT-3 Adaはシリーズの中で最も速いですが、最も優れています。ただし、大きな「ショーケース」Davinciモデルは、研究者の実験の後半で構成されるファインチューニングには利用できません。
† インライン引用をハイパーリンクに変換しました。













