Andersonの視点

AIベースの生成書き込みモデルは頻繁にソースデータを「コピー・アンド・ペースト」する

mm
Unite.AI を Google の優先ソースに追加

アメリカの劇作家、起業家であるウィルソン・ミズナーは、よく「1人の著者から盗むのは盗作だが、多くの著者から盗むのは研究である」という言葉で引用される。

同様に、新世代のAIベースの創造的書き込みシステムについての仮定は、訓練段階で大量のデータが与えられた結果、ハイレベルな概念やアイデアの真正な抽象化が得られたというものである。つまり、これらのシステムは数千の著者から集めた知恵を活用して、革新的なオリジナルの書き込みを生成できるというものである。また、こうしたシステムを使用する場合、間接的な盗作に陥っていないことが保証されるというものである。

しかし、この仮定は、大量のデータを訓練段階で与えた結果、機械学習の生成言語モデル(GPTシリーズなど)が「長い文章をそのままコピーする」ことがあることを示した新しい研究論文によって挑戦されている。この論文は、FacebookとMicrosoftのAI研究部門を含む研究コンソーシアムによって作成されたものである。

特に、GPT-2は訓練データセットから1000語を超える文章をそのままコピーすることがあると指摘されている。

この論文のタイトルは、How much do language models copy from their training data? Evaluating linguistic novelty in text generation using RAVENであり、Johns Hopkins University、Microsoft Research、New York University、Facebook AI Researchの共同研究である。

RAVEN

この研究では、RAVEN(RAtingVErbalNovelty)と呼ばれる新しいアプローチが使用されている。RAVENは、エドガー・アラン・ポーの「不思議の国のアリス」に登場するカラスに因んで命名されたものである。

「このアクロニムは、エドガー・アラン・ポーの「不思議の国のアリス」に登場するカラスに因んで命名されたものである。カラスは「Nevermore」と繰り返し叫ぶが、カラスが人間の言葉を単に繰り返しているのか、自分で言葉を作っているのか(たとえば「never」と「more」を組み合わせて「nevermore」という言葉を作っているのか)がわからない。同様の曖昧さが私たちの論文で扱っている問題である。」

この研究の結果は、AIによるコンテンツ生成システムが「単純な」編集タスクを置き換え、さらにはフルレングスのコンテンツを生成することを目指している状況において重要な意味を持つ。

研究者は、「GPT-2は訓練データセットから1000語を超える文章をそのままコピーすることがある」(強調は研究者のもの)と指摘し、生成言語システムはソースデータの言語的エラーを拡散させることも示唆している。

この研究では、GPTシリーズ(GPT-3は除く)、Transformer、Transformer-XL、LSTMなどの言語モデルが調査された。

Novelty

この論文では、GPT-2は新しい言葉を生成する能力があることも示唆されている。たとえば、「Swissified」「IKEA-ness」などの言葉が生成された。これらの言葉はGPT-2の訓練データセットには存在しないが、言語的原則に基づいて生成されたものである。

結果は、Transformer-XLによって生成された文章の74%が、訓練データセットには存在しない構文を持っていることを示唆している。研究者は、「ニューラル言語モデルは単に記憶するのではなく、既知の部分を新しい方法で組み合わせることができる」と述べている。

したがって、一般化と抽象化によって、革新的なテキストが生成されるべきである。

Data Duplication May Be the Problem

この論文では、自然言語生成(NLG)システムによって生成された長い引用文が、データセットに複数回存在することによって、AIモデルに「焼き付け」される可能性があると示唆されている。

別の研究プロジェクトでは、完全なテキストの複製が、ソーステキストがデータセットに1回だけ存在する場合でも発生する可能性があると示唆されている。しかし、このプロジェクトは、一般的なコンテンツ生成AIシステムとは異なる概念アーキテクチャを持っている。

研究者は、言語生成システムのデコーディングコンポーネントを変更することで、独創性を高めることができる可能性があるが、テストでは、品質の低下が見られたと報告している。

さらに、データセットが大きくなるにつれて、問題が増大する。データの前処理や品質保証のコストや実行可能性の問題だけでなく、基本的なエラーが多く存在するため、AIによって生成されたコンテンツにもエラーが伝播する可能性がある。

研究者は、「最近の訓練データセットのサイズの増加により、自然に発生することが期待されるものについての直感を破壊する可能性があるため、独創性を確認することが特に重要である」と述べている。

「たとえば、言語習得に関するある研究では、不規則な動詞の正しい過去形(たとえば、becomed、teached)が、学習者の経験の中に存在しないと仮定している。しかし、実際には、GPT-2の訓練データセットには、92の基本的な不規則な動詞すべての誤った正しい過去形が存在している。」

More Data Curation Needed

この論文では、生成言語システムの構築において、独創性に重点を置く必要があると主張している。特に、テストデータセット(訓練データの主な部分を評価するために使用されるデータの部分)がタスクに適していることを確認する必要がある。

「機械学習では、モデルをテストデータセットで評価することが重要である。テキスト生成の場合は、モデルが生成したテキストが訓練データセットからコピーされた場合、テストデータセットではなくなり、モデルを評価するために使用することはできない。」

研究者は、さらに、Eliza効果により、言語モデルの生成するテキストが、人間が読むべきよりも多くの意味を読み取られる可能性があるため、言語モデルの生成においても注意が必要であると述べている。

* この論文のインライン引用をハイパーリンクに変換したもの

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]