AIモデルとプラットフォーム

ディープ強化学習を用いたパラフレーズ生成 – Thought Leaders

mm
Unite.AI を Google の優先ソースに追加

文章を書いたり話したりする際には、他の人にアイデアを伝えるためのより良い方法はないかと考えることがあります。どのような言葉を使用すればよいのでしょうか。どのように構造化すればよいのでしょうか。どのように受け取られるのでしょうか。 Phrasee では、言語について多くの時間を費やしています。何が機能し、 何が機能しないのかを考えています。

10 million 人のリストに送信される電子メールキャンペーンの件名行を書いているとします。新しいラップトップに 20% オフの割引を提供しています。

どちらの行を選択しますか:

  • あなたの次の注文でさらに 20% オフ
  • 準備してください – 追加の 20% オフ

両方の行は同じ情報を伝えていますが、1 つの行はほとんど 15% 高いオープン率を達成しました (そして、私のモデルはどちらの行が優れているかを予測することができます)。言語は、A/B テスト または マルチアームドバンディット を通じてテストされることがよくありますが、パラフレーズを自動的に生成することは依然として非常に難しい研究課題です。

2 つの文が互いのパラフレーズであるとみなされるのは、それらが同じ意味を共有し、交換可能である場合です。機械生成された文が流暢であるかどうかというのは、他の人によって常に前提とされる別の重要な事実です。

教師あり学習とは異なり、強化学習 (RL) エージェントは環境とやり取りし、結果として受け取る報酬を観察することで学習します。このニュアンスのある違いは、アルゴリズムの動作とモデルのトレーニング方法に大きな影響を与えます。 ディープ強化学習 では、エージェントが複雑な環境 (例: 囲碁、Atari、StarCraft II ) で人間を上回る方法を学ぶために、関数近似としてニューラルネットワークを使用します。

この成功にもかかわらず、強化学習は自然言語処理 (NLP) を含む現実世界の問題には広く適用されていません。

私のデータサイエンスの修士論文 の一環として、ディープ RL を使用して教師あり学習方法を上回る入力テキストのパラフレーズを自動的に生成する方法を実証します。パラフレーズを生成する問題は、文の間の意味の類似性を最大化しながら出力の流暢性を維持する単語の系列を見つけることとして見ることができます。 RL エージェントは、制御環境で最大の期待報酬を達成するための最適な行動セットを見つけるのに適しています。

機械学習のほとんどの問題とは異なり、自然言語生成 (NLG) アプリケーションの最大の問題は、モデル化ではなく評価にあります。人間の評価は現在、NLG 評価の金標準と見なされていますが、費用がかかり、時間がかかり、調整が難しく、実験やデータセット間で再現性が不足しているという重大な欠点があります (Han、2016)。その結果、研究者は、人間の判断を反映し、シンプルで一般化可能な自動メトリックを長い間探しています (Papineni et al.、2002)

機械生成画像キャプションを評価するための最も一般的な自動評価方法は、以下にその長所と短所とともにまとめられています。

強化学習を使用したパラフレーズ生成パイプライン

高品質のパラフレーズを生成するシステム、ParaPhrasee を開発しました。このシステムは、計算効率的に強化学習を適用するために複数のステップで構成されています。高レベル パイプラインの簡単な概要は以下に示されていますが、詳細については 修士論文 を参照してください。

データセット

研究に使用されるいくつかのパラフレーズ データセットがあります。例として、Microsoft Paraphrase コーパス (MSFT ) 、ACL の意味的テキスト類似性コンペティション、Quora の重複質問、および Twitter 共有リンク などがあります。私たちは、サイズ、クリーンさ、2 つの注目すべきパラフレーズ生成論文のベンチマークとしての使用性に基づいて、MS-COCO を選択しました。MS-COCO には、120k の一般的なシーンの画像と、5 つの画像キャプションが 5 人の人間アノテーターによって提供されています。

主にコンピュータビジョン研究用に設計されていますが、キャプションは高い意味的類似性を持ち、興味深いパラフレーズです。画像キャプションは異なる人によって提供されるため、生成された文はシーンの詳細を妄想する傾向があります。

教師ありモデル

強化学習はサンプル効率、トレーニング時間、全体的なベストプラクティスに関して大幅に改善されてきましたが、教師ありモデルからスクラッチで RL モデルをトレーニングすることは依然として比較的非常に遅く、不安定です (Arulkumaran et al., 2017)。したがって、スクラッチからトレーニングするのではなく、まず教師ありモデルをトレーニングし、次にそれを RL でファインチューニングします。

エンコーダー-デコーダー モデル フレームワークを使用し、複数の教師ありモデルを評価します。RL を使用してモデルをファインチューニングするときは、デコーダー ネットワークのみをファインチューニングし、エンコーダー ネットワークを静的として扱います。したがって、2 つの主要なフレームワークを検討します。

  • 標準/バニラ エンコーダー デコーダーを使用して教師ありモデルをスクラッチからトレーニングする
  • エンコーダーとして事前トレーニング済みの文埋め込みモデルを使用する: GloVe、InferSent、BERT など

教師ありモデルは、BERT とバニラ エンコーダー デコーダーが最も優れたパフォーマンスを達成することを示しています。

パフォーマンスは一般的に妥当ですが、3 つの一般的なエラー源があります。スタッタリング、文断片の生成、妄想です。これらは、RL を使用することで解決しようとしている主な問題です。

強化学習モデル

RL アルゴリズムを実装することは非常に困難です。特に、問題が解決可能かどうか不明な場合にそうです。環境、エージェント、ハイパーパラメータ、報酬関数、またはすべての組み合わせに問題がある可能性があります。これらの問題は、ニューラルネットワークのデバッグの複雑さが追加されるディープ RL を実行する場合に悪化します。

すべてのデバッグと同様に、シンプルに始めることが重要です。私たちは、CartPole と FrozenLake という 2 つのよく理解されたトイ RL 環境のバリエーションを実装して、RL アルゴリズムをテストし、教師ありモデルから知識を転送するための反復可能な戦略を見つけました。

アクター クリティック アルゴリズムがこれらの環境で REINFORCE を上回ることを発見しました。教師ありモデルからアクター クリティック モデルへの知識の転送については、アクターの重みをトレーニング済みの教師ありモデルで初期化し、クリティックを事前トレーニングすることが最も優れたパフォーマンスを達成することを発見しました。私たちは、複雑なポリシーの転送アプローチを新しい環境に一般化することが難しいことを発見しました。なぜなら、それらは調整するために多くの新しいハイパーパラメータを導入するからです。

これらの洞察に基づいて、私たちはパラフレーズ生成タスクのアプローチを開発することにしました。まず、環境を作成する必要があります。

環境により、さまざまな評価メトリックを報酬関数として使用する影響を簡単にテストできます。

次に、エージェントを定義します。多くの利点があるため、アクター クリティック アーキテクチャを使用します。アクターは、シーケンスの次の単語を選択するために使用され、トレーニング済みの教師ありモデルで初期化されます。クリティックは、アクターが学習するために状態が受け取ることが予想される期待される報酬の見積もりを提供します。

正しい報酬関数の設計

RL システムを設計する最も重要なコンポーネントは報酬関数です。これが RL エージェントが最適化しようとしているものです。報酬関数が間違っている場合、結果は苦しむことになります。システムの他の部分が機能していてもです。

クラシックな例は CoastRunners です。ここでは、OpenAI の研究者が報酬関数をレースを勝つことではなく、合計スコアを最大化することに設定しました。結果として、エージェントは、レースを完了することなくターボを使用して最高スコアを取得できるループを発見しました。

https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title

パラフレーズの品質を評価することは、自体が未解決の問題です。自動的にこの目的を捉える報酬関数を設計することは、さらに困難です。大多数の言語の側面は、線形メトリックにすんなり分解できず、タスク依存です (Novikova et al., 2017)

RL エージェントは、評価メトリックの弱点を利用するのではなく、高品質のテキストを生成するのではなく、報酬を最大化するための興味深い戦略を発見することがあります。これにより、エージェントが直接最適化していないメトリックではパフォーマンスが低下することになります。

私たちは、主に 3 つのアプローチを検討します。

  1. 単語オーバーラップメトリック

一般的な NLP 評価メトリックは、生成されたパラフレーズと評価文の間の単語の重複の割合を考慮します。重複が大きいほど報酬が大きくなります。単語レベルのアプローチの課題は、エージェントが「a は of の」などの接続詞を多く含むことであり、流暢性の尺度がないことです。これにより、非常に低品質のパラフレーズが生成されます。

  1. 文レベルの類似性と流暢性メトリック

生成されたパラフレーズの主な特性は、入力文と意味的に類似しており、流暢である必要があることです。したがって、個別にこれらをスコアリングし、次にメトリックを組み合わせようとします。意味的類似性については、事前トレーニング済みモデルの間の文埋め込みのコサイン類似性を使用します (例: BERT)。流暢性については、GPT-2 からの文の困惑度に基づくスコアを使用します。コサイン類似性と流暢性のスコアが大きいほど、報酬が大きくなります。

私たちは、さまざまな文埋め込みモデルの組み合わせと流暢性モデルの組み合わせを試しましたが、パフォーマンスは妥当でした。エージェントが直面した主な問題は、意味的類似性と流暢性のバランスをとることができなかったことです。大多数の構成では、エージェントは流暢性を優先し、詳細を削除し、ほとんどのエンティティを「何かの中央」または「テーブルの上」または「道路の側」に配置しました。

多目的強化学習は、開かれた研究課題であり、この場合非常に困難です。

  1. 報酬関数としてアドバーサリアル モデルを使用する

人間は評価の金標準と見なされるため、2 つの文がパラフレーズであるかどうかを予測する別のモデル (ディスクリミネーター) をトレーニングします。RL モデルの目標は、このモデルを騙して、生成された文が入力文のパラフレーズであると信じさせることです。ディスクリミネーターは、2 つの文がパラフレーズである可能性のスコアを生成し、これを RL モデルをトレーニングするために使用される報酬として使用します。

ディスクリミネーターは、5,000 の推測ごとに、データセットからどのパラフレーズが来て、どれが生成されたかを教えられ、将来の推測を改善することができます。プロセスは、エージェントがディスクリミネーターを欺こうとし、ディスクリミネーターが生成されたパラフレーズとデータセットの評価パラフレーズを区別しようとする、複数のラウンドで続きます。

複数のトレーニング ラウンドの後、エージェントは教師ありモデルと他の報酬関数を上回るパラフレーズを生成します。

結論と制限事項

対抗的なアプローチ (ゲームのセルフプレイを含む) は、明示的な報酬関数を定義せずに、特定のタスクで人間のパフォーマンスを超える RL アルゴリズムをトレーニングするための非常に有望なアプローチを提供します。

RL はこの場合教師あり学習を上回りましたが、コード、計算、複雑さの点で追加のオーバーヘッドは、ほとんどのアプリケーションではパフォーマンスの向上に値しないです。RL は、教師あり学習が簡単に適用できない場合や、報酬関数が簡単に定義できる場合 (例: Atari ゲーム) に最も適しています。アプローチとアルゴリズムは、教師あり学習でさらに成熟しており、エラーシグナルははるかに強いため、トレーニングははるかに速く、安定しています。

別の考慮事項は、他のニューラル アプローチと同様に、エージェントが前に見た入力と異なる入力で大幅に失敗する可能性があることです。これには、プロダクション アプリケーションでは、追加のセキュリティ チェックが必要です。

RL アプローチと計算インフラストラクチャの進歩に対する関心の爆発により、NLP を含む業界で RL を適用するための大きな機会が解放されます。

Andrew Gibbs-Bravoは、Phraseeの世界をリードするAI-Powered Copywritingの背後にある技術を改善することに焦点を当てたデータサイエンティストです。彼はまた、London Reinforcement Learning Community Meetupの共同オーガナイザーであり、RL、NLP、機械学習のすべてに興味があります。