Andersonの視点

単一の質問に対するGPTスタイルの言語モデルを作成する

mm
Unite.AI を Google の優先ソースに追加

中国の研究者は、GPT-3スタイルの自然言語処理システムを作成するための経済的な方法を開発しました。これは、巨大なデータセットを訓練するための時間と金銭の費用が増加し、FAANGプレーヤーや高レベル投資家のみがこの分野に参入できるようになるという問題を避けるために行われました。

提案されたフレームワークは、タスク駆動言語モデル (TLM) と呼ばれています。巨大なモデルを巨大なコーパスに訓練するのではなく、TLMはクエリをモデル内に組み込むことで、クエリに直接回答することができます。

左、典型的なハイパースケールアプローチによる高容量言語モデル;右、TLMのスリムライン方法による大規模言語コーパスのトピックごとの探索。ソース:https://arxiv.org/pdf/2111.04130.pdf

左、典型的なハイパースケールアプローチによる高容量言語モデル;右、TLMのスリムライン方法による大規模言語コーパスのトピックごとの探索。 ソース:https://arxiv.org/pdf/2111.04130.pdf

実質的に、単一の質問に答えるために、独自のNLPアルゴリズムまたはモデルが生成されます。幅広い質問に答えることができる巨大な汎用言語モデルを作成するのではなく、TLMはクエリに直接回答することができます。

TLMをテストした研究者は、新しいアプローチがPretrained Language Models (PLM) であるRoBERTa-LargeやOpenAIのGPT-3、GoogleのTRILLION Parameter Switch Transformerモデル、KoreaのHyperClover、AI21 LabsのJurassic 1、MicrosoftのMegatron-Turing NLG 530Bと比較して、同等または優れた結果を達成することができたと報告しています。

8つの分類データセットを使用したテストでは、TLMは訓練FLOPs(浮動小数点演算)を2桁削減し、訓練時間を大幅に短縮することができたと報告しています。研究者は、TLMがNLPモデルの訓練を「民主化」することができると考えています。NLPモデルのサイズが大きくなりすぎて、ローカルでインストールすることができなくなり、GPT-3の場合、OpenAIの高価でアクセスが制限されたAPIの後ろに隠れてしまうという問題に対処することができます。

著者は、訓練時間を2桁削減することで、1,000個のGPUを1日間使用する訓練コストを、8個のGPUを48時間使用するコストに削減することができたと述べています。

新しい報告書は、大規模事前訓練なしでスクラッチからNLP:シンプルで効率的なフレームワークと題されています。報告書は、北京の清華大学の3人の研究者と、中国のAI開発会社Recurrent AI、Inc.の研究者によって作成されています。

高価な回答

効果的な汎用言語モデルを訓練するコストは、NLPが文化に広く普及することを妨げる可能性のある「熱限界」として増加しています。

NLPモデルアーキテクチャの面の成長に関する統計、2020年のA121 Labsの報告書より。ソース:https://arxiv.org/pdf/2004.08900.pdf

NLPモデルアーキテクチャの面の成長に関する統計、2020年のA121 Labsの報告書より。 ソース:https://arxiv.org/pdf/2004.08900.pdf

2019年、研究者は、XLNetモデルを2.5日間で512コア、64デバイスで訓練するコストを61,440ドルと計算しました。一方、GPT-3の訓練コストは1,200万ドルと推定されています。これは、GPT-2の訓練コストの200倍です(ただし、最近の再評価では、最低価格のクラウドGPUで460万ドルのコストで訓練できる可能性があると推定されています)。

クエリニーズに基づくデータのサブセット

代わりに、新しい提案されたアーキテクチャは、クエリを大規模言語データベースからサブセットを定義するためのフィルタとして使用し、ラベル、分類、一般化を提供することを目指しています。

著者は次のように述べています:

‘TLMは2つの重要なアイデアによって動機づけられています。まず、人間はタスクをマスターするために、世界の知識の小さな部分のみを使用します(例えば、学生は試験のために、世界中の本のうちわずか数章のみを復習する必要があります)。’

‘私たちは、特定のタスクに対して、大規模コーパスに多くの冗長性があると仮定しています。2つ目は、教師ありラベル付きデータで訓練することは、言語モデリングの目的関数を未ラベル付きデータで最適化するよりも、ダウンストリームのパフォーマンスに対してはるかにデータ効率が高いということです。TLMはタスクデータをクエリとして使用して、一般コーパスから小さなサブセットを取得します。次に、取得したデータとタスクデータを使用して、教師ありタスク目的関数と言語モデリング目的関数を共同で最適化します。’

高性能NLPモデルの訓練をより安価にするだけでなく、著者はTLMを使用することの多くの利点を認識しています。例えば、研究者はシーケンス長、トークン化、ハイパーパラメータチューニング、データ表現に対してより柔軟性を持つことができます。

研究者は、PLMの限定的な事前訓練(現在の実装では予想されていない)と、より大きな柔軟性と一般化に対するトレードオフを取る将来のハイブリッドシステムの開発を予測しています。彼らは、このシステムを、ドメイン内ゼロショット一般化方法の進歩のために重要なステップであると考えています。

テストと結果

TLMは、4つのドメイン(生物医学、ニュース、レビュー、コンピューターサイエンス)における8つのタスクでテストされました。タスクは、高リソースタスク(5,000を超えるタスクデータ)と低リソースタスク(ChemProt、ACL-ARC、およびHyperPartisanニュース検出データセット)に分けられました。

研究者は、Corpus-BERTとCorpus-RoBERTaという2つの訓練セットを開発しました。後者は前者の10倍のサイズでした。実験では、一般的なPretrained Language ModelsであるBERT(Google )とRoBERTa(Facebook )を新しいアーキテクチャと比較しました。

論文では、TLMは一般方法であり、より広範で高容量の最先端モデルよりも範囲と適用性が制限されているはずですが、ドメイン適応ファインチューニング方法に近いパフォーマンスを達成することができたと述べています。

TLMとBERTおよびRoBERTaベースのセットのパフォーマンス比較の結果。結果は、3つの異なる訓練スケールの平均F1スコア、パラメータ数、合計訓練コンピュート(FLOPs)、訓練コーパスのサイズを示しています。

TLMとBERTおよびRoBERTaベースのセットのパフォーマンス比較の結果。結果は、3つの異なる訓練スケールの平均F1スコア、パラメータ数、合計訓練コンピュート(FLOPs)、訓練コーパスのサイズを示しています。

著者は、TLMがPLMと比較して同等または優れた結果を達成し、FLOPsの削減と訓練コーパスのサイズの削減(1/16)を実現したと結論付けています。中規模および大規模なスケールでは、TLMは平均して0.59および0.24ポイントのパフォーマンスの向上を実現し、訓練データのサイズを2桁削減しました。

‘これらの結果は、TLMがPLMよりも高精度で効率的であることを確認しています。さらに、TLMは大規模なスケールでより大きな効率の利点を得ることができます。これは、大規模PLMが特定のタスクに不要な一般知識を保存するために訓練された可能性があることを示唆しています。’

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai