AIモデルとプラットフォーム

GLM-130B: オープンな二言語事前学習モデル

mm
Unite.AI を Google の優先ソースに追加

GLM-130Bフレームワークは、130億パラメータ以上を備えた二言語事前学習大規模言語モデルであり、英語と中国語の両方でテキスト出力を生成することができます。GLM-130Bフレームワークは、100億パラメータ以上の言語モデルをオープンソース化し、どのようにしてそのような大規模なフレームワークを事前学習できるかを議論するための試みです。現在、100億パラメータ以上のモデルを学習することは、しばしば発散や損失スパイクなどの問題で困難です。

この記事では、GLM-130Bフレームワークについて説明します。GLM-130Bフレームワークは、100億パラメータ以上の大規模言語モデルを効率的に事前学習する方法を提案します。GLM-130Bフレームワークのアーキテクチャと学習プロセスについて詳細に説明します。初期の実験では、GLM-130Bフレームワークが英語のベンチマークでGPT-3フレームワークを大幅に上回る結果が得られました。GLM-130Bフレームワークの詳細について説明します。

GLM-130Bフレームワークの紹介

100億パラメータ以上の言語モデルは、ゼロショットとファインショットの両方で動作する可能性があります。GPT-3フレームワークは、100億パラメータ以上のモデルの中で最も優れたパフォーマンスを示しています。しかし、GPT-3フレームワークの学習プロセスとその内部構造は、一般に公開されていません。さらに、100億パラメータ以上のモデルを学習するためのすべての可能な設計を実験することは、計算上実行可能ではありません。したがって、大規模言語モデルフレームワークの事前学習方法を開発することが重要です。

上記の点は、GPT-3などの高品質の大規模言語モデルフレームワークの動作と学習プロセスを共有することが、非常に重要であることを示しています。GLM-130Bフレームワークは、100億パラメータ以上のオープンソース言語モデルを事前学習するための試みです。GLM-130B開発チームは、大規模言語モデルフレームワークを事前学習する際に、事前学習の安定性、効率、収束性に関する多くのエンジニアリングと技術的な課題に直面することを発見しました。

GLM-130Bは、130億パラメータ以上の双方向密なフレームワークであり、400億トークン以上のクラスタで約2ヶ月間学習されました。さらに、GPTスタイルのアーキテクチャではなく、GLM-130BフレームワークはGLM(General Language Model)アルゴリズムを使用し、自己回帰的な空白埋めの目的を利用します。以下の表は、GLM-130Bフレームワークを他の100億パラメータ以上のモデルと比較しています。

GLM-130Bフレームワークのエンジニアリングと開発概念は、GPT-3やPaLM 540Bなどのほとんどの大規模言語モデルフレームワークを上回ります。以下の図は、GLM-130Bフレームワークと100億パラメータ以上のモデルのパフォーマンスを比較しています。

最後に、GLM-130Bフレームワークは、100億パラメータ以上のフレームワークを研究する開発者が多くいることを可能にするように設計されています。GLM-130Bフレームワークは、2つの方法でこれを実現します。まず、BLOOMやOPTのように175億パラメータ以上を使用するのではなく、130億パラメータを使用します。2つ目は、GLM-130Bフレームワークを実行するためのGPU要件が他のLLMフレームワークよりも低いことです。GLM-130BフレームワークはINT4精度への量子化を使用してパフォーマンスを向上させ、パフォーマンスの低下を最小限に抑えています。

GLM-130B: アーキテクチャ

機械学習モデルの誘導バイアスは、そのアーキテクチャによって記述されます。開発者が、大規模言語モデルのさまざまなアーキテクチャ設計を探索できないことは、計算上の実行可能性と実行可能性のためです。GLM-130Bのアーキテクチャを見てみましょう。

PaLM、GPTなどの大規模言語モデルフレームワークは、100億パラメータ以上のGPTスタイルのデコーダーのみのアーキテクチャで構築されています。一方、GLM-130Bフレームワークは、自己回帰的な空白埋めの目的を利用する双方向のGeneral Language Model(GLM)を使用します。簡単に説明すると、GLMフレームワークは、与えられたテキストシーケンスからテキストスパンをサンプリングし、それを単一のマスクトークンで置き換えます。

GLMの双方向の注意は、GLM-130BフレームワークをGPTスタイルのアプローチから区別するものです。さらに、GLMフレームワークは、データの生成と理解をサポートするために、2つの汚染戦略を組み合わせており、それぞれが特殊で一意のマスクトークンで示されます。

  • [MASK] : [MASK]は、文の短い空白を使用する汚染戦略であり、その長さは入力の一定の割合に加算され、ポアソン分布に従います。
  • [gMASK] : [gMASK]は、文の末尾にランダムな長さの空白を使用する汚染戦略であり、prefixコンテキストを使用します。

GLMフレームワークのアプローチは、GLM-130BフレームワークがゼロショットLAMBADA言語モデリングで80%以上の精度スコアを記録し、PaLM 540BとGPT-3フレームワークを上回ることを可能にします。

レイヤー正規化

大規模言語モデルを学習する際の主要な課題の1つは、学習の不安定性です。適切なレイヤー正規化(LN)を使用することで、この問題を緩和することができます。GLM-130Bフレームワークは、ダウンストリームタスクでのパフォーマンスのため、Post-LNアプローチを使用します。

FFNと位置エンコーディング

GLM-130Bフレームワークは、フィードフォワードニューラルネットワーク(FFN)と位置エンコーディングを使用して、ダウンストリームパフォーマンスと学習の安定性を高めます。

事前学習の設定

GLM-130Bフレームワークの事前学習目的は、多タスク学習と自己回帰的な空白埋めの両方を含みます。GLM-130Bフレームワークは、ダウンストリームタスクで優れたパフォーマンスを発揮することを目指しています。GLM-130Bフレームワークの事前学習設定は以下のとおりです。

自己回帰的な空白埋め

すでに述べたように、GLM-130Bフレームワークは、2つの汚染戦略、[MASK]と[gMASK]を使用します。1つの戦略は、個々のトレーニングシーケンスごとに独立して適用されます。空白を埋めるために、[MASK]戦略は、トレーニングシーケンスの30%で連続するスパンをマスクし、スパンの長さは入力の15%に加算され、ポアソン分布に従います。シーケンスの残りの70%については、各シーケンスのprefixはコンテキストとして保持され、[gMASK]戦略は残りをマスクし、ユニフォーム分布を使用してマスクされた長さをサンプリングします。

多タスクインストラクション事前学習

多タスク学習アプローチを使用してモデルを事前学習することは、ゼロショット設定でのタスク転送を改善するために役立ちます。GLM-130Bフレームワークは、事前学習中に言語生成、理解、情報抽出などの指示付きデータセットの配列を使用することを提案します。

GLM-130Bフレームワークが使用する多タスクインストラクション事前学習アプローチは、他のゼロショットタスク転送アプローチと比較して、トークンの合計5%しか占めません。さらに、GLM-130Bフレームワークは、事前学習中にこのアプローチを設定することで、LLMフレームワークの他の能力を損なうことを防ぎます。

3Dパラレル戦略

大規模モデルを学習するための2つの実践は、テンソルモデル並列性とデータ並列性です。GLM-130Bフレームワークは、パイプラインモデル並列性戦略とテンソルモデル並列性およびデータ並列性戦略を組み合わせた3Dパラレル戦略を実装します。

GLM-130B: 学習の安定性

学習の安定性は、LLMの品質を決定する重要な要素です。学習の安定性は、パスするトークンの数によって大きく影響されます。さらに、浮動小数点形式の制約を考慮して、安定性と効率の間のトレードオフを確立することが重要です。たとえば、低精度浮動小数点形式は計算効率を向上させますが、オーバーフローとアンダーフローエラーに敏感であるため、学習の崩壊につながる可能性があります。

混合精度

GLM-130Bフレームワークは、学習の精度を向上させてメモリ使用量を削減するために、混合精度を使用します。BLOOM-176BやOPT-175Bなどの他のLLMフレームワークと同様に、GLM-130Bフレームワークの混合精度戦略を使用した学習では、頻繁に損失スパイクが発生し、モデルが学習を続けるにつれて損失スパイクの頻度が増加します。

まず、Pre-LNを使用する場合、トランスフォーマーのメインブランチの値のスケールは、より深い層で非常に大きくなる可能性があります。GLM-130Bフレームワークでは、DeepNormベースのPre-LNを使用して、値のスケールが常にバウンドされていることを保証します。2つ目は、モデルがスケールアップするにつれて、注意スコアがFP16の範囲を超えるまでに増加します。

埋め込み層の勾配収縮またはEGS

GLM-130Bフレームワークの開発者は、勾配ノルムが学習の崩壊の指標となることを発見しました。学習の崩壊は、勾配ノルムのスパイクに続くことが多いです。勾配ノルムのスパイクの原因は、埋め込み層の異常な勾配です。開発者は、埋め込み層の勾配ノルムが、他の層の勾配ノルムよりも何桁も大きく、学習の初期段階で劇的に変動することも観察しました。ビジョンモデルもこの問題に直面していますが、パッチ投影層を凍結することで対処できます。しかし、言語モデルでは、投影層を凍結することはできません。

GLM-130B: 結果とパフォーマンス

GLM-130Bの英語タスクのパフォーマンスを評価するために、PaLMやGPT-3などの一般的なLLMフレームワークと同じ設定を使用します。GLM-130Bは二言語フレームワークであるため、複数の中国語ベンチマークでも評価されます。GLM-130Bのパフォーマンスは、言語モデリング、MMLU(Massive Multitask Language Understanding)、BIG-Bench(Beyond the Imitation Game Benchmark)、CLUE(Chinese Language Understanding Evaluation)などのベンチマークで評価されます。

言語モデリング

GLM-130Bの言語モデリングベンチマークテストは、LAMBADAとPileの2つのデータセットで実行されます。

LAMBADAデータセットは、LLMの最後の単語モデリング能力をテストするために使用されます。GLM-130Bフレームワークは、双方向設定で80.2のゼロショット精度スコアを達成し、LAMBADAデータセットの新しいベンチマークレコードを樹立します。

一方、Pileは、言語モデルのシリーズのベンチマークテストセットです。平均して、GPT-3やJurassic-1と比較して、GLM-130Bフレームワークは、18の共通テストセットで重み付きBPBsの点で最も優れたパフォーマンスを発揮します。結果は、GLM-130Bフレームワークの強力な言語能力を示しています。

MMLUまたはMassive Multitask Language Understanding

MMLUまたはMassive Multitask Language Understandingは、人工知能と知識に関する50以上の多選択質問回答タスクを含む多様なベンチマークです。Pileテストセットのクロール後にリリースされ、ゼロショット学習能力の評価に適したテストベストとして機能します。

5ショット設定で、GLM-130Bフレームワークのパフォーマンスは、GPT-3モデルのパフォーマンスに近づきます。学習が進むにつれて、パフォーマンスはさらに向上し、400Bトークンを学習した後、44.8の精度スコアを達成します。

BIG-BenchまたはBeyond the Imitation Game Benchmark

BIG-BenchまたはBeyond the Imitation Game Benchmarkは、モデルの知識、推論、常識の能力をテストする課題です。ゼロショット設定で、GLM-130Bフレームワークは、PaLM 540BとGPT-3 175Bフレームワークを上回ります。これは、MIPと双方向コンテキスト注意によってGLM-130Bのパフォーマンスが向上するためです。さらに、ショット数が増加すると、GLM-130Bフレームワークのパフォーマンスも向上し、GPT-3フレームワークを一貫して上回ります。

CLUEまたはChinese Language Understanding Evaluation

GLM-130Bの中国語ゼロショットパフォーマンスは、CLUEとFewCLUEなどの既存のNLPベンチマークタスクで評価され、260B ERNIE Titan 3.0と比較されます。GLM-130Bフレームワークは、12つの異なるタスクで一貫して260B ERNIE Titan 3.0フレームワークを上回り、2つの抽象的なMRCデータセットで約260%のパフォーマンスを発揮します。

結論

この記事では、GLM-130Bについて説明しました。GLM-130Bは、100億パラメータ以上のオープンソースLLMフレームワークであり、LLM研究を促進することを目的としています。GLM-130Bのアーキテクチャ、エンジニアリング、技術的取り組みは、LLMフレームワークのアーキテクチャ、学習効率、安定性、事前学習目的、費用対効果について、AIコミュニティにより深い理解を提供することを目的としています。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。