AIモデルとプラットフォーム

MPT-30B:MosaicML、GPT-3を超える新しいLLMでNLPの境界を拡大

mm
Unite.AI を Google の優先ソースに追加

MosaicMLは、ジェネレーティブAI会社で、AIの展開とスケーラビリティのソリューションを提供しています。彼らの最新の大規模言語モデル(LLM)MPT-30Bは、AIコミュニティで波紋を起こしています。

MosaicMLのLLMの旅は、2023年5月にMPT-7B(Mosaic Pretrained Transformer)をリリースしたことで始まりました。これには3つのバリアントが含まれていました:

  1. MPT-7B-StoryWriter-65k+(長文の物語生成用)
  2. MPT-7B-Instruct(短文の指示の実行用)
  3. MPT-7B-Chat(会話生成用)

これらのモデルは、オープンソースであること、商用利用可能であること、拡張コンテキストウィンドウを処理する際の優れた能力により、MLコミュニティで大きな成功を収めました。

特に重要なのは、これらのモデルは、LLaMA-7BやStableLM 7Bなどの他の比較可能なモデルと同等か、それを上回るパフォーマンスを示したことです。2023年6月までに、MPT-7Bシリーズは300万回以上ダウンロードされました。2023年6月22日、MosaicMLはMPT-30Bをリリースし、オープンソースの基礎モデルにとっての基準をさらに高めました。

MPT-30B:GPT-3を超える強力なLLM

MPT-30Bは、GPT-3-175Bよりも強力なオープンソースおよび商用ライセンスのデコーダーベースのLLMです。GPT-3のパラメーターの17%、つまり30Bで、GPT-3を上回るパフォーマンスを示しています。MPT-30BとGPT-3の比較は以下のとおりです。

MPT-30Bは、以前のMPT-7Bモデルを基にしています。同等のサイズのモデルと比較して、計算効率が高いことが特徴です。例えば、LLaMA-30BはMPT-30Bよりも約1.44倍のFLOPs予算を使用しました。一方、Falcon-40BはMPT-30Bよりも約1.27倍のFLOPs予算を使用しました。以下は、MPT-30Bの前身モデルとの比較です。

MPT-30Bの特徴は以下のとおりです:

8kトークンコンテキストウィンドウ

LLMのコンテキストウィンドウは、モデルが出力生成前に考慮できるトークンの範囲を指します。MPT-30Bのトレーニング時のコンテキストウィンドウは8000トークンでした。最初に、1トークンの2kトークンシーケンスでトレーニングされ、さらに50Bトークンの8kトークンシーケンス(約6000語)でトレーニングされました。

ALiBiサポート

この機能を説明するために、質問を考えてみましょう。

MPT-30Bは、トレーニング時に使用したシーケンスよりも長いシーケンスを理解し、予測することができますか?

MPT-30Bは、ALiBi(Attention with Linear Biases)テクニックを使用して、長いシーケンスを理解し、8kトークンを超えるコンテキストウィンドウを拡張します。

代わりに、シーケンス内の各単語にベクトルを割り当てるポジショナルエンベディングを計算するのではなく、ALiBiはキーとクエリートークン間のアテンションスコアを計算します。キーとクエリートークンが近い場合、ペナルティは低くなります。結果として、基礎となるトランスフォーマーアーキテクチャは、長い入力シーケンスを外挿することができます。

FlashAttentionによる効率的な推論とトレーニングパフォーマンス

アテンション、つまり入力シーケンスの関連する部分に焦点を当てることは、トランスフォーマーの重要なコンポーネントですが、特に長いテキストシーケンスを処理する際には遅く、メモリを大量に消費する可能性があります。

FlashAttentionは、コーネル大学の研究者によって提案されたMPT-30Bの問題に対処するアプローチです。タイル化というテクニックを使用して、モデルがメモリから読み取りまたは書き込む必要がある回数を削減し、処理を高速化します。したがって、モデルは最先端のFlashAttentionテクニックとNVIDIAのFasterTransformer最適化ライブラリを使用して、効率的なトレーニングと推論を実現します。

トレーニングとデプロイの容易さ

開発者は、MPT-30Bをスクラッチからトレーニングしたり、MosaicMLのチェックポイントを使用してより迅速にデプロイしたりできます。また、特定のデータセットに対してドメイン固有のユースケースにファインチューニングすることもできます。

モデルのサイズは、1xA100-80GBの16ビット精度または1xA100-40GBの8ビット精度で、単一のGPU上でのデプロイを容易にするように選択されました。これは、モデルのサイズがこれらのGPUのメモリ制限内に収まるように設計されたことを意味します。

コーディング能力

MPT-30Bは、優れたコーディング能力も提供します。 HumanEvalは、OpenAIによって公開された、164の手作りのプログラミング問題を含むデータセットです。HumanEvalデータセットでは、MPT-30Bは、StarCoderシリーズなどの目的のLLMモデルを上回ります。

ファインチューンされたバリアント:MPT-30B-InstructとMPT-30B-Chat

MPT-30B-Instruct

LLMは主に、質問回答、テキスト要約、言語翻訳などの指示に使用されます。MPT-30B-Instructは、指示の実行タスクに特化してファインチューニングされた、商用利用可能な(CC-By-SA-3.0ライセンスを保持)MPT-30Bのバリアントです。ファインチューニングには、以下のデータセットが使用されました:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Dollyデータセットは、指示のファインチューニングのために、AnthropicのHelpful and Harmlessデータセットで拡張されました。また、以下のデータセットを使用して、データを拡張しました:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chatは、会話生成用にファインチューニングされたMPT-30Bのバージョンです。これは、CC-By-NC-SA-4.0ライセンスの下でリリースされた研究成果で、非商用利用のみを許可しています。モデルは、以下の言語データセットを使用してファインチューニングされました:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

LLMは、数十億ドル規模のジェネレーティブAI市場の重要な部分を占めています。この市場は、ChatGPTが昨年ランドスケープを革命的に変えた後、短期間で急成長しています。MPTファミリーは、この革命の基礎的な部分です。近い将来、MPTファミリーよりもさらに強力で効率的なオープンソースモデルが商用利用可能になることが予想されます。

最新のAIニュースについては、unite.aiを訪問してください。

Haziqaは、AIおよびSaaS企業向けの技術コンテンツの作成における豊富な経験を持つデータサイエンティストです。