AIモデルとプラットフォーム
最も強力なオープンソースLLM:Meta LLAMA 3.1-405B
Llama 3.1-405B、Meta AIによって開発されたこのモデルは、オープンソース言語モデルにおいて大きな飛躍を表しています。405億のパラメータを持ち、公開されている言語モデルの中で最大のものであり、ベンチマークの多くで最も高度な独自モデルを上回り、または並んでいます。
主要機能:
- 405億のパラメータ
- 128Kトークンのコンテキスト長
- マルチリンガル対応(8言語)
- インストラクションチューニング版あり
- オープンソースで、パーミッシブライセンス
このような強力なモデルのオープンソース化は、最先端のAI機能へのアクセスを民主化し、業界全体の革新を促進する画期的な出来事です。
モデルアーキテクチャとトレーニング
このプロセスは、入力テキストトークンをトークン埋め込みに変換することから始まります。これらの埋め込みは、自己注意とフィードフォワードネットワークの複数の層を通過し、モデルはテキスト内の複雑な関係と依存関係を捉えることができます。自動再帰デコーディングメカニズムは、出力テキストトークンを生成し、プロセスを完了します。

-
グループ化クエリ注意(GQA)
Llama 3.1は、グループ化クエリ注意を使用しています。これは、長いシーケンスの際の計算コストとメモリ使用量を削減することを目的とした、マルチヘッド注意のバリエーションです。Llama 3.1 405Bモデルでは、GQAは8つのキーバリューヘッドで実装されています。
ここで、GQAのしくみを詳しく見てみましょう:
- 各注意ヘッドに個別のキーとバリュープロジェクションを持たずに、複数のクエリヘッドを同じキーとバリューヘッドでグループ化します。
- このグループ化により、キーとバリュープロジェクションのパラメータ数が大幅に削減され、モデルサイズが小さくなり、推論が速くなります。
- 注意計算は、次のように表すことができます:
Attention(Q, K, V) = softmax(QK^T / sqrt(d_k))Vここで、Qはgグループにグループ化され、KとVはQよりも少ないヘッド数を持ちます。
Llama 3.1 405BにおけるGQAの利点は次のとおりです:
- メモリフットプリントの削減:キーとバリュープロジェクションが少ないため、モデルパラメータを格納するために必要なメモリが少なくなります。
- 推論の高速化:キーとバリュープロジェクションの計算が少ないため、推論が速くなります。
- パフォーマンスの維持:パラメータの削減にもかかわらず、GQAは多くのタスクで標準のマルチヘッド注意と同等のパフォーマンスを維持することが示されています。
-
2段階の事前トレーニングによるコンテキストの拡張
この記事では、128Kトークンのコンテキストウィンドウを達成するために、2段階の事前トレーニングプロセスについて触れています。これは、Llama 3.1 405Bの能力の重要な側面です:
ステージ1:8Kトークンの初期事前トレーニング
- モデルは最初に、最大8Kトークンのシーケンスでトレーニングされます。
- このステージでは、モデルは一般的な言語理解と生成能力を学習します。
ステージ2:コンテキスト拡張のための継続的な事前トレーニング
- 初期トレーニングの後、モデルはコンテキスト長を128Kトークンに拡張するために、継続的な事前トレーニングを受けます。
- このステージでは、モデルは短いコンテキストを処理する能力を失うことなく、長いシーケンスを一般化するために、慎重に設計されたトレーニングレジームを受けます。
-
マルチモーダル機能
以前の回答では、マルチモーダル機能について触れましたが、ここではLlama 3.1 405Bがこれをどのように実現しているかについて詳しく見てみましょう:
構成アプローチ:
- Llama 3.1 405Bは、さまざまなモーダリティ(例:画像、音声)に対して個別のエンコーダを使用します。
- これらのエンコーダは、さまざまなモーダリティからの入力を、言語モデルが理解できる共有埋め込み空間に変換します。
言語モデルとの統合:
- これらの専用エンコーダからの出力は、メインの言語モデルにフィードされます。
- これにより、Llama 3.1 405Bは、さまざまなタイプのデータを同時に処理して理解することができ、複数のモーダリティを含むタスクを実行することができます。
クロス注意メカニズム:
- さまざまなモーダリティを統合するために、Llama 3.1 405Bはクロス注意メカニズムを使用する可能性があります。
- これらのメカニズムにより、モデルは、テキストを生成したり他のタスクを実行したりする際に、さまざまなモーダリティからの関連情報に注意を払うことができます。
Llama 3.1 405Bのマルチモーダル機能は、次のような幅広いアプリケーションを可能にします:
- 画像キャプションと視覚質問回答
- 音声テキスト転写とコンテキスト理解
- テキスト、画像、その他のデータタイプを組み合わせたマルチモーダル推論タスク
トレーニング詳細
- 15兆トークン以上でトレーニング
- カスタムビルドのGPUクラスタで、405Bモデル用に39.3M GPU時間
- マルチリンガル対応のための多様なデータセットキュレーション
インストラクションチューニング版は、追加のトレーニングを受けました:
- 公開されているインストラクションデータセットでファインチューニング
- 2500万以上の合成生成例
- 監督ファインチューニング(SFT)と人間のフィードバックを使用した強化学習(RLHF)
パフォーマンスベンチマーク
Llama 3.1 405B、Nemotron 4 340B Instruct、GPT-4 (0125)、GPT-4 Omni、Claude 3.5 Sonnetを比較します。主要なベンチマークには、MMLUやIFEvalなどの一般タスク、HumanEvalやGSM8Kなどのコードタスク、ARC Challengeなどの推論タスクがあります。各ベンチマークスコアは、モデルが人間のようなテキストを理解して生成する能力、複雑な問題を解決する能力、コードを実行する能力を反映しています。特に、Llama 3.1 405BとClaude 3.5 Sonnetは、一般タスクとドメイン特化タスクの両方で優れたパフォーマンスを示しています。
将来の方向性
Llama 3.1-405Bのリリースは、以下の分野で革新を加速する可能性があります:
- 特化ドメインのファインチューニング技術の改善
- より効率的な推論方法の開発
- モデル圧縮とディスティレーションの進歩
結論
Llama 3.1-405Bは、オープンソースAIにおける重要な里程標であり、従来はクローズドソースモデルにしかなかった能力を提供しています。
このモデルの使用を進めるにつれて、責任を持って倫理的に使用することが重要です。モデルの提供とともに提供されるツールやガイドラインは、責任ある展開のフレームワークを提供しますが、継続的な注意とコミュニティの協力が、この強力なテクノロジーが社会の利益になるようにするための鍵となります。














