AIモデルとプラットフォーム

メタのLlama 3:大規模言語モデルにおける大幅な進歩

mm
Unite.AI を Google の優先ソースに追加

生成的なAIの分野では、メタはオープンソースの提供に尽力し、先進的な大規模言語モデルMeta AI(Llama)シリーズを開発者や研究者に世界中で提供しています。メタは最近、Llamaシリーズの3回目のバージョン、Llama 3を発表しました。この新しいバージョンは、Llama 2を大幅に上回り、業界の競合他社であるGoogle、Mistral、Anthropicに挑戦する基準を設定しています。この記事では、Llama 3の重要な進歩とLlama 2との比較について説明します。

メタのLlamaシリーズ:独占的からオープンアクセスと高性能へ

メタは2022年にLlamaシリーズを開始し、Llama 1を発表しました。これは、非商用利用に限定され、選ばれた研究機関のみがアクセスできるモデルでした。2023年、Llama 2のロールアウトに伴い、メタAIは研究と商業目的の両方でモデルを無料で提供するようになりました。この動きは、先進的な生成的なAI技術へのアクセスを民主化し、スタートアップや小規模な研究チームがアプリケーションを開発する際の高額なコストを軽減することを目的としていました。メタはLlama 3を発表し、業界のベンチマークを上回るパフォーマンスを提供することを目指しています。

Llama 3の紹介

Llama 3は、メタのオープンソース大規模言語モデルの2世代目です。8Bと70Bのパラメータを持つ、事前トレーニング済みと指示によるファインチューニング済みのモデルを提供します。Llama 3は、デコーダーのみトランスフォーマーアーキテクチャを使用し、自己教師あり学習を続けています。Llama 3は、Llama 2の7倍のサイズのデータセットでトレーニングされており、15兆以上のトークンを含む新しくキュレーションされたオンラインデータから構成されています。このデータセットは、24,000のGPUを搭載した2つのクラスタで処理されています。トレーニングデータの質を維持するために、データ中心のAI技術が使用されています。Llama 3 Instructモデルは、10万以上の人間が注釈したデータサンプルを組み込んでおり、教師ありファインチューニング近接ポリシーオプティマイゼーション直接ポリシーオプティマイゼーションなどの高度なトレーニング方法を使用しています。

Llama 3 vs. Llama 2:主要な強化

Llama 3は、Llama 2と比較していくつかの重要な強化を提供します。

  • 語彙の拡張: Llama 3の語彙は128,256トークンに増えており、Llama 2の32,000トークンから大幅に増加しています。この強化により、入力と出力の両方でより効率的なテキストエンコードが可能になり、多言語対応能力が向上しています。
  • コンテキスト長の拡張: Llama 3モデルは8,000トークンのコンテキスト長を提供し、Llama 2の4,090トークンを大幅に上回ります。この増加により、ユーザーのプロンプトとモデルの応答の両方を含む、より広範なコンテンツを処理できます。
  • トレーニングデータの強化: Llama 3のトレーニングデータセットは、Llama 2の7倍のサイズで、4倍以上のコードを含みます。30以上の言語で構成される、高品質の非英語データを5%以上含み、多言語アプリケーションのサポートに不可欠です。このデータは、データ中心のAI技術を使用して厳格にフィルタリングされています。
  • 指示によるファインチューニングと評価の強化: Llama 3は、Llama 2と比較して、教師ありファインチューニング近接ポリシーオプティマイゼーション直接ポリシーオプティマイゼーションなどの高度な指示によるファインチューニング技術を使用しています。また、1,800のプロンプトで構成される新しい高品質の人間評価セットを導入し、モデルの能力の包括的な評価とファインチューニングを可能にしました。
  • 高度なAIセーフティ: Llama 3は、Llama 2と同様に、指示によるファインチューニングや徹底的なレッドチームテストなどの厳格なセーフティ対策を組み込んでいます。さらに、Llama 3の8BバージョンにファインチューニングされたLlama Guard 2を導入し、LLMの入力と出力を分類して潜在的に安全でないコンテンツを特定し、生産環境での使用に適しています。

Llama 3の提供状況

Llama 3モデルは、Hugging Faceエコシステムに統合されており、開発者にとってアクセスが容易になりました。また、Perplexity LabsFireworks.aiなどのモデルとしてサービスを提供するプラットフォームや、AWS SageMakerAzure MLVertex AIなどのクラウドプラットフォームで利用可能です。メタは、Llama 3をGoogle Cloud、Kaggle、IBM WatsonX、NVIDIA NIM、Snowflakeなどのプラットフォームで提供する予定です。また、AMD、AWS、Dell、Intel (INTC ) 、NVIDIA、Qualcommなどのハードウェアプラットフォームでもサポートを拡大する予定です。

今後のLlama 3の強化

メタは、現在のLlama 3のリリースが、より包括的なビジョンの一部であることを明らかにしました。400億パラメータ以上のモデルを開発中で、新しい機能を追加し、多モーダリティと複数言語のサポートを提供する予定です。この強化されたバージョンでは、コンテキストウィンドウが大幅に拡大し、全体的なパフォーマンス能力が向上します。

まとめ

メタのLlama 3は、大規模言語モデルの分野で重要な進歩を遂げ、オープンソースの提供とパフォーマンスの強化を両立させています。トレーニングデータセットが7倍に増加し、語彙の拡張やコンテキスト長の増加などの機能を備え、Llama 3は業界の強力な競合他社に挑戦する基準を設定しています。

Llama 3は、AI技術の民主化を進め、高度な機能をより広範な開発者に提供するだけでなく、セーフティとトレーニングの精度の面でも重要な進歩を遂げています。Hugging Faceや主要なクラウドサービスへの統合により、メタはLlama 3を普及させると同時に、強力なモデルであることを保証しています。

将来的に、メタはさらに強力な機能を開発中で、多モーダリティや言語サポートの拡大を提供する予定です。これにより、Llama 3は、業界の主要なAIモデルと競合し、さらには上回る可能性があります。Llama 3は、メタがAI革命を牽引し、世界中のユーザーにアクセスしやすく、さらに高度で安全なツールを提供するというコミットメントを示しています。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。