AIモデルとプラットフォーム

Google、Gemma 2を発表:開発者向けのAIパフォーマンス、スピード、そしてアクセシビリティの向上

mm
Unite.AI を Google の優先ソースに追加

Googleは、Gemma 2を発表しました。これは、9億(9B)と27億(27B)パラメータサイズで利用可能な、最新のオープンソース軽量言語モデルのバージョンです。この新しいバージョンは、前身のGemmaモデルよりもパフォーマンスと推論速度が向上していることを約束しています。Gemma 2は、GoogleのGeminiモデルから派生したもので、研究者や開発者にとってよりアクセスしやすいように設計されています。Geminiモデルとは異なり、Gemma 2は言語処理にのみ焦点を当てています。この記事では、Gemma 2の特徴と進歩について説明し、前身モデルや競合モデルと比較し、用途や課題について説明します。

Gemma 2の構築

Gemma 2モデルは、デコーダーのみのトランスフォーマーアーキテクチャに基づいています。27Bバリアントは、主に英語のトークン13兆個でトレーニングされています。一方、9Bモデルは8兆トークンでトレーニングされており、2.6Bモデルは2兆トークンでトレーニングされています。これらのトークンは、Webドキュメント、コード、科学記事など、さまざまなソースから来ています。モデルは、Gemma 1とGeminiと同じトークナイザーを使用し、データ処理の一貫性を保っています。
Gemma 2は、ナレッジディスティレーションという方法で事前トレーニングされています。ここで、大規模な事前トレーニング済みモデルの出力確率から学習します。初期トレーニング後、モデルは教師ありファインチューニング(SFT)を通じてファインチューニングされます。これは、合成および人間が生成した英語テキストのみのプロンプトとレスポンスのペアで開始されます。その後、人間のフィードバックからの強化学習(RLHF)が適用され、全体的なパフォーマンスが向上します。

Gemma 2:多様なハードウェアでのパフォーマンスと効率の向上

Gemma 2は、Gemma 1よりもパフォーマンスが向上しているだけでなく、2倍のサイズのモデルと競合できるように設計されています。さまざまなハードウェア設定、ラップトップ、デスクトップ、IoTデバイス、モバイルプラットフォームで効率的に動作するように設計されています。特に、単一のGPUとTPUに最適化されており、Gemma 2は前身モデルよりも効率が向上しています。たとえば、27Bモデルは、NVIDIA H100 Tensor Core GPU (NVDA ) またはTPUホストで推論を実行することに優れています。これにより、開発者はハードウェアへの大量投資を行わずに、高パフォーマンスを実現できます。
さらに、Gemma 2は、開発者が幅広いプラットフォームやツールでファインチューニングを行うことを可能にします。Google (GOOGL ) Cloudなどのクラウドベースのソリューションや、Axolotlなどの人気プラットフォームを使用する場合、Gemma 2は幅広いファインチューニングオプションを提供します。Hugging FaceNVIDIA TensorRT-LLMGoogleのJAXおよびKerasとの統合により、研究者や開発者は、さまざまなハードウェア構成で最適なパフォーマンスと効率的な展開を実現できます。

Gemma 2 vs. Llama 3 70B

Gemma 2とLlama 3 70Bを比較すると、両者はオープンソース言語モデルのカテゴリで優れています。Googleの研究者は、Gemma 2 27Bがサイズがはるかに小さいにもかかわらず、Llama 3 70Bと同等のパフォーマンスを発揮することを主張しています。さらに、Gemma 2 9Bは、言語理解、コーディング、数学の問題の解決などのさまざまなベンチマークで、Llama 3 8Bを一貫して上回っています。
Gemma 2がLlama 3よりも優れている主な点は、インド語の処理方法です。Gemma 2は、インド語を特にサポートするように設計されたトークナイザーを使用し、256kトークンの大きな語彙を備え、言語のニュアンスを捉えることができます。一方、Llama 3は、さまざまな言語をサポートしていますが、インド語のトークナイゼーションに苦労しています。語彙とトレーニングデータが限られているためです。これにより、Gemma 2は、インド語を含むタスクで優れています。これにより、開発者や研究者にとって、インド語を含む言語で作業するための優れた選択肢となります。

用途

Gemma 2モデルの特性とパフォーマンスに基づいて、以下の実用的な用途を特定しました。

  • マルチリンガルアシスタント: Gemma 2のトークナイザーは、さまざまな言語、特にインド語をサポートするように設計されています。これにより、インド語を含む言語のユーザー向けにカスタマイズされたマルチリンガルアシスタントを開発するための効果的なツールとなります。ヒンディー語で情報を検索したり、ウルドゥー語で教育用資料を作成したり、アラビア語でマーケティングコンテンツを作成したり、ベンガル語で研究記事を作成したりできます。Gemma 2は、言語生成ツールを提供し、開発者が地域の聴衆に効果的にコミュニケーションをとることができます。実際の例としては、Navarasaがあります。これは、Gemmaに基づくマルチリンガルアシスタントで、9つのインド語をサポートしています。開発者は、地域の聴衆に共感し、言語のニュアンスに従うコンテンツを作成できます。
  • 教育ツール: Gemma 2は、数学の問題を解決し、複雑な言語の質問を理解する能力があるため、個別化された学習体験を提供するインテリジェントチュートリアルシステムや教育アプリを作成するために使用できます。
  • コーディングとコードアシスタンス: Gemma 2のコーディングベンチマークでのパフォーマンスは、コード生成、バグ検出、自動コードレビューの強力なツールであることを示しています。リソースに制約のあるデバイスで動作する能力により、開発者は開発環境にシームレスに統合できます。
  • Retrieval Augmented Generation(RAG) Gemma 2は、テキストベースの推論ベンチマークで強力なパフォーマンスを発揮するため、さまざまなドメインでRAGシステムを開発するために適しています。ヘルスケアアプリケーションをサポートし、臨床情報をシンセサイズし、法的AIシステムを支援し、インテリジェントなチャットボットを開発し、カスタマイズされた教育ツールを作成することができます。

制限と課題

Gemma 2は注目すべき進歩を示していますが、主にトレーニングデータの品質と多様性に関連する制限と課題もあります。トークナイザーはさまざまな言語をサポートしていますが、Gemma 2は多言語機能の特定のトレーニングが不足しており、他の言語を効果的に処理するにはファインチューニングが必要です。モデルは、明確で構造化されたプロンプトで動作しますが、オープンエンドまたは複雑なタスクや、皮肉や比喩的な表現などの微妙な言語のニュアンスで苦労します。事実の正確性は常に信頼できるものではなく、古くなったまたは不正確な情報を生成する可能性があります。また、特定の状況では、共通の判断力が不足している可能性があります。ホールシネーション、特に医療やCBRNシナリオなどのデリケートな分野に対処するための努力が行われているにもかかわらず、精密でないドメインでの不正確な情報の生成のリスク仍然として存在します。また、憎悪表現やサイバーセキュリティ脅威などの非倫理的なコンテンツの生成を防ぐための措置が講じられているにもかかわらず、他のドメインでの悪用のリスクが存在します。最後に、Gemma 2はテキストベースのみであり、多モーダルデータの処理をサポートしていません。

まとめ

Gemma 2は、オープンソース言語モデルの分野で注目すべき進歩をもたらします。前身モデルよりもパフォーマンスと推論速度が向上しており、多様なハードウェア設定で動作するように設計されています。しかし、繊細な言語タスクの処理や複雑なシナリオでの正確性の確保には課題が残っています。法的アドバイスや教育ツールなどのアプリケーションには有益ですが、開発者は多言語機能の限界やデリケートな状況での事実の正確性の潜在的な問題に注意する必要があります。これらの考慮事項にもかかわらず、Gemma 2は信頼性の高い言語処理ソリューションを求める開発者にとって貴重な選択肢のままです。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。