AIモデルとプラットフォーム

Gemma:Googleがオープンソースで提供する高度なAI能力

mm
Unite.AI を Google の優先ソースに追加

人工知能(AI)の分野は近年、ディープラーニングと自然言語処理(NLP)の進歩によって大きな進展を遂げてきました。こうした進歩の先頭に立つのは、大量のテキストデータで訓練された大規模言語モデル(LLM)です。LLMは人間のようなテキストを生成し、会話タスクに従事することができます。

GoogleのPaLM、AnthropicのClaude、DeepMindのGopherなどのLLMは、コード作成から共通の推論まで、驚くべき能力を示しています。しかし、これらのモデルの中で、公開されているものはほとんどありません。これにより、研究、開発、有益な応用へのアクセスが制限されています。

しかし、DeepMindのGemmiという大規模言語モデルファミリーのオープンソース化により、状況は変わりました。Gemmiは、DeepMindの強力な独自モデルGeminiを基に構築されています。この記事では、Gemmiのアーキテクチャ、訓練プロセス、パフォーマンス、責任ある公開について詳しく見ていきます。

Gemmiの概要

2023年2月、DeepMindはGemmiモデルの2つのサイズをオープンソース化しました。一つは、2億パラメータのバージョンで、デバイスへの展開に最適化されています。もう一つは、7億パラメータのバージョンで、GPU/TPUでの使用に設計されています。

Gemmiは、Geminiモデルと同様のトランスフォーマー基盤のアーキテクチャと訓練方法論を使用しています。Gemmiは、最大6兆トークンのテキストデータで訓練されました。これには、ウェブドキュメント、数学的テキスト、ソースコードが含まれます。

DeepMindは、Gemmiの生の事前訓練済みチェックポイントと、監督学習と人間のフィードバックでファインチューンされたバージョンを公開しました。後者は、ダイアログ、指示の従順、コード作成などの分野で強化された能力を提供します。

Gemmiの開始

Gemmiのオープンソース化により、開発者、研究者、愛好家が高度なAI能力にアクセスできるようになりました。以下は、Gemmiを使用するための簡単なガイドです。

プラットフォーム非依存の展開

Gemmiの強みの一つは、その柔軟性です。Gemmiは、CPU、GPU、またはTPUで実行できます。CPUの場合、TensorFlow LiteまたはHuggingFace Transformersを使用します。GPU/TPUの場合、TensorFlowを使用します。Google CloudのVertex AIなどのクラウドサービスも、シームレスなスケーリングを提供します。

事前訓練済みモデルのアクセス

Gemmiには、異なる事前訓練済みバリアントがあります。2Bと7Bのモデルは、出荷時に強力な生成能力を提供します。カスタムファインチューニングの場合、2B-FTと7B-FTモデルが理想的な出発点です。

興味深いアプリケーションの構築

Gemmiを使用して、物語の生成、言語翻訳、質問回答、創造的なコンテンツの生成などの多様なアプリケーションを構築できます。Gemmiの強みを活かすには、独自のデータセットでファインチューニングすることが重要です。

アーキテクチャ

Gemmiは、デコーダーのみのトランスフォーマーアーキテクチャを使用しています。このアーキテクチャは、以下の技術を取り入れています。

  • トランスフォーマー: 2017年に導入されたトランスフォーマーアーキテクチャは、NLPで広く使用されています。Gemmiは、トランスフォーマーの長距離依存関係をモデル化する能力を継承しています。
  • デコーダーのみ: Gemmiは、BARTやT5のようなエンコーダー-デコーダーモデルとは異なり、トランスフォーマーデコーダースタックのみを使用しています。これにより、テキスト生成タスクに強力な能力が提供されます。
  • マルチクエリーアテンション: Gemmiの大きなモデルでは、マルチクエリーアテンションを使用しています。これにより、各アテンションヘッドが並列に複数のクエリーを処理できます。
  • ロータリーポジショナルエンベッディング: Gemmiは、絶対的な位置エンコーディングではなく、ロータリーポジショナルエンベッディングを使用して位置情報を表現しています。これにより、モデルサイズを削減しながら位置情報を保持できます。

これらの技術を使用することで、Gemmiモデルはパフォーマンス、推論速度、モデルサイズの間で最適なトレードオフを達成しています。

データと訓練プロセス

Gemmiは、最大6兆トークンのテキストデータで訓練されました。これには、ウェブドキュメント、数学的テキスト、ソースコードが含まれます。DeepMindは、データフィルタリングに多大な努力を費やし、有害または偏ったコンテンツを除去しました。

訓練は、GoogleのTPUv5インフラストラクチャを使用して行われました。最大4096のTPUを使用してGemmi-7Bを訓練しました。モデルとデータの並列化技術により、コモディティハードウェアで大規模なモデルを訓練することが可能になりました。

段階的な訓練が使用され、データの分布を高品質の関連テキストに焦点を当てるために継続的に調整されました。最終的なファインチューニング段階では、人間が生成した指示と合成された指示のフォローの例を使用して、ダイアログやコード作成などの能力を高めるために使用されました。

モデルパフォーマンス

DeepMindは、質問回答、推論、数学、コード作成、共通の感性、ダイアログ能力など、25以上のベンチマークでGemmiモデルを徹底的に評価しました。

Gemmiは、同サイズのオープンソースモデルと比較して、ほとんどのベンチマークで最先端の結果を達成しています。以下は、いくつかのハイライトです。

  • 数学: Gemmiは、GSM8KやMATHなどの数学的推論テストで、CodexやAnthropicのClaudeを10点以上上回ります。
  • コード作成: Gemmiは、MBPPなどのプログラミングベンチマークで、Codexと同等以上のパフォーマンスを示します。Gemmiはコードに特に訓練されていません。
  • ダイアログ: Gemmiは、人間の好みテストで、AnthropicのMistral-7Bに対して51.7%の勝率を示します。
  • 推論: ARCやWinograndeなどの推論タスクで、Gemmiは他の7Bモデルを5〜10点上回ります。

Gemmiの多才な能力は、さまざまな分野での強力な一般知能を示しています。人間レベルのパフォーマンスとのギャップはまだ残っていますが、GemmiはオープンソースNLPの飛躍的な進歩を表しています。

安全性と責任

大規模モデルのオープンソース化には、意図的な悪用やモデル内在の偏見などのリスクが伴います。DeepMindは、リスクを軽減するための措置を講じました。

  • データフィルタリング: 有害、違法、または偏ったテキストは、分類器と推論を使用して除去されました。
  • 評価: Gemmiは、安全性、公平性、ロバスト性を評価するために30以上のベンチマークでテストされました。Gemmiは他のモデルと同等以上のパフォーマンスを示しました。
  • ファインチューニング: モデルのファインチューニングは、情報フィルタリングや適切なヘッジ/拒否行動などの安全性機能の向上に焦点を当てました。
  • 使用条件: 使用条件では、Gemmiモデルの悪用、違法、または非倫理的な使用を禁止しています。ただし、使用条件の施行は課題です。
  • モデルカード: モデルの能力、限界、偏見に関する詳細を記載したカードが公開され、透明性を促進しました。

Gemmiの公開にはリスクが伴いますが、DeepMindは、Gemmiの安全性プロファイルと研究の促進により、社会全体への利益がリスクを上回ると判断しています。ただし、潜在的な危害を注意深く監視する必要性は依然としてあります。

次のAIイノベーションの促進

Gemmiのオープンソース化は、AIコミュニティ全体の進歩を促進するものです。

  • アクセシビリティ: Gemmiは、組織が最先端のNLPを構築するための障壁を低減します。組織は、独自のLLMを訓練するための高額なコンピューティング/データコストに直面していました。
  • 新しいアプリケーション: 事前訓練済みおよびファインチューンされたチェックポイントをオープンソース化することで、DeepMindは、教育、科学、またはアクセシビリティなどの分野での有益なアプリケーションの開発を容易にします。
  • カスタマイズ: 開発者は、Gemmiを業界またはドメイン固有のアプリケーションにさらにカスタマイズできます。独自のデータで継続的に訓練することで、Gemmiを強化できます。
  • 研究: Gemmiのようなオープンモデルは、現在のNLPシステムの透明性と監査を高め、将来の研究方向を明らかにします。
  • イノベーション: 強力なベースラインモデルであるGemmiの提供により、偏見の軽減、事実性、AIの安全性などの分野での進歩が促進されます。

Gemmiの能力をすべての人に提供することで、DeepMindは、AIの責任ある開発を社会の利益のために促進したいと考えています。

今後の道

AIの進歩は、人間の知能を超えるモデルへの道を歩み出しています。Gemmiのようなシステムは、自己教師ありモデルの急速な進歩が、ますます高度な認知能力を解放していることを強調しています。

しかし、信頼性、解釈可能性、制御可能性の向上は、AIの分野で依然として課題です。数学などの分野は、これらのギャップを浮き彫りにしています。GemmiはMMLUで64%のスコアを達成していますが、人間のパフォーマンスは89%と推定されています。

これらのギャップを埋めながら、AIシステムの安全性と倫理性を確保することが、将来の主要な課題です。開放性と慎重さのバランスを取ることが重要です。DeepMindは、AIの利点へのアクセスを民主化しながら、リスクを管理することを目指しています。

AIの安全性を促進する取り組み、たとえばDario AmodeiのANC、DeepMindのエシックス&ソサエティチーム、AnthropicのコンスティテューショナルAIは、慎重さの必要性を認識しています。有意義な進歩を達成するには、研究者、開発者、政策立案者、そして一般大衆の間で、開かれた、証拠に基づいた対話が必要です。

責任を持って進めば、GemmiはAIの頂点ではなく、次のAI研究者世代がDeepMindの足跡をたどり、公平で有益な人工一般知能に向かって歩み出すためのベースキャンプになります。

結論

DeepMindのGemmiモデルの公開は、オープンソースAIの新しい時代を迎えるものです。この時代は、狭いベンチマークを超えた一般化された知能能力を特徴としています。Gemmiは、広くアクセス可能で、安全性が徹底的に評価されているため、AIのオープンソース化における新しい標準を設定しています。

競争的な精神と協力的な価値観によって推進されるGemmiの公開は、AIエコシステム全体を前進させます。コミュニティ全体が、革新的なプロジェクトを推進またはサポートするために、多才なLLMファミリーにアクセスできるようになりました。

リスクは依然として存在しますが、DeepMindの技術的および倫理的な尽力により、Gemmiの利点が潜在的な危害を上回ると信頼できます。AIの能力がますます高度になるにつれて、開放性と慎重さのバランスを維持することが重要です。

Gemmiは、全人類に利益をもたらすAIの一歩前進です。ただし、人工一般知能への道のりには、まだ多くの大きな課題が残っています。AI研究者、開発者、社会全体が協力して進歩を維持できるのであれば、Gemmiは将来、歴史的なベースキャンプとして見られるかもしれません。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。