AIの基礎
Mixture-of-Expertsの台頭:スパースAIモデルが機械学習の未来を形作る方法
Mixture-of-Experts (MoE)モデルは、AIを拡張する方法を変えている。モデルの一部のみを有効にすることで、MoEはモデルサイズと計算効率のトレードオフを管理するための新しいアプローチを提供する。従来の密なモデルとは異なり、MoEは大量のパラメータを使用しながらも、計算コストとトレーニングコストを抑えることができる。このブレークスルーは、研究と開発の波を引き起こし、テック巨大企業とスタートアップがMoEベースのアーキテクチャに大量に投資するようになった。
Mixture-of-Expertsモデルがどのように機能するか
MoEモデルは、複数の専門化されたサブネットワーク(「エキスパート」)と、各入力にどのエキスパートを使用するかを決定するゲーティングメカニズムで構成される。たとえば、言語モデルに文が入力された場合、8つのエキスパートのうち2つだけが活性化され、計算コストが大幅に削減される。
この概念は、GoogleのSwitch TransformerとGLaMモデルで主流になった。Switch Transformerでは、トークンが各層の1つのエキスパートにルーティングされるのに対し、GLaMではトップ2のルーティングを使用してパフォーマンスを向上させた。これらの設計では、MoEがGPT-3などの密なモデルと同等のパフォーマンスを発揮しながらも、エネルギーと計算コストを大幅に削減できることを実証した。
革新的な点は、条件付き計算にある。モデル全体を活性化するのではなく、MoEは最も関連する部分のみを活性化するため、数百億または数兆のパラメータを持つモデルを、ずっと小さいモデルの効率で実行できるようになる。これにより、研究者は、計算コストの線形増加なしに容量を拡張できるようになった。

MoEの実世界での応用
MoEモデルはすでに複数のドメインで実績を残している。GoogleのGLaMとSwitch Transformerは、言語モデリングで州-of-the-artの結果を達成し、トレーニングと推論コストを削減した。MicrosoftのZ-Code MoEは、Translatorツールで運用されており、100以上の言語を扱い、以前のモデルよりも精度と効率が向上している。これらは研究プロジェクトではなく、実際のサービスを支えている。
コンピュータビジョンでは、GoogleのV-MoEアーキテクチャが、ImageNetなどのベンチマークで分類精度を向上させた。LIMoEモデルは、画像とテキストを含むマルチモーダルタスクで強力なパフォーマンスを発揮した。エキスパートが専門化できること(一部はテキストを扱い、他は画像を扱う)により、AIシステムに新しい能力が追加された。
レコメンダーシステムやマルチタスク学習プラットフォームもMoEの恩恵を受けている。たとえば、YouTubeのレコメンドエンジンは、MoEのようなアーキテクチャを使用して、視聴時間やクリック率などの目標をより効率的に処理している。異なるエキスパートを異なるタスクまたはユーザーの行動に割り当てることで、MoEはより強力なパーソナライゼーションエンジンを構築するのに役立つ。
メリットと課題
MoEの主な利点は効率である。大量のモデルをトレーニングしてデプロイすることができ、計算コストを大幅に削減できる。たとえば、Mistral AIのMixtral 8×7Bモデルは47Bのパラメータを持つが、トークンごとに12.9Bのパラメータのみを活性化するため、13Bモデルのコスト効率を実現しながら、GPT-3.5と同等の品質を達成している。
MoEはまた、専門化を促進する。異なるエキスパートが異なるパターンを学習できるため、全体的なモデルは多様な入力に対処する能力が向上する。これは、多言語、多ドメイン、またはマルチモーダルタスクで、ワンサイズフィットオールの密なモデルが不十分な場合に特に有用である。
しかし、MoEにはエンジニアリング上の課題もある。トレーニングには、すべてのエキスパートが効果的に使用されるように慎重にバランスをとる必要がある。メモリオーバーヘッドも懸念事項である。推論ごとにパラメータのうちの一部のみが活性化されるが、すべてのパラメータをメモリにロードする必要がある。GPUまたはTPU上での計算の効率的な分散は、MicrosoftのDeepSpeedやGoogleのGShardなどの専用フレームワークの開発につながった。
これらの課題にもかかわらず、パフォーマンスとコストの利点は大きく、MoEは現在、大規模なAI設計の重要なコンポーネントと見なされている。ツールやインフラストラクチャが成熟するにつれ、これらの課題は徐々に解決されつつある。
MoEが他のスケーリング方法と比較してどうなのか
従来の密なスケーリングでは、モデルサイズと計算コストが比例して増加する。MoEは、この比例関係を破り、パラメータ数を増やしながらも、入力ごとの計算コストを増やさない。つまり、数兆のパラメータを持つモデルを、以前は数十億のパラメータしか扱えなかったハードウェアでトレーニングできるようになる。
モデルアンサンブルと比較して、MoEははるかに効率的である。複数のモデルを並列に実行するのではなく、MoEは1つのモデルを実行するが、複数のエキスパートパスを活用できる。
MoEは、スケーリングトレーニングデータ(例:チンチラ法)などの戦略を補完する。チンチラ法では、小さいモデルでより多くのデータを使用することを強調するのに対し、MoEはモデル容量を拡張しながら計算コストを安定させ、計算コストがボトルネックとなる場合に最適である。
最後に、プルーニングや量子化などのテクニックは、トレーニング後にモデルを縮小するのに対し、MoEはトレーニング中にモデル容量を増やす。MoEは圧縮の代替ではなく、効率的な成長のための直交ツールである。
MoE革命を牽引する企業
テック巨大企業
Google (GOOGL ) 今日のMoE研究の多くを牽引してきた。Switch TransformerとGLaMモデルはそれぞれ1.6Tと1.2Tのパラメータにスケールした。GLaMはGPT-3のパフォーマンスに匹敵しながらも、エネルギーを3分の1に削減した。Googleはまた、MoEをビジョン(V-MoE)とマルチモーダルタスク(LIMoE)に適用し、より幅広いAIモデルへの道筋を示した。
Microsoftは、Z-Code MoEモデルをMicrosoft Translatorに統合し、生産環境でMoEを実現した。DeepSpeed-MoEを開発し、数兆パラメータのモデルを高速にトレーニングし、低遅延の推論を可能にした。また、ルーティングアルゴリズムとTutelライブラリを貢献し、MoEの計算を効率化した。
Metaは、大規模言語モデルとレコメンダーシステムでMoEを探求した。1.1TのMoEモデルは、4倍少ない計算コストで密なモデルと同等の品質を達成できることを示した。LLaMAモデルは密なモデルであるが、MetaのMoEに関する研究は、より広いコミュニティに情報を提供し続けている。
Amazonは、SageMakerプラットフォームを通じてMoEをサポートし、内部での取り組みも行っている。MistralのMixtralモデルのトレーニングを支援し、アレクサAIサービスでMoEを使用していると噂されている。AWSのドキュメントでは、MoEを大規模モデルトレーニングのための推奨アプローチとして紹介している。
HuaweiとBAAIは、PanGu-Σ(1.085Tパラメータ)などの記録的なMoEモデルを開発し、言語とマルチモーダルタスクでのMoEの潜在性を示した。
スタートアップとチャレンジャー
Mistral AIは、オープンソースでのMoE革新の旗手である。Mixtral 8×7Bと8×22Bモデルは、密なモデルに匹敵するパフォーマンスを達成しながらも、計算コストを大幅に削減した。6億ユーロの資金を得たMistralは、スパースアーキテクチャに大きな賭けをしている。
xAIは、GrokモデルでMoEを探求していると報告されている。詳細は限られているが、MoEはxAIのようなスタートアップが、大規模な計算リソースを必要とせずに大手企業と競争できる可能性を提供する。
Databricksは、DBRXをリリースし、効率的なオープンMoEモデルを提供した。MoEトレーニングのためのインフラストラクチャとレシピも提供し、採用の敷居を下げている。
他のプレーヤーであるHugging Faceは、ライブラリにMoEサポートを統合し、開発者がこれらのモデルを構築しやすくした。MoEを構築していなくても、MoEを可能にするプラットフォームはエコシステムにとって重要である。
結論
Mixture-of-Expertsモデルは、単なるトレンドではなく、AIシステムを構築してスケールする方法に根本的な変化をもたらすものである。ネットワークの一部のみを選択的に活性化することで、MoEは大量モデルの力と、抑制されたコストを提供する。ソフトウェアインフラストラクチャが成熟し、ルーティングアルゴリズムが改善されると、MoEはマルチドメイン、多言語、多モーダルAIのデフォルトアーキテクチャになる可能性がある。
あなたが研究者、エンジニア、投資家であるかどうかに関係なく、MoEは、AIがこれまで以上に強力で効率的で適応性に富んだ未来を垣間見せるものである。












