AIモデルとプラットフォーム
ミストラル AI の最新の Mixture of Experts (MoE) 8x7B モデル
は、パリを拠点とするオープンソース モデル スタートアップで、最新の大規模言語モデル (LLM) である MoE 8x7B を、シンプルな トレント リンク でリリースし、従来の規範に挑戦しています。これは、Google の Gemini リリースの従来のアプローチとは対照的であり、AI コミュニティ内で議論と興奮を引き起こしています。
ミストラル AI のリリース アプローチは、常に非伝統的でした。通常の論文、ブログ、プレス リリースなどの付随物を省略し、代わりに AI コミュニティの注目を集めるための独自の戦略を採用しています。
最近、同社は、Andreessen Horowitz が主導する資金調達ラウンドを通じて、$2 億の評価額 を達成しました。この資金調達ラウンドは歴史的であり、欧州における最大のシード ラウンドである 1 億 1,800 万ドルの記録を樹立しました。資金調達の成功以外に、ミストラル AI は、オープンソース AI に対する規制の削減を主張する EU AI 法に関する議論に積極的に参加しています。
MoE 8x7B が注目を集める理由
「GPT-4 の縮小版」と呼ばれる Mixtral 8x7B は、8 つのエキスパートを備えた Mixture of Experts (MoE) フレームワークを使用しています。各エキスパートには 111B のパラメータがあり、55B の共有アテンション パラメータと組み合わせて、モデルの合計 166B のパラメータを提供します。この設計選択は重要であり、各トークンの推論に 2 つのエキスパートのみを関与させることで、より効率的で集中した AI 処理へのシフトを強調しています。
Mixtral の主な特徴の 1 つは、32,000 トークンの広範なコンテキストを処理できることです。これにより、複雑なタスクを処理するための幅広いスケールが提供されます。モデルの多言語機能には、英語、フランス語、イタリア語、ドイツ語、スペイン語を含むグローバル開発者 コミュニティに対応する堅牢なサポートが含まれます。
Mixtral の事前トレーニングには、オープン Web から取得されたデータが使用され、エキスパートとルーターを同時にトレーニングするアプローチが採用されています。この方法により、モデルのパラメータ空間が広くなるだけでなく、接触した膨大なデータのニュアンスにも細かく調整されています。

Mixtral 8x7B が印象的なスコアを達成
Mixtral 8x7B は、LLaMA 2 70B と GPT-3.5 を上回り、特に MBPP タスクで 60.7% の成功率を達成し、対抗するモデルを大幅に上回りました。さらに、命令に従うモデル向けに調整された MT-Bench でも、Mixtral 8x7B は印象的なスコアを達成し、GPT-3.5 に近づいています。
Mixture of Experts (MoE) フレームワークの理解
Mixture of Experts (MoE) モデルは、ミストラル AI の MoE 8x7B などの最先端の言語モデルに組み込まれていることで最近注目されていますが、実際には数年前に遡る基礎概念に根ざしています。 lets このアイデアの起源を、基礎となる研究論文を通じて再訪してみましょう。
MoE の概念
Mixture of Experts (MoE) は、ニューラル ネットワーク アーキテクチャーにおけるパラダイム シフトを表します。従来のモデルがすべてのデータを処理するための単一のホモジニアス ネットワークを使用するのとは異なり、MoE はより専門化されたモジュラー アプローチを採用しています。各エキスパート ネットワークは、特定のデータまたはタスクを処理するように設計されており、ダイナミックに入力データを最も適切なエキスパートに導くゲーティング ネットワークによって監督されます。

再帰言語モデル内に埋め込まれた Mixture of Experts (MoE) レイヤー (ソース)
上記の画像は、言語モデル内に埋め込まれた MoE レイヤーの高レベル ビューを示しています。MoE レイヤーは、各エキスパートが異なるデータの側面を処理する可能性のある複数のフィード フォワード サブ ネットワークで構成されています。ゲーティング ネットワーク (図の右側に強調表示) は、入力 (図では G(x) と表記) を評価し、入力を処理するためにエキスパートのスパース セットを選択します。この選択は、ゲーティング ネットワークの出力によって調整され、各エキスパートが最終的な出力に寄与する「投票」または貢献を決定します。たとえば、図の右側に示されているように、各入力トークンの出力を計算するために、2 つのエキスパートのみが選択される可能性があります。これにより、計算リソースが最も必要な場所に集中され、処理が効率化されます。

MoE レイヤーを備えた Transformer エンコーダー (ソース)
上記の 2 番目の図は、MoE レイヤーを備えた Transformer エンコーダーと従来の Transformer エンコーダーを比較しています。Transformer アーキテクチャーは、言語関連タスクでその有効性が広く知られていますが、従来は自己注意とフィード フォワード層のスタックで構成されていました。MoE レイヤーの導入により、フィード フォワード層の一部が置き換えられ、モデルがより効果的にスケールできるようになりました。
増強モデルでは、MoE レイヤーは複数のデバイスに分割されています。これは、モデルを大幅にスケールアップする場合に、計算負荷とメモリ要件をデバイス クラスター (GPU または TPU など) に分散できるため、重要です。この分割は、数十億から数千億のパラメータを持つモデルを効率的にトレーニングおよびデプロイするために不可欠です。
LLM での MoE のスパース アプローチと命令チューニング
「スパース Mixture-of-Experts (MoE) for Scalable Language Modeling」という論文では、大規模言語モデル (LLM) を改善するための革新的なアプローチについて説明しています。Mixture of Experts アーキテクチャーと命令チューニング技術を統合することで、LLM をスケーラブルにします。
MoE モデルは、特定のタスクにファインチューンされた場合、同じ計算能力の密なモデルに比べて低いパフォーマンスを示すことが多いという課題について説明しています。
命令チューニングは、モデルを自然言語の命令に従うように改良するトレーニング方法論です。これにより、タスクのパフォーマンスが大幅に向上します。論文では、MoE モデルが命令チューニングと組み合わせた場合に、特に密なモデルよりも大幅に改善されることを示しています。この技術により、モデルの事前トレーニングされた表現が命令に従うように調整され、パフォーマンスが大幅に向上します。
研究者は、3 つの実験設定で研究を実施し、MoE モデルは、特定のタスクに直接ファインチューンされた場合、最初は低いパフォーマンスを示すことを発見しました。ただし、命令チューニングを適用すると、MoE モデルは特に、タスク固有のファインチューニングでさらに補強された場合に、密なモデルを上回ります。これは、命令チューニングが MoE モデルをダウンストリーム タスクで密なモデルを上回るようにするための重要なステップであることを示しています。
さらに、FLAN-MOE32B というモデルを紹介しています。これは、これらの概念の成功した応用例を示しています。特に、FLAN-PALM62B という密なモデルを上回り、ベンチマーク タスクで優れたパフォーマンスを発揮しています。ただし、計算リソースは 3 分の 1 しか使用していません。これは、命令チューニングと組み合わせたスパース MoE モデルが、LLM の効率性とパフォーマンスの新しい基準を設定する可能性を示しています。
実際のシナリオでの Mixture of Experts の実装
MoE モデルの多様性により、幅広いアプリケーションに適しています:
- 自然言語処理 (NLP): MoE モデルは、人間の言語のニュアンスと複雑さをより効果的に処理できます。これにより、NLP タスクの高度な処理が可能になります。
- 画像およびビデオ処理: 高解像度処理が必要なタスクでは、MoE は画像またはビデオ フレームのさまざまな側面を処理できます。これにより、品質と処理速度が向上します。
- カスタマイズ可能な AI ソリューション: ビジネスと研究者は、MoE モデルを特定のタスクに合わせて調整できます。これにより、よりターゲットを絞った効果的な AI ソリューションが可能になります。
課題と考慮事項
MoE モデルは多くの利点を提供しますが、独自の課題もあります:
- トレーニングとチューニングの複雑さ: MoE モデルの分散性により、トレーニング プロセスが複雑になり、エキスパートとゲーティング ネットワークの慎重なバランスとチューニングが必要になります。
- リソース管理: 複数のエキスパートにわたる計算リソースを効率的に管理することは、MoE モデルの利点を最大化するために不可欠です。
MoE レイヤーをニューラル ネットワークに組み込むことで、特に言語モデルの分野では、以前は計算上の制約により実現不可能だったサイズにモデルをスケールアップする道が開けます。MoE レイヤーによって可能になる条件付き計算により、計算リソースをより効率的に分配できます。これにより、大規模で高性能なモデルをトレーニングすることが可能になります。私たちが AI システムからより多くのことを要求するにつれて、MoE を備えた Transformer などのアーキテクチャーは、さまざまな分野で複雑で大規模なタスクを処理するための新しい標準になる可能性が高くなります。













