AIモデルとプラットフォーム

ミストラルAI:オープンソース空間での新たなベンチマーク

mm
Unite.AI を Google の優先ソースに追加

大規模言語モデル(LLM)は、ChatGPTのような注目すべきパフォーマーによって、最近注目を集めています。MetaがLlamaモデルを導入したとき、オープンソースLLMへの関心が再燃しました。目標は、GPT-4のようなトップレベルのモデルと同等のパフォーマンスを発揮するオープンソースLLMを作成することでしたが、コストや複雑さはそれほど高くないというものでした。

このコストと効率の組み合わせは、研究者や開発者にとって新たな機会をもたらすだけでなく、自然言語処理における技術的進歩の新たな時代の幕開けとなりました。

最近、ジェネレーティブAIスタートアップは資金調達で成功を収めています。Togetherは、2000万ドルを調達し、オープンソースAIを構築することを目指しています。Anthropicも、4.5億ドルを調達し、CohereはGoogle Cloudと提携して、2億7000万ドルを調達しました。

ミストラル7Bの紹介:サイズと入手可能性

ミストラルAI

ミストラルAIは、パリを拠点とし、GoogleのDeepMindとMetaの卒業生によって共同設立されました。ミストラルAIは、最初の大規模言語モデルであるミストラル7Bを発表しました。このモデルは、GitHubから簡単にダウンロードでき、また13.4ギガバイトのトレントからも入手できます。

このスタートアップは、プロダクトをリリースする前に、記録的なシードファンディングを獲得しました。ミストラルAIの最初のモデルは、7億パラメータを持つモデルで、Llama 2 13Bを上回り、Llama 1 34Bを多くの指標で上回りました。

他のモデルと比較して、ミストラル7Bは、Llama 2と同等の機能を提供しますが、計算オーバーヘッドは少ないです。GPT-4のような基礎モデルは、より高いコストと複雑さで、API経由でのみアクセス可能です。

コーディングタスクでは、ミストラル7BはCodeLlama 7Bと同等のパフォーマンスを発揮します。また、13.4 GBのコンパクトなサイズで、標準マシンで実行できます。

さらに、ミストラル7B Instructは、Hugging Faceの指示データセットに特化して調整されており、MT-Benchで他の7Bモデルを上回り、13Bチャットモデルと同等のパフォーマンスを発揮しています。

パフォーマンスベンチマーク

ミストラル7Bは、Llama 2ファミリーモデルと比較して、詳細なパフォーマンス分析が行われました。結果は明確でした。ミストラル7Bは、すべてのベンチマークでLlama 2 13Bを上回り、Llama 34Bと同等のパフォーマンスを発揮しました。特に、コードと推論のベンチマークで優れています。

ベンチマークは、コモンセンス推論、世界知識、読解力、数学、コードなど、複数のカテゴリに分けられました。特に注目すべき観察は、ミストラル7Bのコストパフォーマンスメトリクスでした。推論と理解の分野で、ミストラル7Bは、Llama 2モデル3倍のサイズに相当するパフォーマンスを発揮しました。これは、メモリとスループットの節約につながります。しかし、知識ベンチマークでは、ミストラル7BはLlama 2 13Bと密接に一致しました。これは、パラメーターの制限による知識圧縮の影響であると考えられます。

ミストラル7Bモデルが他の言語モデルと比べて優れている理由

注意メカニズムの簡素化

注意メカニズムのニュアンスは技術的ですが、その基本的な考え方は比較的簡単です。重要な文章を強調することを想像してください。これは、注意メカニズムがシーケンス内の特定のデータポイントに「強調」または重要性を付ける方法に似ています。

言語モデルの文脈では、これらのメカニズムにより、モデルは入力データの最も関連性の高い部分に焦点を当てることができ、出力が一貫性があり、コンテキストに正確であることを保証します。

標準的なトランスフォーマーでは、注意スコアは次の式で計算されます。

トランスフォーマーの注意式

トランスフォーマーの注意式

この式には、QとKの行列乗算という重要なステップが含まれます。この挑戦は、シーケンスの長さが増加すると、両方の行列が拡大し、計算コストが高くなることです。このスケーラビリティの懸念は、標準的なトランスフォーマーが遅くなる理由の1つです、特に長いシーケンスを扱う場合です。

トランスフォーマー注意メカニズムにより、モデルは入力データの特定の部分に焦点を当てることができます。通常、これらのメカニズムでは「ヘッド」を使用して注意を管理します。ヘッドが多いほど、注意が具体的になりますが、複雑になり、遅くなります。トランスフォーマーと注意メカニズムの詳細については、こちらを参照してください。

マルチクエリ注意(MQA)は、1つの「キー値」ヘッドを使用して高速化しますが、時々品質を犠牲にします。ここで、MQAの速度とマルチヘッド注意の品質を組み合わせる方法を見つける必要があります。その答えは、グループ化クエリ注意(GQA)にあります。

グループ化クエリ注意(GQA)

グループ化クエリ注意

グループ化クエリ注意

GQAは、妥協点の解決策です。1つまたは複数の「キー値」ヘッドを使用するのではなく、ヘッドをグループ化します。この方法により、GQAは、マルチヘッド注意に近いパフォーマンスを実現しながら、MQAの速度を実現します。ミストラルなどのモデルでは、これは品質を妥協することなく効率的なパフォーマンスを意味します。

スライディングウィンドウ注意(SWA)

ロングフォーマー・トランスフォーマー・スライディングウィンドウ

スライディングウィンドウは、注意シーケンスを処理する別の方法です。この方法では、シーケンス内の各トークン周囲に固定サイズの注意ウィンドウを使用します。複数の層がこのウィンドウ注意をスタックすると、上位層は最終的に、入力全体の情報を包含するより広い視野を獲得します。このメカニズムは、畳み込みニューラルネットワーク(CNN)で見られる受容野に似ています。

ミストラルAIの透明性と分散化における安全性の懸念

ミストラルAIは、声明で透明性を強調しています。「トリックはありません。独自のデータはありません。」しかし、現在利用可能な唯一のモデルである「Mistral-7B-v0.1」は、事前トレーニングされたベースモデルであるため、モデレーションなしで任意のクエリに応答できます。これにより、潜在的な安全性の懸念が生じます。GPTやLlamaなどのモデルには、応答するタイミングを判断するメカニズムがありますが、ミストラルの完全な分散化は、悪意のあるアクターによって利用される可能性があります。

ただし、大規模言語モデルの分散化には利点もあります。悪用される可能性はありますが、人々はその力を社会の利益のために利用できます。

展開の柔軟性

注目すべき点は、ミストラル7BがApache 2.0ライセンスの下で利用可能であることです。これは、個人、巨大企業、政府機関など、誰でも利用可能であることを意味します。ただし、実行するための適切なシステムが必要です。

他のライセンス、たとえば、単純なMITライセンスや、派生物に対して同様のライセンスとクレジットを要求するCC BY-SA-4.0ライセンスもありますが、Apache 2.0ライセンスは、大規模な取り組みに対する堅固な基盤を提供します。

最終的な考え

ミストラル7Bのようなオープンソースの大規模言語モデルの台頭は、AI業界における重要な転換点を示しています。ミストラルAIの革新的なアプローチ、たとえばグループ化クエリ注意とスライディングウィンドウ注意は、品質を妥協することなく効率的なパフォーマンスを約束しています。

ミストラルの分散化性は、特定の課題をもたらしますが、その柔軟性とオープンソースライセンスは、AIの民主化の可能性を強調しています。業界が進化するにつれて、モデルの力と倫理的配慮および安全対策のバランスを取ることに焦点が当てられるでしょう。

ミストラルの次のステップは?7Bモデルはただの始まりです。チームは、近々さらに大きなモデルをリリースすることを目指しています。如果これらの新しいモデルが7Bのパフォーマンスに匹敵する場合、ミストラルは、設立から1年以内に業界のトッププレイヤーになる可能性があります。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。