AIモデルとプラットフォーム
DBRXの中を見てみよう:Databricksが公開した強力なオープンソースLLM

著者
Aayush Mittal ミッタル
大規模言語モデル(LLM)の分野では、DBRXという新しい強力なモデルが登場しました。DBRXは、Databricksによって作成されたオープンソースモデルで、幅広いベンチマークで最先端のパフォーマンスを発揮しています。さらに、業界の大手企業であるOpenAIのGPT-4の能力に匹敵することもあります。
DBRXは、人工知能の民主化における重要な里程標です。研究者、開発者、企業に、トップレベルの言語モデルへのオープンアクセスを提供しています。しかし、DBRXとは何でしょうか?何がそれを特別にしているのでしょうか?この技術的な深い掘り下げでは、DBRXの革新的なアーキテクチャ、トレーニングプロセス、主要な機能を探ってみましょう。
DBRXの誕生:DBRXの作成は、Databricksがすべての企業にデータインテリジェンスを提供するという使命によって推進されました。データ分析プラットフォームのリーダーとして、DatabricksはLLMの潜在力を認識し、独自のモデルを開発することにしました。このモデルは、プロプライエタリモデルと同等、またはそれ以上のパフォーマンスを発揮することを目標としていました。
数ヶ月にわたる集中した研究、開発、数百万ドルの投資の後、DatabricksチームはDBRXでブレークスルーを達成しました。モデルは、言語理解、プログラミング、数学を含む幅広いベンチマークで印象的なパフォーマンスを発揮し、新しいオープンソースLLMの最先端として確立されました。
革新的なアーキテクチャ
専門家の混合(MoE)アーキテクチャの力:DBRXの優れたパフォーマンスの根底にあるのは、その革新的な専門家の混合(MoE)アーキテクチャです。この最先端のデザインは、伝統的な密なモデルから逸脱し、疎なアプローチを採用しています。これにより、事前トレーニングの効率と推論速度が向上します。
MoEフレームワークでは、入力ごとに選択されたコンポーネントのグループのみが有効になります。これにより、モデルは幅広いタスクに適応し、計算リソースを最適化できます。
DBRXは、微細なMoEアーキテクチャを採用し、他のMoEモデルよりも一歩進んでいます。DBRXは16個の専門家を使用し、入力ごとに4個の専門家が有効になります。これにより、専門家の組み合わせは65倍に増加し、DBRXの優れたパフォーマンスに直接貢献します。
DBRXは、以下のいくつかの革新的な機能で他と異なります:
- 回転位置符号(RoPE):トークンの位置の理解を向上させ、コンテキストに応じた正確なテキストを生成する上で重要です。
- ゲート付き線形ユニット(GLU):ゲーティングメカニズムを導入し、モデルが複雑なパターンをより効率的に学習できるようにします。
- グループ化されたクエリ注意(GQA):注意メカニズムを最適化し、モデルの効率性を向上させます。
- 高度なトークン化:GPT-4のトークナイザーを使用して入力をより効果的に処理します。
MoEアーキテクチャは、大規模言語モデルに特に適しています。計算リソースのより効率的なスケーリングと活用が可能になるからです。学習プロセスを複数の専門化されたサブネットワークに分散することで、DBRXは各タスクにデータと計算パワーを効果的に割り当てることができます。高品質の出力と最適な効率性を両立させることができます。
広範なトレーニングデータと効率的な最適化:DBRXのアーキテクチャは確かに印象的ですが、その真の力は、慎重に設計されたトレーニングプロセスと、モデルが公開された膨大な量のデータにあります。DBRXは、12兆トークンのテキストとコードデータで事前トレーニングされ、質と多様性が高いことを保証するために、慎重にキュレーションされました。
トレーニングデータは、Databricksのツールスイートを使用して処理されました。Apache Sparkを使用したデータ処理、Unity Catalogを使用したデータ管理とガバナンス、MLflowを使用した実験追跡が含まれます。この包括的なツールスイートにより、Databricksチームは大量のデータセットを効果的に管理、探索、改良することができ、DBRXの優れたパフォーマンスの基盤を築くことができました。
さらに、Databricksは、トレーニング中のデータミックスを変化させるダイナミックな事前トレーニングカリキュラムを採用しました。この戦略により、各トークンが36億パラメータで効果的に処理され、より円滑で適応性の高いモデルが実現しました。
また、DBRXのトレーニングプロセスは、効率性の向上に重点が置かれました。Databricksの独自ツールとライブラリ、例えばComposer、LLM Foundry、MegaBlocks、Streamingを使用しました。カリキュラム学習や最適化戦略を採用することで、チームは、以前のモデルと比較して、ほぼ4倍の計算効率の改善を達成しました。
トレーニングとアーキテクチャ
DBRXは、12兆トークンの巨大なデータセットでトレーニングされ、テキストとコードを強調しています。このトレーニングセットは、以前のモデルで使用されたものよりもはるかに効果的であると考えられています。さまざまなプロンプトに対する豊富な理解と応答能力を保証します。
DBRXのアーキテクチャは、Databricksの技術力を示すものですが、複数の分野への応用にも光を当てています。チャットボットのやり取りの強化から複雑なデータ分析タスクの強化まで、DBRXはさまざまな分野に統合できます。
注目すべきは、DBRX Instructが市場で最も先進的なクローズドモデルと同等のパフォーマンスを発揮していることです。Databricksの測定によると、DBRX InstructはGPT-3.5を上回り、Gemini 1.0 ProやMistral Mediumと競合するパフォーマンスを発揮しています。
例えば、言語理解を測るMMLUベンチマークでは、DBRX Instructは73.7%のスコアを達成し、GPT-3.5の報告スコア70.0%を上回りました。HellaSwagコモンズセンス推論ベンチマークでは、DBRX Instructは89.0%のスコアを達成し、GPT-3.5の85.5%を上回りました。
DBRX Instructは、HumanEvalベンチマークで70.1%の精度を達成し、GPT-3.5(48.1%)やCodeLLaMA-70B Instructモデル(67.8%)を上回りました。
これらの優れた結果は、DBRXの多様性と、自然言語理解から複雑なプログラミングや数学的な問題解決まで、幅広いタスクで優れたパフォーマンスを発揮する能力を示しています。
効率的な推論とスケーラビリティ:DBRXのMoEアーキテクチャの主な利点の1つは、推論時の効率性です。パラメータの疎な活性化により、DBRXは、同じ総パラメータ数を持つ密なモデルよりも、2〜3倍高速な推論スループットを達成できます。
人気のオープンソースLLMであるLLaMA2-70Bと比較して、DBRXは不仅品質が高いだけでなく、約半分の活性パラメータ数で推論速度が約2倍になります。これにより、DBRXは、コンテンツ作成からデータ分析まで、幅広いアプリケーションで展開するための魅力的な選択肢となります。
さらに、Databricksは、企業がスクラッチからDBRXクラスのモデルをトレーニングしたり、提供されたチェックポイント上でトレーニングを継続したりできる、強力なトレーニングスタックを開発しました。この機能により、企業はDBRXの全ポテンシャルを活用し、ニーズに合わせてカスタマイズすることができます。さらに、最先端のLLMテクノロジーへのアクセスを民主化します。
アクセシビリティと統合
Databricksは、AIへのオープンアクセスを推進するという使命に沿って、DBRXを複数のチャネルで利用可能にしました。ベースモデル(DBRX Base)とファインチューンモデル(DBRX Instruct)の重みは、人気のHugging Faceプラットフォームにホストされており、研究者や開発者がモデルを簡単にダウンロードして使用できます。
さらに、DBRXモデルリポジトリはGitHubにあり、モデルコードの透明性とさらなる探索やカスタマイズを可能にします。
Databricksの顧客の場合、DBRX BaseとDBRX Instructは、Databricks Foundation Model APIを介してアクセスできます。既存のワークフローとアプリケーションへのシームレスな統合が可能になり、機密性の高いユースケースのデータ管理とセキュリティが保証されます。
さらに、DBRXは、You.comやPerplexity Labsを含む複数のサードパーティプラットフォームとサービスにすでに統合されています。DBRXのリーチと潜在的なアプリケーションを拡大し、オープンLLMのさまざまな業界とユースケースでの採用の増加を示しています。
長文脈能力とリトリーバーエンゲージドジェネレーション:DBRXの特徴の1つは、最大32,768トークンの長文脈入力を処理できる能力です。この機能により、モデルは広範なコンテキスト情報に基づいてテキストを生成および処理できます。ドキュメントの要約、質問回答、情報の抽出などのタスクに適しています。
長文脈パフォーマンスを評価するベンチマークでは、DBRX Instructは、KV-PairsやHotpotQAXLなどのさまざまなシーケンス長とコンテキスト位置で、GPT-3.5 Turboを上回りました。
限界と将来の研究
DBRXはオープンLLMの分野で大きな成果を上げていますが、その限界と改善の余地を認識することが重要です。どのAIモデルと同様に、DBRXは不正確または偏った応答を生成する可能性があり、トレーニングデータの質と多様性に依存します。
さらに、DBRXは一般的なタスクで優れていますが、特定のドメインに応じたアプリケーションでは、追加のファインチューニングまたは特化したトレーニングが必要になる場合があります。たとえば、精度と忠実度が最も重要なシナリオでは、Databricksは、モデル出力の強化にリトリーバーエンゲージドジェネレーション(RAG)テクニックを使用することを推奨しています。
また、DBRXの現在のトレーニングデータセットは主に英語のコンテンツで構成されており、非英語のタスクでのパフォーマンスが制限される可能性があります。将来のモデルバージョンでは、トレーニングデータをより多様な言語と文化的背景に拡大することが含まれる場合があります。
Databricksは、DBRXの能力を継続的に強化し、その限界を解決することに尽力しています。将来の研究では、モデルのパフォーマンス、スケーラビリティ、さまざまなアプリケーションとユースケースでの使いやすさの向上に重点が置かれます。また、潜在的な偏見を軽減し、倫理的なAIの使用を促進するためのテクニックの探求も含まれます。
さらに、会社はトレーニングプロセスをさらに洗練し、フェデレーテッドラーニングやプライバシープレシービング方法などの高度なテクニックを利用して、データのプライバシーとセキュリティを確保することを計画しています。
今後の道
DBRXは、AI開発の民主化における重要な一歩です。企業がデータとその運命を制御できる世界を想像しています。
DBRXをオープンソース化し、DBRXを構築するために使用された同じツールとインフラストラクチャへのアクセスを提供することで、Databricksは、企業や研究者が自分のニーズに合わせた最先端のDatabricksモデルを開発できるようにしています。
Databricksプラットフォームを通じて、顧客はApache Spark、Unity Catalog、MLflowを含むDatabricksのデータ処理ツールスイートを利用して、トレーニングデータをキュレーションおよび管理できます。次に、Databricksの最適化されたトレーニングライブラリ(Composer、LLM Foundry、MegaBlocks、Streamingなど)を使用して、DBRXクラスのモデルを効率的にトレーニングできます。
このAI開発の民主化は、企業が大規模言語モデルをさまざまなアプリケーション(コンテンツ作成、データ分析、意思決定サポートなど)に活用できる新しいイノベーションの波を解き放つ可能性があります。
さらに、DBRXを中心としたオープンでコラボレーション的なエコシステムを育むことで、Databricksは、大規模言語モデルの研究と開発のペースを加速することを目指しています。より多くの組織や個人が専門知識と洞察を提供するにつれて、これらの強力なAIシステムの集団的知識と理解が成長し、さらに先進的で能力の高いモデルが開発される基盤が整えられます。
結論
DBRXは、オープンソースの大規模言語モデルにおけるゲームチェンジャーです。革新的な専門家の混合アーキテクチャ、広範なトレーニングデータ、最先端のパフォーマンスにより、新しいベンチマークを設定しています。
最先端のAIテクノロジーへのアクセスを民主化することで、DBRXは、研究者、開発者、企業が自然言語処理、コンテンツ作成、データ分析、その他多くの分野で新しいフロンティアを探求できるようにします。DatabricksがDBRXをさらに洗練し強化するにつれて、この強力なモデルの潜在的なアプリケーションと影響は、実際に無限大です。
私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。













