AIモデルとプラットフォーム

ポケットサイズのパワーハウス:マイクロソフトのPhi-3、スマートフォンに収まる言語モデルを発表

mm
Unite.AI を Google の優先ソースに追加

人工知能の分野は急速に進化しており、トレンドは大規模で複雑なモデルに向かっていることが多いですが、マイクロソフトはPhi-3 Miniで異なるアプローチを採用しています。この小規模言語モデル(SLM)は、3世代目となり、より大規模なモデルの強力な機能を、スマートフォンの厳格なリソース制約に収まるフレームワークにまとめています。3.8億のパラメータを持ち、言語処理、推論、コーディング、数学などのタスクで大規模言語モデル(LLM)と同等の性能を発揮し、量子化によりモバイルデバイスでの効率的な動作が可能です。

大規模言語モデルの課題

マイクロソフトのPhi SLMの開発は、LLMが消費者向けデバイスで利用可能なよりも多くの計算リソースを必要とするという重大な課題に対する対応です。この高要求は、標準コンピュータとモバイルデバイスでの利用を複雑にし、トレーニングと動作時のエネルギー消費により環境への懸念を引き起こし、偏りの永続化をリスクにさらします。これらの要因は、リアルタイムアプリケーションでのモデルのレスポンスを損なう可能性があり、更新をより困難にします。

Phi-3 Mini:個人向けデバイスでのAIの効率化とプライバシー強化

Phi-3 Miniは、個人向けデバイス such as スマートフォンとラップトップへの先進的なAIの直接統合を提供するために戦略的に設計されています。この設計により、より迅速で即時的なレスポンスが可能になり、日常的なシナリオでの技術とのユーザーインタラクションが強化されます。
Phi-3 Miniは、モバイルデバイス上で高度なAI機能を直接処理できるようにし、クラウドサービスへの依存を減らし、リアルタイムデータ処理を強化します。これは、モバイルヘルスケア、リアルタイム言語翻訳、パーソナライズされた教育などのアプリケーションで不可欠です。モデルのコスト効率は、運用コストを削減するだけでなく、様々な業界、特にウェアラブルテクノロジーとホームオートメーションなどの新興市場でのAI統合の可能性を拡大します。Phi-3 Miniは、ローカルデバイス上でのデータ処理を可能にし、ユーザーのプライバシーを強化します。これは、個人ヘルスケアや金融サービスなどの機密情報を管理する分野で重要です。また、モデルの低エネルギー要件は、環境に優しいAI運用に貢献し、世界的な持続可能性への取り組みと一致しています。

Phiの設計哲学と進化

Phiの設計哲学は、カリキュラム学習の概念に基づいています。これは、子供が進んでいくほど難しい例から学ぶ教育アプローチからインスピレーションを得ています。主なアイデアは、AIのトレーニングを簡単な例から始めて、学習プロセスが進むにつれてトレーニングデータの複雑さを増やしていくことです。マイクロソフトは、「教科書はすべて必要です」という研究で詳細に説明されているように、教科書からデータセットを構築することで、この教育戦略を実施しています。Phiシリーズは、2023年6月に開始され、最初のPhi-1は13億のパラメータを持つコンパクトモデルでした。このモデルはすぐにその有効性を実証し、特にPythonのコーディングタスクで、大規模で複雑なモデルを上回りました。この成功を基盤に、マイクロソフトは後にPhi-1.5を開発し、同じ数のパラメータを維持しながら、共通の感覚的な推論や言語理解などの分野での能力を拡大しました。シリーズは、2023年12月にPhi-2をリリースすることで、27億のパラメータを持つモデルを展示し、大規模なモデルと比較して、推論と言語理解で印象的なスキルを示し、大規模なモデルに対する強力な競争相手として位置付けられました。

Phi-3 vs. 他の小規模言語モデル

Phi-3 Miniは、GoogleのGemmaMistralのMistralMetaのLlama3-Instruct、およびGPT 3.5などの他のSLMを上回り、言語理解と推論、一般知識、共通の感覚的な推論、学校数学のワードプロブレム、医療質問回答などの産業アプリケーションで優れた性能を示しています。Phi-3 Miniは、さまざまなタスク、コンテンツ作成、特定の場所に合わせたアクティビティの提案を含む、iPhone 14でのオフラインテストにも合格しています。この目的のために、Phi-3 Miniは、量子化というプロセスを使用して1.8GBに圧縮されています。これにより、モデルは32ビット浮動小数点数から4ビット整数などのよりコンパクトな形式に最適化され、モデルのメモリフットプリントが削減され、処理速度と電力効率が向上します。これは、モバイルデバイスでは不可欠です。開発者は、TensorFlow LiteまたはPyTorch Mobileなどのフレームワークを使用して、自動化と精製のための組み込み量子化ツールを活用します。

Phi-3 MiniとPhi-2 Miniの機能比較

以下、Phi-3とその前身のPhi-2のいくつかの機能を比較します。

  • モデルアーキテクチャ:Phi-2は、次の単語を予測するためのトランスフォーマー基盤のアーキテクチャを採用しています。Phi-3 Miniもトランスフォーマーデコーダアーキテクチャを採用していますが、Llama-2モデルの構造に近くなっています。320,641の語彙サイズを持つ同じトークナイザを使用します。これにより、Llama-2用に開発されたツールをPhi-3 Miniで簡単に使用できるようになります。
  • コンテキスト長:Phi-3 Miniは、8,000トークンのコンテキスト長をサポートしています。これは、Phi-2の2,048トークンよりもはるかに大きいです。この増加により、Phi-3 Miniはより詳細なインタラクションを処理し、より長いテキストを処理できるようになります。
  • モバイルデバイスでのローカル実行:Phi-3 Miniは、4ビットに圧縮されて約1.8GBのメモリを占め、Phi-2と同等のパフォーマンスを発揮します。A16 Bionicチップを搭載したiPhone 14でテストされ、同等の条件下でPhi-2と同等の12トークン/秒の処理速度を達成しました。
  • モデルサイズ:Phi-3 Miniには、3.8億のパラメータがあり、Phi-2の2.7億パラメータよりも大規模です。これは、モデルの機能の向上を反映しています。
  • トレーニングデータ:Phi-2は1.4兆トークンでトレーニングされたのに対し、Phi-3 Miniは3.3兆トークンでトレーニングされています。これにより、複雑な言語パターンをよりよく理解できるようになります。

Phi-3 Miniの限界に対処する

Phi-3 Miniは、小規模言語モデルの分野で重大な進歩を示していますが、限界がありません。Phi-3 Miniの主な制約は、そのサイズが大規模な言語モデルに比べて小さいことです。これにより、広範な事実情報を独立して処理する能力が制限され、詳細な事実情報や専門知識を必要とするクエリを処理する能力に影響を及ぼす可能性があります。これは、Phi-3 Miniを検索エンジンと統合することで軽減できます。这样、モデルはリアルタイムでより広範な情報にアクセスでき、事実情報の限界を補うことができます。この統合により、Phi-3 Miniは、言語とコンテキストを包括的に理解しているが、時々情報を「調べる」必要がある、高度な会話能力を発揮できるようになります。

利用可能性

Phi-3は、Microsoft Azure AI Studio (MSFT )Hugging Face、およびOllamaなどのプラットフォームで利用可能です。Azure AIでは、モデルはデプロイ、評価、ファインチューニングのワークフローを提供し、Ollamaではラップトップでローカルに実行できます。モデルは、ONNX Runtimeに最適化されており、Windows DirectMLをサポートし、GPU、CPU、モバイルデバイスなどのさまざまなハードウェアで動作します。また、Phi-3は、NVIDIA NIM (NVDA ) を介してマイクロサービスとして提供され、標準APIを備えており、NVIDIA GPU用に最適化されています。マイクロソフトは、近い将来、Phi-3シリーズをさらに拡大し、Phi-3-small(7B)とPhi-3-medium(14B)モデルを追加して、ユーザーにさらに多くの選択肢を提供する予定です。

まとめ

マイクロソフトのPhi-3 Miniは、人工知能の分野で重大な進歩を遂げ、モバイルデバイスでの大規模言語モデルのパワーを活用しています。このモデルは、より迅速なリアルタイム処理と強化されたプライバシー機能を提供し、クラウドベースのサービスへの依存を減らし、ヘルスケアやホームオートメーションなどの分野でのAIの適用範囲を拡大します。カリキュラム学習を通じて偏りの軽減に重点を置き、大規模モデルと競合するパフォーマンスを維持することで、Phi-3 Miniは、効率的で持続可能なモバイルAIの重要なツールになり、毎日の生活でのテクノロジーとのやり取りを変革しています。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。