AIモデルとプラットフォーム

メタのLlama 3.2:オープンソースのジェネレーティブAIを再定義するオンデバイスおよびマルチモーダル機能

mm
Unite.AI を Google の優先ソースに追加

メタのLlama 3.2の最近のリリースは、オープンソースのジェネレーティブAIエコシステムの進化において重要な発展です。このアップグレードにより、Llamaの機能が2つの次元で拡大します。一方では、Llama 3.2はマルチモーダルデータの処理を可能にし、画像、テキスト、その他を統合して、高度なAI機能をより広いオーディエンスに提供します。他方では、エッジデバイスでの展開の可能性を拡大し、リアルタイムのオンデバイスAIアプリケーションのための魅力的な機会を生み出します。この記事では、この開発とそのAI展開の将来への影響について探ります。

Llamaの進化

メタのLlamaとの旅は2023年初頭に始まり、その間、シリーズは爆発的な成長と採用を経験しました。Llama 1から始まり、非商用利用のみに限定され、選択された研究機関のみにアクセス可能でしたが、2023年のLlama 2のリリースにより、オープンソースの領域に移行しました。今年初めにリリースされたLlama 3.1は、405億パラメータの最大のオープンソースモデルを導入し、独自の競合他社と同等かそれを超えるものでした。最新のリリースであるLlama 3.2は、新しい軽量モデルとビジョンに焦点を当てたモデルを導入し、オンデバイスAIとマルチモーダル機能をよりアクセスしやすくしています。メタのオープン性と変更可能性への取り組みにより、Llamaはオープンソースコミュニティのリーディングモデルになりました。同社は、透明性とアクセシビリティへの取り組みを維持することで、AIの革新をより効果的に推進できるという信念を持っています。

Llama 3.2の紹介

Llama 3.2は、さまざまな要件を満たすように設計された言語モデルのバリエーションを含むメタのLlamaシリーズの最新バージョンです。最大サイズと中サイズのモデル、90億と11億パラメータは、テキストと画像を含むマルチモーダルデータの処理を可能にします。これらのモデルは、チャート、グラフ、その他の視覚的なデータを解釈することができ、コンピュータビジョン、ドキュメント分析、拡張現実ツールなどの分野でのアプリケーションの構築に適しています。軽量モデル、1億と3億パラメータは、モバイルデバイス専用に設計されています。これらのテキストのみのモデルは、多言語テキスト生成とツール呼び出しの機能に優れており、リトリーバー増強生成、要約、エッジデバイスでのパーソナライズされたエージェントベースのアプリケーションの作成などのタスクに非常に効果的です。

Llama 3.2の重要性

このLlama 3.2のリリースは、2つの重要な分野で進歩を示しています。

マルチモーダルAIの新時代

Llama 3.2は、テキストと画像の処理能力を備えたメタの最初のオープンソースモデルです。これは、オープンソースのジェネレーティブAIの進化において重要な発展です。モデルは、視覚的な入力とともにテキストデータを分析および応答できるようになりました。たとえば、ユーザーは画像をアップロードし、オブジェクトの識別やキャプションの生成などの自然言語プロンプトに基づいて詳細な分析または修正を受け取ることができます。マーク・ザッカーバーグは、Llama 3.2が「視覚的な理解を必要とする多くの魅力的なアプリケーションを可能にするように設計されている」と発言しました。この統合により、視覚的な情報に依存する業界、たとえば小売、ヘルスケア、教育、エンターテイメントのためのLlamaの範囲が拡大します。

アクセシビリティのためのオンデバイス機能

Llama 3.2の特徴的な機能の1つは、特にモバイル環境でのエッジデバイスでの展開の最適化です。1億と3億パラメータの軽量バージョンは、QualcommとMediaTekのハードウェアを搭載したスマートフォンやその他のエッジデバイスで実行するように設計されています。このユーティリティにより、開発者は広範な計算リソースを必要とせずにアプリケーションを作成できます。また、これらのモデルバージョンは、多言語テキスト処理に優れており、128Kトークンの長いコンテキスト長をサポートし、ユーザーがネイティブ言語で自然言語処理アプリケーションを開発できるようになります。また、これらのモデルにはツール呼び出しの機能があり、ユーザーがデバイス上で直接カレンダーの招待や旅行の計画などのエージェントアプリケーションに参加できるようになります。

競争上の優位性

メタは、Llama 3.2がOpenAIとAnthropicのリーディングモデルと比較して競争力を持っていることを報告しています。同社は、Llama 3.2が、指示の実行やコンテンツの要約タスクを含むさまざまなベンチマークで、Claude 3-HaikuやGPT-4o-miniなどのライバルを上回っていることを主張しています。この競争上の優位性は、急速に進化しているジェネレーティブAIの分野で、オープンソースAIが独自のモデルと同等のレベルを維持することを目指しているメタにとって非常に重要です。

Llama Stack:AIの展開を簡素化

Llama 3.2のリリースの重要な側面の1つは、Llama Stackの導入です。このツールのスイートは、開発者がさまざまな環境、単一ノード、オンプレミス、クラウド、オンデバイス設定でLlamaモデルを簡単に使用できるようにします。Llama Stackには、RAGとツール呼び出しが可能なアプリケーションに対するサポートが含まれており、ジェネレーティブAIモデルの展開のための柔軟で包括的なフレームワークを提供します。展開プロセスを簡素化することで、メタは開発者がクラウド、モバイル、デスクトップ環境向けのアプリケーションにLlamaモデルを容易に統合できるようにしています。

まとめ

メタのLlama 3.2は、オープンソースのジェネレーティブAIの進化における重要な瞬間であり、新しい基準をアクセシビリティ、機能性、汎用性の面で設定しています。オンデバイス機能とマルチモーダル処理により、このモデルは、ヘルスケアから教育まで、プライバシー、レイテンシ、インフラの制限などの重要な懸念に対処しながら、業界全体で変革的な可能性を開拓します。開発者が高度なAIをローカルで効率的に展開できるようにすることで、Llama 3.2は、AIアプリケーションの範囲を拡大するだけでなく、先端技術へのアクセスを世界規模で民主化します。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。