AIモデルとプラットフォーム
DeepMind、EmbeddingGemma 2を発表、5つのモダリティを1つの空間にマッピング

Google DeepMindは2026年10月6日にEmbeddingGemma 2を発表した。このモデルは7億4,000万パラメータのオープンモデルで、テキスト、コード、画像、動画、音声を単一の768次元埋め込み空間にマッピングし、Apache 2.0ライセンスの下でリリースされ、消費者向けハードウェア上で動作するよう設計されている。
このモデルはGoogle DeepMindの研究エンジニアSahil DuaとHenrique Schechter Veraによって、Google の公式ブログの投稿で発表された。GoogleはEmbeddingGemma 2を、オンデバイスマルチモーダル埋め込みにおいて最も高性能なモデルと説明し、Gemini Embeddingモデルと同じ技術で構築されていると述べている。同社は、音声メモで特定のビデオクリップを取得したり、テキストで数時間分の音声録音を検索したりする例を挙げている。
このリリースは、Googleが2025年に消費者向けハードウェア上でのテキスト埋め込み用軽量オプションとして導入したオリジナルのEmbeddingGemmaに続くものである。Googleによると、このモデルは2000万ダウンロードを超えており、開発者はオンデバイス検索ツールやプライバシー重視の検索拡張生成パイプラインで利用している。
Gemma 4 ベース上のモジュラーエンコーダー
EmbeddingGemma 2はGemma 4アーキテクチャ上に構築されている。EmbeddingGemma 2 モデルカードによると、740百万パラメータは、270百万パラメータのテキストモデル(130百万のトランスフォーマー・バックボーンと140百万のエンベッダーから構成)と、170百万パラメータのビジョンエンコーダー、300百万パラメータのオーディオエンコーダーを組み合わせ、すべてが共有の768次元空間に投影されている。エンコーダーが独立しているため、開発者はテキストとコード用に270百万パラメータ、テキストとビジョン用に440百万、テキストとオーディオ用に570百万、または同一チェックポイントからのフルマルチモーダル構成を選択的にロードでき、すべての構成は同一ベクトル空間を共有する。
モデルカードには、グループ化クエリとマルチクエリアテンションを備えた24層アーキテクチャ、262,144トークンの語彙、平均プーリング、512から768次元への射影層が記載されている。すべてのモダリティは8,192トークンのコンテキストウィンドウを共有し、GoogleによればこれはEmbeddingGemma 1 の4倍の大きさである。各モダリティは固定レートで予算を消費し、画像1枚あたり280トークン、ビデオフレーム1枚あたり140トークン、音声1秒あたり25トークンであるため、単一入力では最大29枚の画像、58フレームのビデオ、または5.5分の音声を保持できる。交互入力はテキストとメディアを混在させ、プレースホルダートークンで各メディア項目の位置を示す。
ベンチマーク結果とベクトルの切り詰め
Googleは、EmbeddingGemma 2が前モデルの多言語テキスト性能と同等でありながら、MTEB Codeスコアを68.76から78.68へ9.92ポイント向上させたと報告している。モデルカードのフルプレシジョン結果では、MTEB multilingual (v2)で61.36、MIEB liteで64.64、MMEB v2画像検索で57.28、ビジュアルドキュメント検索で67.84、ビデオ検索で50.67、MSEB音声検索で69.54、MAEB音声タスクで49.39と示されている。Googleによれば、このモデルは10億パラメータ未満のマルチモーダル埋め込みモデルの中でトップクラスのスコアを達成し、サイズが2倍以上の一部の専門モデルを上回っている。
Matryoshka Representation Learningにより、開発者は出力ベクトルを元の768次元から512、256、または128次元に切り詰めることができ、Googleはこれによりベクトル保存要件が最大6倍削減されると述べている。モデルカードによれば、品質は256次元までほとんど影響がなく、128次元はテキスト専用のワークロードに最適である。コンパニオン開発者ガイドでは、256次元ベクトルは画像、ビデオ、音声検索で約95%のフル品質を維持し、128次元はテキストとコードで約90%、マルチモーダル検索では約75%に低下すると報告されている。ガイドによると、bfloat16精度で768次元ベクトルを100万個保存すると約1.5ギガバイトのメモリが必要で、128次元では約250メガバイトになるという。
安全姿勢と明示された制限事項
モデルカードは、EmbeddingGemma 2を事前学習済みの埋め込みモデルとして説明しており、事後学習のアラインメントや安全チューニング、出力レベルのモデレーションは行われておらず、安全対策は主に事前学習データのフィルタリングに集中していると述べている。この準備には、複数段階での児童性的虐待コンテンツのフィルタリングや、個人情報およびその他の機密データの自動フィルタリングが含まれていた。トレーニングデータはウェブ文書、コード、画像、動画、音声、そしてクロスモダリティのペアサンプルで構成され、ウェブテキストは140以上の言語にわたり、カットオフは2025年1月となっている。
カードは、モデルは100以上の言語をサポートしているものの、言語間で性能が均等でない可能性があること、テキスト入力で推奨されるタスク指示プレフィックスを省略すると埋め込み精度が低下することを指摘している。また、モデルの活性化範囲がfloat16の動的範囲を超えており、NaN値が発生したり埋め込みが静かに劣化したりする恐れがあるため、推論はbfloat16またはfloat32を使用するよう指示している。デプロイはGemma禁止使用ポリシーに従う必要があり、カードは開発者に検索フィルタリングや公平性テストといったアプリケーションレベルの安全策の責任を課している。
オンデバイス性能と利用可能性
Googleは、Pixel 11 Proで量子化を行うと、EmbeddingGemma 2はテキストのみの重みで約191メガバイト、フルマルチモーダルモデルで約567メガバイトのアクティブRAMしか必要としないと報告しています。重みはHugging FaceとKaggleで入手可能で、LiteRT Communityを通じてHugging Face上でデバイス最適化版も提供されています。モデルはtransformers、sentence-transformers 6.1.0以降、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudioで動作し、Unslothによるファインチューニングガイダンスと、transformers.jsとWebGPUを用いたブラウザ展開が可能です。
Google AI EdgeのMediaPipeとLiteRTはクロスプラットフォーム展開を処理し、MediaPipe Decision Task APIはマルチモーダルコンテキスト上でリアルタイム分類とルーティングをサポートします。Instant Media SearchやVideo Moments Finderを含むデモはGoogle AI Edge Galleryアプリで提供され、Google AI Edge Foresightアプリはローカルファイル検索用にEmbeddingGemma 2を、コンテキスト推論用にGemma 4と組み合わせます。2つのモデルはテキストトークナイザーとオーディオエンコーダーアーキテクチャを共有しているため、同時に実行すると合計メモリフットプリントが削減されるとGoogleは述べています。Gemini Enterprise Agent Platform Model Gardenでの利用可能化は、同社によると近日中に予定されています。












