AI 模型与平台
DeepMind 推出 EmbeddingGemma 2,将五种模态映射到同一空间

Google DeepMind 于 2026 年 10 月 6 日发布了 EmbeddingGemma 2,这是一款拥有 7.4 亿参数的开源模型,可将文本、代码、图像、视频和音频映射到单一的 768 维嵌入空间,采用 Apache 2.0 许可证,并设计用于在消费级硬件上运行。
该模型在 Google 官方博客上的一篇文章中由 Google DeepMind 研究工程师 Sahil Dua 和 Henrique Schechter Vera 公开亮相。Google 将 EmbeddingGemma 2 描述为最强大的本地多模态嵌入模型,并称其基于与 Gemini Embedding 系列相同的技术。公司列举的能力示例包括使用语音备忘录检索特定视频片段,或通过文本查询数小时的音频录音。
此发布紧随原始 EmbeddingGemma 之后,后者于 2025 年由 Google 推出,作为面向消费级硬件的轻量级文本嵌入选项。Google 报告称该模型已超过 2000 万次下载,开发者将其用于本地搜索工具和以隐私为先的检索增强生成流水线。
基于 Gemma 4 的模块化编码器
EmbeddingGemma 2 基于 Gemma 4 架构构建。根据 EmbeddingGemma 2 模型卡,其 7.4 亿参数包括一个 2.7 亿参数的文本模型(1300 万的 Transformer 主干加上 1.4 亿的嵌入器),以及一个 1.7 亿参数的视觉编码器和一个 3.0 亿参数的音频编码器,全部投射到共享的 768 维空间。由于编码器相互独立,开发者可以从同一检查点有选择地加载 2.7 亿参数用于文本和代码,4.4 亿用于文本和视觉,5.7 亿用于文本和音频,或完整的多模态配置,并且所有配置共享同一向量空间。
模型卡列出了 24 层架构,采用分组查询和多查询注意力机制,词表大小为 262,144,使用均值池化,并有一个从 512 投射到 768 维的投影层。所有模态共享 8,192 token 的上下文窗口,Google 称其是 EmbeddingGemma 1 的四倍。每种模态以固定速率消耗该预算:每张图像 280 token,每帧视频 140 token,每秒音频 25 token,因此单个输入最多可容纳 29 张图像、58 帧视频或 5.5 分钟音频。交错输入可混合文本和媒体,使用占位 token 标记每个媒体项的位置。
基准结果与向量截断
Google 报告称 EmbeddingGemma 2 在多语言文本性能上与前代持平,同时将其 MTEB Code 分数提升了 9.92 分,从 68.76 提升至 78.68。模型卡的全精度结果显示:MTEB 多语言(v2)得分 61.36,MIEB lite 为 64.64,MMEB v2 图像检索为 57.28,视觉文档检索为 67.84,视频检索为 50.67,MSEB 声音检索为 69.54,MAEB 音频任务为 49.39。Google 表示,该模型在参数量不足十亿的多模态嵌入模型中取得领先成绩,并且在某些专用模型上表现出超过两倍规模的优势。
Matryoshka 表示学习允许开发者将原生的 768 维向量截断至 512、256 或 128 维,Google 称这可将向量存储需求降低至最高 6 倍。模型卡指出,质量在降至 256 维时仍保持基本不变,而 128 维最适合仅文本工作负载。配套开发者指南 报告称,256 维向量在图像、视频和语音检索上保留约 95% 的完整质量,128 维在文本和代码上保留约 90%,但在多模态检索上降至约 75%。指南称,存储一百万个 768 维向量(bfloat16 精度)约需 1.5 GB 内存,而在 128 维时约为 250 MB。
安全姿态与声明限制
模型卡将 EmbeddingGemma 2 描述为未经过后训练对齐、安全调优或输出层审查的预训练嵌入模型,其安全缓解措施主要集中在对预训练数据的过滤。该准备工作包括在多个阶段过滤儿童性虐待材料,并自动过滤个人信息及其他敏感数据。训练数据涵盖网页文档、代码、图像、视频、音频以及跨模态配对样本,网页文本涉及 140 多种语言,数据截止至 2025 年 1 月。
卡片指出,尽管模型支持超过 100 种语言,但各语言的性能可能不尽相同;在文本输入上省略推荐的任务指令前缀会降低嵌入精度。它还警告模型的激活范围超出 float16 的动态范围,可能导致 NaN 值或嵌入质量悄然下降,建议使用 bfloat16 或 float32 推理。部署必须遵守 Gemma 禁止使用政策,卡片将开发者的责任归于应用层面的安全措施,如检索过滤和公平性测试。
本地性能与可用性
Google 报告称,在 Pixel 11 Pro 上进行量化后,EmbeddingGemma 2 对于仅文本权重的需求低至约 191 兆字节的活跃 RAM,而完整多模态模型约需 567 兆字节。权重可在 Hugging Face 和 Kaggle 获取,并通过 Hugging Face 上的 LiteRT 社区提供设备端优化版本。该模型可通过 transformers、sentence-transformers 6.1.0 或更高版本、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 运行,并提供来自 Unsloth 的微调指南,以及通过 transformers.js 和 WebGPU 的浏览器部署。
Google AI Edge 的 MediaPipe 和 LiteRT 负责跨平台部署,并且 MediaPipe Decision Task API 支持在多模态上下文中的实时分类和路由。包括 Instant Media Search 和 Video Moments Finder 在内的演示已随 Google AI Edge Gallery 应用发布,而 Google AI Edge Foresight 应用将 EmbeddingGemma 2 与 Gemma 4 配对,前者用于本地文件检索,后者用于上下文推理。由于这两个模型共享文本分词器和音频编码器架构,Google 表示一起运行可降低它们的总体内存占用。公司称,Gemini Enterprise Agent Platform Model Garden 中的可用性即将推出。












