Модели и платформы ИИ
DeepMind представляет EmbeddingGemma 2, объединяя пять модальностей в одно пространство

Google DeepMind запустил EmbeddingGemma 2 6 октября 2026 года, открытый модель с 740 млн параметров, которая отображает текст, код, изображения, видео и аудио в единое 768‑мерное пространство вложений, выпущенную под лицензией Apache 2.0 и предназначенную для работы на потребительском оборудовании.
Модель была представлена в посте в официальном блоге Google инженерами-исследователями Google DeepMind Сахилом Дуа и Энрике Шехтером Вера. Google описывает EmbeddingGemma 2 как наиболее способную модель для мультимодальных вложений на устройстве и заявляет, что она построена на той же технологии, что и модели Gemini Embedding. Компания приводит примеры возможностей, таких как извлечение конкретного видеоклипа с помощью голосовой заметки или поиск по часам аудиозаписей с помощью текста.
Выпуск следует за оригинальной EmbeddingGemma, которую Google представил в 2025 году как легковесный вариант текстовых вложений для потребительского оборудования. Google сообщает, что модель уже более 20 млн загрузок, а разработчики используют её для поисковых инструментов на устройстве и конвейеров генерации с дополнением поиска, ориентированных на конфиденциальность.
Модульные энкодеры на базе Gemma 4
EmbeddingGemma 2 построен на архитектуре Gemma 4. Согласно карточке модели EmbeddingGemma 2, её 740 млн параметров объединяют 270‑млн‑параметров текстовую модель (130‑млн‑параметров трансформер‑ядро плюс 140‑млн‑параметров эмбеддер) с 170‑млн‑параметров визуальным энкодером и 300‑млн‑параметров аудио‑энкодером, все проецируются в общее 768‑мерное пространство. Поскольку энкодеры независимы, разработчики могут выборочно загружать 270 млн параметров для текста и кода, 440 млн для текста и зрения, 570 млн для текста и аудио, либо полную мультимодальную конфигурацию из того же контрольного пункта, и каждая конфигурация использует одно векторное пространство.
В карточке модели указана 24‑слойная архитектура с grouped‑query и multi‑query вниманием, словарь из 262 144 токенов, среднее объединение и слой проекции из 512 в 768 измерений. Все модальности используют контекстное окно в 8 192 токена, что, по словам Google, в четыре раза больше, чем у EmbeddingGemma 1. Каждая модальность расходует этот бюджет по фиксированным ставкам: 280 токенов на изображение, 140 токенов на видеокадр и 25 токенов на секунду аудио, поэтому один ввод может содержать до 29 изображений, 58 видеокадров или 5,5 минуты аудио. Перемежающиеся вводы смешивают текст и медиа, при этом специальные токены отмечают позицию каждого медиа‑элемента.
Результаты бенчмарков и усечение векторов
Google сообщает, что EmbeddingGemma 2 сохраняет многоязычную текстовую производительность своего предшественника, одновременно повышая показатель MTEB Code на 9,92 пункта — с 68,76 до 78,68. В карточке модели указаны результаты полной точности: 61,36 по MTEB multilingual (v2), 64,64 по MIEB lite, 57,28 по MMEB v2 image retrieval, 67,84 по visual‑document retrieval, 50,67 по video retrieval, 69,54 по MSEB sound retrieval и 49,39 по MAEB audio tasks. Google заявляет, что модель достигает лидирующих результатов среди мультимодальных эмбеддеров с менее чем одним миллиардом параметров и превосходит некоторые специализированные модели более чем вдвое.
Matryoshka Representation Learning позволяет разработчикам усекать выходные векторы с исходных 768 измерений до 512, 256 или 128, что, по словам Google, сокращает требования к хранению векторов до 6‑кратного уменьшения. Согласно карточке модели, качество сохраняется с минимальным влиянием до 256 измерений, тогда как 128 измерений лучше подходят для задач только с текстом. Сопроводительное руководство разработчика сообщает, что 256‑мерные векторы сохраняют около 95 % полной качества при поиске изображений, видео и речи, тогда как 128‑мерные сохраняют примерно 90 % при работе с текстом и кодом, но падают до примерно 75 % при мультимодальном поиске. Хранение одного миллиона 768‑мерных векторов в точности bfloat16 занимает примерно 1,5 ГБ памяти, указывает руководство, против около 250 МБ при 128 измерениях.
Подход к безопасности и заявленные ограничения
В карточке модели EmbeddingGemma 2 описывается как предобученная модель вложений, которая не прошла посттренировочное согласование, настройку безопасности или модерацию на уровне вывода, при этом меры безопасности сосредоточены на фильтрации данных предобучения. Эта подготовка включала фильтрацию материалов детской сексуальной эксплуатации на нескольких этапах и автоматическую фильтрацию личной информации и других чувствительных данных. Данные обучения охватывали веб‑документы, код, изображения, видео, аудио и парные кросс‑модальные образцы, при этом веб‑текст был на более чем 140 языках, а отсечка — январь 2025 года.
В карточке отмечается, что хотя модель поддерживает более 100 языков, производительность может различаться, а отсутствие рекомендованных префиксов инструкций задачи в текстовых вводах снижает точность вложений. Также предупреждается, что диапазон активаций модели превышает динамический диапазон float16, что может приводить к значениям NaN или незаметному ухудшению вложений, и рекомендуется выполнять вывод в bfloat16 или float32. Развертывания должны соответствовать Политике запрещённого использования Gemma, а карточка возлагает на разработчиков ответственность за защитные меры на уровне приложений, такие как фильтрация результатов поиска и тестирование справедливости.
Производительность на устройстве и доступность
Google сообщает, что при квантизации на Pixel 11 Pro EmbeddingGemma 2 требует всего около 191 мегабайта активной ОЗУ для весов только текста и примерно 567 мегабайта для полной мультимодальной модели. Весы доступны на Hugging Face и Kaggle, а оптимизированные для устройства версии доступны через сообщество LiteRT на Hugging Face. Модель работает через transformers, sentence-transformers 6.1.0 или новее, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio, с рекомендациями по дообучению от Unsloth и развертыванием в браузере через transformers.js и WebGPU.
MediaPipe и LiteRT от Google AI Edge обеспечивают кроссплатформенное развертывание, а MediaPipe Decision Task API поддерживает классификацию в реальном времени и маршрутизацию в мультимодальном контексте. Демонстрации, включая Instant Media Search и Video Moments Finder, поставляются в приложении Google AI Edge Gallery, а приложение Google AI Edge Foresight сочетает EmbeddingGemma 2 для локального поиска файлов с Gemma 4 для контекстного рассуждения. Поскольку обе модели используют общий токенизатор текста и архитектуру аудио‑энкодера, Google заявляет, что их совместный запуск уменьшает суммарный объём памяти. Доступность в Gemini Enterprise Agent Platform Model Garden ожидается в ближайшее время, сообщает компания.












