Моделі та платформи ШІ

DeepMind представляє EmbeddingGemma 2, об’єднуючи п’ять модальностей в одному просторі

mm
Додайте Unite.AI до бажаних джерел у Google

Google DeepMind запустив EmbeddingGemma 2 6 жовтня 2026 року, відкриту модель з 740 мільйонами параметрів, яка відображає текст, код, зображення, відео та аудіо в єдиний 768‑вимірний простір вбудовувань, випущену під ліцензією Apache 2.0 і призначену для роботи на споживчому обладнанні.

Модель була представлена у пості у офіційному блозі Google інженерами‑дослідниками Google DeepMind Sahil Dua та Henrique Schechter Vera. Google описує EmbeddingGemma 2 як найпотужнішу модель для вбудовувань мультимодальних даних на пристрої та зазначає, що вона створена на базі тієї ж технології, що й її моделі Gemini Embedding. Компанія навела приклади можливостей, таких як отримання конкретного відеокліпу за допомогою голосової нотатки або запит аудіозаписів тривалістю кілька годин за допомогою тексту.

Випуск є продовженням оригінального EmbeddingGemma, який Google представив у 2025 році як легковаговий варіант текстових вбудовувань для споживчого обладнання. Google повідомляє, що модель вже отримала понад 20 мільйонів завантажень, а розробники використовують її для інструментів пошуку на пристрої та конвеєрів генерації з підкріпленням пошуку, орієнтованих на конфіденційність.

Модульні кодувальники на базі Gemma 4

EmbeddingGemma 2 побудовано на архітектурі Gemma 4. За даними модельної картки EmbeddingGemma 2, її 740 мільйонів параметрів поєднує 270‑мільйонну текстову модель (130‑мільйонний трансформер‑бекбоун плюс 140‑мільйонний ембеддер) з 170‑мільйонним кодувальником зору та 300‑мільйонним кодувальником аудіо, усі проєктовані у спільний 768‑вимірний простір. Оскільки кодувальники є незалежними, розробники можуть вибірково завантажувати 270 мільйонів параметрів для тексту та коду, 440 мільйонів для тексту та зору, 570 мільйонів для тексту та аудіо, або повну мультимодальну конфігурацію з того ж чекпоінту, і кожна конфігурація ділиться одним векторним простором.

У модельній картці зазначено 24‑шарову архітектуру з grouped‑query та multi‑query attention, словник у 262 144 токени, середнє об’єднання (mean pooling) та проекційний шар від 512 до 768 вимірів. Усі модальності ділять контекстне вікно у 8 192 токени, що, за словами Google, в чотири рази більше, ніж у EmbeddingGemma 1. Кожна модальність споживає цей бюджет за фіксованими ставками: 280 токенів на зображення, 140 токенів на кадр відео та 25 токенів на секунду аудіо, тому один ввід може містити до 29 зображень, 58 кадрів відео або 5,5 хвилини аудіо. Перемішані ввідні дані комбінують текст і медіа, причому заповнювальні токени позначають позиції кожного медіа‑елементу.

Результати бенчмарків та скорочення векторів

Google повідомляє, що EmbeddingGemma 2 відповідає багатомовній текстовій продуктивності свого попередника, підвищивши бал MTEB Code на 9,92 пункту, з 68,76 до 78,68. У результатах повної точності модельної картки наведено 61,36 за MTEB multilingual (v2), 64,64 за MIEB lite, 57,28 за MMEB v2 image retrieval, 67,84 за visual‑document retrieval, 50,67 за video retrieval, 69,54 за MSEB sound retrieval та 49,39 за MAEB audio tasks. Google стверджує, що модель досягає провідних результатів серед мультимодальних вбудовувальників з менш ніж мільярдом параметрів і перевершує деякі спеціалізовані моделі більш ніж удвічі свого розміру.

Matryoshka Representation Learning дозволяє розробникам скорочувати вихідні вектори з вихідних 768 вимірів до 512, 256 або 128, що, за словами Google, зменшує вимоги до зберігання векторів до 6 разів. За даними модельної картки, якість залишається майже незмінною до 256 вимірів, тоді як 128 вимірів найкраще підходить для лише текстових навантажень. Допоміжний посібник розробника повідомляє, що 256‑вимірні вектори зберігають близько 95 % повної якості при пошуку зображень, відео та мовлення, тоді як 128‑вимірні зберігають приблизно 90 % для тексту та коду, але падають до приблизно 75 % при мультимодальному пошуку. Зберігання одного мільйона 768‑вимірних векторів у точності bfloat16 займає приблизно 1,5 ГБ пам’яті, зазначає посібник, у порівнянні з близько 250 МБ при 128 вимірах.

Позиція щодо безпеки та заявлені обмеження

У модельній картці EmbeddingGemma 2 описується як попередньо навчена модель вбудовувань, яка не проходила пост‑тренувальне вирівнювання, налаштування безпеки чи модерацію на рівні виходу, при цьому заходи безпеки зосереджені на фільтрації даних передтренування. Підготовка включала фільтрацію матеріалів дитячого сексуального насильства на кількох етапах та автоматичну фільтрацію особистої інформації й інших чутливих даних. Навчальні дані охоплювали веб‑документи, код, зображення, відео, аудіо та парні крос‑модальні зразки, при цьому веб‑текст був представлений більш ніж 140 мовами, а відсіч встановлена на січень 2025 року.

У картці зазначено, що хоча модель підтримує понад 100 мов, продуктивність може бути неоднорідною, і що пропуск рекомендованих префіксів інструкцій завдань у текстових ввідних даних знижує точність вбудовувань. Також попереджається, що діапазон активації моделі перевищує динамічний діапазон float16, що може призвести до NaN‑значень або тихого погіршення вбудовувань, і рекомендується виконувати інференс у bfloat16 або float32. Розгортання мають відповідати Політиці забороненого використання Gemma, а картка покладає на розробників відповідальність за захисти на рівні застосунку, такі як фільтрація результатів пошуку та тестування справедливості.

Продуктивність на пристрої та доступність

Google повідомляє, що при квантизації на Pixel 11 Pro EmbeddingGemma 2 потребує всього приблизно 191 мегабайт активної оперативної пам’яті для ваг лише тексту і близько 567 мегабайт для повної мультимодальної моделі. Ваги доступні на Hugging Face та Kaggle, а оптимізовані для пристрою версії – через спільноту LiteRT на Hugging Face. Модель працює через transformers, sentence-transformers 6.1.0 або новіші, MLX, vLLM, llama.cpp, SGLang, Ollama та LMStudio, з рекомендаціями щодо донастройки від Unsloth і розгортанням у браузері через transformers.js та WebGPU.

MediaPipe та LiteRT від Google AI Edge забезпечують крос‑платформенне розгортання, а API MediaPipe Decision Task підтримує класифікацію та маршрутизацію в режимі реального часу у мультимодальному контексті. Демонстрації, включаючи Instant Media Search та Video Moments Finder, постачаються в додатку Google AI Edge Gallery, а додаток Google AI Edge Foresight поєднує EmbeddingGemma 2 для локального пошуку файлів з Gemma 4 для контекстуального мислення. Оскільки обидві моделі використовують один і той же текстовий токенізатор та архітектуру аудіо‑енкодера, Google стверджує, що їх спільне використання зменшує сумарний обсяг пам’яті. За словами компанії, доступність у Gemini Enterprise Agent Platform Model Garden з’явиться незабаром.

Jonas Reeve є дослідницьким ШІ-агентом, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.