KI-Modelle und Plattformen
DeepMind stellt EmbeddingGemma 2 vor, das fünf Modalitäten in einen gemeinsamen Raum abbildet

Google DeepMind hat am 6. Oktober 2026 EmbeddingGemma 2 veröffentlicht, ein offenes Modell mit 740 Millionen Parametern, das Text, Code, Bilder, Video und Audio in einen einzigen 768‑dimensionalen Einbettungsraum abbildet, unter der Apache‑2.0‑Lizenz veröffentlicht und für den Betrieb auf Consumer‑Hardware konzipiert ist.
Das Modell wurde in ein Beitrag im offiziellen Blog von Google von den Google DeepMind‑Forschungsingenieuren Sahil Dua und Henrique Schechter Vera vorgestellt. Google beschreibt EmbeddingGemma 2 als das leistungsfähigste Modell für multimodale Einbettungen auf dem Gerät und gibt an, dass es mit derselben Technologie wie die Gemini‑Embedding‑Modelle gebaut wurde. Das Unternehmen nennt Anwendungsbeispiele wie das Abrufen eines bestimmten Videoclips mittels Sprachnotiz oder das Abfragen von Stunden an Audioaufnahmen mittels Text.
Die Veröffentlichung folgt auf das ursprüngliche EmbeddingGemma, das Google 2025 als leichtgewichtige Option für Texteinbettungen auf Consumer‑Hardware eingeführt hat. Google berichtet, dass das Modell mehr als 20 Millionen Downloads erreicht hat, wobei Entwickler es für Suchwerkzeuge auf dem Gerät und für datenschutzorientierte Retrieval‑augmented‑Generation‑Pipelines einsetzen.
Modulare Encoder auf einer Gemma‑4‑Basis
EmbeddingGemma 2 basiert auf der Gemma‑4‑Architektur. Laut der EmbeddingGemma 2 Modellkarte kombinieren die 740 Millionen Parameter ein 270‑Millionen‑Parameter‑Textmodell (ein 130‑Millionen‑Transformer‑Backbone plus ein 140‑Millionen‑Einbettungsmodul) mit einem 170‑Millionen‑Parameter‑Vision‑Encoder und einem 300‑Millionen‑Parameter‑Audio‑Encoder, die alle in den gemeinsamen 768‑dimensionalen Raum projizieren. Da die Encoder unabhängig sind, können Entwickler gezielt 270 Millionen Parameter für Text und Code, 440 Millionen für Text und Vision, 570 Millionen für Text und Audio oder die vollständige multimodale Konfiguration aus demselben Checkpoint laden, wobei jede Konfiguration denselben Vektorraum nutzt.
Die Modellkarte führt eine 24‑schichtige Architektur mit gruppierter und mehrfacher Abfrage‑Aufmerksamkeit, einem Vokabular von 262 144 Token, Mittelwert‑Pooling und einer Projektionsschicht von 512 auf 768 Dimensionen auf. Alle Modalitäten teilen ein Kontextfenster von 8 192 Token, das Google als viermal größer als das von EmbeddingGemma 1 bezeichnet. Jede Modalität verbraucht dieses Budget zu festen Raten: 280 Token pro Bild, 140 Token pro Videoframe und 25 Token pro Sekunde Audio, sodass ein einzelner Input bis zu 29 Bilder, 58 Videoframes oder 5,5 Minuten Audio enthalten kann. Verschachtelte Eingaben kombinieren Text und Medien, wobei Platzhalter‑Token die Position jedes Medienelements markieren.
Benchmark‑Ergebnisse und Vektorkürzung
Google berichtet, dass EmbeddingGemma 2 die mehrsprachige Textleistung seines Vorgängers erreicht und dabei seinen MTEB‑Code‑Score um 9,92 Punkte von 68,76 auf 78,68 erhöht. Die Vollpräzisions‑Ergebnisse der Modellkarte zeigen 61,36 bei MTEB multilingual (v2), 64,64 bei MIEB lite, 57,28 bei MMEB v2 Bildabruf, 67,84 bei visueller Dokumenten‑Abruf, 50,67 bei Video‑Abruf, 69,54 bei MSEB Sound‑Abruf und 49,39 bei MAEB Audio‑Aufgaben. Google sagt, das Modell erzielt Spitzenwerte unter den multimodalen Einbettungsmodellen mit weniger als einer Milliarde Parametern und übertrifft einige spezialisierte Modelle um das Mehrfache seiner Größe.
Matryoshka Representation Learning ermöglicht es Entwicklern, Ausgabevektoren von den nativen 768 Dimensionen auf 512, 256 oder 128 zu kürzen, was Google zufolge den Speicherbedarf für Vektoren um bis zu das Sechsfache reduziert. Laut der Modellkarte bleibt die Qualität bis zu 256 Dimensionen mit minimalen Einbußen erhalten, während 128 Dimensionen am besten für reine Text‑Workloads geeignet sind. Eine begleitende Entwickleranleitung berichtet, dass 256‑dimensionale Vektoren etwa 95 % der vollen Qualität bei Bild‑, Video‑ und Spracherkennung behalten, während 128 Dimensionen rund 90 % bei Text und Code bewahren, jedoch bei multimodaler Abrufung auf etwa 75 % fallen. Das Speichern von einer Million 768‑dimensionalen Vektoren in bfloat16‑Präzision beansprucht laut Anleitung etwa 1,5 Gigabyte Speicher, verglichen mit etwa 250 Megabyte bei 128 Dimensionen.
Sicherheitsposition und genannte Einschränkungen
Die Modellkarte beschreibt EmbeddingGemma 2 als vortrainiertes Einbettungsmodell, das keine nachträgliche Ausrichtung, Sicherheitsabstimmung oder Moderation auf Ausgabebene erfahren hat, wobei die Sicherheitsmaßnahmen hauptsächlich auf das Filtern der Vortrainingsdaten abzielen. Diese Vorbereitung umfasste das Filtern von Kinderpornografie in mehreren Stufen sowie die automatisierte Filterung persönlicher Informationen und anderer sensibler Daten. Die Trainingsdaten umfassten Webdokumente, Code, Bilder, Video, Audio und gepaarte Cross‑Modalitäts‑Beispiele, wobei Webtexte in mehr als 140 Sprachen enthalten waren und ein Stichtag von Januar 2025 gilt.
Die Karte weist darauf hin, dass das Modell zwar mehr als 100 Sprachen unterstützt, die Leistung jedoch nicht in allen gleich sein muss, und dass das Weglassen der empfohlenen Aufgaben‑Instruktions‑Präfixe bei Texteingaben die Einbettungspräzision verringert. Sie warnt zudem, dass der Aktivierungsbereich des Modells die Dynamik von float16 überschreitet, was NaN‑Werte oder stillschweigend degradierte Einbettungen erzeugen kann, und empfiehlt die Inferenz in bfloat16 oder float32. Implementierungen müssen die Gemma‑Richtlinie für verbotene Nutzung einhalten, und die Karte legt die Verantwortung für anwendungsseitige Schutzmaßnahmen wie Abruffilterung und Fairness‑Tests den Entwicklern zu.
Leistung und Verfügbarkeit auf dem Gerät
Google berichtet, dass bei Quantisierung auf einem Pixel 11 Pro EmbeddingGemma 2 nur etwa 191 Megabyte aktiven RAM für rein textbasierte Gewichte und etwa 567 Megabyte für das vollständige multimodale Modell benötigt. Die Gewichte sind auf Hugging Face und Kaggle verfügbar, mit geräteoptimierten Versionen über die LiteRT Community auf Hugging Face. Das Modell läuft über transformers, sentence-transformers 6.1.0 oder neuer, MLX, vLLM, llama.cpp, SGLang, Ollama und LMStudio, mit Feinabstimmungs‑Hinweisen von Unsloth und Browser‑Bereitstellung über transformers.js und WebGPU.
Google AI Edge’s MediaPipe und LiteRT übernehmen die plattformübergreifende Bereitstellung, und eine MediaPipe Decision Task API unterstützt Echtzeit‑Klassifizierung und -Routing im multimodalen Kontext. Demos, darunter Instant Media Search und Video Moments Finder, werden in der Google AI Edge Gallery app ausgeliefert, und die Google AI Edge Foresight app kombiniert EmbeddingGemma 2 für die lokale Dateisuche mit Gemma 4 für kontextuelles Schließen. Da beide Modelle denselben Text‑Tokenizer und dieselbe Audio‑Encoder‑Architektur teilen, sagt Google, dass ihr gemeinsamer Einsatz den kombinierten Speicherbedarf senkt. Die Verfügbarkeit im Gemini Enterprise Agent Platform Model Garden wird laut Unternehmen in Kürze kommen.












