AI-mallit ja alustat

DeepMind lanseeraa EmbeddingGemma 2:n, kartoittaen viisi modaliteettia yhteen tilaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Google DeepMind lanseeri EmbeddingGemma 2:n 6. lokakuuta 2026, 740 miljoonaa parametria sisältävän avoimen mallin, joka kartoittaa tekstin, koodin, kuvat, videon ja äänen yhdeksi 768‑dimensioiseksi upotusavaruudeksi, julkaistu Apache 2.0 -lisenssillä ja suunniteltu toimimaan kuluttajalaitteistolla.

Malli esiteltiin julkaisussa Googlen virallisessa blogissa Google DeepMind -tutkimusinsinöörien Sahil Dua ja Henrique Schechter Vera toimesta. Google kuvaa EmbeddingGemma 2:n olevan tehokkain malli laitteistossa tapahtuvaan multimodaaliseen upotukseen, ja toteaa sen perustuvan samaan tekniikkaan kuin Gemini Embedding -mallit. Yritys listaa käyttöesimerkkejä, kuten tietyn videoleikkeen hakemisen äänimuistion avulla tai tunteja äänitallenteita koskevan kyselyn tekstillä.

Julkaisu seuraa alkuperäistä EmbeddingGemmaa, jonka Google esitteli vuonna 2025 kevyenä vaihtoehtona tekstin upotuksille kuluttajalaitteilla. Google raportoi, että malli on ylittänyt 20 miljoonaa latausta, ja kehittäjät käyttävät sitä laitteistossa tapahtuvien hakutyökalujen ja yksityisyyttä ensisijaisesti huomioivien hakupohjaisten generointiputkien yhteydessä.

Modulaariset enkooderit Gemma 4 -pohjalla

EmbeddingGemma 2 on rakennettu Gemma 4 -arkkitehtuurin päälle. EmbeddingGemma 2 -mallikortti mukaan sen 740 miljoonaa parametria yhdistävät 270 miljoonan parametrin tekstimalli (130 miljoonan transformeri‑runko plus 140 miljoonan upottaja) 170 miljoonan parametrin näköenkooderin ja 300 miljoonan parametrin ääni‑enkooderin, kaikki projisoituna yhteiseen 768‑dimensioiseen tilaan. Koska enkooderit ovat itsenäisiä, kehittäjät voivat valikoivasti ladata 270 miljoonaa parametria tekstille ja koodille, 440 miljoonaa tekstille ja näköön, 570 miljoonaa tekstille ja äänelle tai täyden multimodaalikonfiguraation samasta tarkistuspisteestä, ja kaikki konfiguraatiot jakavat yhden vektoritilan.

Mallikortti luettelee 24‑kerroksisen arkkitehtuurin, jossa on ryhmitelty kysely- ja monikysely‑huomio, 262 144 tokenin sanasto, keskiarvopoolaus ja projektiokerros 512‑stä 768‑aan dimensioon. Kaikki modaliteetit jakavat 8 192 tokenin kontekstinikkunan, jonka Google toteaa olevan neljä kertaa suurempi kuin EmbeddingGemma 1:n. Jokainen modaliteetti kuluttaa tätä budjettia kiinteillä nopeuksilla: 280 tokenia per kuva, 140 tokenia per videokehys ja 25 tokenia per sekunti ääntä, joten yksi syöte voi sisältää enintään 29 kuvaa, 58 videokehystä tai 5,5 minuuttia ääntä. Interletoidut syötteet sekoittavat tekstiä ja mediaa, jossa paikkamerkitokenit merkitsevät kunkin median kohdan sijaintia.

Vertailutulokset ja vektorien supistaminen

Google raportoi, että EmbeddingGemma 2 vastaa edeltäjänsä monikielisen tekstin suorituskykyä samalla kun se nostaa MTEB Code -pistemäärän 9,92 pisteellä, 68,76:sta 78,68:aan. Mallikortin täysprecision tulokset listaavat 61,36 MTEB multilingual (v2) -testissä, 64,64 MIEB lite -testissä, 57,28 MMEB v2 -kuvahaussa, 67,84 visuaalinen-dokumentti‑haussa, 50,67 videohauissa, 69,54 MSEB‑äänihauissa ja 49,39 MAEB‑äänitehtävissä. Google toteaa, että malli saavuttaa johtavia pisteitä multimodaalisissa upottajissa, joiden parametrimäärä on alle miljardi, ja ylittää joitakin erikoismalleja yli kaksinkertaisella koon määrällä.

Matryoshka-representaatiolearning antaa kehittäjille mahdollisuuden supistaa tulosvektoreita alkuperäisestä 768‑dimensiosta 512, 256 tai 128, mikä Google mukaan vähentää vektorivarastoinnin vaatimuksia jopa 6‑kertaiseksi. Mallikortin mukaan laatu säilyy vähäisellä vaikutuksella jopa 256 dimensioon asti, kun taas 128 dimensio sopii parhaiten pelkästään teksti‑työkuormiin. lisäkehittäjäopas raportoi, että 256‑dimensioiset vektorit säilyttävät noin 95 % täyden laadun kuvan, videon ja puhehaussa, kun taas 128 dimensio säilyttää noin 90 % tekstissä ja koodissa, mutta laskee noin 75 % multimodaalisessa haussa. Yhden miljoonan 768‑dimensioisen vektorin tallentaminen bfloat16‑tarkkuudella vie noin 1,5 gigatavua muistia, opas toteaa, verrattuna noin 250 megatavuun 128‑dimensiota.

Turvallisuusasenne ja ilmoitetut rajoitukset

Mallikortti kuvaa EmbeddingGemma 2:n esikoulutettuna upotusmallina, joka ei ole käynyt läpi jälkikoulutuksen kohdistamista, turvallisuussäätöä tai tulostason moderointia, ja jonka turvallisuusmitigointi keskittyy esikoulutusaineiston suodatukseen. Tämä valmistelu sisälsi lapsiin kohdistuvan seksuaalisen hyväksikäytön materiaalin suodattamisen useissa vaiheissa sekä automatisoidun henkilökohtaisten tietojen ja muiden arkaluontoisten tietojen suodattamisen. Koulutusdata kattoi verkkodokumentit, koodin, kuvat, videon, äänen ja paritetut monimodaaliset näytteet, verkkoteksti yli 140 kielellä ja leikkauspisteen tammikuu 2025.

Kortti huomauttaa, että vaikka malli tukee yli 100 kieltä, suorituskyky ei välttämättä ole tasainen niiden välillä, ja että suositeltujen tehtäväohjeiden etuliitteiden pois jättäminen teksti‑syötteissä heikentää upotuksen tarkkuutta. Se varoittaa myös, että mallin aktivointialue ylittää float16:n dynaamisen alueen, mikä voi johtaa NaN‑arvoihin tai hiljaiseen upotusten heikkenemiseen, ja ohjaa inferenssin bfloat16‑ tai float32‑tarkkuuteen. Käyttöönottojen on noudatettava Gemma Prohibited Use Policy -käyttökieltoa, ja kortti asettaa kehittäjille vastuuta sovellus‑tason suojauksista, kuten hakusuodatuksesta ja oikeudenmukaisuustestauksesta.

Laitteessa tapahtuva suorituskyky ja saatavuus

Google raportoi, että kvantisoinnin avulla Pixel 11 Prossa EmbeddingGemma 2 tarvitsee vain noin 191 megatavua aktiivista RAM-muistia pelkästään tekstipainotteisiin painoihin ja noin 567 megatavua täyteen multimodaaliseen malliin. Painot ovat saatavilla Hugging Face -palvelussa ja Kagglessa, ja laitteistolle optimoituja versioita on LiteRT Communityn kautta Hugging Facessa. Malli toimii transformerien, sentence-transformers 6.1.0:n tai uudemman, MLX:n, vLLM:n, llama.cpp:n, SGLang:n, Ollaman ja LMStudion kautta, ja hienosäätöohjeita tarjoaa Unsloth sekä selainkäyttöön toteutetaan transformers.js:n ja WebGPU:n avulla.

Google AI Edge:n MediaPipe ja LiteRT hoitavat monialustaisen käyttöönoton, ja MediaPipe Decision Task -rajapinta tukee reaaliaikaista luokittelua ja reititystä multimodaalisessa kontekstissa. Demonstraatiot, kuten Instant Media Search ja Video Moments Finder, sisältyvät Google AI Edge Gallery -sovellukseen, ja Google AI Edge Foresight -sovellus yhdistää EmbeddingGemma 2:n paikalliseen tiedostonhakuun Gemma 4:n kanssa kontekstuaalista päättelyä varten. Koska kaksi mallia jakavat saman tekstitokenisoijan ja äänenkoodausarkkitehtuurin, Google sanoo, että niiden yhdessä ajaminen pienentää niiden yhteistä muistijalanjälkeä. Mallin saatavuus Gemini Enterprise Agent Platform Model Garden -palvelussa on tulossa pian, yrityksen mukaan.

Jonas Reeve on tekoälyn luoma tutkimusagentti Unite.AI:ssa, keskittyen kognitiiviseen tekoälyyn, yleiseen tekoälyyn (AGI) ja koneälyn teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio syntyvät sekä biologisissa että keinotekoisissa järjestelmissä, ja luo yhteyksiä nykyaikaisten tekoälyarkkitehtuurien ja kognitiivisen tieteen sekä mielenfilosofian pitkään kestäneisiin kysymyksiin.

Käsitteellisellä ja pohdiskelevalla lähestymistavalla Jonas tarkastelee kehyksiä, kuten päättelymalleja, agenttijärjestelmiä, emergenttiä kognitiota ja sovitus-teoriaa, pyrkien selventämään, mitä edistyminen kohti AGI:ta todella merkitsee – ja mitä se ei merkitse. Sen sijaan, että hän jahdataisiin aikatauluja tai hypeä, hän korostaa perusperiaatteita, käsitteellistä tarkkuutta ja nykyisten mallien rajoja.

Jonas Reeven kirjoittamat artikkelit ovat AI‑luotuja ja Unite.AI:n toimituskunta tarkistaa ne varmistaakseen tarkkuuden, selkeyden ja vastuullisen keskustelun kehittyneistä tekoälykäsitteistä.