AI-mallit ja alustat
Google julkaisee Gemini 3.8 Live- ja Extended Thinking -äänimallit

Google julisti Gemini 3.8 Live ja Gemini 3.8 Live Extended Thinking 15. syyskuuta 2026, kaksikko live‑keskustelumalleja, jotka otetaan käyttöön Gemini API:ssa, Google AI Studiossa, Gemini Enterprise -palvelussa, Search Live -palvelussa, Gemini Live -palvelussa ja Google Workspacessa.
Mallit esittelivät Tom Ouyang, pääinsinööri, ja Malini Jaganathan, tekninen henkilökunnan jäsen, Gemini Audio -tiimin puolesta. Google kuvailee tätä kaksikkoa sen tähän mennessä kehittyneimmiksi live‑keskustelumalleiksi, jotka on suunniteltu luonnolliseen keskusteluun, ja toteaa, että älykkyyden ja rinnakkaisen päättelyn parannukset tekevät niistä intuitiivisempia yhteistyökumppaneita ääniohjatuissa monimutkaisissa tehtävissä. Yritys asettaa Gemini 3.8 Live -mallin skaalautuvuuden ja kustannustehokkuuden eduksi, yhdistäen keskusteluälykkyyden sulavaan dialogiin ja visuaaliseen ankkurointiin, kun taas Gemini 3.8 Live Extended Thinking on rakennettu korkean monimutkaisuuden tehtäviin, jotka vaativat lisääntynyttä älykkyyttä ja monivaiheista päättelyä. Googlen mukaan mallit tarjoavat kehittäjille ja yrityksille rakennuspalikat luotettaville, tuotantovalmiille ääniagentille, samalla kun ne tekevät Gemini‑sovelluksen, Workspacen ja Haun kanssa käydyt keskustelut sujuvammiksi.
Raportoituja vertailutuloksia
Google raportoi, että Gemini 3.8 Live Extended Thinking saavutti ensimmäisen sijan Artificial Analysisin Speech to Speech Quality Index -indeksissä pisteillä 82,6, ja että se johtaa agenttipohjaisessa tehtävien suorittamisessa 68,6 %:lla τ-Voice‑testissä ja 35,1 %:lla Sierra:n τ-Voice‑banking‑vertailussa. Yritys raportoi myös 97,7 %:n pistemäärän Big Bench Audio -testissä ja toteaa, että Extended Thinking pitää erittäin kilpailukykyisen hintatason verrattuna muihin huipputason malleihin. Google sanoo, että Gemini 3.8 Live sijoittui toiseksi Artificial Analysisin Speech Agent Arena -kilpailussa, korostaen käyttäjien suurta mieltymyttä, ja kuvailee sitä erittäin kustannustehokkaaksi ja skaalautuvaksi. ServiceNow:n EVA-Bench‑vertailussa, joka arvioi ääniagentteja, Google väittää mallien työntävän Pareto‑rajapintaa monimutkaisille työnkuluille tasapainottamalla onnistuneesti tarkkuutta ja keskustelun laatua; julkaisu mainitsee, että tämä arviointi suoritettiin Live‑API:ssa Gemini Enterprise Agent Platform -ympäristössä.
Reaaliaikaiset keskustelukyvyt
Googlen mukaan Gemini 3.8 Live käsittelee visuaalisia syötteitä lähes reaaliajassa, lisäten kontekstia, jonka yritys väittää tuottavan hyödyllisempiä vastauksia. Malli havaitsee automaattisesti ja siirtyy 97 tuetun kielen välillä keskustelun aikana, ja se suorittaa työkaluja ja API‑kutsuja taustalla samalla kun keskustelu jatkuu, tunnustaen pyynnöt ja pitämällä dialogin käynnissä tehtävien valmistuessa. Syvempää päättelyä vaativissa tehtävissä Google sanoo, että Extended Thinking päättely ja puhe tapahtuvat samanaikaisesti, käyttäen varhaisia sanallisia vihjeitä tunnistaakseen kehotteet luonnollisesti ja reaaliaikaista edistymiskerrontaa opastaakseen käyttäjät monivaiheisten taustatehtävien läpi edetessä, ilman että keskustelun virta katkeaa.
Ilmoituksen yhteydessä julkaistut demovideot osoittavat Gemini 3.8 Live:n ohjaavan työntekijän perehdytyssessiota reaaliajassa hyödyntäen visuaalista kontekstia vastatakseen live‑kysymyksiin, pelaavan lähellä reaaliaikaa shakkia, rakentaen täydellisiä liiketoimintasuunnitelmia ja räätälöityjä markkinointityökaluja luonnollisen puheen avulla, sekä tarjoavan vaiheittaisia vianmääritysohjeita Search Live -ympäristössä. Extended Thinking -demot näyttävät mallin muuntavan raakapiirustuksia ja lähes reaaliaikaista ääni‑palautetta toimiviksi React‑komponenteiksi, koordinoivan monivaiheisia ravintolavarauksia asynkronisten funktiokutsujen avulla keskeyttämättä keskustelua, sekä toimivan Docs Live, Gmail Live ja Keep Live -ympäristöissä Google Workspacessa.
Live‑API ja kehittäjäekosysteemi
Google nimeää Agora, Fishjam, LiveKit, Pipecat, Vercel ja Vision Agents -kehittäjäalustoiksi, jotka käyttävät Gemini Live API -rajapintaa antaakseen kehittäjille mahdollisuuden rakentaa ja ottaa käyttöön ääni‑ohjattuja käyttöliittymiä, samalla kun alusta hallinnoi taustalla olevaa reaaliaikaista mediatiedonsiirto‑infrastruktuuria. Yritys kertoo myös tekevänsä yhteistyötä Salesforce‑, Genspark‑ ja Lumeris‑yritysten kanssa uusissa malleissa, korostaen niiden kiinnostusta mallien viiveeseen, sulavuuteen ja työkalukutsukyvyn.
Virallinen Live‑API‑dokumentaatio kuvaa rajapintaa mahdollistavan matalan viiveen, reaaliaikaiset ääni‑ ja näkövuorovaikutukset Geminin kanssa, käsittelemällä jatkuvia ääni‑, kuva‑ ja tekstivirtoja ja toimittaen välittömät puhevastaukset tilallisen WebSocket‑yhteyden kautta. Dokumentoidut syötteet ovat raakaa 16‑bit PCM -ääntä 16 kHz:n taajuudella, JPEG‑kuvia enintään yhden ruudun sekunnissa, sekä tekstiä, ja äänen ulostulo on raakaa 16‑bit PCM -ääntä 24 kHz:n taajuudella. Kehittäjät voivat valita palvelin‑palvelin‑toteutuksen, jossa taustajärjestelmä välittää asiakasvirran tiedot Live‑API:lle, tai asiakas‑palvelin‑toteutuksen, jossa käyttöliittymäkoodi yhdistää suoraan WebSocket‑yhteyden kautta. Dokumentaatio listaa käyttötapauksia, jotka kattavat vähittäiskaupan ostosavustajat ja tukihenkilöt, interaktiiviset pelihahmot, ääni‑ ja video‑ominaisuuksia robotiikassa, älylasit ja ajoneuvot, terveys‑seurantalaitteet, talousneuvontatyökalut, koulutusmentorointi, reaaliaikaisen käännöksen sekä live‑tekstityksen ja -litteroinnin.
Google toteaa, että kaikki sen AI‑tuotteiden tuottama ääni on vesileimattu SynthID:llä, havaittavissa olevalla vesileimalla, joka on kudottu suoraan äänen ulostuloon, jotta AI‑luotu sisältö pysyy tunnistettavana ja auttaa estämään väärää tietoa. Julkaisu ohjaa lukijat mallikorttiin, josta löytyy lisätietoja yrityksen turvallisuus‑ ja vastuullisuuslähestymistavasta.
Saatavuus ja käyttöönotto
Molemmat mallit alkoivat levitä 15. syyskuuta. Kehittäjille ne ovat saatavilla Gemini API:ssa ja Google AI Studiossa, ja yrityksille ne ovat yksityisessä esikatselussa Gemini Enterprise -palvelussa. Gemini 3.8 Live on saatavilla kaikille Search Live -palvelussa, kun taas Extended Thinking on saatavilla Gemini Live -palvelussa, Docsissa Google AI Pro‑ ja Ultra‑tilaajille Workspace‑palvelun kautta sekä Gmailissa ja Keepissä kaikille Google AI -tilaajille. Google kertoo, että Gemini Enterprise –asiakaskokemustuki molemmille malleille on tulossa pian, ja että Extended Thinking on tulossa pian Google Workspace -yritysasiakkaille.












