AI-modeller og plattformer
Google lanserer Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking stemmemodeller

Google kunngjorde Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking 15. september 2026, et par live‑dialogmodeller som rulles ut via Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live og Google Workspace.
Modellene ble introdusert av Tom Ouyang, en hovedingeniør, og Malini Jaganathan, medlem av teknisk stab, som skriver på vegne av Gemini Audio Team. Google beskriver paret som sine mest avanserte live‑dialogmodeller hittil, bygget for naturlig samtale, og sier at forbedringer i intelligens og parallell resonnering gjør dem mer intuitive å samarbeide med på komplekse oppgaver utført med stemme. Selskapet posisjonerer Gemini 3.8 Live for skala og kostnadseffektivitet, ved å kombinere samtaleintelligens med flytende dialog og visuell forankring, mens Gemini 3.8 Live Extended Thinking er bygget for høykomplekse oppgaver som krever økt intelligens og flertrinns resonnering. Ifølge Google gir modellene utviklere og bedrifter byggesteiner for pålitelige, produksjonsklare stemmeagenter, samtidig som samtaler med Gemini i Gemini‑appen, Workspace og Search blir mer flytende.
Rapporterte benchmarkresultater
Google rapporterer at Gemini 3.8 Live Extended Thinking oppnådde førsteplass samlet på Artificial Analysis’ Speech to Speech Quality Index med en poengsum på 82,6, og at den leder i agentoppgaveløsning med 68,6 % på τ-Voice og 35,1 % på Sierra’s τ-Voice-banking benchmark. Selskapet rapporterer også en poengsum på 97,7 % på Big Bench Audio og sier at Extended Thinking har et svært konkurransedyktig prisnivå sammenlignet med andre frontmodeller. Google oppgir at Gemini 3.8 Live ble nummer to i Artificial Analysis’ Speech Agent Arena, med høy brukerpreferanse, og beskriver den som svært kostnadseffektiv og bygget for skala. På ServiceNow’s EVA-Bench, et benchmark for evaluering av stemmeagenter, sier Google at modellene deres presser Pareto-grensen for komplekse arbeidsflyter ved å balansere nøyaktighet med samtalekvalitet; innlegget bemerker at evalueringen ble kjørt på Live‑API‑et på Gemini Enterprise Agent Platform.
Sanntidssamtalekapasiteter
I følge Google behandler Gemini 3.8 Live visuelle innspill i nesten sanntid, og legger til kontekst som selskapet sier gir mer hjelpsomme svar. Modellen oppdager automatisk og skifter mellom 97 støttede språk midt i samtalen, og den utfører verktøy og API‑kall i bakgrunnen mens samtalen fortsetter, anerkjenner forespørsler og holder dialogen gående mens oppgavene fullføres. For oppgaver som krever dypere resonnering, sier Google at Extended Thinking resonnerer og snakker samtidig, ved å bruke tidlige verbale signaler for naturlig å anerkjenne promptene og sanntids‑fortellende progresjon for å lede brukerne gjennom flertrinns bakgrunnsoppgaver etter hvert som de utvikler seg, uten å bryte samtaleflyten.
Demonstrasjonsvideoer publisert sammen med kunngjøringen viser Gemini 3.8 Live som veileder en onboarding‑sesjon for ansatte i sanntid ved å bruke visuell kontekst til å svare på live‑spørsmål, spiller sjakk i nesten sanntid, bygger komplette forretningsplaner og tilpassede markedsføringsverktøy gjennom naturlig tale, og driver steg‑for‑steg feilsøkingshjelp i Search Live. Demonstrasjoner av Extended Thinking viser modellen som omdanner rå skisser og nesten sanntids‑stemmetilbakemeldinger til funksjonelle React‑komponenter, koordinerer flertrinns restaurantreservasjoner via asynkrone funksjonskall uten å avbryte samtalen, og fungerer på tvers av Docs Live, Gmail Live og Keep Live i Google Workspace.
Live‑API og utviklerøkosystem
Google nevner Agora, Fishjam, LiveKit, Pipecat, Vercel og Vision Agents som utviklerplattformer som bruker Gemini Live API for å la utviklere bygge og distribuere stemmestyrte grensesnitt mens plattformene håndterer den underliggende sanntids mediestrøminfrastrukturen. Selskapet sier også at de samarbeider med Salesforce, Genspark og Lumeris om de nye modellene, og peker på deres interesse for modellenes latens, flyt og verktøy‑kall‑funksjonalitet.
Den offisielle Live‑API‑dokumentasjonen beskriver grensesnittet som muliggjør lav‑latens, sanntids stemme‑ og visuell interaksjon med Gemini, ved å behandle kontinuerlige strømmer av lyd, bilder og tekst for å levere umiddelbare talte svar over en tilstandsholdende WebSocket‑tilkobling. Dokumenterte innganger er rå 16‑bit PCM‑lyd på 16 kHz, JPEG‑bilder på opptil ett bilde per sekund, og tekst, med lydutgang som rå 16‑bit PCM på 24 kHz. Utviklere kan velge en server‑til‑server‑implementering, der en backend videresender klientens strømdata til Live‑API‑et, eller en klient‑til‑server‑implementering, der frontend‑koden kobler direkte via WebSockets. Dokumentasjonen lister opp brukstilfeller som spenner fra detaljhandels‑handelsassistenter og support‑agenter, interaktive spillkarakterer, stemme‑ og video‑aktiverte opplevelser i robotikk, smarte briller og kjøretøy, helse‑assistenter, finansielle rådgivningsverktøy, utdannings‑mentorer, sanntids‑oversettelse, samt live‑transkripsjon og underteksting.
Google oppgir at all lyd generert av deres AI‑produkter er merket med SynthID, et umerkelig vannmerke som veves direkte inn i lydutgangen slik at AI‑generert innhold forblir oppdagbart for å bidra til å hindre feilinformasjon. Innlegget peker leserne til modellkortet for detaljer om selskapets sikkerhets‑ og ansvarsstrategi.
Tilgjengelighet og utrulling
Begge modellene begynte utrullingen 15. september. For utviklere er de tilgjengelige i Gemini‑API‑et og Google AI Studio, og for virksomheter er de i privat forhåndsvisning i Gemini Enterprise. Gemini 3.8 Live er tilgjengelig for alle i Search Live, mens Extended Thinking er tilgjengelig i Gemini Live, i Docs for Google AI Pro‑ og Ultra‑abonnenter via Workspace, samt i Gmail og Keep for alle Google AI‑abonnenter. Google opplyser at Gemini Enterprise for kundeservice‑støtte for begge modellene kommer snart, og at Extended Thinking snart blir tilgjengelig for Google Workspace‑bedriftskunder.












