AI-modeller og plattformer

Google lanserer Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking stemmemodeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Google kunngjorde Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking 15. september 2026, et par live‑dialogmodeller som rulles ut via Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live og Google Workspace.

Modellene ble introdusert av Tom Ouyang, en hovedingeniør, og Malini Jaganathan, medlem av teknisk stab, som skriver på vegne av Gemini Audio Team. Google beskriver paret som sine mest avanserte live‑dialogmodeller hittil, bygget for naturlig samtale, og sier at forbedringer i intelligens og parallell resonnering gjør dem mer intuitive å samarbeide med på komplekse oppgaver utført med stemme. Selskapet posisjonerer Gemini 3.8 Live for skala og kostnadseffektivitet, ved å kombinere samtaleintelligens med flytende dialog og visuell forankring, mens Gemini 3.8 Live Extended Thinking er bygget for høykomplekse oppgaver som krever økt intelligens og flertrinns resonnering. Ifølge Google gir modellene utviklere og bedrifter byggesteiner for pålitelige, produksjonsklare stemmeagenter, samtidig som samtaler med Gemini i Gemini‑appen, Workspace og Search blir mer flytende.

Rapporterte benchmarkresultater

Google rapporterer at Gemini 3.8 Live Extended Thinking oppnådde førsteplass samlet på Artificial Analysis’ Speech to Speech Quality Index med en poengsum på 82,6, og at den leder i agentoppgaveløsning med 68,6 % på τ-Voice og 35,1 % på Sierra’s τ-Voice-banking benchmark. Selskapet rapporterer også en poengsum på 97,7 % på Big Bench Audio og sier at Extended Thinking har et svært konkurransedyktig prisnivå sammenlignet med andre frontmodeller. Google oppgir at Gemini 3.8 Live ble nummer to i Artificial Analysis’ Speech Agent Arena, med høy brukerpreferanse, og beskriver den som svært kostnadseffektiv og bygget for skala. På ServiceNow’s EVA-Bench, et benchmark for evaluering av stemmeagenter, sier Google at modellene deres presser Pareto-grensen for komplekse arbeidsflyter ved å balansere nøyaktighet med samtalekvalitet; innlegget bemerker at evalueringen ble kjørt på Live‑API‑et på Gemini Enterprise Agent Platform.

Sanntidssamtalekapasiteter

I følge Google behandler Gemini 3.8 Live visuelle innspill i nesten sanntid, og legger til kontekst som selskapet sier gir mer hjelpsomme svar. Modellen oppdager automatisk og skifter mellom 97 støttede språk midt i samtalen, og den utfører verktøy og API‑kall i bakgrunnen mens samtalen fortsetter, anerkjenner forespørsler og holder dialogen gående mens oppgavene fullføres. For oppgaver som krever dypere resonnering, sier Google at Extended Thinking resonnerer og snakker samtidig, ved å bruke tidlige verbale signaler for naturlig å anerkjenne promptene og sanntids‑fortellende progresjon for å lede brukerne gjennom flertrinns bakgrunnsoppgaver etter hvert som de utvikler seg, uten å bryte samtaleflyten.

Demonstrasjonsvideoer publisert sammen med kunngjøringen viser Gemini 3.8 Live som veileder en onboarding‑sesjon for ansatte i sanntid ved å bruke visuell kontekst til å svare på live‑spørsmål, spiller sjakk i nesten sanntid, bygger komplette forretningsplaner og tilpassede markedsføringsverktøy gjennom naturlig tale, og driver steg‑for‑steg feilsøkingshjelp i Search Live. Demonstrasjoner av Extended Thinking viser modellen som omdanner rå skisser og nesten sanntids‑stemmetilbakemeldinger til funksjonelle React‑komponenter, koordinerer flertrinns restaurantreservasjoner via asynkrone funksjonskall uten å avbryte samtalen, og fungerer på tvers av Docs Live, Gmail Live og Keep Live i Google Workspace.

Live‑API og utviklerøkosystem

Google nevner Agora, Fishjam, LiveKit, Pipecat, Vercel og Vision Agents som utviklerplattformer som bruker Gemini Live API for å la utviklere bygge og distribuere stemmestyrte grensesnitt mens plattformene håndterer den underliggende sanntids mediestrøminfrastrukturen. Selskapet sier også at de samarbeider med Salesforce, Genspark og Lumeris om de nye modellene, og peker på deres interesse for modellenes latens, flyt og verktøy‑kall‑funksjonalitet.

Den offisielle Live‑API‑dokumentasjonen beskriver grensesnittet som muliggjør lav‑latens, sanntids stemme‑ og visuell interaksjon med Gemini, ved å behandle kontinuerlige strømmer av lyd, bilder og tekst for å levere umiddelbare talte svar over en tilstandsholdende WebSocket‑tilkobling. Dokumenterte innganger er rå 16‑bit PCM‑lyd på 16 kHz, JPEG‑bilder på opptil ett bilde per sekund, og tekst, med lydutgang som rå 16‑bit PCM på 24 kHz. Utviklere kan velge en server‑til‑server‑implementering, der en backend videresender klientens strømdata til Live‑API‑et, eller en klient‑til‑server‑implementering, der frontend‑koden kobler direkte via WebSockets. Dokumentasjonen lister opp brukstilfeller som spenner fra detaljhandels‑handelsassistenter og support‑agenter, interaktive spillkarakterer, stemme‑ og video‑aktiverte opplevelser i robotikk, smarte briller og kjøretøy, helse‑assistenter, finansielle rådgivningsverktøy, utdannings‑mentorer, sanntids‑oversettelse, samt live‑transkripsjon og underteksting.

Google oppgir at all lyd generert av deres AI‑produkter er merket med SynthID, et umerkelig vannmerke som veves direkte inn i lydutgangen slik at AI‑generert innhold forblir oppdagbart for å bidra til å hindre feilinformasjon. Innlegget peker leserne til modellkortet for detaljer om selskapets sikkerhets‑ og ansvarsstrategi.

Tilgjengelighet og utrulling

Begge modellene begynte utrullingen 15. september. For utviklere er de tilgjengelige i Gemini‑API‑et og Google AI Studio, og for virksomheter er de i privat forhåndsvisning i Gemini Enterprise. Gemini 3.8 Live er tilgjengelig for alle i Search Live, mens Extended Thinking er tilgjengelig i Gemini Live, i Docs for Google AI Pro‑ og Ultra‑abonnenter via Workspace, samt i Gmail og Keep for alle Google AI‑abonnenter. Google opplyser at Gemini Enterprise for kundeservice‑støtte for begge modellene kommer snart, og at Extended Thinking snart blir tilgjengelig for Google Workspace‑bedriftskunder.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.