AI-modeller og platforme
Google lancerer Gemini 3.8 Live og Extended Thinking stemmemodeller

Google annoncerede Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking den 15. september 2026, et par live‑dialogmodeller, der rulles ud på tværs af Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live og Google Workspace.
Modellerne blev introduceret af Tom Ouyang, en principal engineer, og Malini Jaganathan, et medlem af det tekniske personale, som skrev på vegne af Gemini Audio Team. Google beskriver parret som sine mest avancerede live‑dialogmodeller til dato, bygget til naturlig samtale, og siger, at gevinster i intelligens og parallel ræsonnement gør dem mere intuitive at samarbejde med om komplekse opgaver udført via stemme. Virksomheden positionerer Gemini 3.8 Live for skala og omkostningseffektivitet, kombinerende samtaleintelligens med flydende dialog og visuel forankring, mens Gemini 3.8 Live Extended Thinking er bygget til højkompleksitet opgaver, der kræver øget intelligens og flertrins ræsonnement. Ifølge Google giver modellerne udviklere og virksomheder byggesten til pålidelige, produktionsklare stemmeagenter, samtidig med at samtaler med Gemini på Gemini‑appen, Workspace og Search bliver mere flydende.
Rapporterede benchmarkresultater
Google rapporterer, at Gemini 3.8 Live Extended Thinking opnåede den samlede førsteplads på Artificial Analysis’ Speech to Speech Quality Index med en score på 82,6, og at den fører i agentbaseret opgavefuldførelse med 68,6 % på τ-Voice og 35,1 % på Sierra’s τ-Voice-banking benchmark. Virksomheden rapporterer også en score på 97,7 % på Big Bench Audio og siger, at Extended Thinking opretholder et meget konkurrencedygtigt prisniveau i forhold til andre frontmodeller. Google siger, at Gemini 3.8 Live placerede sig som nummer to i Artificial Analysis’ Speech Agent Arena, med høj brugerpræference, og beskriver den som meget omkostningseffektiv og bygget til skala. På ServiceNow’s EVA-Bench, et benchmark for evaluering af stemmeagenter, siger Google, at modellerne skubber Pareto‑fronten for komplekse arbejdsgange ved succesfuldt at balancere nøjagtighed med samtalekvalitet; indlægget bemærker, at denne evaluering blev udført på Live‑API’en på Gemini Enterprise Agent Platform.
Real‑tids samtalekapaciteter
Ifølge Google behandler Gemini 3.8 Live visuelle input i næsten realtid, hvilket tilføjer kontekst, som virksomheden siger giver mere hjælpsomme svar. Modellen opdager automatisk og skifter mellem 97 understøttede sprog midt i samtalen, og den udfører værktøjer og API‑kald i baggrunden, mens samtalen fortsætter, anerkender forespørgsler og holder dialogen i gang, mens opgaverne afsluttes. For opgaver, der kræver dybere ræsonnement, siger Google, at Extended Thinking ræsonnerer og taler samtidigt, bruger tidlige verbale signaler til naturligt at anerkende prompts og leverer live‑fremskridtsfortælling for at guide brugerne gennem flertrins baggrundsopgaver, mens de skrider frem, uden at afbryde samtaleflowet.
Demonstrationsvideoer offentliggjort sammen med meddelelsen viser Gemini 3.8 Live, der guider en medarbejderindstillingssession i realtid ved hjælp af visuel kontekst til at besvare live‑spørgsmål, spiller skak i næsten realtid, bygger komplette forretningsplaner og tilpassede marketingværktøjssæt gennem naturlig tale, samt driver trin‑for‑trin fejlfinding i Search Live. Extended Thinking‑demonstrationer viser modellen, der omdanner rå skitser og næsten realtids stemmefeedback til funktionelle React‑komponenter, koordinerer flertrins restaurantreservationer via asynkrone funktionskald uden at afbryde samtalen, og arbejder på tværs af Docs Live, Gmail Live og Keep Live i Google Workspace.
Live‑API og udviklerøkosystem
Google nævner Agora, Fishjam, LiveKit, Pipecat, Vercel og Vision Agents som udviklerplatforme, der bruger Gemini Live API til at lade udviklere bygge og implementere stemme‑drevne grænseflader, mens platformene håndterer den underliggende real‑time mediestreaming‑infrastruktur. Virksomheden siger også, at den samarbejder med Salesforce, Genspark og Lumeris om de nye modeller og peger på deres interesse for modellernes latenstid, flydendehed og værktøj‑kald‑funktioner.
Den officielle Live‑API‑dokumentation beskriver grænsefladen som muliggørende lav‑latens, real‑time stemme‑ og vision‑interaktioner med Gemini, der behandler kontinuerlige strømme af lyd, billeder og tekst for at levere øjeblikkelige talte svar over en tilstandsholdende WebSocket‑forbindelse. Dokumenterede input er rå 16‑bit PCM‑lyd ved 16 kHz, JPEG‑billeder op til ét billede pr. sekund, og tekst, med lydoutput som rå 16‑bit PCM ved 24 kHz. Udviklere kan vælge en server‑til‑server‑implementering, hvor en backend videresender klient‑stream‑data til Live‑API’en, eller en klient‑til‑server‑implementering, hvor frontend‑koden forbinder direkte via WebSockets. Dokumentationen lister anvendelsestilfælde fra detailhandels‑shoppingassistenter og supportagenter, interaktive spilkarakterer, stemme‑ og video‑aktiverede oplevelser i robotteknik, smarte briller og køretøjer, sundhedskammerater, finansielle rådgivningsværktøjer, uddannelses‑mentorer, real‑time oversættelse samt live‑transskription og undertekstning.
Google oplyser, at al lyd genereret af dets AI‑produkter er vandmærket med SynthID, et umærkbart vandmærke, der væves direkte ind i lydoutputtet, så AI‑genereret indhold forbliver genkendeligt for at hjælpe med at forhindre misinformation. Indlægget henviser læserne til modelkortet for detaljer om virksomhedens sikkerheds‑ og ansvarsstrategi.
Tilgængelighed og udrulning
Begge modeller begyndte at blive rullet ud den 15. september. For udviklere er de tilgængelige i Gemini API og Google AI Studio, og for virksomheder er de i privat forhåndsvisning i Gemini Enterprise. Gemini 3.8 Live er tilgængelig for alle i Search Live, mens Extended Thinking er tilgængelig i Gemini Live, i Docs for Google AI Pro- og Ultra-abonnenter via Workspace, samt i Gmail og Keep for alle Google AI-abonnenter. Google siger, at Gemini Enterprise til Customer Experience-support for begge modeller snart kommer, og at Extended Thinking snart bliver tilgængelig for Google Workspace-virksomhedskunder.












