AI-modeller och plattformar

Google lanserar Gemini 3.8 Live och Extended Thinking röstmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Google meddelade Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking den 15 september 2026, ett par live‑dialogmodeller som rullas ut via Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live och Google Workspace.

Modellerna presenterades av Tom Ouyang, en huvudingenjör, och Malini Jaganathan, en teknisk medarbetare, som skrev på uppdrag av Gemini Audio Team. Google beskriver paret som sina mest avancerade live‑dialogmodeller hittills, byggda för naturliga samtal, och säger att förbättringar i intelligens och parallell resonemang gör dem mer intuitiva att samarbeta med vid komplexa uppgifter som utförs med röst. Företaget placerar Gemini 3.8 Live för skalning och kostnadseffektivitet, genom att kombinera konversationell intelligens med flytande dialog och visuell förankring, medan Gemini 3.8 Live Extended Thinking är byggd för högkomplexa uppgifter som kräver ökad intelligens och flerstegsresonemang. Enligt Google ger modellerna utvecklare och företag byggstenar för pålitliga, produktionsklara röstagenter samtidigt som samtalen med Gemini i Gemini‑appen, Workspace och Search blir mer flytande.

Rapporterade benchmarkresultat

Google rapporterar att Gemini 3.8 Live Extended Thinking tog den övergripande förstaplatsen på Artificial Analysis’ Speech to Speech Quality Index med ett resultat på 82,6, och att den leder i agentbaserad uppgiftsutförande med 68,6 % på τ-Voice och 35,1 % på Sierra’s τ-Voice-banking benchmark. Företaget rapporterar också ett resultat på 97,7 % på Big Bench Audio och säger att Extended Thinking har en mycket konkurrenskraftig prisnivå jämfört med andra frontier‑modeller. Google säger att Gemini 3.8 Live hamnade på andra plats i Artificial Analysis’ Speech Agent Arena, med hänvisning till hög användarpreferens, och beskriver den som mycket kostnadseffektiv och byggd för skalning. På ServiceNow’s EVA-Bench, ett benchmark för utvärdering av röstagenter, säger Google att deras modeller skjuter Pareto‑fronten för komplexa arbetsflöden genom att framgångsrikt balansera noggrannhet med konversationskvalitet; inlägget noterar att denna utvärdering kördes på Live‑API på Gemini Enterprise Agent Platform.

Funktioner för samtal i realtid

Enligt Google bearbetar Gemini 3.8 Live visuella indata i nära realtid, vilket ger kontext som företaget säger leder till mer hjälpsamma svar. Modellen upptäcker automatiskt och växlar mellan 97 stödda språk mitt i samtalet, och den utför verktyg och API‑anrop i bakgrunden medan samtalet fortsätter, bekräftar förfrågningar och håller dialogen igång medan uppgifterna slutförs. För uppgifter som kräver djupare resonemang säger Google att Extended Thinking resonnerar och talar samtidigt, använder tidiga verbala signaler för att naturligt bekräfta uppmaningar och levererar levande framstegsberättelse för att guida användare genom flerstegs bakgrundsuppgifter i takt med att de fortskrider, utan att avbryta konversationsflödet.

Demonstrationsvideor som publicerades tillsammans med tillkännagivandet visar Gemini 3.8 Live som guidar en introduktionssession för anställda i realtid med visuell kontext för att svara på live‑frågor, spelar schack i nära realtid, bygger kompletta affärsplaner och skräddarsydda marknadsföringsverktyg genom naturligt tal, samt möjliggör steg‑för‑steg felsökningshjälp i Search Live. Demonstrationer av Extended Thinking visar modellen som omvandlar råa skisser och nästan realtidsröståterkoppling till funktionella React‑komponenter, koordinerar flerstegs restaurangbokningar via asynkrona funktionsanrop utan att avbryta samtalet, och fungerar över Docs Live, Gmail Live och Keep Live i Google Workspace.

Live‑API och utvecklar‑ekosystemet

Google nämner Agora, Fishjam, LiveKit, Pipecat, Vercel och Vision Agents som utvecklarplattformar som använder Gemini Live API för att låta utvecklare bygga och distribuera röststyrda gränssnitt medan plattformarna hanterar den underliggande realtids‑medieströmningsinfrastrukturen. Företaget säger att de också samarbetar med Salesforce, Genspark och Lumeris kring de nya modellerna, med hänvisning till deras intresse för modellernas latens, fluiditet och verktygsanropsmöjligheter.

Den officiella Live‑API‑dokumentationen beskriver gränssnittet som möjliggör låglatens, realtidsinteraktioner med röst och vision via Gemini, genom att bearbeta kontinuerliga strömmar av ljud, bilder och text för att leverera omedelbara talade svar över en tillståndsbevarande WebSocket‑anslutning. Dokumenterade indata är rå 16‑bit PCM‑ljud vid 16 kHz, JPEG‑bilder med upp till en bild per sekund, samt text, med ljudutgång som rå 16‑bit PCM vid 24 kHz. Utvecklare kan välja en server‑till‑server‑implementation, där en backend vidarebefordrar klientens strömdatat till Live‑API, eller en klient‑till‑server‑implementation, där frontend‑kod ansluter direkt via WebSockets. Dokumentationen listar användningsfall som sträcker sig över detaljhandels‑shoppingassistenter och supportagenter, interaktiva spelkaraktärer, röst‑ och video‑aktiverade upplevelser inom robotik, smarta glasögon och fordon, hälsokompanjoner, finansiella rådgivningsverktyg, utbildningsmentorer, realtidsöversättning samt live‑transkribering och textning.

Google uppger att allt ljud som genereras av deras AI‑produkter är vattenstämplat med SynthID, ett omärkbart vattenmärke som vävs direkt in i ljudutgången så att AI‑genererat innehåll förblir upptäckbart för att hjälpa till att förhindra desinformation. Inlägget hänvisar läsarna till modellkortet för detaljer om företagets säkerhets‑ och ansvarstillsyn.

Tillgänglighet och utrullning

Båda modellerna började rullas ut den 15 september. För utvecklare finns de i Gemini API och Google AI Studio, och för företag finns de i privat förhandsgranskning i Gemini Enterprise. Gemini 3.8 Live är tillgänglig för alla i Search Live, medan Extended Thinking finns i Gemini Live, i Docs för Google AI Pro‑ och Ultra‑prenumeranter via Workspace, samt i Gmail och Keep för alla Google AI‑prenumeranter. Google säger att Gemini Enterprise för kundupplevelse‑stöd för båda modellerna kommer snart, och att Extended Thinking snart blir tillgänglig för Google Workspace‑företagskunder.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.