AI-modellen en platforms

Google lanceert Gemini 3.8 Live en Extended Thinking spraakmodellen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Google aankondigde Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking op 15 september 2026, een paar live‑dialoogmodellen die worden uitgerold via de Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live en Google Workspace.

De modellen werden geïntroduceerd door Tom Ouyang, hoofdingenieur, en Malini Jaganathan, lid van het technische personeel, namens het Gemini Audio Team. Google beschrijft het duo als haar meest geavanceerde live‑dialoogmodellen tot nu toe, gebouwd voor natuurlijke conversatie, en stelt dat verbeteringen in intelligentie en parallel redeneren ze intuïtiever maken om samen te werken aan complexe taken die via spraak worden uitgevoerd. Het bedrijf positioneert Gemini 3.8 Live voor schaal en kostenefficiëntie, door conversatie‑intelligentie te combineren met vloeiende dialoog en visuele verankering, terwijl Gemini 3.8 Live Extended Thinking is ontworpen voor taken met hoge complexiteit die meer intelligentie en meer‑stappen‑redenering vereisen. Volgens Google bieden de modellen ontwikkelaars en bedrijven de bouwstenen voor betrouwbare, productieklare spraak‑agents, terwijl gesprekken met Gemini via de Gemini‑app, Workspace en Search vloeiender worden.

Gerapporteerde benchmarkresultaten

Google meldt dat Gemini 3.8 Live Extended Thinking de algehele toppositie behaalde op de Speech to Speech Quality Index van Artificial Analysis met een score van 82,6, en dat het leidt in agentische taakvoltooiing met 68,6 % op τ-Voice en 35,1 % op Sierra’s τ-Voice-banking benchmark. Het bedrijf meldt ook een score van 97,7 % op Big Bench Audio en stelt dat Extended Thinking een zeer concurrerende prijs behoudt ten opzichte van andere frontier‑modellen. Google zegt dat Gemini 3.8 Live tweede plaats behaalde in de Speech Agent Arena van Artificial Analysis, met vermelding van een hoge voorkeur onder gebruikers, en beschrijft het als zeer kostenefficiënt en geschikt voor schaal. Op ServiceNow’s EVA‑Bench, een benchmark voor het evalueren van spraak‑agents, zegt Google dat haar modellen de Pareto‑frontier voor complexe workflows verleggen door nauwkeurigheid en conversatiekwaliteit in evenwicht te brengen; de post merkt op dat deze evaluatie werd uitgevoerd op de Live‑API op Gemini Enterprise Agent Platform.

Realtime‑gespreksmogelijkheden

Volgens Google verwerkt Gemini 3.8 Live visuele invoer bijna realtime, waardoor er context wordt toegevoegd die volgens het bedrijf meer behulpzame antwoorden oplevert. Het model detecteert automatisch en schakelt halverwege een gesprek tussen 97 ondersteunde talen, en voert tools en API‑aanroepen op de achtergrond uit terwijl het gesprek doorgaat, erkent verzoeken en houdt de dialoog gaande terwijl taken worden voltooid. Voor taken die diepere redenering vereisen, zegt Google dat Extended Thinking gelijktijdig redeneert en spreekt, gebruikmakend van vroege verbale signalen om prompts op natuurlijke wijze te erkennen en live‑voortgangsvertelling om gebruikers door meer‑stappen‑achtergrondtaken te begeleiden terwijl ze vorderen, zonder de gespreksstroom te onderbreken.

Demonstratievideo’s die bij de aankondiging zijn gepubliceerd tonen Gemini 3.8 Live die een onboarding‑sessie voor medewerkers in realtime begeleidt met behulp van visuele context om live vragen te beantwoorden, schaak speelt bijna realtime, volledige businessplannen en op maat gemaakte marketing‑toolkits opstelt via natuurlijke spraak, en stap‑voor‑stap probleemoplossingshulp biedt binnen Search Live. Demonstraties van Extended Thinking laten zien hoe het model ruwe schetsen en bijna realtime spraakfeedback omzet in functionele React‑componenten, meer‑stappen‑restaurantreserveringen coördineert via asynchrone functie‑aanroepen zonder het gesprek te onderbreken, en werkt over Docs Live, Gmail Live en Keep Live in Google Workspace.

Live‑API en ontwikkelaars‑ecosysteem

Google noemt Agora, Fishjam, LiveKit, Pipecat, Vercel en Vision Agents als ontwikkelaarsplatformen die de Gemini Live API gebruiken om ontwikkelaars in staat te stellen spraakgestuurde interfaces te bouwen en uit te rollen, terwijl de platformen de onderliggende realtime‑media‑streaming‑infrastructuur beheren. Het bedrijf zegt ook samen te werken met Salesforce, Genspark en Lumeris aan de nieuwe modellen, en wijst op hun interesse in de latentie, vloeiendheid en tool‑aanroepmogelijkheden van de modellen.

De officiële Live‑API‑documentatie beschrijft de interface als het mogelijk maken van lage‑latentie, realtime spraak‑ en visuele interacties met Gemini, waarbij continue streams van audio, afbeeldingen en tekst worden verwerkt om onmiddellijke gesproken antwoorden te leveren via een stateful WebSocket‑verbinding. Gedocumenteerde invoer omvat ruwe 16‑bit PCM‑audio op 16 kHz, JPEG‑afbeeldingen tot één frame per seconde, en tekst, met audio‑output als ruwe 16‑bit PCM op 24 kHz. Ontwikkelaars kunnen kiezen voor een server‑naar‑server‑implementatie, waarbij een backend client‑stream‑data doorstuurt naar de Live‑API, of een client‑naar‑server‑implementatie, waarbij frontend‑code rechtstreeks via WebSockets verbinding maakt. De documentatie somt use‑cases op variërend van retail‑shopassistenten en support‑agents, interactieve game‑personages, spraak‑ en video‑geactiveerde ervaringen in robotica, slimme brillen en voertuigen, gezondheids‑companions, financiële advies‑tools, onderwijs‑mentoren, realtime vertaling, tot live‑transcriptie en ondertiteling.

Google stelt dat alle audio die door haar AI‑producten wordt gegenereerd, is voorzien van een watermerk met SynthID, een onwaarneembaar watermerk dat direct in de audio‑output is verweven zodat AI‑gegenereerde inhoud detecteerbaar blijft om misinformatie te helpen voorkomen. Het bericht verwijst lezers naar de model‑card voor details over de veiligheids‑ en verantwoordingsaanpak van het bedrijf.

Beschikbaarheid en uitrol

Beide modellen begonnen op 15 september uit te rollen. Voor ontwikkelaars zijn ze beschikbaar via de Gemini API en Google AI Studio, en voor ondernemingen zijn ze in privévoorvertoning in Gemini Enterprise. Gemini 3.8 Live is voor iedereen beschikbaar in Search Live, terwijl Extended Thinking beschikbaar is in Gemini Live, in Docs voor Google AI Pro- en Ultra-abonnees via Workspace, en in Gmail en Keep voor alle Google AI-abonnees. Google zegt dat Gemini Enterprise voor Customer Experience‑ondersteuning voor beide modellen binnenkort beschikbaar komt, en dat Extended Thinking binnenkort beschikbaar komt voor Google Workspace‑zakelijke klanten.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.