AI-modellen en platforms

Google rolt Gemini 3.8 spraakmodellen uit in API en AI Studio

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Google heeft op 23 september 2026 Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS geïntroduceerd, twee tekst-naar-spraakmodellen die het beschreef als zijn meest expressieve audiogeneratiemodellen tot nu toe. Beide modellen werden dezelfde dag uitgerold in de Gemini API en Google AI Studio.

De aankondiging, geschreven door Groepsproductmanager Leland Rechis en Directeur Research Science Alan Cowen namens het Gemini Audio Team, positioneert Gemini 3.8 Flash TTS voor diepgaande creatieve richting en karakterontwerp in gaming, meeslepende audioboeken, podcasts en interactieve media. Gemini 3.8 Flash-Lite TTS is gebouwd voor grootschalig, kostenefficiënt gebruik, geoptimaliseerd voor nasynchronisatie, audio‑contentcreatie en stem‑agents met fijnmazige controle over toon, tempo en expressieve nuance. De aankondiging presenteert het duo als vervolg op eerdere Gemini Audio‑releases: 3.5 Live Translate, 3.5 Transcribe en de Gemini 3.8 Live en 3.8 Live Extended Thinking modellen. Volgens de Gemini 3.8 Audio modelkaart zijn de modellen gebaseerd op Gemini 3 Pro, en accepteren de TTS‑varianten tekstinvoer tot 8 K tokens en geven ze audio‑output tot 64 K tokens terug.

Stemontwerp en replicatie

Google zei dat Gemini 3.8 Flash TTS op maat gemaakte stemmen vanaf nul kan creëren via natural language prompting, waarbij rol, accent en stemkenmerken worden aangepast in meer dan 100 talen en dialecten. Het bedrijf meldde dat de release de oorspronkelijke set van 30 stemmen opschaalt naar een bibliotheek van meer dan 2.000 productieklare stemmen met brede taaldekking, inclusief regionale varianten zoals Mexicaans Spaans, Quebec Frans en Schots Engels. Gebruikers kunnen hun aangepaste stemmen opslaan en beheren om de prestaties consistent te houden gedurende lopende projecten, en een stem‑remixfunctie die timbre, toonhoogte, tempo en accent van bibliotheekstemmen aanpast, staat vermeld als binnenkort beschikbaar.

Stemreplicatie maakt een consistent vocaal profiel aan op basis van een audio‑sample van 30 seconden van de eigen stem van de gebruiker of van een stem die de gebruiker mag gebruiken. Google zei dat de functionaliteit wordt geleverd met ingebouwde toestemmingsverificatie, SynthID‑watermerken en C2PA‑referenties.

Prestatieaansturing en gerapporteerde benchmarks

Beide modellen maken line‑by‑line aansturing van elke uitvoering mogelijk: gebruikers kunnen hun eigen regie‑instructies schrijven of Gemini de levering laten sturen op basis van natuurlijke script‑aanwijzingen. Google zei dat lange‑formaat generatie de stemkwaliteit, het tempo en het karaktertimbre stabiel houdt gedurende uren continue audio met minimale spreker‑drift, gericht op podcasts en audioboeken. Inheemse scène‑staging met twee sprekers leidt meer‑turn‑gesprekken vanuit één script terwijl de twee stemmen gescheiden blijven met natuurlijke beurtwisseling. Gescripte vocale uitbarstingen en backchanneling voegen non‑verbale signalen toe zoals <laughs>, <sigh> en <gasp>, plus interjecties als “mhm” en “yeah”.

Uit evaluaties meldde Google dat Gemini 3.8 Flash TTS de algehele eerste plaats behaalde op Hume AI’s Voice Design Benchmark met een score van 71,4 en ook leidde in accentmodellering met 60,8. Het zei dat Flash TTS en Flash‑Lite TTS de eerste en tweede plaats innemen op Hume AI’s Overall Quality Index, en dat de nieuwe modellen aanzienlijke verbeteringen laten zien ten opzichte van Gemini 3.1 Flash TTS in gebruikssituaties waaronder lange‑formaat content en dual‑speaker scenario‑besturing. In blinde menselijke voorkeursevaluaties op Voice Arena zei Google dat de twee modellen de topposities behaalden onder concurrenten in talen waaronder Japans, Braziliaans Portugees, Vietnamees, Modern Standaard Arabisch, Mexicaans Spaans en Hindi.

Veiligheid, beperkingen en beschikbaarheid

Onder het toestemmings‑verificatiesysteem moet een gebruiker een verbale toestemmingsopname van de stem‑eigenaar leveren die overeenkomt met de referentiespreker voordat een gerepliceerde stem kan worden aangemaakt. Elke audio‑clip die de Gemini Audio‑modellen genereren bevat een SynthID‑watermerk, dat Google beschrijft als onwaarneembaar en direct in de audio‑output ingebed, zodat AI‑gegenereerde spraak detecteerbaar blijft.

De modelkaart vermeldt bekende beperkingen, waaronder hallucinaties en af en toe traagheid of time‑out‑problemen, en geeft een kennisafkapdatum van januari 2025. Voor frontier‑veiligheid zei Google DeepMind dat haar beoordelingen geen betekenisvolle nieuwe mogelijkheden of materiële prestatieverbeteringen in de Gemini 3.8 Audio‑modellen vonden ten opzichte van Gemini 3.7 Flash, waarvan de evaluaties aangaven dat ze geen van de getrackte of kritieke capaciteitsniveaus onder het Frontier Safety Framework bereikten. Op basis daarvan stelde ze dat de Gemini 3.8 Audio‑modellen waarschijnlijk die niveaus niet zullen bereiken.

Gemini 3.8 Flash TTS is ook beschikbaar in Gemini Notebook en Flash‑Lite TTS in Google Vids, met enterprise‑toegang via API in Gemini Enterprise vermeld als binnenkort beschikbaar. Google AI Studio voegt een audio‑speelplaats toe die is opgebouwd als een stemontwerp‑werkruimte, waar ontwikkelaars nieuwe vocale identiteiten vanaf nul kunnen prompten of een stem kunnen repliceren en vervolgens line‑by‑line levering kunnen aansturen in een dual‑speaker scenario‑editor. Een voetnoot in de aankondiging vermeldt dat stemreplicatie via AI Studio niet beschikbaar is in Illinois, Texas, de Europese Economische Ruimte, het Verenigd Koninkrijk, Zwitserland en India. Ontwikkelaarsplatformen Agora, LiveKit, Pipecat en Vercel ondersteunen de modellen via de Gemini API, en Google noemde Figma, HeyGen, Linguana, Wondercraft, 99.co en Ollang als partners die de nieuwe TTS‑modellen integreren voor wereldwijde nasynchronisatie, mediaprocessen en conversatie‑stemagents.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.