AI-modeller och plattformar
Google lanserar Gemini 3.8 talmodeller i API och AI Studio

Google introducerade den 23 september 2026 Gemini 3.8 Flash TTS och Gemini 3.8 Flash-Lite TTS, två text‑till‑tal‑modeller som beskrevs som företagets mest uttrycksfulla ljudgenereringsmodeller hittills. Båda modellerna började rullas ut samma dag i Gemini API och Google AI Studio.
Tillkännagivandet, skrivet av Group Product Manager Leland Rechis och Director of Research Science Alan Cowen för Gemini Audio‑teamet, placerar Gemini 3.8 Flash TTS för djup kreativ styrning och karaktärsdesign inom spel, uppslukande ljudböcker, poddar och interaktiv media. Gemini 3.8 Flash‑Lite TTS är byggd för högvolym, kostnadseffektiv användning, optimerad för dubbning, skapande av ljudinnehåll och röstagenter med finjusterad kontroll över ton, tempo och uttrycksnyans. Tillkännagivandet presenterar paret som en fortsättning på tidigare Gemini Audio‑utgåvor: 3.5 Live Translate, 3.5 Transcribe och Gemini 3.8 Live och 3.8 Live Extended Thinking-modellerna. Enligt Gemini 3.8 Audio modellkort är modellerna baserade på Gemini 3 Pro, och TTS‑varianterna accepterar textinmatning upp till 8K token och returnerar ljudutdata upp till 64K token.
Röddesign och replikering
Google uppgav att Gemini 3.8 Flash TTS kan skapa skräddarsydda röster från grunden via naturlig språkpromptning, med anpassning av roll, accent och röstegenskaper på mer än 100 språk och dialekter. Företaget sade att lanseringen skalar upp sitt ursprungliga set av 30 röster till ett bibliotek med mer än 2 000 produktionsklara röster med bred språk täckning, inklusive regionala varianter som mexikansk spanska, quebecfranska och skotsk engelska. Användare kan spara och hantera sina anpassade röster för att hålla prestanda konsekvent över pågående projekt, och en röst‑remixeringsfunktion som justerar timbre, tonhöjd, tempo och accent på bibliotekets röster listas som kommande.
Röstreplikering återskapar en konsekvent vokalprofil från ett 30‑sekunders ljudprov av användarens egen röst eller en röst som användaren har rätt att använda. Google meddelade att funktionen levereras med inbyggd samtyckesverifiering, SynthID‑vattenstämpling och C2PA‑referenser.
Prestandastyrning och rapporterade benchmarkresultat
Båda modellerna möjliggör rad‑för‑rad‑styrning av varje prestation: användare kan skriva egna scenanvisningar eller låta Gemini styra leveransen utifrån naturliga manusindikationer. Google sade att långformsgenerering behåller röstkvalitet, tempo och karaktärstimbre stabilt över timmar av kontinuerligt ljud med minimal talardrift, riktat mot poddar och ljudböcker. Inbyggd två‑talare‑scenuppsättning styr flerturiga konversationer från ett enda manus samtidigt som de två rösterna hålls separerade med naturlig tur‑och‑respons. Skriptade vokala utbrott och bakkanaler lägger till icke‑verbala signaler såsom <laughs>, <sigh> och <gasp>, samt inskjutningar som “mhm” och “yeah”.
I utvärderingar rapporterade Google att Gemini 3.8 Flash TTS tog den övergripande topplaceringen i Hume AI:s Voice Design Benchmark med ett resultat på 71,4 och även ledde accentmodellering med 60,8. Det uppgav att Flash TTS och Flash‑Lite TTS innehar första respektive andra plats i Hume AI:s Overall Quality Index, och att de nya modellerna visar stora förbättringar jämfört med Gemini 3.1 Flash TTS över användningsområden inklusive långformigt innehåll och två‑talar‑manuskontroll. I blinda mänskliga preferensutvärderingar på Voice Arena sade Google att de två modellerna tog topplaceringar bland konkurrenterna på språk som japanska, brasiliansk portugisiska, vietnamesiska, modern standardarabiska, mexikansk spanska och hindi.
Säkerhet, begränsningar och tillgänglighet
Under samtyckesverifieringssystemet måste en användare tillhandahålla en muntlig samtyckesinspelning från röstägaren som matchar referenstalaren innan en replikerad röst kan skapas. Varje ljudklipp som Gemini Audio‑modellerna genererar bär en SynthID‑vattenstämpel, som Google beskriver som omärklig och inbäddad direkt i ljudutdata så att AI‑genererat tal förblir upptäckbart.
Modellkortet listar kända begränsningar inklusive hallucinationer samt sporadisk långsamhet eller tidsgräns‑problem, och anger ett kunskapsavbrott i januari 2025. För frontier‑säkerhet sade Google DeepMind att deras bedömningar inte fann några betydande nya förmågor eller materiella prestandaförbättringar i Gemini 3.8 Audio‑modellerna jämfört med Gemini 3.7 Flash, som deras utvärderingar visade inte nådde några spårade eller kritiska förmågenivåer enligt deras Frontier Safety Framework. På den grunden uppgav de att Gemini 3.8 Audio‑modellerna sannolikt inte kommer att nå dessa nivåer.
Gemini 3.8 Flash TTS finns också tillgänglig i Gemini Notebook och Flash‑Lite TTS i Google Vids, med företagsåtkomst via API i Gemini Enterprise som anges komma snart. Google AI Studio lägger till en ljudlekplats byggd som ett röddesign‑arbetsområde, där utvecklare kan skapa nya vokala identiteter från grunden eller replikera en röst och sedan styra rad‑för‑rad‑leverans i en två‑talare‑manusredigerare. En fotnot i tillkännagivandet noterar att röstreplikering via AI Studio inte är tillgänglig i Illinois, Texas, Europeiska ekonomiska området, Storbritannien, Schweiz och Indien. Utvecklarplattformarna Agora, LiveKit, Pipecat och Vercel stödjer modellerna via Gemini API, och Google nämnde Figma, HeyGen, Linguana, Wondercraft, 99.co och Ollang som partners som integrerar de nya TTS‑modellerna för global dubbning, medielokalisering och konversations‑röstagenter.












