AI-modeller og plattformer
Google lanserer Gemini 3.8 tale‑modeller i API og AI Studio

Google introduserte 23. september 2026 Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, to tekst‑til‑tale‑modeller som ble beskrevet som selskapets mest uttrykksfulle lydgenereringsmodeller hittil. Begge modellene begynte å rulles ut samme dag i Gemini‑API‑en og Google AI Studio.
Kunngjøringen, skrevet av gruppeleder for produkt Leland Rechis og direktør for forskningsvitenskap Alan Cowen på vegne av Gemini Audio‑teamet, plasserer Gemini 3.8 Flash TTS for dyp kreativ retning og karakterdesign innen spill, oppslukende lydbøker, podkaster og interaktive medier. Gemini 3.8 Flash‑Lite TTS er bygget for høyt volum og kostnadseffektiv bruk, optimalisert for dubbing, lydinnholdsproduksjon og stemmeagenter med finjustert kontroll over tone, tempo og uttrykksnyanser. Kunngjøringen presenterer paret som en videreføring av tidligere Gemini Audio‑utgivelser: 3.5 Live Translate, 3.5 Transcribe og Gemini 3.8 Live and 3.8 Live Extended Thinking-modellene. Ifølge Gemini 3.8 Audio modellkort er modellene basert på Gemini 3 Pro, og TTS‑variantene godtar tekstinput på opptil 8K‑token og returnerer lydoutput på opptil 64K‑token.
Stemmedesign og replikasjon
Google opplyser at Gemini 3.8 Flash TTS kan lage skreddersydde stemmer fra bunnen av via naturlig språk‑prompting, og tilpasse rolle, aksent og stemmeegenskaper på over 100 språk og dialekter. Selskapet sier at utgivelsen skalerer det opprinnelige settet på 30 stemmer til et bibliotek med over 2,000 produksjonsklare stemmer med bred språkdekning, inkludert regionale varianter som meksikansk spansk, Quebec‑fransk og skotsk engelsk. Brukere kan lagre og administrere sine tilpassede stemmer for å holde ytelsen konsistent gjennom pågående prosjekter, og en stemme‑remiks‑funksjon som justerer klangfarge, tonehøyde, tempo og aksent på bibliotekstemmer er oppført som kommende.
Stemmereplikasjon gjenskaper en konsistent vokalprofil fra et 30‑sekunders lydklipp av brukerens egen stemme eller en stemme brukeren har rettigheter til å bruke. Google opplyser at funksjonen leveres med innebygd samtykkebekreftelse, SynthID‑vannmerking og C2PA‑legitimasjon.
Ytelsesretning og rapporterte måleverdier
Begge modellene tillater linje‑for‑linje‑retning av hver opptreden: brukere kan skrive sine egne sceneregier eller la Gemini styre leveringen fra naturlige manus‑signal. Google opplyser at langtidsgenerering opprettholder stemmekvalitet, tempo og karakterklang stabilt over timer med kontinuerlig lyd med minimal taler‑drift, rettet mot podkaster og lydbøker. Innfødt to‑talers‑scenestaging styrer samtaler med flere vendinger fra ett manus mens de to stemmene holdes adskilt med naturlig taletid. Manusbaserte vokale utbrudd og tilbakekanalering legger til ikke‑verbale signaler som <laughs>, <sigh> og <gasp>, samt innskudd som “mhm” og “yeah”.
I evalueringer rapporterte Google at Gemini 3.8 Flash TTS tok den første samlede plasseringen på Hume AI sin Voice Design Benchmark med en poengsum på 71.4 og også ledet aksentmodellering med 60.8. Det ble oppgitt at Flash TTS og Flash‑Lite TTS innehar første og andre plass på Hume AI sin Overall Quality Index, og at de nye modellene viser betydelige forbedringer sammenlignet med Gemini 3.1 Flash TTS på tvers av bruksområder inkludert langtidsinnhold og to‑talers manuskontroll. I blinde menneskelige preferanse‑evalueringer på Voice Arena sa Google at de to modellene tok toppposisjoner blant konkurrentene på språk som japansk, brasiliansk portugisisk, vietnamesisk, moderne standardarabisk, meksikansk spansk og hindi.
Sikkerhet, begrensninger og tilgjengelighet
Under samtykkebekreftelsessystemet må en bruker levere en muntlig samtykkerekording fra stemmeeieren som samsvarer med referansetaleren før en replikert stemme kan opprettes. Hvert lydklipp som Gemini Audio‑modellene genererer inneholder en SynthID‑vannmerking, som Google beskriver som umerkelig og direkte innbakt i lydoutputen slik at AI‑generert tale forblir oppdagbar.
Modellkortet lister opp kjente begrensninger, inkludert hallusinasjoner og sporadisk treghet eller tidsavbrudd, og angir en kunnskapsgrense i januar 2025. For grensesikkerhet uttalte Google DeepMind at deres vurderinger ikke fant noen betydningsfulle nye evner eller vesentlige ytelsesforbedringer i Gemini 3.8 Audio‑modellene sammenlignet med Gemini 3.7 Flash, som deres evalueringer fant ikke nådde noen sporet eller kritiske kapasitetsnivåer under deres Frontier Safety‑rammeverk. På dette grunnlaget sa de at Gemini 3.8 Audio‑modellene sannsynligvis ikke vil nå disse nivåene.
Gemini 3.8 Flash TTS er også tilgjengelig i Gemini Notebook og Flash‑Lite TTS i Google Vids, med bedrifts‑tilgang via API i Gemini Enterprise oppført som kommende. Google AI Studio legger til en lyd‑lekplass bygget som et stemmedesign‑arbeidsområde, hvor utviklere kan promptere nye vokale identiteter fra bunnen av eller replikere en stemme og deretter styre linje‑for‑linje‑levering i en to‑talers manusredigerer. En fotnote i kunngjøringen bemerker at stemmereplikasjon gjennom AI Studio ikke er tilgjengelig i Illinois, Texas, Det europeiske økonomiske området, Storbritannia, Sveits og India. Utviklerplattformer som Agora, LiveKit, Pipecat og Vercel støtter modellene via Gemini‑API‑en, og Google navnga Figma, HeyGen, Linguana, Wondercraft, 99.co og Ollang som partnere som integrerer de nye TTS‑modellene for global dubbing, medielokalisering og konversasjonelle stemmeagenter.












