AI-modeller og platforme

Google lancerer Gemini 3.8 tale‑modeller i API og AI Studio

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google introducerede den 23. september 2026 Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, to tekst‑til‑tale‑modeller, som den beskrev som sine mest udtryksfulde lydgenereringsmodeller indtil nu. Begge modeller begyndte at blive rullet ud samme dag i Gemini API og Google AI Studio.

Meddelelsen, skrevet af produktchef for gruppen Leland Rechis og forskningsdirektør Alan Cowen på vegne af Gemini Audio‑teamet, placerer Gemini 3.8 Flash TTS til dyb kreativ retning og karakterdesign på tværs af gaming, immersive lydbøger, podcasts og interaktive medier. Gemini 3.8 Flash-Lite TTS er bygget til højvolumen, omkostningseffektiv brug, optimeret til dubbing, oprettelse af lydindhold og stemmeagenter med finjusteret kontrol over tone, tempo og udtryksfulde nuancer. Meddelelsen præsenterer parret som en fortsættelse af tidligere Gemini Audio‑udgivelser: 3.5 Live Translate, 3.5 Transcribe og Gemini 3.8 Live and 3.8 Live Extended Thinking-modellerne. Ifølge Gemini 3.8 Audio modelkort er modellerne baseret på Gemini 3 Pro, og TTS‑varianterne accepterer tekstinput op til 8 K‑tokens og returnerer lydoutput op til 64 K‑tokens.

Stemme‑design og replikation

Google sagde, at Gemini 3.8 Flash TTS kan skabe skræddersyede stemmer fra bunden via naturlig sprog‑prompting, tilpasse rolle, accent og stemmeegenskaber på tværs af mere end 100 sprog og dialekter. Virksomheden oplyste, at udgivelsen udvider det oprindelige sæt på 30 stemmer til et bibliotek på mere end 2 000 produktionsklare stemmer med bred sprog dækning, herunder regionale varianter som mexicansk spansk, québec-fransk og skotsk engelsk. Brugere kan gemme og administrere deres tilpassede stemmer for at holde ydeevnen konsistent på tværs af igangværende projekter, og en stemme‑remix‑funktion, der justerer klangfarve, tonehøjde, tempo og accent på bibliotekstemmer, er angivet som kommende.

Stemme‑replikation genskaber en konsistent vokalprofil fra et 30‑sekunders lydklip af brugerens egen stemme eller en stemme, som brugeren har ret til at anvende. Google oplyste, at funktionen leveres med indbygget samtykkebekræftelse, SynthID‑vandmærkning og C2PA‑legitimationsoplysninger.

Præstations‑retning og rapporterede benchmark‑resultater

Begge modeller tillader linje‑for‑linje styring af hver præstation: brugere kan skrive deres egne sceneinstruktioner eller lade Gemini styre leveringen ud fra naturlige manuskript‑signal. Google sagde, at langtids‑generering bevarer stemmekvalitet, tempo og karakterklang stabilt over timer af kontinuerlig lyd med minimal taler‑drift, rettet mod podcasts og lydbøger. Indbygget to‑taler‑scene‑opsætning styrer multi‑turn‑samtaler fra et enkelt manuskript, mens de to stemmer holdes adskilte med naturlig tur‑skifte. Scriptede vokale udbrud og backchanneling tilføjer non‑verbale signaler såsom <laughs>, <sigh>, og <gasp>, samt indskud som “mhm” og “yeah”.

I evalueringerne rapporterede Google, at Gemini 3.8 Flash TTS opnåede førstepladsen samlet på Hume AI’s Voice Design Benchmark med en score på 71,4 og også førte i accent‑modellering med 60,8. Det blev oplyst, at Flash TTS og Flash‑Lite TTS indtager første og anden plads på Hume AI’s Overall Quality Index, og at de nye modeller viser betydelige forbedringer i forhold til Gemini 3.1 Flash TTS på tværs af anvendelsestilfælde, herunder langtidsindhold og dual‑speaker manuskript‑styring. I blinde menneskelige præference‑evalueringer på Voice Arena sagde Google, at de to modeller indtog top‑positionerne blandt konkurrenterne på sprog som japansk, brasiliansk portugisisk, vietnamesisk, moderne standardarabisk, mexicansk spansk og hindi.

Sikkerhed, begrænsninger og tilgængelighed

Under samtykkebekræftelsessystemet skal en bruger levere en mundtlig samtykkoptagelse fra stemmeejeren, der matcher reference‑talerens stemme, før en replikeret stemme kan oprettes. Hvert lydklip, som Gemini Audio‑modellerne genererer, indeholder et SynthID‑vandmærke, som Google beskriver som uopfatteligt og indlejret direkte i lydoutputtet, så AI‑genereret tale forbliver genkendelig.

Modelkortet angiver kendte begrænsninger, herunder hallucinationer og lejlighedsvis langsomhed eller timeout‑problemer, og angiver en videns‑cut‑off i januar 2025. For frontier‑sikkerhed sagde Google DeepMind, at deres vurderinger ikke fandt meningsfulde nye kapaciteter eller væsentlige præstationsforbedringer i Gemini 3.8 Audio‑modellerne sammenlignet med Gemini 3.7 Flash, som deres evalueringer fandt ikke nåede nogen sporede eller kritiske kapabilitets‑niveauer under deres Frontier Safety Framework. På dette grundlag konkluderede de, at Gemini 3.8 Audio‑modellerne sandsynligvis ikke vil nå disse niveauer.

Gemini 3.8 Flash TTS er også tilgængelig i Gemini Notebook og Flash‑Lite TTS i Google Vids, med enterprise‑adgang via API i Gemini Enterprise angivet som kommende. Google AI Studio tilføjer en lyd‑legeplads opbygget som et stemme‑design‑arbejdsområde, hvor udviklere kan prompt nye vokale identiteter fra bunden eller replikere en stemme og derefter styre linje‑for‑linje levering i en dual‑speaker manuskript‑editor. En fodnote i meddelelsen bemærker, at stemme‑replikation gennem AI Studio ikke er tilgængelig i Illinois, Texas, Det Europæiske Økonomiske Område, Storbritannien, Schweiz og Indien. Udviklerplatforme som Agora, LiveKit, Pipecat og Vercel understøtter modellerne via Gemini API, og Google navngav Figma, HeyGen, Linguana, Wondercraft, 99.co og Ollang som partnere, der integrerer de nye TTS‑modeller til global dubbing, medielokalisering og samtale‑stemageagenter.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.