Modely a platformy AI
Google představuje modely řeči Gemini 3.8 v API a AI Studiu

Google 23. září 2026 představil Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, dva modely převodu textu na řeč, které popsal jako své dosud nejvýraznější modely pro generování audia. Oba modely začaly být nasazovány tentýž den v Gemini API a Google AI Studiu.
Oznámení, které sepsali Group Product Manager Leland Rechis a Director of Research Science Alan Cowen jménem týmu Gemini Audio, umisťuje Gemini 3.8 Flash TTS pro hluboké kreativní směřování a návrh postav napříč hraním, imerzními audioknihami, podcasty a interaktivními médii. Gemini 3.8 Flash-Lite TTS je navržen pro vysoký objem a nákladově efektivní využití, optimalizován pro dabing, tvorbu audioobsahu a hlasové agenty s detailní kontrolou nad tónem, tempem a expresivní nuancí. Oznámení představuje tento pár jako pokračování předchozích vydání Gemini Audio: 3.5 Live Translate, 3.5 Transcribe a modely Gemini 3.8 Live a 3.8 Live Extended Thinking. Podle Gemini 3.8 Audio karty modelu jsou modely založeny na Gemini 3 Pro a varianty TTS přijímají textový vstup až do 8K tokenů a vracejí audio výstup až do 64K tokenů.
Návrh a replikace hlasu
Google uvedl, že Gemini 3.8 Flash TTS dokáže vytvářet zakázkové hlasy od nuly pomocí přirozeného jazykového zadání, přizpůsobovat roli, přízvuk a charakteristiky hlasu ve více než 100 jazycích a dialektech. Společnost uvedla, že vydání rozšiřuje původní sadu 30 hlasů na knihovnu více než 2 000 produkčně připravených hlasů s širokým jazykovým pokrytím, včetně regionálních variant jako mexická španělština, québecká francouzština a skotská angličtina. Uživatelé si mohou ukládat a spravovat své vlastní hlasy, aby si zachovali konzistentní výkon napříč probíhajícími projekty, a funkce přemíchávání hlasu, která upravuje barvu, výšku, tempo a přízvuk knihovních hlasů, je uvedena jako připravovaná.
Replikace hlasu vytvoří konzistentní vokální profil z 30‑sekundového audio vzorku uživatelova vlastního hlasu nebo hlasu, který uživatel má právo používat. Google uvedl, že tato funkce je dodávána s vestavěným ověřením souhlasu, vodoznakem SynthID a údaji C2PA.
Řízení výkonu a hlášené benchmarky
Oba modely umožňují řídit výkon řádek po řádku: uživatelé mohou psát vlastní scénické pokyny nebo nechat Gemini řídit výstup na základě přirozených narážek v scénáři. Google uvedl, že generování dlouhých formátů udržuje kvalitu hlasu, tempo a barvu postavy stabilní po dobu hodin nepřetržitého audia s minimálním posunem řečníka, což je zaměřeno na podcasty a audioknihy. Nativní scénář s dvěma řečníky řídí víceotáčkové konverzace z jediného scénáře a zároveň udržuje oba hlasy oddělené přirozeným střídáním. Scénické vokální výbuchy a zpětná vazba přidávají neverbální signály jako <laughs>, <sigh> a <gasp>, plus vložky jako “mhm” a “yeah”.
Při hodnoceních Google uvedl, že Gemini 3.8 Flash TTS získal první celkovou pozici v Hume AI Voice Design Benchmark s výsledkem 71,4 a také vedl v modelování přízvuku s 60,8. Uvedl, že Flash TTS a Flash-Lite TTS zaujímají první a druhou pozici v Hume AI Overall Quality Index a že nové modely vykazují výrazná zlepšení oproti Gemini 3.1 Flash TTS napříč případy použití, včetně dlouhých formátů a řízení scénáře s dvěma řečníky. V neviditelných hodnoceních lidských preferencí na Voice Arena Google uvedl, že oba modely získaly přední pozice mezi konkurencí v jazycích jako japonština, brazilská portugalština, vietnamština, moderní standardní arabština, mexická španělština a hindština.
Bezpečnost, omezení a dostupnost
V rámci systému ověřování souhlasu musí uživatel poskytnout ústní nahrávku souhlasu od vlastníka hlasu, která odpovídá referenčnímu mluvčímu, než může být vytvořen replikovaný hlas. Každý audio klip generovaný modely Gemini Audio nese vodoznak SynthID, který Google popisuje jako nepostřehnutý a vložený přímo do audio výstupu, aby byl AI‑generovaný projev nadále detekovatelný.
Modelová karta uvádí známá omezení, včetně halucinací a občasných pomalých nebo časových limitů, a stanovuje hranici znalostí na leden 2025. Pro hraní bezpečnosti Google DeepMind uvedl, že jeho hodnocení nenašla žádné významné nové schopnosti ani podstatné zvýšení výkonu v modelech Gemini 3.8 Audio ve srovnání s Gemini 3.7 Flash, které podle jeho hodnocení nedosáhly žádných sledovaných nebo kritických úrovní schopností podle rámce Frontier Safety Framework. Na této základně uvedl, že modely Gemini 3.8 Audio pravděpodobně nedosáhnou těchto úrovní.
Gemini 3.8 Flash TTS je také k dispozici v Gemini Notebook a Flash-Lite TTS v Google Vids, s podnikatelským přístupem přes API v Gemini Enterprise, který je uveden jako připravovaný. Google AI Studio přidává audio hřiště postavené jako pracovní prostor pro návrh hlasu, kde vývojáři mohou od nuly zadávat nové vokální identity nebo replikovat hlas a následně řídit řádek po řádku výstup v editoru scénáře pro dva řečníky. Poznámka pod čarou v oznámení uvádí, že replikace hlasu prostřednictvím AI Studia není k dispozici v Illinois, Texasu, Evropském hospodářském prostoru, Spojeném království, Švýcarsku a Indii. Vývojářské platformy Agora, LiveKit, Pipecat a Vercel podporují modely přes Gemini API a Google uvedl Figma, HeyGen, Linguana, Wondercraft, 99.co a Ollang jako partnery integrující nové TTS modely pro globální dabing, lokalizaci médií a konverzační hlasové agenty.












