Моделі та платформи ШІ
Google запускає мовні моделі Gemini 3.8 в API та AI Studio

Google 23 вересня 2026 року представив Gemini 3.8 Flash TTS та Gemini 3.8 Flash-Lite TTS, два моделі синтезу мови, які він описав як найвиразніші моделі генерації аудіо на сьогодні. Обидві моделі почали розгортатися того ж дня в Gemini API та Google AI Studio.
Оголошення, написане керівником групи продукту Леландом Речісом та директором дослідницької науки Аланом Коуеном від імені команди Gemini Audio, позиціонує Gemini 3.8 Flash TTS для глибокого креативного напрямку та дизайну персонажів у іграх, занурювальних аудіокнигах, подкастах та інтерактивних медіа. Gemini 3.8 Flash-Lite TTS створений для високого обсягу, економічно ефективного використання, оптимізований для дублювання, створення аудіоконтенту та голосових агентів з детальним керуванням тоном, темпом та виразними нюансами. Оголошення представляє цю пару як наступну після попередніх випусків Gemini Audio: 3.5 Live Translate, 3.5 Transcribe та Gemini 3.8 Live і 3.8 Live Extended Thinking моделей. За даними картка моделі Gemini 3.8 Audio, моделі базуються на Gemini 3 Pro, а варіанти TTS приймають текстовий ввід до 8 000 токенів і повертають аудіо‑вивід до 64 000 токенів.
Дизайн та реплікація голосу
Google повідомив, що Gemini 3.8 Flash TTS може створювати індивідуальні голоси з нуля за допомогою підказок природної мови, налаштовуючи роль, акцент і характеристики голосу більш ніж у 100 мовах і діалектах. Компанія зазначила, що випуск розширює початковий набір з 30 голосів до бібліотеки понад 2 000 готових до виробництва голосів із широким мовним охопленням, включаючи регіональні варіанти, такі як мексиканська іспанська, квебекська французька та шотландська англійська. Користувачі можуть зберігати та керувати своїми кастомними голосами, щоб забезпечити стабільну продуктивність у поточних проектах, а функція реміксу голосу, яка коригує тембр, висоту, темп і акцент у бібліотечних голосах, зазначена як майбутня.
Реплікація голосу відтворює послідовний вокальний профіль з 30‑секундного аудіо‑зразка власного голосу користувача або голосу, на використання якого у користувача є права. Google зазначив, що ця можливість постачається з вбудованою перевіркою згоди, водяним знаком SynthID та обліковими даними C2PA.
Керування виконанням та повідомлені еталони
Обидві моделі дозволяють покрокове керування кожним виконанням: користувачі можуть писати власні сценічні вказівки або дозволити Gemini керувати подачею на основі природних підказок зі сценарію. Google зазначив, що генерація довгих форм зберігає якість голосу, темп і тембр персонажів стабільними протягом годин безперервного аудіо з мінімальним зсувом голосу, орієнтуючись на подкасти та аудіокниги. Вбудоване постановлення сцен з двома спікерами керує багатократними діалогами з одного сценарію, зберігаючи два голоси розділеними природним чергуванням. Сценічні вокальні вибухи та бекчейнджинг додають невербальні сигнали, такі як <laughs>, <sigh>, та <gasp>, а також вигуки типу “mhm” і “yeah”.
Під час оцінок Google повідомив, що Gemini 3.8 Flash TTS зайняв перше місце в загальному рейтингу Voice Design Benchmark від Hume AI зі скором 71,4 та також лідирував у моделюванні акцентів зі скором 60,8. Компанія зазначила, що Flash TTS і Flash‑Lite TTS посідають перше та друге місця в Overall Quality Index від Hume AI, і що нові моделі демонструють суттєві покращення порівняно з Gemini 3.1 Flash TTS у випадках використання, включаючи довготривалий контент та контроль сценаріїв з двома спікерами. У сліпих оцінках переваг людей на Voice Arena Google повідомив, що обидві моделі зайняли провідні позиції серед конкурентів за мовами, включаючи японську, бразильську португальську, в’єтнамську, сучасну стандартну арабську, мексиканську іспанську та хінді.
Безпека, обмеження та доступність
За системою перевірки згоди користувач повинен надати голосовий запис згоди від власника голосу, який збігається з референтним спікером, перш ніж можна створити реплікований голос. Кожен аудіо‑фрагмент, який генерують моделі Gemini Audio, містить водяний знак SynthID, який Google описує як непомітний і вбудований безпосередньо в аудіо‑вивід, щоб штучно згенерована мова залишалася виявленою.
Картка моделі перераховує відомі обмеження, включаючи галюцинації та випадкову повільність або проблеми з тайм‑аутом, і вказує дату обмеження знань — січень 2025 року. Щодо безпеки на межі, Google DeepMind зазначив, що його оцінки не виявили суттєвих нових можливостей або значних підвищень продуктивності в моделях Gemini 3.8 Audio порівняно з Gemini 3.7 Flash, які, за їхніми оцінками, не досягли жодного рівня відстежуваних або критичних можливостей у межах їхньої Frontier Safety Framework. На підставі цього було сказано, що моделі Gemini 3.8 Audio навряд чи досягнуть цих рівнів.
Gemini 3.8 Flash TTS також доступний у Gemini Notebook, а Flash‑Lite TTS — у Google Vids, при цьому корпоративний доступ через API у Gemini Enterprise зазначено як майбутній. Google AI Studio додає аудіо‑майданчик, побудований як робочий простір дизайну голосу, де розробники можуть створювати нові вокальні ідентичності з нуля або реплікувати голос, а потім керувати покроковою подачею у редакторі сценарію з двома спікерами. У примітці до оголошення зазначено, що реплікація голосу через AI Studio недоступна в Іллінойсі, Техасі, Європейській економічній зоні, Сполученому Королівству, Швейцарії та Індії. Платформи для розробників Agora, LiveKit, Pipecat і Vercel підтримують моделі через Gemini API, а Google назвав Figma, HeyGen, Linguana, Wondercraft, 99.co та Ollang партнерами, які інтегрують нові моделі TTS для глобального дублювання, локалізації медіа та розмовних голосових агентів.












