Модели и платформы ИИ

Google выпускает модели речи Gemini 3.8 в API и AI Studio

mm
Добавьте Unite.AI в избранные источники в Google

Google 23 сентября 2026 года представил Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, две модели синтеза речи, которые он описал как самые выразительные модели генерации аудио на данный момент. Обе модели начали распространяться в тот же день в Gemini API и Google AI Studio.

Объявление, написанное менеджером группы продуктов Леландом Речисом и директором исследовательской науки Аланом Коуэном от имени команды Gemini Audio, позиционирует Gemini 3.8 Flash TTS для глубокого творческого направления и разработки персонажей в играх, иммерсивных аудиокнигах, подкастах и интерактивных медиа. Gemini 3.8 Flash-Lite TTS создан для использования в больших объёмах, экономичной работы, оптимизирован для дубляжа, создания аудио контента и голосовых агентов с тонким управлением тоном, темпом и выразительными нюансами. Объявление представляет пару как продолжение более ранних выпусков Gemini Audio: 3.5 Live Translate, 3.5 Transcribe и Gemini 3.8 Live и 3.8 Live Extended Thinking модели. Согласно карточке модели Gemini 3.8 Audio, модели основаны на Gemini 3 Pro, а варианты TTS принимают текстовый ввод до 8K токенов и возвращают аудио‑вывод до 64K токенов.

Проектирование голоса и репликация

Google заявила, что Gemini 3.8 Flash TTS может создавать индивидуальные голоса с нуля с помощью подсказок на естественном языке, настраивая роль, акцент и характеристики голоса более чем на 100 языках и диалектах. Компания сообщила, что выпуск расширил первоначальный набор из 30 голосов до библиотеки более 2 000 готовых к производству голосов с широким языковым покрытием, включая региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский. Пользователи могут сохранять и управлять своими пользовательскими голосами, чтобы поддерживать стабильную производительность в текущих проектах, а функция ремикса голоса, позволяющая регулировать тембр, высоту, темп и акцент у голосов библиотеки, объявлена как «скоро в продаже».

Репликация голоса воссоздаёт постоянный вокальный профиль из 30‑секундного аудио‑образца собственного голоса пользователя или голоса, право использовать который есть у пользователя. Google заявила, что возможность поставляется с встроенной проверкой согласия, водяным знаком SynthID и учётными данными C2PA.

Управление исполнением и заявленные показатели

Обе модели позволяют управлять каждой частью исполнения построчно: пользователи могут писать собственные сценические указания или позволить Gemini управлять подачей на основе естественных подсказок из сценария. Google заявила, что генерация длительных форм сохраняет качество голоса, темп и тембр персонажей стабильными в течение часов непрерывного аудио с минимальным дрейфом говорящего, ориентирована на подкасты и аудиокниги. Нативное сценическое построение с двумя голосами направляет многосерийные диалоги из единого сценария, при этом два голоса остаются раздельными с естественной сменой реплик. Сценарные вокальные всплески и обратные каналы добавляют невербальные сигналы, такие как <смех>, <вздох>, и <вдох>, плюс междометия вроде «мгм» и «да».

По результатам оценок Google сообщила, что Gemini 3.8 Flash TTS занял первое место в общем рейтинге Voice Design Benchmark от Hume AI со скором 71,4 и также возглавил моделирование акцентов со скором 60,8. Было заявлено, что Flash TTS и Flash‑Lite TTS занимают первое и второе места в Overall Quality Index от Hume AI, и новые модели демонстрируют значительные улучшения по сравнению с Gemini 3.1 Flash TTS в сценариях использования, включая длительный контент и управление диалогом двух голосов. В слепых оценках предпочтений людей на Voice Arena Google заявила, что обе модели заняли лидирующие позиции среди конкурентов на языках, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди.

Безопасность, ограничения и доступность

Согласно системе проверки согласия пользователь должен предоставить голосовую запись согласия от владельца голоса, соответствующую эталонному говорящему, прежде чем можно будет создать реплицированный голос. Каждый аудиоклип, генерируемый моделями Gemini Audio, содержит водяной знак SynthID, который Google описывает как незаметный и встроенный непосредственно в аудиовывод, чтобы ИИ‑сгенерированная речь оставалась обнаруживаемой.

В карточке модели перечислены известные ограничения, включая галлюцинации и периодические замедления или проблемы с тайм‑аутом, а также указан предел знаний — январь 2025 года. Что касается передовой безопасности, Google DeepMind заявила, что её оценки не обнаружили значимых новых возможностей или существенного повышения производительности в моделях Gemini 3.8 Audio по сравнению с Gemini 3.7 Flash, которые, по их оценкам, не достигли ни отслеживаемых, ни критических уровней возможностей в рамках их Frontier Safety Framework. На этой основе было сказано, что модели Gemini 3.8 Audio вряд ли достигнут этих уровней.

Gemini 3.8 Flash TTS также доступен в Gemini Notebook, а Flash‑Lite TTS — в Google Vids, при этом корпоративный доступ через API в Gemini Enterprise объявлен как «скоро». Google AI Studio добавляет аудио‑площадку, построенную как рабочее пространство проектирования голоса, где разработчики могут создавать новые вокальные идентичности с нуля или реплицировать голос, а затем управлять построчным исполнением в редакторе сценариев с двумя голосами. Сноска в объявлении указывает, что репликация голоса через AI Studio недоступна в Иллинойсе, Техасе, Европейской экономической зоне, Соединённом Королевстве, Швейцарии и Индии. Платформы для разработчиков Agora, LiveKit, Pipecat и Vercel поддерживают модели через Gemini API, а Google назвала Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang партнёрами, интегрирующими новые модели TTS для глобального дубляжа, локализации медиа и разговорных голосовых агентов.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.