Modelos e plataformas de IA
Google lança modelos de fala Gemini 3.8 na API e no AI Studio

Google, em 23 de setembro de 2026, apresentou Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, dois modelos de texto‑para‑fala que descreveu como seus modelos de geração de áudio mais expressivos até agora. Ambos os modelos começaram a ser lançados no mesmo dia na Gemini API e no Google AI Studio.
O anúncio, escrito pelo Gerente de Produto de Grupo Leland Rechis e pelo Diretor de Pesquisa Científica Alan Cowen em nome da equipe Gemini Audio, posiciona o Gemini 3.8 Flash TTS para direção criativa profunda e design de personagens em jogos, audiolivros imersivos, podcasts e mídia interativa. O Gemini 3.8 Flash-Lite TTS foi desenvolvido para uso de alto volume e custo‑eficiente, otimizado para dublagem, criação de conteúdo de áudio e agentes de voz com controle granular sobre tom, ritmo e nuances expressivas. O anúncio apresenta o par como continuação dos lançamentos anteriores da Gemini Audio: 3.5 Live Translate, 3.5 Transcribe e os modelos Gemini 3.8 Live e 3.8 Live Extended Thinking. De acordo com o cartão do modelo Gemini 3.8 Audio, os modelos são baseados no Gemini 3 Pro, e as variantes TTS aceitam entrada de texto de até 8K tokens e retornam saída de áudio de até 64K tokens.
Design de Voz e Replicação
A Google afirmou que o Gemini 3.8 Flash TTS pode criar vozes sob medida a partir do zero por meio de prompts em linguagem natural, personalizando papel, sotaque e características vocais em mais de 100 idiomas e dialetos. A empresa disse que o lançamento amplia seu conjunto original de 30 vozes para uma biblioteca de mais de 2 mil vozes prontas para produção, com ampla cobertura linguística, incluindo variantes regionais como espanhol mexicano, francês de Quebec e inglês escocês. Os usuários podem salvar e gerenciar suas vozes personalizadas para manter o desempenho consistente em projetos em andamento, e um recurso de remixagem de voz que ajusta timbre, altura, ritmo e sotaque nas vozes da biblioteca está listado como chegando em breve.
A replicação de voz recria um perfil vocal consistente a partir de uma amostra de áudio de 30 segundos da própria voz do usuário ou de uma voz que o usuário tem direito de usar. A Google afirmou que a funcionalidade vem com verificação de consentimento integrada, marca d’água SynthID e credenciais C2PA.
Direção de Performance e Pontos de Referência Reportados
Ambos os modelos permitem direção linha a linha de cada performance: os usuários podem escrever suas próprias indicações de cena ou deixar o Gemini conduzir a entrega a partir de pistas naturais do roteiro. A Google afirmou que a geração de longo prazo mantém a qualidade da voz, o ritmo e o timbre dos personagens estáveis ao longo de horas de áudio contínuo, com mínima deriva do locutor, direcionado a podcasts e audiolivros. A encenação nativa de cena com dois locutores direciona conversas de múltiplas voltas a partir de um único roteiro, mantendo as duas vozes separadas com turnos naturais. Explosões vocais roteirizadas e backchanneling adicionam sinais não verbais como <laughs>, <sigh>, e <gasp>, além de interjeições como “mhm” e “yeah”.
Em avaliações, a Google informou que o Gemini 3.8 Flash TTS conquistou a primeira posição geral no Benchmark de Design de Voz da Hume AI com pontuação de 71.4 e também liderou a modelagem de sotaques com 60.8. A empresa afirmou que o Flash TTS e o Flash-Lite TTS ocupam as primeiras e segundas posições no Índice de Qualidade Geral da Hume AI, e que os novos modelos apresentam melhorias significativas em relação ao Gemini 3.1 Flash TTS em casos de uso que incluem conteúdo de longo formato e controle de roteiro de dois locutores. Em avaliações cegas de preferência humana no Voice Arena, a Google disse que os dois modelos ficaram em primeiro lugar entre os concorrentes em idiomas como japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi.
Segurança, Limitações e Disponibilidade
Sob o sistema de verificação de consentimento, o usuário deve fornecer uma gravação de consentimento verbal do proprietário da voz que corresponda ao locutor de referência antes que uma voz replicada possa ser criada. Cada trecho de áudio gerado pelos modelos Gemini Audio contém uma marca d’água SynthID, que a Google descreve como imperceptível e incorporada diretamente na saída de áudio, de modo que a fala gerada por IA permaneça detectável.
O cartão do modelo lista limitações conhecidas, incluindo alucinações e ocasional lentidão ou problemas de tempo limite, e indica um corte de conhecimento em janeiro de 2025. Para a segurança de fronteira, a Google DeepMind afirmou que suas avaliações não encontraram novas capacidades significativas ou aumentos de desempenho material nos modelos Gemini 3.8 Audio em comparação com o Gemini 3.7 Flash, cujas avaliações mostraram que não atingiram nenhum Nível de Capacidade Rastreada ou Crítica sob seu Framework de Segurança de Fronteira. Com base nisso, afirmou que os modelos Gemini 3.8 Audio provavelmente não alcançarão esses níveis.
O Gemini 3.8 Flash TTS também está disponível no Gemini Notebook e o Flash-Lite TTS no Google Vids, com acesso empresarial via API em Gemini Enterprise listado como chegando em breve. O Google AI Studio adiciona um playground de áudio construído como um espaço de trabalho de design de voz, onde desenvolvedores podem gerar novas identidades vocais do zero ou replicar uma voz e então direcionar a entrega linha a linha em um editor de roteiro de dois locutores. Uma nota de rodapé no anúncio indica que a replicação de voz através do AI Studio não está disponível em Illinois, Texas, na Área Econômica Europeia, no Reino Unido, na Suíça e na Índia. As plataformas de desenvolvedor Agora, LiveKit, Pipecat e Vercel suportam os modelos via Gemini API, e a Google nomeou Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang como parceiros que integram os novos modelos TTS para dublagem global, localização de mídia e agentes de voz conversacionais.












