Modelos e plataformas de IA

Google lança os modelos de voz Gemini 3.8 Live e Extended Thinking

mm
Adicione Unite.AI às suas fontes preferidas no Google

Google anunciou Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking em 15 de setembro de 2026, um par de modelos de diálogo ao vivo sendo lançados na Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live e Google Workspace.

Os modelos foram apresentados por Tom Ouyang, engenheiro principal, e Malini Jaganathan, membro da equipe técnica, escrevendo em nome da Gemini Audio Team. A Google descreve o par como seus modelos de diálogo ao vivo mais avançados até agora, desenvolvidos para conversas naturais, e afirma que os ganhos em inteligência e raciocínio paralelo os tornam mais intuitivos para colaboração em tarefas complexas executadas por voz. A empresa posiciona o Gemini 3.8 Live para escala e eficiência de custos, combinando inteligência conversacional com diálogo fluido e fundamentação visual, enquanto o Gemini 3.8 Live Extended Thinking foi criado para tarefas de alta complexidade que exigem maior inteligência e raciocínio em múltiplas etapas. Segundo a Google, os modelos fornecem aos desenvolvedores e empresas os blocos de construção para agentes de voz confiáveis e prontos para produção, ao mesmo tempo em que tornam as conversas com o Gemini nos aplicativos Gemini, Workspace e Search mais fluidas.

Resultados de Benchmark Reportados

A Google informa que o Gemini 3.8 Live Extended Thinking alcançou a primeira posição geral no Speech to Speech Quality Index da Artificial Analysis com pontuação de 82.6, e que lidera em conclusão de tarefas agentes com 68.6% no τ-Voice e 35.1% no benchmark τ-Voice-banking da Sierra. A empresa também relata uma pontuação de 97.7% no Big Bench Audio e afirma que o Extended Thinking mantém um preço altamente competitivo em relação a outros modelos de ponta. A Google diz que o Gemini 3.8 Live ficou em segundo lugar na Speech Agent Arena da Artificial Analysis, citando alta preferência entre os usuários, e o descreve como altamente econômico e projetado para escala. No EVA-Bench da ServiceNow, um benchmark para avaliação de agentes de voz, a Google afirma que seus modelos empurram a Fronteira de Pareto para fluxos de trabalho complexos ao equilibrar com sucesso precisão e qualidade conversacional; a postagem observa que essa avaliação foi executada na Live API na plataforma de agentes Gemini Enterprise.

Capacidades de Conversação em Tempo Real

De acordo com a Google, o Gemini 3.8 Live processa entradas visuais quase em tempo real, adicionando contexto que, segundo a empresa, gera respostas mais úteis. O modelo detecta e transita automaticamente entre 97 idiomas suportados durante a conversa, e executa ferramentas e chamadas de API em segundo plano enquanto a conversa continua, reconhecendo solicitações e mantendo o diálogo enquanto as tarefas são concluídas. Para tarefas que exigem raciocínio mais profundo, a Google afirma que o Extended Thinking raciocina e fala simultaneamente, usando pistas verbais iniciais para reconhecer prompts de forma natural e narração de progresso ao vivo para guiar os usuários por tarefas de fundo em múltiplas etapas à medida que avançam, sem interromper o fluxo da conversa.

Os vídeos de demonstração publicados com o anúncio mostram o Gemini 3.8 Live orientando uma sessão de integração de funcionários em tempo real, usando contexto visual para responder a perguntas ao vivo, jogando xadrez quase em tempo real, elaborando planos de negócios completos e kits de marketing personalizados por meio de fala natural, e fornecendo ajuda passo a passo de solução de problemas dentro do Search Live. As demonstrações do Extended Thinking mostram o modelo transformando esboços brutos e feedback de voz quase em tempo real em componentes React funcionais, coordenando reservas de restaurante em múltiplas etapas por meio de chamadas assíncronas de funções sem interromper a conversa, e operando nos ambientes Docs Live, Gmail Live e Keep Live no Google Workspace.

Live API e Ecossistema de Desenvolvedores

A Google nomeia Agora, Fishjam, LiveKit, Pipecat, Vercel e Vision Agents como plataformas de desenvolvedores que utilizam a Gemini Live API para permitir que os desenvolvedores criem e implantem interfaces acionadas por voz enquanto as plataformas gerenciam a infraestrutura subjacente de streaming de mídia em tempo real. A empresa afirma que também está em parceria com Salesforce, Genspark e Lumeris nos novos modelos, destacando seu interesse na latência, fluidez e capacidades de chamada de ferramentas dos modelos.

A documentação oficial da Live API descreve a interface como habilitando interações de voz e visão em tempo real e baixa latência com o Gemini, processando fluxos contínuos de áudio, imagens e texto para fornecer respostas faladas imediatas por meio de uma conexão WebSocket com estado. As entradas documentadas são áudio PCM bruto de 16 bits a 16kHz, imagens JPEG de até um quadro por segundo e texto, com saída de áudio em PCM bruto de 16 bits a 24kHz. Os desenvolvedores podem escolher uma implementação server-to-server, na qual um backend encaminha os dados de fluxo do cliente para a Live API, ou uma implementação client-to-server, na qual o código front‑end se conecta diretamente via WebSockets. A documentação lista casos de uso que abrangem assistentes de compras no varejo e agentes de suporte, personagens interativos de jogos, experiências habilitadas por voz e vídeo em robótica, óculos inteligentes e veículos, companheiros de saúde, ferramentas de consultoria financeira, mentores educacionais, tradução em tempo real e transcrição e legendagem ao vivo.

A Google afirma que todo áudio gerado por seus produtos de IA possui marca d’água SynthID, uma marca d’água imperceptível incorporada diretamente na saída de áudio para que o conteúdo gerado por IA continue detectável, ajudando a prevenir desinformação. A postagem direciona os leitores ao modelo de cartão para detalhes sobre a abordagem de segurança e responsabilidade da empresa.

Disponibilidade e Lançamento

Ambos os modelos começaram a ser lançados em 15 de setembro. Para desenvolvedores, eles estão disponíveis na Gemini API e no Google AI Studio, e para empresas estão em pré‑visualização privada no Gemini Enterprise. O Gemini 3.8 Live está disponível para todos no Search Live, enquanto o Extended Thinking está disponível no Gemini Live, no Docs para assinantes do Google AI Pro e Ultra através do Workspace, e no Gmail e Keep para todos os assinantes do Google AI. O Google afirma que o Gemini Enterprise para suporte de Experiência do Cliente para ambos os modelos chegará em breve, e que o Extended Thinking chegará em breve aos clientes empresariais do Google Workspace.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.