Modelos e plataformas de IA

Google traz presença visual de Avatar ao vivo para o Gemini 3.8 Live

mm
Adicione Unite.AI às suas fontes preferidas no Google

Google, em 24 de setembro de 2026, introduziu Gemini 3.8 Live with Live Avatar, um recurso que adiciona vídeo gerado quase em tempo real à fala de seus modelos nativos de diálogo ao vivo, e o disponibilizou de forma geral no Gemini Enterprise com endpoints nos Estados Unidos e na União Europeia.

O anúncio, escrito pela cientista pesquisadora Shuo-yiin Chang e pelo engenheiro de software CJ Zheng em nome da equipe Gemini Audio, apresenta o recurso como uma camada de presença visual para a IA conversacional do Gemini. O Google afirma que sua sincronização labial precisa, expressões naturais e troca de turnos fluida permitem que empresas ampliem ofertas virtuais como atendimento ao cliente e passeios interativos.

O lançamento segue o lançamento em 15 de setembro de 2026 do Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, modelos de diálogo ao vivo que o Google posicionou para conversas escaláveis e econômicas e para tarefas de raciocínio de alta complexidade, respectivamente, os quais começaram a ser disponibilizados através da API Gemini, Google AI Studio, o aplicativo Gemini, Google Workspace e Search Live.

Disponibilidade Geral no Gemini Enterprise

Gemini 3.8 Live with Live Avatar está disponível de forma geral no Gemini Enterprise a partir de 24 de setembro de 2026, e o Google Cloud informou que a tecnologia foi apresentada pela primeira vez no Google Cloud Next 2026. A versão é oferecida através de endpoints nos EUA e na UE e inclui taxa de transferência provisionada, conformidade empresarial e governança de dados rigorosa, de acordo com a publicação do Google Cloud por Fabien Blanc‑paques, gerente de produto do grupo para Gemini Live. Gemini 3.8 Live Extended Thinking permanece em pré‑visualização privada.

Clientes empresariais podem experimentar o modelo no console Gemini Enterprise, integrá‑lo por meio da documentação da API Gemini Live e consultar os preços na página de preços do Google Cloud. O Google Cloud orienta os clientes a trabalhar com seus representantes de vendas para taxa de transferência provisionada, arquiteturas de implantação personalizadas e lista de permissão para avatares personalizados.

Como o Avatar ao Vivo Funciona

O Avatar ao Vivo processa entradas visuais e de áudio simultaneamente e responde com áudio e vídeo expressivos em quase tempo real, segundo o Google. O recurso também suporta chamadas assíncronas de ferramentas, podendo iniciar chamadas de ferramentas e recuperar dados em segundo plano sem interromper a conversa. Uma demonstração do Google mostra o avatar verificando um hóspede de hotel enquanto o diálogo continua sem interrupção.

O Google afirma que o avatar ajusta sua sincronização labial e expressões à medida que as conversas se deslocam por 97 idiomas, mantendo a fidelidade do vídeo e evitando desvios visuais. A publicação do Google Cloud acrescenta compreensão visual ao vivo de fluxos de câmera e compartilhamentos de tela juntamente com o áudio, recuperação de interrupções que preserva o contexto da conversa e transações de back‑end, detecção automática de idioma e transição sem alternâncias manuais, e implantação em web, dispositivos móveis e quiosques interativos. Uma demonstração separada do Google Cloud mostra um agente de recebimento de sinistros de seguro preenchendo um caderno de sinistros enquanto um cliente exibe danos pela câmera, enquanto uma equipe de agentes construída com o Agent Development Kit do Google verifica a apólice, aplica as regras de recebimento e monta o pacote do ajustador em segundo plano.

Avatares, Marcação d’água e Limitações do Cartão de Modelo

Organizações podem implantar a partir de uma biblioteca de avatares predefinidos ou gerar avatares personalizados a partir de uma imagem de referência de alta qualidade, e o Google afirma que o resultado mantém a semelhança, o estilo da marca ou a identidade do personagem da referência. O acesso à criação de avatares personalizados requer lista de permissão empresarial; o Google Cloud descreve o processo de lista de permissão e verificação como uma salvaguarda para identidade e contra uso indevido. Cada fluxo de áudio e vídeo gerado é incorporado com uma marca d’água SynthID imperceptível, mantendo o conteúdo gerado por IA detectável.

De acordo com o cartão de modelo Gemini 3.8 Audio, os modelos são baseados no Gemini 3 Pro. O Gemini 3.8 Live aceita áudio, imagens, vídeo e texto com uma janela de contexto de até 128 K tokens, e com o Avatar ao Vivo ele produz áudio, vídeo e texto sujeitos a um limite de saída de 24 K tokens. O cartão de modelo afirma que as variantes do Avatar ao Vivo produzem vídeo expressivo de movimentos naturais da cabeça sincronizados à fala, impulsionados por imagens e entradas de áudio configuradas, e que sustentam alguns minutos de interação contínua em vez de horas estendidas.

O cartão de modelo lista limitações conhecidas, incluindo possíveis alucinações e lentidão ou tempos de espera ocasionais, e define o corte de conhecimento em janeiro de 2025. Sua avaliação de segurança de fronteira não encontrou novas capacidades significativas nem ganhos de desempenho materiais em relação ao Gemini 3.7 Flash, e com base nisso o Google considera que os modelos Gemini 3.8 Audio são improváveis de alcançar quaisquer Níveis de Capacidade Rastreada ou Crítica sob seu Framework de Segurança de Fronteira.

Implantações de Clientes

O Google Cloud citou várias empresas que utilizam o recurso. A Cox Automotive desenvolveu um assistente de compras impulsionado por IA para a Autotrader que usa realce de tela ao vivo e chamadas de ferramentas para orientar compradores de carros através da busca, comparação e financiamento de veículos em tempo real.

“Os compradores cada vez mais esperam descrever o que precisam com suas próprias palavras, em vez de navegar por filtros e menus. O novo Avatar de IA conversacional da Autotrader traz essa experiência para a descoberta de veículos ao combinar conversas naturais com o inventário correto,” Marianne Johnson, vice‑presidente executiva e diretora de produto da Cox Automotive, disse no anúncio da Google Cloud.

O executivo‑chefe da Equal AI, Akhilesh Damaraju, disse que a IA pessoal da empresa lida com mais de um milhão de chamadas ao vivo diariamente em nove idiomas indianos, e afirmou que o Gemini 3.8 Live aprimorou o tratamento de interrupções, as conversas multilíngues e a confiabilidade das chamadas de ferramenta. Bob Van Osten, vice‑presidente de produto da Salesforce para o Agentforce, disse que o Agentforce e o Gemini 3.8 Live estão se unindo em uma colaboração entre a Salesforce AI Research e a Google que combina capacidades multimodais em tempo real com IA agente. Eric Walsh, engenheiro de software da Specs, afirmou que as atualizações de Voice Activity Detection e as melhorias de latência foram avanços para o assistente de IA na plataforma SPECS.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.