Modelos e plataformas de IA
GPT-Live-1 da OpenAI chega à API por US$0,05 por minuto

OpenAI lançou o GPT-Live-1 na API em 10 de setembro de 2026, disponibilizando seu modelo de voz full‑duplex para desenvolvedores por US$0,05 por minuto para a camada de voz de front‑end. O lançamento amplia o sistema conversacional por trás do ChatGPT Voice para aplicativos de terceiros e fluxos de trabalho empresariais.
O GPT-Live-1 pode ouvir e falar simultaneamente, e a OpenAI afirmou que delega raciocínio mais profundo e ações aos modelos e ferramentas com os quais está emparelhado, como demonstrado com o Codex e ChatGPT Work. Para o lançamento na API, a empresa disse que se concentrou em recursos que permitem aos desenvolvedores orientar e personalizar experiências de voz de acordo com seus usuários, fluxos de trabalho e objetivos.
Um único modelo para ouvir e falar
Os agentes de voz tradicionais encadeiam reconhecimento de fala, um modelo de raciocínio e síntese de fala, e cada transferência acrescenta latência e gera mais oportunidades de perda de sincronização, contexto ou do ritmo natural de uma conversa. O GPT-Live-1 trata a escuta e a fala em um único modelo que raciocina sobre o áudio de entrada e saída simultaneamente, respondendo a interrupções e reconhecimentos à medida que ocorrem, ao mesmo tempo em que delega o raciocínio mais profundo ao back‑end, permitindo que a conversa continue enquanto o processamento acontece em segundo plano.
Os desenvolvedores escolhem os modelos, ferramentas e a estrutura de agente por trás da conversa. A OpenAI exemplifica o emparelhamento do GPT-Live-1 com um modelo como o Luna para tarefas de alto volume, como agendamento ou atualizações de pedidos, e um modelo como o Astra para questões complexas de clientes que exigem raciocínio; o back‑end também pode ser um modelo de terceiros. Os desenvolvedores podem moldar o tom, o ritmo e o estilo conversacional de um agente por meio do prompt do sistema.
OpenAI enumera mais vantagens para o lançamento da API: gerenciamento silencioso de contexto e tratamento de ruído de fundo sem narrar cada passo em voz alta, retenção de contexto ao longo de sessões prolongadas e suporte telefônico para agentes de telefone full‑duplex em chamadas que vão de reservas em restaurantes a suporte ao cliente. O GPT-Live-1 fornece nativamente transcrições ASR e texto de resposta, suporta viés por palavras‑chave e compreensão alfanumérica e, embora não seja um modelo baseado em turnos, oferece suporte nativo à detecção de turnos, permitindo que os desenvolvedores continuem construindo em torno de limites de turno explícitos. Um trecho de código publicado com o anúncio mostra um aplicativo transmitindo o contexto da conversa ao Codex e retornando a resposta do Codex ao GPT-Live-1 durante uma sessão.
Resultados de avaliação reportados
A OpenAI relata que o GPT-Live-1 melhora o desempenho do Full Duplex Bench em 30 pontos percentuais em relação ao GPT-Realtime-2.1, com grandes ganhos na latência de turnos e no comportamento interativo, e que ele ocupa a primeira posição no Tau3, um benchmark que mede a inteligência de agentes de voz de ponta em tarefas de ponta a ponta, quando emparelhado com GPT-6 Astra com esforço de raciocínio médio.
Na Inteligência Tau3 (Voz), que avalia tarefas faladas de atendimento ao cliente nos domínios de aviação, varejo e telecomunicações, as pontuações Pass@1 de sucesso de tarefa reportadas pela OpenAI são 86,2 % para o GPT-Live-1, contra 45,7 % para o GPT-Realtime-2.1 e 42,4 % para o GPT-Realtime-2. No Conhecimento Tau Banking (Voz), medido como a fração de 97 tarefas de conhecimento bancário concluídas com sucesso, os valores reportados são 32,0 % versus 12,4 % e 10,3 %.
A empresa também reportou uma pontuação média de 97,3 % em Análise Artificial de Dinâmica Conversacional para o GPT-Live-1, contra 95,7 % para o GPT-Realtime-2.1 e 95,3 % para o GPT-Realtime-2, em uma avaliação que abrange tratamento de pausas, turnos conversacionais, interrupções e backchannels. No Full Duplex Bench v1.5 Interactivity, que testa reações a fala de fundo, fala dirigida a outra pessoa, backchannels do ouvinte e interrupções, as pontuações reportadas são 80,10 % versus 45,4 % e 47,8 %. A latência de turnos reportada no Full Duplex Bench v1, que mede a rapidez com que o agente inicia sua resposta após o usuário terminar um turno, é de 0,798 segundos versus 1,41 segundos e 1,63 segundos. No Full Duplex Bench v3, executado com um back‑end Terra com baixo esforço de raciocínio, a OpenAI reportou Pass@1 de chamada de ferramenta de 87,0 % versus 60,0 % e 58,0 %, e qualidade de resposta de 90,0 % versus 88,0 % e 81,0 %.
Do ChatGPT Voice para a API
A OpenAI introduziu o GPT-Live em 8 de julho de 2026 como uma nova geração de modelos de voz full‑duplex que alimentam o ChatGPT Voice, lançando o GPT-Live-1 e o GPT-Live-1 mini para usuários do ChatGPT em todo o mundo naquele dia e afirmando que planejava levar os modelos para a API. A OpenAI disse que o GPT-Live-1 se tornaria o modelo padrão que alimenta o ChatGPT Voice para usuários Go, Plus e Pro, com o GPT-Live-1 mini como padrão para usuários Free. Uma atualização de 31 de julho de 2026 adicionou marca d’água SynthID ao áudio suportado gerado com o GPT-Live através do ChatGPT Voice e da API da OpenAI, juntamente com acesso via API à ferramenta pública de verificação da OpenAI.
O anúncio também direciona empresas para OpenAI Presence, que, segundo a OpenAI, usa o GPT-Live-1 para impulsionar interações de voz em tempo real para agentes que respondem perguntas, resolvem problemas, utilizam sistemas da empresa, executam ações aprovadas e escalam para pessoas quando necessário. A OpenAI apresentou o Presence em 22 de julho de 2026 como um produto empresarial implantado para fluxos de trabalho de voz e chat, disponível para clientes elegíveis por meio de um programa de disponibilidade geral limitada liderado por engenheiros de implantação avançada da OpenAI e por integradores de sistemas globais selecionados, e não como um produto de autoatendimento.
Primeiros clientes e novas vozes
O diretor de tecnologia da Yelp, Alex Levy, afirmou que a adição do GPT-Live-1 ao Yelp Host e ao Hatch melhorou a tomada de turnos e a precisão em relação à arquitetura de voz tradicional da empresa, e que a Yelp está observando melhorias significativas nas taxas de atendimento de chamadas quando o Yelp Host atende chamadas como reservas e pedidos de comida. “Os interlocutores também estão falando frases mais completas e naturais, o que nos indica que a experiência do outro lado do telefone realmente mudou”, disse Levy. Uma demonstração publicada com o anúncio mostra o Yelp Host garantindo uma reserva enquanto o GPT-Live-1 lida com ruído de fundo, conversas paralelas e interrupções.
O cofundador e diretor de tecnologia da Speak, Andrew Hsu, disse que avaliações iniciais descobriram que o GPT-Live-1 reduziu as interrupções durante as pausas de reflexão dos aprendizes em quase 80 % em comparação com os sistemas baseados em turnos anteriores nas Aulas ao Vivo do Tutor da Speak. O diretor de operações da Fin, Jordan Neil, afirmou que o modelo desloca o suporte de voz de IA de um ritmo de parada e início para o fluxo natural de uma chamada telefônica, permitindo que os clientes façam pausas, interrompam e mudem de direção enquanto a Fin combina a conversa com seu sistema de suporte proprietário para resolver problemas. O cofundador e diretor de produto da Cognition, Walden Yan, descreveu o uso do GPT-Live-1 ao lado de Devin, engenheiro de IA da Cognition, para discutir uma ideia, testar a viabilidade de uma abordagem ou transferir trabalho enquanto está longe do teclado.
A OpenAI informou que está ampliando de um pequeno conjunto de vozes em tempo real para uma seleção mais ampla de sotaques, dialetos e idiomas, oferecendo aos desenvolvedores mais opções sobre como seus assistentes soam. Desenvolvedores que buscam acesso a vozes personalizadas devem entrar em contato com as vendas da OpenAI para conhecer os critérios de elegibilidade e o processo de solicitação. A empresa afirmou que continuará expandindo as opções de voz e a disponibilidade de idiomas nos próximos meses.












