Modelos e plataformas de IA

xAI lança o modelo de fala-para-texto Grok Voice Transcribe 2.0

mm
Adicione Unite.AI às suas fontes preferidas no Google

xAI lançou o Grok Voice Transcribe 2.0, seu mais recente modelo de fala-para-texto, em 18 de setembro de 2026, mantendo o preço por lote em $0,10 por hora de áudio, ao mesmo tempo em que descreveu o modelo como duas vezes mais preciso que o Grok Voice Transcribe 1.0.

O Grok Voice Transcribe 2.0 foi construído sobre o modelo de base de áudio que sustenta o Grok Voice. Segundo a xAI, o Grok Voice já alimenta dezenas de milhares de chamadas de suporte ao cliente por dia, transcreve milhões de horas de narração de vídeo e opera agentes de voz em produtos físicos, incluindo o assistente Grok em veículos da Tesla. A empresa afirmou que o novo modelo foi treinado com áudio ao vivo, ruidoso e multilíngue, gravado em um conjunto diversificado de ambientes e refinado após o treinamento, e descreveu o resultado como um dos modelos de transcrição mais precisos disponíveis para fala em cenários do mundo real.

Avaliações de Precisão

A xAI afirmou que o Grok Voice Transcribe 2.0 ocupa o primeiro lugar em precisão entre 32 modelos de streaming no leaderboard público Artificial Analysis. Além dos benchmarks públicos, a empresa mede a taxa de erro de palavras em quatro conjuntos de avaliação internos extraídos do tráfego de produção: áudio de telefonia de chamadas de suporte ao cliente, conversas com o Grok, credenciais faladas como códigos de conta e endereços de e‑mail, e comandos de voz curtos e multilíngues. A empresa relatou que o novo modelo supera o Grok Voice Transcribe 1.0 em todos os quatro conjuntos e lidera todos os modelos testados no conjunto de telefonia, que consiste em chamadas de suporte ao cliente em inglês de 8 kHz. Os gráficos publicados pela xAI comparam o modelo com Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 e Whisper Large v3 nesses conjuntos internos.

Segundo a xAI, a transcrição multilíngue representa o maior ganho de precisão em relação à versão 1.0. A empresa disse que o modelo transcreve dezenas de idiomas, detecta a língua automaticamente e acompanha mudanças de idioma durante a gravação em uma única passagem. Frases curtas, como comandos dentro do carro, fornecem ao modelo pouco contexto para identificar o idioma; no conjunto de frases curtas da xAI de falas de assistentes de voz abrangendo 19 idiomas, a taxa de erro de palavras caiu de 20,6 % para 6,8 %, informou a empresa.

Recursos e Acesso à API

Por meio da API de fala-para-texto, o Grok Voice Transcribe 2.0 realiza transcrição em lote de arquivos gravados e URLs, bem como streaming em tempo real. O conjunto de recursos documentado inclui timestamps de nível de palavra com pontuações de confiança, diarização de falantes sem custo adicional, transcrição multicanal de até oito canais, viés de termos‑chave de até 100 termos de domínio por solicitação, formatação de texto que devolve números, datas, moedas, números de telefone e endereços de e‑mail em forma escrita, remoção de palavras de preenchimento e detecção inteligente de turnos que identifica o fim da fala de um interlocutor para agentes de voz. A xAI afirmou que as integrações existentes da API de fala-para-texto recebem a melhoria de precisão sem alterações de código.

A documentação de fala-para-texto oficial lista 12 formatos de áudio suportados, tamanho máximo de arquivo de 500 MB e taxas de amostragem de 8000, 16000, 22050, 24000, 44100 e 48000 Hz. Um parâmetro de idioma permite formatação em forma escrita em 25 idiomas, entre eles Inglês, Espanhol, Francês, Alemão, Hindi, Japonês e Coreano.

Solicitações em lote utilizam dados de formulário multipart e devem fornecer um arquivo enviado ou uma URL para que o servidor faça o download e a transcrição; a resposta devolve a transcrição completa, o idioma detectado como um código BCP‑47, a duração do áudio em segundos e segmentos de nível de palavra com tempos de início e fim. Para streaming, os clientes enviam áudio bruto como quadros binários para um endpoint WebSocket em wss://api.x.ai/v1/stt e recebem eventos de transcrição JSON à medida que o áudio é processado, com resultados intermediários opcionais emitidos aproximadamente a cada 500 milissegundos.

Implantação no Loom, Preços e Descontinuação

A xAI disse que a Atlassian avaliou o Grok Voice Transcribe 2.0 em comparação com sua solução de transcrição existente, considerou‑o mais preciso e agora usa o modelo para transcrever todos os vídeos no Loom, seu produto de gravação de tela. anúncio da xAI citou Sanchan Saxena, vice‑presidente sênior da Teamwork Collection na Atlassian, sobre fluxos de trabalho que encaminham transcrições do Loom para a ferramenta de codificação Cursor: “Com o Grok alimentando a fala‑para‑texto do Loom e o Cursor transformando isso em código, estamos fechando o ciclo do contexto ao código: registre o que você quer dizer, e o trabalho é feito.”

Os preços são idênticos aos do Grok Voice Transcribe 1.0: $0,10 por hora de áudio para transcrição em lote e $0,20 por hora para streaming, com diarização, timestamps e termos‑chave incluídos. A xAI afirmou que o Grok Voice Transcribe 2.0 em breve se tornará o modelo padrão na API de fala‑para‑texto e que a versão 1.0 será descontinuada nas próximas semanas; clientes que desejarem permanecer no modelo anterior durante a transição podem fixar grok-voice-transcribe-1.0 em suas solicitações. A documentação atualmente lista grok-voice-transcribe-1.0 como padrão quando o parâmetro de modelo é omitido, com grok-voice-transcribe-2.0 selecionável em ambos os endpoints REST e WebSocket.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.