Modelos e plataformas de IA
IBM afirma que Granite Speech 5.0 transcreve 3,5 horas de fala em um segundo

A IBM lançou dois modelos compactos de reconhecimento de fala em inglês em 25 de agosto de 2026, alegando uma taxa de transcrição que nenhum modelo aberto havia alcançado antes: mais de 3,5 horas de áudio processadas em um único segundo. O par, Granite Speech 5.0 TurboCTC e sua variante não comercial, possui apenas 470 milhões de parâmetros cada, e a empresa relata uma taxa agregada superior a 12.600 RTFx em uma única GPU NVIDIA H200, o que significa que o áudio atravessa os modelos mais de doze mil vezes mais rápido que o tempo real.
A velocidade vem acompanhada de precisão competitiva, ao menos nos números da IBM. Nos conjuntos de teste públicos de curta duração em inglês do OpenASR Leaderboard, a variante não comercial registra uma taxa de erro de palavra (WER) agregada de 4,85 % e a variante licenciada abertamente 5,00 %, conforme o anúncio da IBM. Ambas as métricas são reportadas pelo fornecedor: a IBM as rotula como não oficiais, embora a inferência tenha sido executada na própria infraestrutura de jobs da Hugging Face e avaliada com as ferramentas do leaderboard, de modo que a empresa espera que correspondam à tabela oficial assim que for atualizada.
Os dois modelos são idênticos em tamanho e arquitetura, diferindo nos dados de treinamento e na licença. O modelo Apache 2.0 foi treinado com aproximadamente 60 000 horas de áudio em inglês e está liberado para uso comercial. A variante não comercial adiciona GigaSpeech e SPGI Speech, cerca de 15 000 horas adicionais, elevando seu corpus para quase 75 000 horas sob licença CC‑BY‑NC‑SA‑4.0. A IBM afirma que esses dados extras conferem uma leve vantagem de precisão na maioria dos conjuntos de teste, com um ganho mais perceptível no próprio SPGI Speech e uma desvantagem notável no novo teste segmentado Earnings22 do leaderboard.
Um Codificador sem Modelo de Linguagem
A alegação de velocidade baseia‑se no que a IBM deixou de fora. Lançamentos anteriores do Granite Speech (as versões 3.3 e 4.x documentadas no artigo Granite Speech da IBM) acoplaram um codificador acústico Conformer a um modelo de linguagem Granite por meio de um projetor e adaptadores LoRA, gerando texto de forma autorregressiva como um modelo de chat. Os modelos 5.0 descartam totalmente o modelo de linguagem. O que resta é um codificador Conformer de 16 camadas treinado com classificação temporal conexionista, um esquema de decodificação que mapeia quadros de áudio diretamente para tokens de saída em uma única passagem não autorregressiva com decodificação gulosa.
Outras duas mudanças realizam a maior parte do trabalho. Enquanto os codificadores Granite anteriores emitiam 50 caracteres por segundo, os novos modelos emitem 12,5 tokens por segundo, alcançados por meio de três estágios de subamostragem temporal 2× a partir da frente log‑Mel de 100 quadros por segundo. Além disso, o vocabulário de saída passou de caracteres para 16 384 unidades sub‑palavra treinadas, SentencePiece no modelo não comercial e BPE no modelo Apache. Menos tokens, porém mais longos, a um quarto da taxa de quadros, é o que eleva a taxa de processamento a mais de 20 vezes a dos modelos Granite Speech anteriores, segundo a IBM.
O compromisso está na amplitude de recursos em troca de foco na transcrição. Sem o modelo de linguagem, esses modelos perdem a capacidade de tradução de fala e o viés por palavras‑chave que a versão anterior suportava. O que eles ganham é uma pegada adequada para laptops e hardware de borda: a IBM posiciona o par para soluções corporativas de fala‑para‑texto onde latência e taxa de processamento são mais importantes do que um modelo que também possa raciocinar sobre o que ouviu.
O que as Avaliações Mostram e Não Mostram
O sinal independente mais forte até agora vem do áudio em campo distante. No FFASR Leaderboard, que mede o reconhecimento de fala ruidosa e reverberante, a IBM relata resultados oficiais em 25 de agosto de 2026, posicionando o modelo não comercial em quinto lugar em precisão e o modelo Apache em nono — enquanto ambos são as duas entradas mais rápidas do ranking, com taxa de processamento medida em uma única NVIDIA L4. O FFASR avalia os modelos em áudio ruidoso, reverberante e de fonte em movimento em múltiplas relações sinal‑ruído (SNRs), condições nas quais o reconhecimento em campo distante se deteriora, conforme a própria descrição do leaderboard.
Entretanto, a cifra de 12 600 RTFx precisa ser contextualizada. Trata‑se de um número de inferência em lote em uma das GPUs de datacenter mais rápidas disponíveis, não do que um laptop executando a demonstração de streaming WebGPU observará. As métricas agregadas de WER cobrem apenas inglês de curta duração, e os rankings oficiais do OpenASR Leaderboard, que incluem conjuntos de teste privados, ainda não haviam incorporado os novos modelos na publicação. A própria perspectiva da IBM é a mais honesta aqui: são resultados fortes reportados pelo fornecedor que aguardam a confirmação do leaderboard.
A receita de treinamento também merece destaque pelo que revela sobre a abertura dos dados. Cada conjunto de dados nos corpora de ambos os modelos está disponível publicamente, e as 2 740 horas de adições sintéticas compreendem 2 500 horas de áudio multi‑falante concatenado a partir de segmentos de falante único, além de 240 horas de enunciados gerados pelos modelos de peso aberto gpt‑oss da OpenAI e sintetizados com StyleTTS2, focados em números, moedas e endereços que confundem reconhecedores. O treinamento durou 10 dias em 8 GPUs NVIDIA H100 no cluster Blue Vela da IBM, conforme o modelo‑card.
Ambos os modelos estão disponíveis no Hugging Face agora com suporte nativo na biblioteca transformers — instalados a partir do código‑fonte até a próxima versão — dentro da coleção Granite Speech, e uma demonstração de streaming baseada em navegador funciona no Chrome e no Edge. Para ter uma ideia de como os modelos de transcrição dedicados se comparam aos serviços comerciais, veja nossa análise de software de transcrição de IA.












