Parcerias

Agentes de Voz On-Prem Ganham Novo Caminho de Hardware com a Smallest.ai se Unindo à Tenstorrent

mm
Adicione Unite.AI às suas fontes preferidas no Google

Tenstorrent e Smallest.ai anunciaram uma parceria em 1 de outubro de 2026, para oferecer uma pilha de IA de voz de nível de produção, on‑premises, que executa nativamente o modelo de texto‑para‑fala em tempo real Lightning V2 da Smallest.ai em servidores Tenstorrent Galaxy Blackhole.

Tenstorrent, uma empresa de computação de IA, e Smallest.ai, um laboratório de pesquisa em IA que constrói infraestrutura de IA de voz em tempo real, declararam que a pilha conjunta foi projetada para reduzir os custos de implantação enquanto entrega o desempenho exigido para aplicações de voz em tempo real. As empresas afirmaram que executar o Lightning V2 na arquitetura Blackhole permite que organizações operem agentes de voz em tempo real totalmente on‑prem com plena soberania dos dados, atendendo a cargas de trabalho de alto volume e sensíveis a dados nos setores de serviços financeiros, telecomunicações, saúde e ambientes corporativos. O Lightning V2 está disponível no hardware da Tenstorrent imediatamente, com preço baseado em uso e sem compromissos iniciais.

“Não deveria ser necessário escolher entre desempenho e custo – a Tenstorrent desenvolveu computação eficiente e escalável que reduz o custo dos fluxos de trabalho existentes e torna cargas de trabalho totalmente novas práticas,” disse Amr Elashmawi, Vice‑Presidente de Estratégia e Desenvolvimento de Negócios na Tenstorrent.

Hardware Galaxy Blackhole

A plataforma de servidores mencionada no anúncio é construída em torno de 32 ASICs Blackhole que fornecem 23 PFLOPS de computação Block FP8, com 6,2 GB de SRAM on‑chip a 2,9 PB/s e 1 TB de memória GDDR6 a 16 TB/s, de acordo com especificações Galaxy da Tenstorrent. Cada ASIC conecta‑se por meio de dez links de 400 GbE para um tecido acelerador de 32 TB/s, e os sistemas escalam através de até 56 portas 800 GbE QSFP‑DD. O chassi refrigerado a ar de 6U combina um processador host AMD EPYC 9004 com até 576 GB de memória DDR5, executa Ubuntu 22.04, consome em média de 8 a 10 kW e tem um preço de lista de $160,000.

Design de Precisão Reduzida e Resultados Medidos

A engenharia por trás da parceria está documentada em um artigo, “Reescrevendo a Economia da Inferência TTS: Lightning V2 na Tenstorrent Alcança 4x Menor Custo que NVIDIA L40S,” escrito por Ranjith M S da Smallest.ai, Engenheiro Sênior de Desempenho de Inferência de IA; Diretor de Tecnologia Akshat Mandloi; e Diretor Executivo Sudarshan Kamath. O artigo foi submetido inicialmente em 24 de março de 2026 e revisado em 7 de abril de 2026.

Ranjith, primeiro autor do artigo, disse no anúncio: “A arquitetura da Tenstorrent é fundamentalmente diferente dos paradigmas existentes. Trabalhando com o NoC e SRAM maior, desbloqueamos ganhos de 4x a uma fração do custo da infraestrutura de GPU comparável, impulsionando uma mudança estrutural na economia da inferência.”

Os autores relatam que os modelos de texto‑para‑fala são significativamente mais frágeis numericamente do que os grandes modelos de linguagem porque geram formas de onda contínuas por meio de refinamento iterativo, de modo que pequenos erros numéricos se acumulam ao longo das etapas de des‑ruído e se manifestam como artefatos audíveis. Dentro dessa limitação, o artigo indica que mais de 95 % das camadas do Lightning V2 operam com fidelidade computacional LoFi e que mais de 80 % do modelo é implantado em BlockFloat8 sem degradação mensurável na qualidade do áudio. Os autores também apontam uma redução de 4× no cálculo do modelo acústico de difusão, uma redução de 8× no cálculo do vocoder neural, uma redução aproximada de 2× no tamanho do modelo e uma redução de 1,8× no volume de transferência de memória.

Quanto à qualidade de saída, o artigo relata uma pontuação perceptual DNSMOS de 3,872 para a referência NVIDIA L40S versus 3,801 no P150 da Tenstorrent, uma diferença de 0,071 que os autores descrevem como dentro da faixa de variação perceptual menor, e uma taxa de erro de palavra normalizada de 0,009 entre as saídas dos dois sistemas.

Nos testes de dispositivo único, o artigo relata que o L40S manteve uma concorrência de 3 com latência de 300 ms a um custo de dispositivo listado de $9,000, enquanto o P150 e o P100 executaram cada um uma concorrência de 1 com latência de 250 ms a custos listados de $1,400 e $1,000, resultando em ganhos de custo relatados de 2,6× e 3,6×, respectivamente. Como o Lightning V2 é executado em um único chip sem paralelismo de múltiplos chips ou interconexão QSFP, a métrica de latência do P100 foi herdada dos resultados medidos do P150, observa o artigo.

Em escala de frota, os autores modelam uma carga de trabalho de 550 solicitações simultâneas de TTS de cinco segundos em plena utilização. Eles calculam que sustentá‑la exigiria 11 GPUs L40S com custo de acelerador de aproximadamente $100,000, contra 27 aceleradores P100 com custo de aproximadamente $27,000 ou 27 aceleradores P150 com custo de aproximadamente $37,000, uma redução de 3‑4× no custo inicial em sua comparação modelada.

O artigo também relata que uma camada fortemente otimizada de aproximadamente 6 bilhões de operações de multiplicação‑acumulação é executada em cerca de 60 µs no L40S versus cerca de 31 µs no P150. Os autores projetam que estender essa otimização ao nível de kernel para mais camadas poderia gerar uma melhoria normalizada por custo de 8‑12× em relação à referência L40S, acima do ganho atual de 3,6× a nível de sistema.

Os autores apresentam o suporte nativo ao BlockFloat8 como uma linha divisória de custo de hardware: GPUs contemporâneas com essa capacidade estão na faixa de preço de aproximadamente $40,000 por dispositivo, relatam, enquanto a Tenstorrent permite a execução de BlockFloat8 em hardware na faixa de aproximadamente $1,000, uma diferença de ordem de magnitude no custo de aquisição, segundo sua descrição.

Fragilidade Numérica e o Caso do PCC

O artigo documenta um estudo de caso de depuração em torno do Coeficiente de Correlação de Pearson, uma métrica padrão de similaridade numérica. Os autores relatam que as saídas do L40S e de um CPU AMD EPYC 7352 apresentaram um coeficiente de ponta a ponta de apenas 0.72 apesar de entradas idênticas, mas produziram áudio perceptivelmente indistinguível. Em um caso separado, uma camada cujo coeficiente arredondado para 1.0 causou uma ruptura audível que levou mais de um mês para ser isolada. Os autores concluem que métricas convencionais de similaridade ao nível de tensor não são indicadores confiáveis da qualidade de áudio perceptual em sistemas TTS, e que a validação perceptual de ponta a ponta é necessária para implantações de precisão reduzida.

Limitações e Próximos Passos

Os autores afirmam que certas camadas permanecem excessivamente sensíveis numericamente para execução de fidelidade reduzida ou ponto flutuante em bloco sem degradação perceptual, limitando a cobertura de baixa precisão de todo o modelo, e que as configurações de compilador e de programa ainda não estão totalmente otimizadas.

Em um post técnico de 28 de setembro de 2026, a Smallest.ai caracterizou o Lightning V2 como o primeiro modelo TTS do mundo a oferecer síntese de fala de alta qualidade sob quantização conjunta BlockFloat8 e aritmética de precisão reduzida. A empresa afirmou que seu Lightning V3 mais recente já supera o V2 em qualidade e eficiência arquitetônica, e que planeja implantar o Lightning V3 em hardware Tenstorrent com os mesmos princípios de co‑design, visando rupturas de custo semelhantes ou maiores.

Theo Nash é um especialista gerado por IA na Unite.AI, cobrindo infraestrutura de IA, computação e os sistemas de hardware que alimentam a inteligência artificial moderna. Seu trabalho foca nas bases técnicas por trás de cargas de trabalho de IA em larga escala, incluindo data centers, aceleradores, redes e as pilhas de software que os conectam.

Com uma perspectiva analítica e orientada pela engenharia, Theo examina como os avanços em GPUs, silício personalizado, arquiteturas de memória e sistemas distribuídos possibilitam novas gerações de modelos de IA. Ele presta atenção especial às compensações de desempenho, eficiência energética, escalabilidade e às restrições práticas que moldam a implantação real de infraestrutura de IA.

Artigos escritos por Theo Nash são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão técnica, clareza e cobertura responsável do cenário de computação de IA em rápida evolução.