Partnerskaber

On-Prem stemmeagenter får ny hardwarevej, da Smallest.ai slutter sig til Tenstorrent

mm
Føj Unite.AI til dine foretrukne kilder på Google

Tenstorrent og Smallest.ai annoncerede et partnerskab den 1. oktober 2026 for at levere en produktionsklar, on-premises stemme‑AI‑stack, der kører Smallest.ai’s Lightning V2 real‑time tekst‑til‑tale‑model native på Tenstorrent Galaxy Blackhole servers.

Tenstorrent, et AI‑compute‑firma, og Smallest.ai, et AI‑forskningslaboratorium, der bygger real‑time stemme‑AI‑infrastruktur, sagde, at den fælles stack er designet til at reducere implementeringsomkostningerne, samtidig med at den leverer den ydeevne, der kræves til real‑time stemmeapplikationer. Virksomhederne udtalte, at kørsel af Lightning V2 på Blackhole‑arkitekturen gør det muligt for organisationer at drive real‑time stemmeagenter fuldstændigt on‑prem med fuld datasuverænitet, målrettet mod højvolumen‑ og datasensitive arbejdsbelastninger inden for finansielle tjenester, telekommunikation, sundhedssektoren og virksomhedsmiljøer. Lightning V2 er tilgængelig på Tenstorrent‑hardware med det samme, med forbrugsbaseret prisfastsættelse og uden forudgående forpligtelser.

“Der burde ikke være et valg mellem ydeevne og omkostninger – Tenstorrent har bygget effektiv og skalerbar compute, der reducerer omkostningerne ved eksisterende arbejdsprocesser og gør helt nye arbejdsbelastninger praktiske,” sagde Amr Elashmawi, Vicepræsident for strategi & forretningsudvikling hos Tenstorrent.

Galaxy Blackhole‑hardware

Serverplatformen, der blev nævnt i meddelelsen, er bygget omkring 32 Blackhole ASIC’er, der leverer 23 PFLOPS af Block FP8 compute, med 6.2 GB on-chip SRAM ved 2.9 PB/s og 1 TB GDDR6‑hukommelse ved 16 TB/s, ifølge Tenstorrent’s Galaxy-specifikationer. Hver ASIC forbinder gennem ti 400 GbE‑linke til et 32 TB/s accelerator‑fabric, og systemerne kan skaleres ud via op til 56 800 GbE QSFP‑DD‑porte. Det 6U luftkølede chassis kombinerer en AMD EPYC 9004‑værtsprocessor med op til 576 GB DDR5‑hukommelse, kører Ubuntu 22.04, trækker i gennemsnit 8 til 10 kW og har en listepris på $160,000.

Design med reduceret præcision og målte resultater

Ingeniørarbejdet bag partnerskabet er dokumenteret i et papir, “Omskrivning af TTS‑inference‑økonomi: Lightning V2 på Tenstorrent opnår 4× lavere omkostning end NVIDIA L40S,” skrevet af Smallest.ai’s Ranjith M S, Senior AI Inference Performance Engineer; Chief Technology Officer Akshat Mandloi; og Chief Executive Officer Sudarshan Kamath. Papiret blev først indsendt den 24. marts 2026 og revideret den 7. april 2026.

Ranjith, papirens første forfatter, sagde i meddelelsen: “Tenstorrent’s arkitektur er grundlæggende anderledes end eksisterende paradigmer. Ved at arbejde med NoC og større SRAM låste vi op for 4× gevinster til en brøkdel af omkostningerne ved sammenlignelig GPU‑infrastruktur, hvilket driver et strukturelt skift i inference‑økonomi.”

Forfatterne rapporterer, at tekst‑til‑tale‑modeller er betydeligt mere numerisk skrøbelige end store sprogmodeller, fordi de genererer kontinuerlige bølgeformer gennem iterativ forfinelse, så små numeriske fejl akkumuleres over afstøjningstrin og manifesterer sig som hørbare artefakter. På trods af denne begrænsning rapporterer papiret, at mere end 95 % af Lightning V2’s lag kører med LoFi‑beregningsnøjagtighed, og at mere end 80 % af modellen implementeres i BlockFloat8 uden målbar forringelse af lydkvaliteten. Forfatterne rapporterer også en 4× beregningsreduktion i den difusions‑akustiske model, en 8× beregningsreduktion i den neurale vocoder, en cirka 2× reduktion i modelstørrelse og en 1,8× reduktion i hukommelsesoverførselsvolumen.

Med hensyn til outputkvalitet rapporterer papiret en DNSMOS‑perceptuel score på 3.872 for en NVIDIA L40S‑baseline versus 3.801 på Tenstorrent’s P150, en forskel på 0.071 som forfatterne beskriver som inden for området for mindre perceptuel variation, samt en normaliseret ordfejlrate på 0.009 mellem de to systemers output.

I test af enkelt‑enhed rapporterer papiret, at L40S opretholder en samtidighed på 3 ved 300 ms latenstid mod en oplyst enhedspris på $9,000, mens P150 og P100 hver kørte med en samtidighed på 1 ved 250 ms latenstid til oplyste priser på $1,400 og $1,000, hvilket giver rapporterede omkostningsgevinster på henholdsvis 2.6× og 3.6×. Da Lightning V2 kører på en enkelt chip uden multi‑chip‑parallelisme eller QSFP‑interconnect, er P100‑latensmålingen overført fra de målte P150‑resultater, bemærker papiret.

På flådeskala modellerer forfatterne en arbejdsbyrde på 550 samtidige fem‑sekunders TTS‑forespørgsler ved fuld udnyttelse. De beregner, at opretholdelse ville kræve 11 L40S‑GPU’er til en acceleratorkost på cirka $100,000, versus 27 P100‑acceleratorer til cirka $27,000 eller 27 P150‑acceleratorer til cirka $37,000, hvilket svarer til en 3‑4× reduktion i upfront‑omkostninger i deres modellerede sammenligning.

Papiret rapporterer også, at et kraftigt optimeret lag på cirka 6 milliarder multiplikations‑akkumulerings‑operationer udføres på omkring 60 µs på L40S versus omkring 31 µs på P150. Forfatterne forudser, at en udvidelse af sådan kernel‑niveau‑optimering over flere lag kunne give en 8‑12× omkostningsnormaliseret forbedring i forhold til L40S‑baseline, op fra den nuværende 3.6× system‑niveau‑gevinst.

Forfatterne beskriver indbygget BlockFloat8‑support som en hardware‑omkostningsgrænse: nutidige GPU’er med denne funktion ligger i den cirka $40,000 pr. enhed pris‑klasse, rapporterer de, mens Tenstorrent muliggør BlockFloat8‑eksekvering på hardware i den cirka $1,000‑klasse, en størrelsesordens forskel i anskaffelsesomkostning i deres beskrivelse.

Numerisk skrøbelighed og PCC‑sagen

Papiret dokumenterer en fejlsøgningscase omkring Pearson‑korrelationskoefficienten, en standard numerisk ligheds‑metrik. Forfatterne rapporterer, at output fra L40S og en AMD EPYC 7352‑CPU viste en end‑to‑end‑koefficient på kun 0,72 trods identiske input, men alligevel producerede lyd, der var perceptuelt uadskillelig. I et separat tilfælde forårsagede et lag, hvis koefficient rundede op til 1,0, en hørbar fejl, som tog mere end en måned at isolere. Forfatterne konkluderer, at konventionelle tensor‑niveau‑ligheds‑metrikker ikke er pålidelige indikatorer for perceptuel lydkvalitet i TTS‑systemer, og at end‑to‑end‑perceptuel validering er nødvendig for implementeringer med reduceret præcision.

Begrænsninger og næste skridt

Forfatterne påpeger, at visse lag stadig er for numerisk følsomme til udførelse med reduceret nøjagtighed eller blok‑flydende‑punkt uden perceptuel forringelse, hvilket begrænser fuld‑model‑dækning med lav præcision, og at compiler‑ og programkonfigurationer endnu ikke er fuldt optimerede.

I et 28. september 2026 teknisk indlæg karakteriserede Smallest.ai Lightning V2 som verdens første TTS‑model, der leverer høj‑kvalitets tale‑syntese under fælles BlockFloat8‑kvantisering og reduceret‑præcisions‑aritmetik. Virksomheden sagde, at den nyere Lightning V3 allerede overgår V2 i kvalitet og arkitektonisk effektivitet, og at den planlægger at implementere Lightning V3 på Tenstorrent‑hardware med de samme co‑design‑principper, med mål om lignende eller større omkostnings‑gennembrud.

Theo Nash er en AI‑genereret specialist hos Unite.AI, der dækker AI‑infrastruktur, beregning og de hardware‑systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag bag store AI‑arbejdsbelastninger, herunder datacentre, acceleratorer, netværk og software‑stakke, der binder dem sammen.

Med et analytisk og ingeniørdrevet perspektiv undersøger Theo, hvordan fremskridt inden for GPU’er, specialdesignet silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI‑modeller. Han lægger særlig vægt på præstationsafvejninger, energieffektivitet, skalerbarhed og de praktiske begrænsninger, der former implementeringen af AI‑infrastruktur i den virkelige verden.

Artikler skrevet af Theo Nash er AI‑genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af det hastigt udviklende AI‑beregningslandskab.