Partnerskap

On-Prem stemmeagenter får ny maskinvarevei da Smallest.ai slutter seg til Tenstorrent

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Tenstorrent og Smallest.ai kunngjorde et partnerskap 1. oktober 2026, for å levere en produksjonsklar, lokal stemme‑AI‑stabel som kjører Smallest.ai sin Lightning V2 sanntids‑tekst‑til‑tale‑modell direkte på Tenstorrent Galaxy Blackhole servers.

Tenstorrent, et AI‑beregningsselskap, og Smallest.ai, et AI‑forskningslaboratorium som bygger sanntids stemme‑AI‑infrastruktur, sa at den felles stabelen er designet for å redusere distribusjonskostnader samtidig som den leverer den ytelsen som kreves for sanntids stemmeapplikasjoner. Selskapene uttalte at kjøring av Lightning V2 på Blackhole‑arkitekturen gjør det mulig for organisasjoner å drive sanntids stemmeagenter fullstendig lokalt med full datasuverénitet, rettet mot høyvolum, datasensitive arbeidsbelastninger innen finansielle tjenester, telekommunikasjon, helsevesen og bedriftsmiljøer. Lightning V2 er tilgjengelig på Tenstorrent‑maskinvare umiddelbart, med forbruksbasert prising og uten forhåndsforpliktelser.

«Det burde ikke være nødvendig å velge mellom ytelse og kostnad – Tenstorrent har bygget effektiv og skalerbar beregning som reduserer kostnadene for eksisterende arbeidsflyter og gjør helt nye arbeidsbelastninger praktiske», sa Amr Elashmawi, visepresident for strategi og forretningsutvikling i Tenstorrent.

Galaxy Blackhole‑maskinvare

Serverplattformen som ble nevnt i kunngjøringen er bygget rundt 32 Blackhole‑ASIC‑er som leverer 23 PFLOPS med Block FP8‑beregning, med 6,2 GB on‑chip SRAM på 2,9 PB/s og 1 TB GDDR6‑minne på 16 TB/s, i henhold til Tenstorrent sine Galaxy‑spesifikasjoner. Hver ASIC kobles via ti 400 GbE‑lenker til et akselerator‑fabric på 32 TB/s, og systemene skaleres ut gjennom opptil 56 800 GbE QSFP‑DD‑porter. Det 6U luftkjølte chassis‑et kombinerer en AMD EPYC 9004‑vertprosessor med opptil 576 GB DDR5‑minne, kjører Ubuntu 22.04, trekker i gjennomsnitt 8 til 10 kW, og har en listepris på $160 000.

Redusert presisjonsdesign og målte resultater

Ingeniørarbeidet bak partnerskapet er dokumentert i en artikkel, \”Omstrukturering av TTS‑infernsekonomi: Lightning V2 på Tenstorrent oppnår 4× lavere kostnad enn NVIDIA L40S,\” skrevet av Ranjith M S fra Smallest.ai, senior AI‑inference‑ytelsesingeniør; teknologidirektør Akshat Mandloi; og administrerende direktør Sudarshan Kamath. Artikkelen ble først innsendt 24. mars 2026, og revidert 7. april 2026.

Ranjith, artikkelens første forfatter, sa i kunngjøringen: «Tenstorrent sin arkitektur er fundamentalt annerledes enn eksisterende paradigmer. Ved å arbeide med NoC‑en og større SRAM, oppnådde vi 4× gevinster til en brøkdel av kostnaden for sammenlignbar GPU‑infrastruktur, noe som driver en strukturell endring i inferensekonomien.»

Forfatterne rapporterer at tekst‑til‑tale‑modeller er betydelig mer numerisk skjøre enn store språkmodeller fordi de genererer kontinuerlige bølgeformer gjennom iterativ raffinering, slik at små numeriske feil akkumuleres over avstøningssteg og manifesterer seg som hørbare artefakter. Til tross for denne begrensningen, rapporterer artikkelen at mer enn 95 % av Lightning V2‑lagene kjører med LoFi‑beregningsnøyaktighet og at mer enn 80 % av modellen distribueres i BlockFloat8 uten målbar forringelse av lydkvaliteten. Forfatterne rapporterer også en 4× reduksjon i beregning for den difusjons‑akustiske modellen, en 8× reduksjon i beregning for den nevrale vokoderen, en omtrent 2× reduksjon i modellstørrelse, og en 1,8× reduksjon i minnetransfervolum.

Når det gjelder utdata­kvalitet, rapporterer artikkelen en DNSMOS‑perseptuell poengsum på 3,872 for en NVIDIA L40S‑referanse versus 3,801 på Tenstorrent sin P150, en differanse på 0,071 som forfatterne beskriver som innenfor området for mindre perseptuell variasjon, samt en normalisert ordfeilrate på 0,009 mellom de to systemenes utdata.

I tester med enkelt enhet rapporterer artikkelen at L40S oppnådde en samtidighet på 3 med 300 ms latens mot en oppgitt enhetskostnad på $9 000, mens P150 og P100 hver oppnådde en samtidighet på 1 med 250 ms latens til oppgitte kostnader på $1 400 respektive $1 000, noe som gir rapporterte kostnadsgevinster på henholdsvis 2,6× og 3,6×. Siden Lightning V2 kjører på en enkelt chip uten fler‑chip‑parallellisme eller QSFP‑interconnect, er P100‑latensverdien overført fra de målte P150‑resultatene, bemerker artikkelen.

På flåteskala modellerer forfatterne en arbeidsbelastning på 550 samtidige fem‑sekunders TTS‑forespørsler ved full utnyttelse. De beregner at opprettholdelse av dette ville kreve 11 L40S‑GPU‑er til omtrent $100 000 i akselerator‑kostnad, versus 27 P100‑akseleratorer til omtrent $27 000 eller 27 P150‑akseleratorer til omtrent $37 000, noe som tilsvarer en 3‑4× reduksjon i forhåndskostnad i deres modell‑sammenligning.

Artikkelen rapporterer også at ett sterkt optimalisert lag med omtrent 6 milliarder multipliser‑og‑akkumuler‑operasjoner utføres på omtrent 60 µs på L40S versus omtrent 31 µs på P150. Forfatterne anslår at utvidelse av slik kjerne‑nivå‑optimalisering over flere lag kan gi en 8‑12× kostnadsnormalisert forbedring i forhold til L40S‑referansen, opp fra den nåværende 3,6× system‑nivå‑gevinsten.

Forfatterne presenterer innebygd BlockFloat8‑støtte som en kostnads­skillelinje i maskinvare: moderne GPU‑er med denne evnen ligger i omtrent $40 000‑prisklassen per enhet, rapporterer de, mens Tenstorrent gjør BlockFloat8‑eksekvering mulig på maskinvare i omtrent $1 000‑klassen, en differanse på én størrelsesorden i anskaffelseskostnad i deres beskrivelse.

Numerisk skjørhet og PCC-tilfellet

Artikkelen dokumenterer en feilsøkingsstudie rundt Pearson Correlation Coefficient, en standard numerisk likhetsmåling. Forfatterne rapporterer at utdata fra L40S og en AMD EPYC 7352 CPU viste en ende-til-ende koeffisient på kun 0,72 til tross for identiske innganger, men likevel produserte lyd som var perceptuelt uatskillelig. I et separat tilfelle forårsaket et lag hvis koeffisient rundet av til 1,0 en hørbar feil som tok mer enn en måned å isolere. Forfatterne konkluderer med at konvensjonelle likhetsmål på tensor-nivå ikke er pålitelige indikatorer på perceptuell lydkvalitet i TTS-systemer, og at ende-til-ende perceptuell validering er nødvendig for implementeringer med redusert presisjon.

Begrensninger og neste steg

Forfatterne uttaler at visse lag fortsatt er for numerisk følsomme for utførelse med redusert nøyaktighet eller blokk-flytende punkt uten perceptuell forringelse, noe som begrenser full-modell lavpresisjon-dekning, og at kompilator- og programkonfigurasjoner ennå ikke er fullt optimalisert.

I en 28. september 2026 teknisk innlegg, karakteriserte Smallest.ai Lightning V2 som verdens første TTS-modell som leverer høykvalitets talesyntese under kombinert BlockFloat8‑kvantisering og redusert presisjons‑aritmetikk. Selskapet oppga at den nyere Lightning V3 allerede overgår V2 i kvalitet og arkitektonisk effektivitet, og at de planlegger å distribuere Lightning V3 på Tenstorrent‑maskinvare med de samme med‑design‑prinsippene, med mål om lignende eller større kostnadsbrudd.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og maskinvaresystemene som driver moderne kunstig intelligens. Arbeidet hans fokuserer på de tekniske grunnlagene bak AI-arbeidsbelastninger i stor skala, inkludert datasentre, akseleratorer, nettverk og programvarestablene som binder dem sammen.

Med et analytisk og ingeniørdrevet perspektiv undersøker Theo hvordan fremskritt innen GPU-er, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger særlig vekt på ytelsesavveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former implementeringen av AI-infrastruktur i den virkelige verden.

Artikler skrevet av Theo Nash er AI-genererte og gjennomgås av redaksjonsteamet i Unite.AI for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av det raskt utviklende AI-beregningslandskapet.