Partnerskap
On-Prem-röstagenter får ny hårdvaruväg när Smallest.ai går med i Tenstorrent

Tenstorrent och Smallest.ai annonserade ett partnerskap den 1 oktober 2026 för att leverera en produktionsklassad, lokalt installerad röst‑AI‑stack som kör Smallest.ai:s Lightning V2 realtids‑text‑till‑tal‑modell nativt på Tenstorrent Galaxy Blackhole servers.
Tenstorrent, ett AI‑beräkningsföretag, och Smallest.ai, ett AI‑forskningslab som bygger realtids‑röst‑AI‑infrastruktur, säger att den gemensamma stacken är utformad för att minska implementeringskostnaderna samtidigt som den levererar den prestanda som krävs för realtids‑röstapplikationer. Företagen uppger att körning av Lightning V2 på Blackhole‑arkitekturen gör det möjligt för organisationer att driva realtids‑röstagenter helt på plats med full datasuveränitet, med inriktning på högvolymiga, datakänsliga arbetsbelastningar inom finansiella tjänster, telekom, sjukvård och företagsmiljöer. Lightning V2 finns tillgänglig på Tenstorrent‑hårdvara omedelbart, med användningsbaserad prissättning och utan förhandsåtaganden.
”Det bör inte behövas ett val mellan prestanda och kostnad – Tenstorrent har byggt effektiv och skalbar beräkning som minskar kostnaden för befintliga arbetsflöden och gör helt nya arbetsbelastningar praktiska,” sade Amr Elashmawi, vice president för strategi och affärsutveckling på Tenstorrent.
Galaxy Blackhole‑hårdvara
Serverplattformen som nämns i tillkännagivandet är byggd kring 32 Blackhole‑ASIC:er som levererar 23 PFLOPS av Block FP8‑beräkning, med 6,2 GB on‑chip SRAM på 2,9 PB/s och 1 TB GDDR6‑minne på 16 TB/s, enligt Tenstorrent Galaxy-specifikationer. Varje ASIC ansluts via tio 400 GbE‑länkar för ett accelerator‑fabric på 32 TB/s, och systemen kan skalas ut via upp till 56 800 GbE‑QSFP‑DD‑portar. Det 6U‑luftkylade chassit kombinerar en AMD EPYC 9004‑värdprocessor med upp till 576 GB DDR5‑minne, kör Ubuntu 22.04, drar i genomsnitt 8 till 10 kW och har ett listpris på $160 000.
Design med reducerad precision och uppmätta resultat
Ingenjörsarbetet bakom partnerskapet dokumenteras i en artikel, “Omskriver TTS‑inferensekonomi: Lightning V2 på Tenstorrent uppnår 4× lägre kostnad än NVIDIA L40S,” författad av Smallest.ai:s Ranjith M S, senior AI‑inferens‑prestandaingenjör; teknisk chef Akshat Mandloi; och verkställande direktör Sudarshan Kamath. Artikeln lämnades in första gången den 24 mars 2026 och reviderades den 7 april 2026.
Ranjith, artikelns första författare, sade i tillkännagivandet: “Tenstorrent-arkitekturen är i grunden annorlunda än befintliga paradigm. Genom att arbeta med NoC och större SRAM låste vi upp 4× vinster till en bråkdel av kostnaden för jämförbar GPU‑infrastruktur, vilket driver en strukturell förändring i inferensekonomin.”
Författarna rapporterar att text‑till‑tal‑modeller är avsevärt mer numeriskt sköra än stora språkmodeller eftersom de genererar kontinuerliga vågformer genom iterativ förfining, så små numeriska fel ackumuleras över avbrusningssteg och manifesteras som hörbara artefakter. Trots den begränsningen rapporterar artikeln att mer än 95 % av Lightning V2:s lager körs med LoFi‑beräkningsfidelitet och att mer än 80 % av modellen distribueras i BlockFloat8 utan mätbar försämring av ljudkvaliteten. Författarna rapporterar också en 4× beräkningsreduktion i den diffusionsakustiska modellen, en 8× beräkningsreduktion i den neurala vokodern, en ungefärlig 2× minskning av modellstorleken och en 1,8× minskning av minnesöverföringsvolymen.
När det gäller utdatakvalitet rapporterar artikeln ett DNSMOS‑perceptuellt poäng på 3,872 för en NVIDIA L40S‑baslinje jämfört med 3,801 på Tenstorrent’s P150, en skillnad på 0,071 som författarna beskriver som inom intervallet för mindre perceptuell variation, samt en normaliserad felordsfrekvens på 0,009 mellan de två systemens utdata.
I en‑enhetstest rapporterar artikeln att L40S upprätthåller en samtidighet på 3 med 300 ms fördröjning mot en listad enhetskostnad på $9 000, medan P150 och P100 vardera körde en samtidighet på 1 med 250 ms fördröjning vid listade kostnader på $1 400 respektive $1 000, vilket ger rapporterade kostnadsbesparingar på 2,6× och 3,6×. Eftersom Lightning V2 körs på en enda chip utan multi‑chip‑parallellism eller QSFP‑interconnect, överförs P100‑latensvärdet från de uppmätta P150‑resultaten, noterar artikeln.
På flotta skala modellerar författarna en arbetsbelastning på 550 samtidiga femsekunders TTS‑förfrågningar vid full utnyttjandegrad. De beräknar att upprätthållandet skulle kräva 11 L40S‑GPU:er med cirka $100 000 i accelerator‑kostnad, jämfört med 27 P100‑acceleratorer med cirka $27 000 eller 27 P150‑acceleratorer med cirka $37 000, vilket motsvarar en 3‑4× minskning av förhandskostnaden i deras modell jämförelse.
Artikeln rapporterar också att ett starkt optimerat lager med ungefär 6 miljarder multiplikations‑ackumuleringsoperationer körs på cirka 60 µs på L40S jämfört med cirka 31 µs på P150. Författarna förutspår att en utvidgning av sådan kernel‑nivåoptimering över fler lager kan ge en 8‑12× kostnadsnormaliserad förbättring jämfört med L40S‑baslinjen, upp från den nuvarande 3,6× systemnivåvinsten.
Författarna beskriver inbyggt BlockFloat8‑stöd som en kostnadsgräns för hårdvara: moderna GPU:er med den funktionen ligger i ungefär $40 000‑prisklassen per enhet, rapporterar de, medan Tenstorrent möjliggör BlockFloat8‑exekvering på hårdvara i ungefär $1 000‑klassen, en skillnad på en tiopotenser i anskaffningskostnad enligt deras beskrivning.
Numerisk bräcklighet och PCC-fallet
Papperet dokumenterar en felsökningsfallstudie kring Pearson-korrelationen, en standardiserad numerisk likhetsmetrik. Författarna rapporterar att utdata från L40S och en AMD EPYC 7352‑CPU visade en end‑to‑end‑koefficient på endast 0,72 trots identiska indata, men ändå producerade auditivt omöjligt att skilja ljud. I ett separat fall orsakade ett lager vars koefficient avrundades till 1,0 hörbar störning som tog mer än en månad att isolera. Författarna drar slutsatsen att konventionella likhetsmått på tensor‑nivå inte är pålitliga indikatorer på perceptuell ljudkvalitet i TTS‑system, och att end‑to‑end‑perceptuell validering är nödvändig för implementationer med reducerad precision.
Begränsningar och nästa steg
Författarna konstaterar att vissa lager fortfarande är för numeriskt känsliga för körning med reducerad upplösning eller blockflyttals‑exekvering utan perceptuell försämring, vilket begränsar full‑modellens låg‑precision‑täckning, och att kompilator‑ och programkonfigurationer ännu inte är fullt optimerade.
I en teknisk post den 28 september 2026 karakteriserade Smallest.ai Lightning V2 som världens första TTS‑modell som levererar högkvalitativ talsyntes under gemensam BlockFloat8‑kvantisering och reducerad‑precision‑aritmetik. Företaget sade att den nyare Lightning V3 redan överträffar V2 i kvalitet och arkitektonisk effektivitet, och att det planerar att distribuera Lightning V3 på Tenstorrent‑hårdvara med samma sam‑design‑principer, med målet att uppnå liknande eller större kostnadsgenombrott.












