Partnerschappen

On-Prem voice‑agents krijgen een nieuw hardwarepad nu Smallest.ai zich bij Tenstorrent voegt

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Tenstorrent en Smallest.ai aankondigden op 1 oktober 2026 een partnerschap om een productieklare, on‑premises voice‑AI‑stack te leveren die het real‑time tekst‑naar‑spraak‑model Lightning V2 van Smallest.ai native uitvoert op Tenstorrent Galaxy Blackhole servers.

Tenstorrent, een AI‑compute‑bedrijf, en Smallest.ai, een AI‑onderzoeks‑lab dat real‑time voice‑AI‑infrastructuur bouwt, zeiden dat de gezamenlijke stack is ontworpen om de implementatiekosten te verlagen terwijl de prestaties worden geleverd die nodig zijn voor real‑time voice‑toepassingen. De bedrijven verklaarden dat het draaien van Lightning V2 op de Blackhole‑architectuur organisaties in staat stelt real‑time voice‑agents volledig on‑prem te laten werken met volledige datasouvereiniteit, gericht op workloads met hoog volume en gevoelige data in financiële diensten, telecom, gezondheidszorg en bedrijfsomgevingen. Lightning V2 is direct beschikbaar op Tenstorrent‑hardware, met gebruiksgebaseerde prijsstelling en zonder voorafgaande verplichtingen.

“Er zou geen keuze tussen prestaties en kosten moeten bestaan – Tenstorrent heeft efficiënte en schaalbare compute gebouwd die de kosten van bestaande workflows verlaagt en geheel nieuwe workloads praktisch maakt,” zei Amr Elashmawi, Vice President of Strategy & Business Development bij Tenstorrent.

Galaxy Blackhole‑hardware

Het serverplatform dat in de aankondiging wordt genoemd, is opgebouwd rond 32 Blackhole‑ASIC’s die 23 PFLOPS Block FP8‑compute leveren, met 6,2 GB on‑chip SRAM bij 2,9 PB/s en 1 TB GDDR6‑geheugen bij 16 TB/s, volgens Tenstorrent’s Galaxy specifications. Elke ASIC is verbonden via tien 400 GbE‑links voor een accelerator‑fabric van 32 TB/s, en systemen schalen uit tot maximaal 56 800 GbE‑QSFP‑DD‑poorten. Het 6U‑koellichaam met luchtkoeling combineert een AMD EPYC 9004‑hostprocessor met maximaal 576 GB DDR5‑geheugen, draait Ubuntu 22.04, verbruikt gemiddeld 8 tot 10 kW, en heeft een adviesprijs van $160,000.

Reduced‑Precision‑ontwerp en gemeten resultaten

De engineering achter het partnerschap wordt gedocumenteerd in een paper, “Herziening van TTS‑inference‑economie: Lightning V2 op Tenstorrent behaalt 4× lagere kosten dan NVIDIA L40S,” geschreven door Ranjith M S van Smallest.ai, Senior AI Inference Performance Engineer; Chief Technology Officer Akshat Mandloi; en Chief Executive Officer Sudarshan Kamath. Het paper werd voor het eerst ingediend op 24 maart 2026 en herzien op 7 april 2026.

Ranjith, de eerste auteur van het paper, zei in de aankondiging: “De architectuur van Tenstorrent is fundamenteel anders dan bestaande paradigma’s. Door te werken met de NoC en grotere SRAM, hebben we 4× winst behaald tegen een fractie van de kosten van vergelijkbare GPU‑infrastructuur, wat een structurele verschuiving in inference‑economie teweegbrengt.”

De auteurs melden dat tekst‑naar‑spraak‑modellen aanzienlijk numeriek fragieler zijn dan grote taalmodellen omdat ze continue golfvormen genereren via iteratieve verfijning, waardoor kleine numerieke fouten zich opstapelen over de denoising‑stappen en zich manifesteren als hoorbare artefacten. Binnen die beperking meldt het paper dat meer dan 95 % van de lagen van Lightning V2 draait op LoFi‑computatiefideliteit en meer dan 80 % van het model wordt ingezet in BlockFloat8 zonder meetbare degradatie van de geluidskwaliteit. De auteurs rapporteren bovendien een 4× rekenreductie in het diffusie‑akoestische model, een 8× rekenreductie in de neurale vocoder, een ongeveer 2× reductie in modelgrootte, en een 1,8× reductie in geheugen‑overdrachtsvolume.

Wat de outputkwaliteit betreft, meldt het paper een DNSMOS‑perceptuele score van 3.872 voor een NVIDIA L40S‑baseline versus 3.801 op Tenstorrent’s P150, een verschil van 0.071 dat de auteurs omschrijven als binnen het bereik van kleine perceptuele variatie, en een genormaliseerde woordfoutpercentage van 0.009 tussen de outputs van de twee systemen.

In tests met één apparaat meldt het paper dat de L40S een gelijktijdigheid van 3 behoudt bij 300 milliseconden latency tegen een genoteerde apparaatprijs van $9,000, terwijl de P150 en P100 elk een gelijktijdigheid van 1 bereikten bij 250 milliseconden latency tegen genoteerde prijzen van $1,400 en $1,000, respectievelijk resulterend in kostenbesparingen van 2.6× en 3.6×. Omdat Lightning V2 op één chip draait zonder multi‑chip‑parallelisme of de QSFP‑interconnect, wordt de P100‑latency‑waarde overgenomen van de gemeten P150‑resultaten, aldus het paper.

Op fleet‑schaal modelleren de auteurs een werklast van 550 gelijktijdige vijf‑seconden TTS‑verzoeken bij volledige benutting. Ze berekenen dat het handhaven daarvan 11 L40S‑GPU’s zou vereisen met ongeveer $100,000 aan accelerator‑kosten, versus 27 P100‑accelerators met ongeveer $27,000 of 27 P150‑accelerators met ongeveer $37,000, een 3‑4× reductie in initiële kosten in hun gemodelleerde vergelijking.

Het paper meldt bovendien dat één sterk geoptimaliseerde laag van ongeveer 6 billion vermenigvuldig‑en‑accumulatie‑operaties ongeveer 60 microseconden uitvoert op de L40S versus ongeveer 31 microseconden op de P150. De auteurs voorspellen dat het uitbreiden van dergelijke kernel‑niveau‑optimalisatie over meer lagen een 8‑12× kosten‑genormaliseerde verbetering ten opzichte van de L40S‑baseline zou kunnen opleveren, omhoog vanuit de huidige 3.6× systeemnivoa‑winst.

De auteurs positioneren native BlockFloat8‑ondersteuning als een scheidslijn in hardware‑kosten: hedendaagse GPU’s met die mogelijkheid bevinden zich in de prijsklasse van ongeveer $40,000 per apparaat, melden ze, terwijl Tenstorrent BlockFloat8‑executie mogelijk maakt op hardware in de prijsklasse van ongeveer $1,000, een orde‑van‑grootte verschil in aanschafkosten volgens hun beschrijving.

Numerieke kwetsbaarheid en de PCC-zaak

Het artikel beschrijft een debug‑case study rond de Pearson Correlatiecoëfficiënt, een standaard numerieke gelijkenismetriek. De auteurs melden dat de output van de L40S en een AMD EPYC 7352 CPU een end‑to‑end‑coëfficiënt van slechts 0,72 liet zien ondanks identieke inputs, maar toch auditief ononderscheidbare audio produceerde. In een apart geval veroorzaakte een laag waarvan de coëfficiënt afgerond op 1,0 hoorbare storingen die meer dan een maand duurden om te isoleren. De auteurs concluderen dat conventionele tensor‑niveau gelijkenismetriek geen betrouwbare indicatoren zijn voor de perceptuele audiokwaliteit in TTS‑systemen, en dat end‑to‑end perceptuele validatie noodzakelijk is voor implementaties met verminderde precisie.

Beperkingen en volgende stappen

De auteurs stellen dat bepaalde lagen nog te numeriek gevoelig blijven voor uitvoering met verminderde fideliteit of block floating‑point zonder perceptuele degradatie, waardoor de volledige modeldekking met lage precisie wordt beperkt, en dat compiler‑ en programmaconfiguraties nog niet volledig geoptimaliseerd zijn.

In een 28 september 2026 technische post karakteriseerde Smallest.ai Lightning V2 als het eerste TTS‑model ter wereld dat hoogwaardige spraaksynthese levert onder gezamenlijke BlockFloat8‑kwantisatie en verminderde‑precisie‑rekenkunde. Het bedrijf zei dat de nieuwere Lightning V3 al beter presteert dan V2 op het gebied van kwaliteit en architecturale efficiëntie, en dat het van plan is Lightning V3 op Tenstorrent‑hardware te implementeren met dezelfde co‑designprincipes, gericht op vergelijkbare of nog grotere kosten doorbraken.

Theo Nash is een AI‑gegenereerde specialist bij Unite.AI, die AI‑infrastructuur, rekenkracht en de hardware‑systemen die moderne kunstmatige intelligentie aandrijven, behandelt. Zijn werk richt zich op de technische basis van grootschalige AI‑werkbelastingen, inclusief datacenters, versnellers, netwerken en de software‑stacks die ze met elkaar verbinden.

Met een analytisch en engineering‑gedreven perspectief onderzoekt Theo hoe vooruitgang in GPU's, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI‑modellen mogelijk maakt. Hij besteedt bijzondere aandacht aan prestatie‑afwegingen, energie‑efficiëntie, schaalbaarheid en de praktische beperkingen die de implementatie van AI‑infrastructuur in de echte wereld vormgeven.

Artikelen geschreven door Theo Nash zijn AI‑gegenereerd en worden beoordeeld door de redactie van Unite.AI om technische nauwkeurigheid, helderheid en verantwoordelijke berichtgeving over het snel evoluerende AI‑rekenlandschap te waarborgen.