Partnerství
On-Prem hlasoví agenti získávají novou hardwarovou cestu, když se Smallest.ai připojuje k Tenstorrent

Tenstorrent a Smallest.ai oznámili partnerství dne 1. října 2026, aby poskytli produkčně připravený, on-premises hlasový AI stack, který nativně spouští model real‑time text‑to‑speech Lightning V2 od Smallest.ai na serverech Tenstorrent Galaxy Blackhole.
Tenstorrent, společnost zabývající se výpočty pro AI, a Smallest.ai, výzkumná laboratoř AI budující infrastrukturu pro real‑time hlasové AI, uvedly, že společný stack je navržen tak, aby snižoval náklady na nasazení a zároveň poskytoval výkon potřebný pro aplikace v reálném čase. Firmy uvedly, že provozování Lightning V2 na architektuře Blackhole umožňuje organizacím provozovat real‑time hlasové agenty zcela on‑prem s úplnou datovou suverenitou, zaměřené na vysoce objemové, citlivé úlohy napříč finančními službami, telekomunikacemi, zdravotnictvím a podnikovým prostředím. Lightning V2 je na hardwaru Tenstorrent dostupný okamžitě, s cenovým modelem založeným na využití a bez předběžných závazků.
„Nemělo by být nutné volit mezi výkonem a náklady – Tenstorrent vybudoval efektivní a škálovatelný výpočet, který snižuje náklady na stávající pracovní postupy a činí zcela nové úlohy praktickými,“ řekl Amr Elashmawi, viceprezident pro strategii a rozvoj podnikání ve společnosti Tenstorrent.
Hardware Galaxy Blackhole
Serverová platforma zmíněná v oznámení je postavena kolem 32 ASICů Blackhole, které poskytují 23 PFLOPS výpočtu Block FP8, s 6,2 GB on‑chip SRAM při 2,9 PB/s a 1 TB paměti GDDR6 při 16 TB/s, podle specifikací Galaxy od Tenstorrent. Každý ASIC se připojuje přes deset 400 GbE odkazů k akcelerátorové síti o šířce 32 TB/s a systémy lze rozšiřovat až pomocí 56 portů 800 GbE QSFP‑DD. 6U šasi chlazené vzduchem kombinuje procesor hostitele AMD EPYC 9004 s až 576 GB paměti DDR5, běží na Ubuntu 22.04, průměrně spotřebuje 8 – 10 kW a má katalogovou cenu 160 000 $.
Design s redukovanou přesností a měřené výsledky
Inženýrství stojící za partnerstvím je zdokumentováno v článku, „Přepisování ekonomiky inferencí TTS: Lightning V2 na Tenstorrent dosahuje 4‑krát nižších nákladů než NVIDIA L40S,“ který napsali Ranjith M S z Smallest.ai, seniorní inženýr výkonu AI inferencí; technický ředitel Akshat Mandloi; a generální ředitel Sudarshan Kamath. Článek byl poprvé předložen 24. března 2026 a revidován 7. dubna 2026.
Ranjith, první autor článku, uvedl v oznámení: „Architektura Tenstorrent je zásadně odlišná od stávajících paradigm. Práce s NoC a větší SRAM nám umožnila dosáhnout 4‑krát vyššího zisku za zlomek nákladů na srovnatelnou GPU infrastrukturu, což přináší strukturální posun v ekonomice inferencí.“
Autoři uvádějí, že modely text‑to‑speech jsou výrazně numericky křehčí než velké jazykové modely, protože generují kontinuální vlnové formy iterativním zdokonalováním, takže malé numerické chyby se kumulují napříč kroky odšumování a projevují jako slyšitelné artefakty. Vzhledem k tomuto omezení článek uvádí, že více než 95 % vrstev Lightning V2 běží s LoFi výpočetní věrností a více než 80 % modelu je nasazeno v BlockFloat8 bez měřitelného zhoršení kvality zvuku. Autoři také uvádějí 4‑krát snížení výpočetní náročnosti difúzního akustického modelu, 8‑krát snížení výpočetní náročnosti neurálního vokodéru, přibližně 2‑krát menší velikost modelu a 1,8‑krát menší objem přenosu paměti.
Co se týče kvality výstupu, článek uvádí percepční skóre DNSMOS 3,872 pro referenční NVIDIA L40S oproti 3,801 u Tenstorrent P150, rozdíl 0,071 autoři popisují jako spadající do rozsahu menších percepčních odchylek, a normalizovanou chybovost slov (WER) 0,009 mezi výstupy obou systémů.
V testování na jednom zařízení článek uvádí, že L40S udržuje souběžnost 3 při latenci 300 ms a uváděné ceně zařízení 9 000 $, zatímco P150 a P100 dosahovaly souběžnosti 1 při latenci 250 ms a uváděných cenách 1 400 $ a 1 000 $, což představuje uváděné úspory nákladů 2,6‑krát a 3,6‑krát. Protože Lightning V2 běží na jednom čipu bez paralelismu více čipů nebo QSFP propojení, hodnota latence P100 je převzata z naměřených výsledků P150, uvádí článek.
V měřítku flotily autoři modelují zátěž 550 simultánních pětisekundových TTS požadavků při plném využití. Vypočítali, že její udržení by vyžadovalo 11 GPU L40S s přibližnými náklady na akcelerátory 100 000 $, oproti 27 akcelerátorům P100 s přibližnými náklady 27 000 $ nebo 27 akcelerátorům P150 s přibližnými náklady 37 000 $, což představuje 3‑4‑krát snížení počátečních nákladů v jejich modelovém srovnání.
Článek také uvádí, že jedna silně optimalizovaná vrstva s přibližně 6 miliardami násobení‑akumulací se provádí zhruba 60 µs na L40S oproti asi 31 µs na P150. Autoři předpovídají, že rozšíření takové optimalizace na úrovni kernelu napříč dalšími vrstvami by mohlo přinést 8‑12‑krát zlepšení po normalizaci nákladů oproti referenci L40S, oproti současnému 3,6‑krátovému zisku na úrovni systému.
Autoři představují nativní podporu BlockFloat8 jako hranici rozdělující náklady na hardware: současné GPU s touto schopností se pohybují v cenové třídě přibližně 40 000 $ za zařízení, uvádějí, zatímco Tenstorrent umožňuje provádění BlockFloat8 na hardwaru v cenové třídě přibližně 1 000 $, což představuje rozdíl o řád velikosti v pořizovacích nákladech podle jejich popisu.
Číselná křehkost a případ PCC
Článek dokumentuje případovou studii ladění týkající se Pearsonova korelačního koeficientu, standardní číselné metriky podobnosti. Autoři uvádějí, že výstupy z L40S a procesoru AMD EPYC 7352 vykázaly celkový koeficient pouhých 0,72 i přes identické vstupy, přesto však produkovaly zvuk, který byl z hlediska vnímání nerozeznatelný. V jiném případě vrstva, jejíž koeficient se zaokrouhlil na 1,0, způsobila slyšitelnou poruchu, jejíž izolace trvala více než měsíc. Autoři docházejí k závěru, že konvenční metriky podobnosti na úrovni tenzoru nejsou spolehlivými ukazateli percepční kvality zvuku v systémech TTS a že pro nasazení s nižší přesností je nutné provádět end-to-end percepční validaci.
Omezení a další kroky
Autoři uvádějí, že některé vrstvy jsou stále příliš číselně citlivé na provádění s nižší věrností nebo blokovým plovoucím desetinným číslem bez percepční degradace, což omezuje pokrytí celého modelu při nízké přesnosti, a že konfigurace kompilátoru a programu ještě nejsou plně optimalizovány.
V technickém příspěvku ze 28. září 2026 Smallest.ai charakterizovalo Lightning V2 jako první TTS model na světě, který poskytuje vysoce kvalitní syntézu řeči při společné kvantizaci BlockFloat8 a aritmetice s nižší přesností. Společnost uvedla, že její novější Lightning V3 již překonává V2 v kvalitě i architektonické efektivitě a že plánuje nasadit Lightning V3 na hardware Tenstorrent se stejnými principy spolu‑designu, s cílem dosáhnout podobných nebo ještě větších průlomů v nákladech.












