Partnerstwa

Agenci głosowi on‑prem zyskują nową ścieżkę sprzętową po dołączeniu Smallest.ai do Tenstorrent

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Tenstorrent i Smallest.ai ogłosiły partnerstwo 1 października 2026 roku, aby dostarczyć produkcyjny, lokalny stos AI głosowy, który uruchamia model syntezy mowy w czasie rzeczywistym Lightning V2 firmy Smallest.ai natywnie na serwerach Tenstorrent Galaxy Blackhole.

Tenstorrent, firma zajmująca się obliczeniami AI, oraz Smallest.ai, laboratorium badawcze AI budujące infrastrukturę AI głosową w czasie rzeczywistym, stwierdziły, że wspólny stos ma na celu obniżenie kosztów wdrożenia przy jednoczesnym zapewnieniu wydajności niezbędnej dla aplikacji głosowych w czasie rzeczywistym. Firmy podkreśliły, że uruchamianie Lightning V2 na architekturze Blackhole umożliwia organizacjom prowadzenie agentów głosowych w czasie rzeczywistym w pełni on‑prem, z pełną suwerennością danych, skierowane do obciążeń o wysokim wolumenie i wrażliwości danych w sektorach usług finansowych, telekomunikacji, opieki zdrowotnej oraz środowisk korporacyjnych. Lightning V2 jest dostępny na sprzęcie Tenstorrent od razu, z modelem cenowym opartym na zużyciu i bez wstępnych zobowiązań.

„Nie powinno być konieczności wyboru między wydajnością a kosztem – Tenstorrent stworzył wydajne i skalowalne obliczenia, które obniżają koszty istniejących przepływów pracy i czynią całkowicie nowe obciążenia praktycznymi,” powiedział Amr Elashmawi, wiceprezes ds. strategii i rozwoju biznesu w Tenstorrent.

Sprzęt Galaxy Blackhole

Platforma serwerowa wymieniona w ogłoszeniu oparta jest na 32 układach ASIC Blackhole, zapewniających 23 PFLOPS obliczeń Block FP8, z 6.2 GB pamięci SRAM na chipie przy 2.9 PB/s oraz 1 TB pamięci GDDR6 przy 16 TB/s, zgodnie z specyfikacjami Galaxy firmy Tenstorrent. Każdy ASIC łączy się poprzez dziesięć łączy 400 GbE, tworząc tkaninę przyspieszacza o przepustowości 32 TB/s, a systemy skalują się poprzez maksymalnie 56 portów 800 GbE QSFP‑DD. Obudowa 6U chłodzona powietrzem łączy procesor hosta AMD EPYC 9004 z maksymalnie 576 GB pamięci DDR5, działa pod Ubuntu 22.04, pobiera średnio od 8 do 10 kW i ma cenę katalogową $160,000.

Projekt o zmniejszonej precyzji i wyniki pomiarowe

Inżynieria stojąca za partnerstwem została udokumentowana w artykule „Przepisanie ekonomiki inferencji TTS: Lightning V2 na Tenstorrent osiąga 4x niższy koszt niż NVIDIA L40S,” autorstwa Ranjitha M S z Smallest.ai, starszego inżyniera wydajności inferencji AI; dyrektora technicznego Akshata Mandloi; oraz dyrektora generalnego Sudarshana Kamatha. Artykuł został po raz pierwszy złożony 24 marca 2026 roku i zrewidowany 7 kwietnia 2026 roku.

Ranjith, pierwszy autor artykułu, powiedział w ogłoszeniu: „Architektura Tenstorrent różni się zasadniczo od istniejących paradygmatów. Pracując z NoC i większą pamięcią SRAM, uzyskaliśmy czterokrotne przyspieszenie przy ułamkowej części kosztów porównywalnej infrastruktury GPU, co wywołuje strukturalną zmianę w ekonomice inferencji.”

Autorzy podają, że modele syntezy mowy są znacznie bardziej podatne numerycznie niż duże modele językowe, ponieważ generują ciągłe fale dźwiękowe poprzez iteracyjne udoskonalanie, co powoduje, że małe błędy numeryczne kumulują się w kolejnych krokach odszumiania i objawiają się słyszalnymi artefaktami. Wbrew temu ograniczeniu, w artykule stwierdzono, że ponad 95 % warstw Lightning V2 działa z niską precyzją obliczeniową (LoFi), a ponad 80 % modelu jest wdrażane w formacie BlockFloat8 bez mierzalnego pogorszenia jakości dźwięku. Autorzy raportują również czterokrotne zmniejszenie zapotrzebowania na obliczenia w modelu akustycznym dyfuzji, ośmiokrotne zmniejszenie w neuralnym wokoderze, przybliżone dwukrotne zmniejszenie rozmiaru modelu oraz 1.8‑krotne zmniejszenie wolumenu transferu pamięci.

Autorzy podają, że wskaźnik percepcyjny DNSMOS wyniósł 3.872 dla punktu odniesienia NVIDIA L40S w porównaniu do 3.801 dla P150 firmy Tenstorrent, różnica 0.071, którą autorzy opisują jako mieszczącą się w zakresie niewielkich odchyleń percepcyjnych, oraz znormalizowany wskaźnik błędów słów (WER) wyniósł 0.009 między wynikami obu systemów.

W testach jednego urządzenia, artykuł podaje, że L40S utrzymuje współbieżność 3 przy opóźnieniu 300 ms przy wymienionej cenie urządzenia 9 000 $, natomiast P150 i P100 osiągały współbieżność 1 przy opóźnieniu 250 ms przy wymienionych cenach 1 400 $ i 1 000 $, co daje zgłoszone oszczędności kosztów odpowiednio 2,6‑krotnie i 3,6‑krotnie. Ponieważ Lightning V2 działa na pojedynczym chipie bez równoległości wielochipowej ani połączenia QSFP, wartość opóźnienia P100 została przyjęta z pomiarów P150, jak zauważa artykuł.

W skali floty autorzy modelują obciążenie składające się z 550 jednoczesnych pięcio‑sekundowych żądań TTS przy pełnym wykorzystaniu. Obliczają, że utrzymanie takiego obciążenia wymagałoby 11 GPU L40S o przybliżonym koszcie akceleratora 100 000 $, w porównaniu do 27 akceleratorów P100 o przybliżonym koszcie 27 000 $ lub 27 akceleratorów P150 o przybliżonym koszcie 37 000 $, co oznacza 3‑4‑krotne zmniejszenie kosztów początkowych w ich modelowym porównaniu.

Artykuł dodatkowo podaje, że jedna silnie zoptymalizowana warstwa obejmująca około 6 miliardów operacji mnożenia‑akumulacji wykonuje się w około 60 µs na L40S w porównaniu do około 31 µs na P150. Autorzy prognozują, że rozszerzenie takiej optymalizacji na poziomie jądra na kolejne warstwy może przynieść 8‑12‑krotne, kosztowo‑znormalizowane ulepszenie w stosunku do punktu odniesienia L40S, w porównaniu do obecnego 3,6‑krotnego zysku na poziomie systemu.

Autorzy przedstawiają natywne wsparcie BlockFloat8 jako granicę kosztową sprzętu: współczesne GPU z tą funkcją plasują się w przybliżonej klasie cenowej 40 000 $ za urządzenie, jak podają, podczas gdy Tenstorrent umożliwia wykonywanie BlockFloat8 na sprzęcie w przybliżonej klasie 1 000 $, co stanowi różnicę rzędu wielkości w kosztach nabycia, według ich opisu.

Numeryczna kruchość i przypadek PCC

Artykuł opisuje studium przypadku debugowania dotyczące współczynnika korelacji Pearsona, standardowej miary podobieństwa numerycznego. Autorzy podają, że wyniki z L40S oraz procesora AMD EPYC 7352 wykazały współczynnik końcowy jedynie 0,72 mimo identycznych danych wejściowych, jednakże generowały dźwięk percepcyjnie nieodróżnialny. W osobnym przypadku warstwa, której współczynnik został zaokrąglony do 1,0, spowodowała słyszalne uszkodzenie, które zajęło ponad miesiąc, aby je zlokalizować. Autorzy wnioskują, że konwencjonalne metryki podobieństwa na poziomie tensora nie są wiarygodnymi wskaźnikami jakości dźwięku percepcyjnego w systemach TTS i że konieczna jest walidacja percepcyjna end‑to‑end przy wdrożeniach o obniżonej precyzji.

Ograniczenia i kolejne kroki

Autorzy stwierdzają, że niektóre warstwy pozostają zbyt wrażliwe numerycznie na wykonanie w trybie o obniżonej wierności lub w formacie blokowego zmiennoprzecinkowego bez degradacji percepcyjnej, co ogranicza pełne pokrycie modelu niską precyzją, oraz że konfiguracje kompilatora i programu nie są jeszcze w pełni zoptymalizowane.

W 28 września 2026 techniczny post Smallest.ai scharakteryzowało Lightning V2 jako pierwszy na świecie model TTS, który dostarcza wysokiej jakości syntezę mowy przy jednoczesnym zastosowaniu kwantyzacji BlockFloat8 i arytmetyki o obniżonej precyzji. Firma poinformowała, że nowszy Lightning V3 już przewyższa V2 pod względem jakości i efektywności architektonicznej oraz że planuje wdrożyć Lightning V3 na sprzęcie Tenstorrent, zachowując te same zasady współprojektowania, dążąc do podobnych lub większych przełomów kosztowych.

Theo Nash jest specjalistą generowanym przez SI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami oraz systemami sprzętowymi napędzającymi współczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach dużych obciążeń AI, w tym centrach danych, akceleratorach, sieciach i stosach oprogramowania, które je łączą.

Z analitycznej i inżyniersko ukierunkowanej perspektywy Theo bada, jak postępy w GPU, niestandardowym krzemie, architekturach pamięci i systemach rozproszonych umożliwiają nowe generacje modeli AI. Szczególną uwagę zwraca na kompromisy wydajności, efektywność energetyczną, skalowalność oraz praktyczne ograniczenia kształtujące rzeczywiste wdrażanie infrastruktury AI.

Artykuły autorstwa Theo Nasha są generowane przez SI i przeglądane przez zespół redakcyjny Unite.AI, aby zapewnić techniczną precyzję, klarowność oraz odpowiedzialne relacjonowanie szybko rozwijającego się krajobrazu obliczeń AI.