Parteneriate

Agenții vocali on‑prem obțin o nouă cale hardware pe măsură ce Smallest.ai se alătură Tenstorrent

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Tenstorrent și Smallest.ai au anunțat un parteneriat pe 1 octombrie 2026, pentru a livra un stack AI vocal de nivel producție, on‑premises, care rulează modelul de text‑to‑speech în timp real Lightning V2 de la Smallest.ai nativ pe serverele Tenstorrent Galaxy Blackhole.

Tenstorrent, o companie de calcul AI, și Smallest.ai, un laborator de cercetare AI care construiește infrastructură AI vocală în timp real, au declarat că stack‑ul comun este conceput să reducă costurile de implementare, oferind în același timp performanța necesară pentru aplicații vocale în timp real. Companiile au precizat că rularea Lightning V2 pe arhitectura Blackhole permite organizațiilor să opereze agenți vocali în timp real complet on‑prem, cu suveranitate totală a datelor, vizând sarcini de lucru cu volum mare și sensibilitate ridicată a datelor în sectorul serviciilor financiare, telecomunicații, sănătate și mediul enterprise. Lightning V2 este disponibil pe hardware‑ul Tenstorrent imediat, cu tarifare bazată pe utilizare și fără angajamente inițiale.

„Nu ar trebui să existe o alegere între performanță și cost – Tenstorrent a construit un calcul eficient și scalabil care reduce costul fluxurilor de lucru existente și face ca sarcinile complet noi să fie practice”, a declarat Amr Elashmawi, Vicepreședinte al Strategiei și Dezvoltării Afacerii la Tenstorrent.

Hardware Galaxy Blackhole

Platforma serverului menționată în anunț este construită în jurul a 32 de ASIC‑uri Blackhole care furnizează 23 PFLOPS de calcul Block FP8, cu 6,2 GB de SRAM pe cip la 2,9 PB/s și 1 TB de memorie GDDR6 la 16 TB/s, conform specificațiilor Galaxy ale Tenstorrent. Fiecare ASIC se conectează prin zece legături de 400 GbE pentru o rețea de acceleratori de 32 TB/s, iar sistemele se extind prin până la 56 de porturi 800 GbE QSFP‑DD. Șasiul aer răcit de 6U combină un procesor gazdă AMD EPYC 9004 cu până la 576 GB de memorie DDR5, rulează Ubuntu 22.04, consumă în medie 8‑10 kW și are un preț de listă de $160,000.

Design cu precizie redusă și rezultate măsurate

Ingineria din spatele parteneriatului este documentată într-un articol, “Rescrierea economiei inferenței TTS: Lightning V2 pe Tenstorrent atinge un cost cu 4x mai mic decât NVIDIA L40S,” scris de Ranjith M S de la Smallest.ai, Inginer Senior de Performanță a Inferenței AI; Director Tehnologic Akshat Mandloi; și Director Executiv Sudarshan Kamath. Articolul a fost depus inițial pe 24 martie 2026 și revizuit pe 7 aprilie 2026.

Ranjith, primul autor al articolului, a declarat în anunț: „Arhitectura Tenstorrent este fundamental diferită de paradigmele existente. Lucrând cu NoC‑ul și cu SRAM‑ul mai mare, am deblocat câștiguri de 4× la o fracțiune din costul infrastructurii GPU comparabile, generând o schimbare structurală în economia inferenței.”

Autorii raportează că modelele de text‑to‑speech sunt semnificativ mai fragili numeric decât modelele de limbaj mari, deoarece generează forme de undă continue prin rafinare iterativă, astfel încât erorile numerice mici se acumulează pe parcursul pașilor de denoisare și apar ca artefacte audibile. În ciuda acestei constrângeri, articolul raportează că peste 95 % dintre straturile Lightning V2 rulează la fidelitate computațională LoFi și că peste 80 % din model este implementat în BlockFloat8 fără degradare măsurabilă a calității audio. Autorii mai raportează o reducere a calculului cu 4× în modelul acustic de difuzie, o reducere cu 8× în vocoderul neural, o reducere de aproximativ 2× a dimensiunii modelului și o reducere de 1,8× a volumului de transfer al memoriei.

În ceea ce privește calitatea ieșirii, articolul raportează un scor perceptual DNSMOS de 3,872 pentru referința NVIDIA L40S versus 3,801 pe P150 de la Tenstorrent, o diferență de 0,071 pe care autorii o descriu ca fiind în intervalul variației perceptuale minore, și o rată de eroare a cuvintelor normalizată de 0,009 între ieșirile celor două sisteme.

În testele pe un singur dispozitiv, articolul raportează că L40S menține o concurență de 3 la o latență de 300 ms, având un cost listat de $9,000, în timp ce P150 și P100 au rulat fiecare cu o concurență de 1 la o latență de 250 ms, la costuri listate de $1,400 și, respectiv, $1,000, obținând câștiguri de cost raportate de 2,6× și 3,6×. Deoarece Lightning V2 rulează pe un singur cip fără paralelism multi‑chip sau interconectare QSFP, valoarea de latență a P100 este preluată din rezultatele măsurate pentru P150, notează articolul.

La scară de flotă, autorii modelează o sarcină de lucru de 550 de cereri TTS simultane de cinci secunde la utilizare completă. Ei calculează că menținerea acesteia ar necesita 11 GPU‑uri L40S cu un cost de acceleratoare de aproximativ $100,000, comparativ cu 27 de acceleratoare P100 la aproximativ $27,000 sau 27 de acceleratoare P150 la aproximativ $37,000, o reducere de 3‑4× a costului inițial în comparația modelată.

Articolul raportează, de asemenea, că un strat puternic optimizat de aproximativ 6 miliarde de operații de înmulțire‑acumulare se execută în circa 60 µs pe L40S versus aproximativ 31 µs pe P150. Autorii proiectează că extinderea unei astfel de optimizări la nivel de kernel pe mai multe straturi ar putea genera o îmbunătățire normalizată la cost de 8‑12× față de referința L40S, în creștere față de câștigul actual de 3,6× la nivel de sistem.

Autorii prezintă suportul nativ BlockFloat8 ca pe o linie de separare a costului hardware: GPU‑urile contemporane cu această capacitate se încadrează în clasa de preț de aproximativ $40,000 pe dispozitiv, raportează ei, în timp ce Tenstorrent permite execuția BlockFloat8 pe hardware în clasa de aproximativ $1,000, o diferență de ordin de mărime în costul de achiziție, conform descrierii lor.

Fragilitatea numerică și cazul PCC

Lucrarea documentează un studiu de caz de depanare în jurul Coeficientului de Corelație Pearson, o metrică standard de similaritate numerică. Autorii raportează că ieșirile de la L40S și de la un CPU AMD EPYC 7352 au afișat un coeficient de capăt-la-capăt de doar 0,72 în ciuda intrărilor identice, totuși au produs sunet perceptual indistinguibil. Într-un alt caz, un strat al cărui coeficient rotunjit la 1,0 a cauzat o defecțiune auditivă care a durat peste o lună pentru a fi izolată. Autorii concluzionează că metricile convenționale de similaritate la nivel de tensor nu sunt indicatori de încredere ai calității audio perceptuale în sistemele TTS și că este necesară validarea perceptuală de la capăt la capăt pentru implementările cu precizie redusă.

Limitări și pași următori

Autorii afirmă că anumite straturi rămân prea sensibile numeric pentru execuția cu fidelitate redusă sau în punct flotant bloc fără degradare perceptuală, limitând acoperirea cu precizie scăzută a modelului complet, și că configurațiile compilatorului și ale programului nu sunt încă complet optimizate.

Într-un post tehnic din 28 septembrie 2026, Smallest.ai a caracterizat Lightning V2 ca fiind primul model TTS din lume care oferă sinteză vocală de înaltă calitate sub cuantizare BlockFloat8 combinată și aritmetică cu precizie redusă. Compania a declarat că versiunea sa mai recentă, Lightning V3, depășește deja V2 în calitate și eficiență arhitecturală și că intenționează să implementeze Lightning V3 pe hardware Tenstorrent cu aceleași principii de co-proiectare, vizând progrese similare sau superioare în cost.

Theo Nash este un specialist generat de AI la Unite.AI, care acoperă infrastructura AI, calculul și sistemele hardware care alimentează inteligența artificială modernă. Munca sa se concentrează pe fundamentele tehnice din spatele sarcinilor de lucru AI la scară largă, inclusiv centrele de date, acceleratoarele, rețelele și stivele software care le leagă.

Dintr‑o perspectivă analitică și orientată spre inginerie, Theo examinează modul în care progresele în GPU‑uri, silicon personalizat, arhitecturi de memorie și sisteme distribuite permit noi generații de modele AI. El acordă o atenție deosebită compromisurilor de performanță, eficienței energetice, scalabilității și constrângerilor practice care modelează implementarea în lumea reală a infrastructurii AI.

Articolele scrise de Theo Nash sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea tehnică, claritatea și o acoperire responsabilă a peisajului în rapidă evoluție al calculului AI.