Partnership

Gli agenti vocali on‑prem ricevono un nuovo percorso hardware con l’arrivo di Smallest.ai su Tenstorrent.

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Tenstorrent e Smallest.ai annunciato una partnership il 1 ottobre 2026, per fornire una stack di IA vocale di livello produttivo, on‑premise, che esegue nativamente il modello di sintesi vocale in tempo reale Lightning V2 di Smallest.ai su Tenstorrent Galaxy Blackhole servers.

Tenstorrent, un’azienda di calcolo AI, e Smallest.ai, un laboratorio di ricerca AI che costruisce infrastrutture vocali AI in tempo reale, hanno dichiarato che lo stack congiunto è progettato per ridurre i costi di distribuzione fornendo al contempo le prestazioni richieste per le applicazioni vocali in tempo reale. Le aziende hanno affermato che l’esecuzione di Lightning V2 sull’architettura Blackhole consente alle organizzazioni di gestire agenti vocali in tempo reale interamente on‑prem con piena sovranità dei dati, puntando a carichi di lavoro ad alto volume e sensibili ai dati nei settori dei servizi finanziari, delle telecomunicazioni, della sanità e delle imprese. Lightning V2 è disponibile sull’hardware Tenstorrent fin da subito, con prezzi basati sull’uso e senza impegni iniziali.

“Non dovrebbe esserci una scelta tra prestazioni e costo – Tenstorrent ha costruito un calcolo efficiente e scalabile che riduce il costo dei flussi di lavoro esistenti e rende pratici carichi di lavoro completamente nuovi,” ha dichiarato Amr Elashmawi, Vicepresidente della Strategia e dello Sviluppo Commerciale presso Tenstorrent.

Hardware Galaxy Blackhole

La piattaforma server nominata nell’annuncio è costruita attorno a 32 ASIC Blackhole che forniscono 23 PFLOPS di calcolo Block FP8, con 6,2 GB di SRAM on‑chip a 2,9 PB/s e 1 TB di memoria GDDR6 a 16 TB/s, secondo Tenstorrent’s Galaxy specifications. Ogni ASIC si collega tramite dieci link 400 GbE per un tessuto acceleratore di 32 TB/s, e i sistemi scalano fino a 56 porte 800 GbE QSFP‑DD. Il chassis raffreddato ad aria da 6U accoppia un processore host AMD EPYC 9004 con fino a 576 GB di memoria DDR5, esegue Ubuntu 22.04, consuma in media da 8 a 10 kW e ha un prezzo di listino di $160.000.

Progettazione a Precisione Ridotta e Risultati Misurati

L’ingegneria alla base della partnership è documentata in un documento, “Riscrivere l’Economia dell’Inferenza TTS: Lightning V2 su Tenstorrent Raggiunge un Costo 4 Volte Inferiore rispetto a NVIDIA L40S,” redatto da Ranjith M S di Smallest.ai, Ingegnere Senior delle Prestazioni di Inferenza AI; dal Direttore Tecnologico Akshat Mandloi; e dall’Amministratore Delegato Sudarshan Kamath. Il documento è stato inizialmente presentato il 24 marzo 2026 e revisionato il 7 aprile 2026.

Ranjith, primo autore del documento, ha dichiarato nell’annuncio: “L’architettura di Tenstorrent è fondamentalmente diversa dai paradigmi esistenti. Lavorando con il NoC e una SRAM più ampia, abbiamo sbloccato guadagni 4 volte superiori a una frazione del costo di un’infrastruttura GPU comparabile, generando uno spostamento strutturale nell’economia dell’inferenza.”

Gli autori segnalano che i modelli di sintesi vocale sono significativamente più fragili numericamente rispetto ai grandi modelli linguistici perché generano forme d’onda continue mediante raffinamento iterativo, così i piccoli errori numerici si accumulano attraverso le fasi di denoising e si manifestano come artefatti udibili. Nonostante tale vincolo, il documento riporta che più del 95 % degli strati di Lightning V2 opera a fedeltà computazionale LoFi e più dell’80 % del modello è distribuito in BlockFloat8 senza degradazione misurabile della qualità audio. Gli autori segnalano inoltre una riduzione computazionale di 4 volte nel modello acustico di diffusione, una riduzione di 8 volte nel vocoder neurale, una riduzione di circa 2 volte nella dimensione del modello e una riduzione di 1,8 volte nel volume di trasferimento della memoria.

Sulla qualità dell’output, il documento riporta un punteggio percettivo DNSMOS di 3,872 per il baseline NVIDIA L40S rispetto a 3,801 sul P150 di Tenstorrent, una differenza di 0,071 che gli autori descrivono come rientrante nella gamma di variazione percettiva minore, e un tasso di errore di parola normalizzato di 0,009 tra le uscite dei due sistemi.

Nei test su singolo dispositivo, il documento riporta che il L40S mantiene una concorrenza di 3 a una latenza di 300 ms con un costo di listino del dispositivo di $9.000, mentre il P150 e il P100 hanno ciascuno raggiunto una concorrenza di 1 a una latenza di 250 ms con costi di listino di $1.400 e $1.000, rispettivamente, per guadagni di costo riportati di 2,6× e 3,6×. Poiché Lightning V2 viene eseguito su un singolo chip senza parallelismo multi-chip o l’interconnessione QSFP, la cifra di latenza del P100 è riportata dai risultati misurati del P150, osserva il documento.

A scala di flotta, gli autori modellano un carico di lavoro di 550 richieste TTS simultanee di cinque secondi a piena occupazione. Calcolano che mantenerlo richiederebbe 11 GPU L40S con un costo acceleratore di circa $100.000, rispetto a 27 acceleratori P100 con un costo di circa $27.000 o 27 acceleratori P150 con un costo di circa $37.000, una riduzione di 3‑4× del costo iniziale nella loro comparazione modellata.

Il documento riporta inoltre che uno strato fortemente ottimizzato di circa 6 miliardi di operazioni di moltiplicazione‑accumulazione viene eseguito in circa 60 µs sul L40S rispetto a circa 31 µs sul P150. Gli autori prevedono che estendere tale ottimizzazione a livello di kernel su più strati potrebbe produrre un miglioramento normalizzato per costo di 8‑12× rispetto al baseline L40S, rispetto all’attuale guadagno a livello di sistema di 3,6×.

Gli autori presentano il supporto nativo a BlockFloat8 come una soglia di costo hardware: le GPU contemporanee con tale capacità rientrano nella fascia di prezzo di circa $40.000 per dispositivo, riportano, mentre Tenstorrent consente l’esecuzione di BlockFloat8 su hardware nella fascia di circa $1.000, una differenza di un ordine di grandezza nel costo di acquisizione nella loro descrizione.

Fragilità Numerica e il Caso PCC

Il documento descrive uno studio di caso di debugging relativo al Pearson Correlation Coefficient, una metrica standard di similarità numerica. Gli autori segnalano che le uscite provenienti da L40S e da una CPU AMD EPYC 7352 hanno mostrato un coefficiente end-to-end di appena 0,72 nonostante input identici, ma hanno prodotto audio percepibilmente indistinguibile. In un altro caso, uno strato il cui coefficiente arrotondato a 1,0 ha provocato una rottura udibile che ha richiesto più di un mese per essere isolata. Gli autori concludono che le metriche di similarità a livello di tensore convenzionali non sono indicatori affidabili della qualità audio percettiva nei sistemi TTS, e che è necessaria una validazione percettiva end-to-end per le implementazioni a precisione ridotta.

Limitazioni e Prossimi Passi

Gli autori affermano che alcuni strati rimangono troppo sensibili numericamente per un’esecuzione a fedeltà ridotta o in virgola mobile a blocchi senza degradazione percettiva, limitando la copertura a bassa precisione dell’intero modello, e che le configurazioni di compilatore e di programma non sono ancora completamente ottimizzate.

In un post tecnico del 28 settembre 2026, Smallest.ai ha caratterizzato Lightning V2 come il primo modello TTS al mondo a fornire sintesi vocale di alta qualità con quantizzazione BlockFloat8 congiunta e aritmetica a precisione ridotta. L’azienda ha dichiarato che il suo più recente Lightning V3 supera già V2 in qualità ed efficienza architettonica, e che prevede di distribuire Lightning V3 sull’hardware Tenstorrent con gli stessi principi di co-design, puntando a progressi di costo simili o superiori.

Theo Nash è uno specialista generato dall'IA presso Unite.AI, che si occupa di infrastruttura IA, calcolo e dei sistemi hardware che alimentano l'intelligenza artificiale moderna. Il suo lavoro si concentra sulle fondamenta tecniche dei carichi di lavoro IA su larga scala, inclusi i data center, gli acceleratori, le reti e gli stack software che li collegano.

Con una prospettiva analitica e orientata all'ingegneria, Theo esamina come i progressi nelle GPU, nel silicio personalizzato, nelle architetture di memoria e nei sistemi distribuiti consentano nuove generazioni di modelli IA. Presta particolare attenzione ai compromessi di prestazioni, all'efficienza energetica, alla scalabilità e alle limitazioni pratiche che modellano il dispiegamento reale dell'infrastruttura IA.

Articoli scritti da Theo Nash sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza tecnica, chiarezza e una copertura responsabile del panorama del calcolo IA in rapida evoluzione.