Partenariats

Les agents vocaux sur site obtiennent un nouveau chemin matériel alors que Smallest.ai rejoint Tenstorrent

mm
Ajouter Unite.AI à vos sources préférées sur Google

Tenstorrent et Smallest.ai annoncé un partenariat le 1 octobre 2026, afin de fournir une pile d’IA vocale de qualité production, sur site, qui exécute nativement le modèle de synthèse vocale en temps réel Lightning V2 de Smallest.ai sur Tenstorrent Galaxy Blackhole servers.

Tenstorrent, une société de calcul IA, et Smallest.ai, un laboratoire de recherche en IA construisant une infrastructure d’IA vocale en temps réel, ont déclaré que la pile conjointe est conçue pour réduire les coûts de déploiement tout en offrant les performances requises pour les applications vocales en temps réel. Les entreprises ont indiqué que l’exécution de Lightning V2 sur l’architecture Blackhole permet aux organisations de faire fonctionner des agents vocaux en temps réel entièrement sur site avec une souveraineté totale des données, en ciblant des charges de travail à haut volume et sensibles aux données dans les services financiers, les télécommunications, la santé et les environnements d’entreprise. Lightning V2 est disponible immédiatement sur le matériel Tenstorrent, avec une tarification à l’usage et sans engagement initial.

“Il ne devrait pas y avoir de choix entre performance et coût – Tenstorrent a construit un calcul efficace et évolutif qui réduit le coût des flux de travail existants et rend entièrement nouvelles charges de travail pratiques,” a déclaré Amr Elashmawi, vice-président de la stratégie et du développement commercial chez Tenstorrent.

Matériel Galaxy Blackhole

La plateforme serveur mentionnée dans l’annonce est construite autour de 32 ASIC Blackhole offrant 23 PFLOPS de calcul Block FP8, avec 6,2 Go de SRAM intégrée à 2,9 PB/s et 1 To de mémoire GDDR6 à 16 TB/s, selon spécifications Galaxy de Tenstorrent. Chaque ASIC se connecte via dix liaisons 400 GbE pour un tissu d’accélérateur de 32 TB/s, et les systèmes s’étendent jusqu’à 56 ports 800 GbE QSFP‑DD. Le châssis refroidi par air de 6 U associe un processeur hôte AMD EPYC 9004 à jusqu’à 576 Go de mémoire DDR5, fonctionne sous Ubuntu 22.04, consomme en moyenne entre 8 et 10 kW, et affiche un prix catalogue de $160,000.

Conception à précision réduite et résultats mesurés

L’ingénierie derrière le partenariat est documentée dans un article, “Réécriture de l’économie de l’inférence TTS : Lightning V2 sur Tenstorrent réalise un coût 4× inférieur à celui du NVIDIA L40S,” rédigé par Ranjith M S de Smallest.ai, ingénieur principal en performance d’inférence IA ; directeur technologique Akshat Mandloi ; et directeur général Sudarshan Kamath. L’article a été soumis pour la première fois le 24 mars 2026 et révisé le 7 avril 2026.

Ranjith, premier auteur de l’article, a déclaré dans l’annonce : “L’architecture de Tenstorrent est fondamentalement différente des paradigmes existants. En travaillant avec le NoC et une SRAM plus grande, nous avons débloqué des gains 4× à une fraction du coût d’une infrastructure GPU comparable, entraînant un changement structurel dans l’économie de l’inférence.”

Les auteurs rapportent que les modèles de synthèse vocale sont nettement plus fragiles numériquement que les grands modèles de langage parce qu’ils génèrent des formes d’onde continues par raffinement itératif, si bien que de petites erreurs numériques s’accumulent à travers les étapes de débruitage et se manifestent sous forme d’artéfacts audibles. Dans ce contexte, l’article indique que plus de 95 % des couches de Lightning V2 fonctionnent à une fidélité computationnelle LoFi et que plus de 80 % du modèle est déployé en BlockFloat8 sans dégradation mesurable de la qualité audio. Les auteurs signalent également une réduction de 4× du calcul dans le modèle acoustique de diffusion, une réduction de 8× du calcul dans le vocodeur neuronal, une réduction d’environ 2× de la taille du modèle, et une réduction de 1,8× du volume de transfert mémoire.

Concernant la qualité de sortie, l’article rapporte un score perceptuel DNSMOS de 3,872 pour la référence NVIDIA L40S contre 3,801 sur le P150 de Tenstorrent, une différence de 0,071 que les auteurs décrivent comme relevant de la variation perceptuelle mineure, ainsi qu’un taux d’erreur de mots normalisé de 0,009 entre les sorties des deux systèmes.

Dans les tests sur un seul dispositif, l’article indique que le L40S maintient une concurrence de 3 avec une latence de 300 ms pour un coût catalogue de $9,000, tandis que le P150 et le P100 ont chacun atteint une concurrence de 1 avec une latence de 250 ms pour des coûts catalogue de $1,400 et $1,000, ce qui représente des gains de coût de 2,6× et 3,6× respectivement. Étant donné que Lightning V2 s’exécute sur une seule puce sans parallélisme multi‑puce ni interconnexion QSFP, la valeur de latence du P100 est reportée à partir des résultats mesurés du P150, note l’article.

À l’échelle d’une flotte, les auteurs modélisent une charge de travail de 550 requêtes TTS simultanées de cinq secondes à pleine utilisation. Ils calculent que la soutenir nécessiterait 11 GPU L40S pour un coût d’accélérateur d’environ $100,000, contre 27 accélérateurs P100 pour environ $27,000 ou 27 accélérateurs P150 pour environ $37,000, soit une réduction de 3 à 4× du coût initial dans leur comparaison modélisée.

L’article indique également qu’une couche fortement optimisée d’environ 6 milliards d’opérations de multiplication‑accumulation s’exécute en environ 60 µs sur le L40S contre environ 31 µs sur le P150. Les auteurs projettent que l’extension d’une telle optimisation au niveau du noyau à davantage de couches pourrait offrir une amélioration normalisée en coût de 8 à 12× par rapport à la référence L40S, contre un gain actuel de 3,6× au niveau du système.

Les auteurs présentent le support natif de BlockFloat8 comme une frontière de coût matériel : les GPU contemporains disposant de cette capacité se situent dans une gamme de prix d’environ $40,000 par dispositif, rapportent-ils, tandis que Tenstorrent permet l’exécution de BlockFloat8 sur du matériel dans une gamme d’environ $1,000, soit une différence d’ordre de grandeur dans le coût d’acquisition selon leur description.

Fragilité numérique et le cas du PCC

L’article documente une étude de débogage autour du Coefficient de corrélation de Pearson, une métrique standard de similarité numérique. Les auteurs rapportent que les sorties du L40S et d’un processeur AMD EPYC 7352 ont montré un coefficient de bout en bout de seulement 0,72 malgré des entrées identiques, tout en produisant un son perceptuellement indiscernable. Dans un autre cas, une couche dont le coefficient était arrondi à 1,0 a provoqué une rupture audible qui a mis plus d’un mois à être isolée. Les auteurs concluent que les métriques de similarité au niveau des tenseurs conventionnelles ne sont pas des indicateurs fiables de la qualité audio perceptuelle dans les systèmes TTS, et qu’une validation perceptuelle de bout en bout est nécessaire pour les déploiements à précision réduite.

Limitations et prochaines étapes

Les auteurs indiquent que certaines couches restent trop sensibles numériquement pour une exécution à fidélité réduite ou en virgule flottante par blocs sans dégradation perceptuelle, limitant la couverture à faible précision du modèle complet, et que les configurations du compilateur et du programme ne sont pas encore entièrement optimisées.

Dans un article technique du 28 septembre 2026, Smallest.ai a caractérisé Lightning V2 comme le premier modèle TTS au monde à fournir une synthèse vocale de haute qualité sous quantification BlockFloat8 conjointe et arithmétique à précision réduite. L’entreprise a déclaré que son Lightning V3 plus récent dépasse déjà V2 en qualité et en efficacité architecturale, et qu’elle prévoit de déployer Lightning V3 sur le matériel Tenstorrent avec les mêmes principes de co‑conception, visant des percées de coût similaires ou supérieures.

Theo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l’infrastructure IA, le calcul, et les systèmes matériels qui alimentent l’intelligence artificielle moderne. Son travail se concentre sur les fondations techniques des charges de travail IA à grande échelle, y compris les centres de données, les accélérateurs, le réseau et les piles logicielles qui les relient.

Avec une perspective analytique et axée sur l’ingénierie, Theo examine comment les avancées des GPU, du silicium personnalisé, des architectures mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il porte une attention particulière aux compromis de performance, à l’efficacité énergétique, à l’évolutivité et aux contraintes pratiques qui façonnent le déploiement réel de l’infrastructure IA.

Les articles rédigés par Theo Nash sont générés par IA et revus par l’équipe éditoriale de Unite.AI afin d’assurer une précision technique, une clarté et une couverture responsable du paysage du calcul IA en évolution rapide.