パートナーシップ
オンプレミス音声エージェントが新たなハードウェア経路を獲得、Smallest.aiがTenstorrentに参加

TenstorrentとSmallest.aiは2026年10月1日に発表したパートナーシップで、Smallest.aiのLightning V2リアルタイムテキスト音声合成モデルをTenstorrent Galaxy Blackhole servers上でネイティブに実行する、プロダクション向けオンプレミス音声AIスタックを提供する。
AIコンピュート企業であるTenstorrentと、リアルタイム音声AIインフラを構築するAI研究ラボのSmallest.aiは、共同スタックが導入コストを削減しつつ、リアルタイム音声アプリケーションに必要な性能を提供するよう設計されていると述べた。両社は、Blackholeアーキテクチャ上でLightning V2を実行することで、組織は高ボリュームでデータ感度の高いワークロード(金融サービス、通信、ヘルスケア、エンタープライズ環境)に対して、完全なデータ主権を保ちつつ、オンプレミスでリアルタイム音声エージェントを運用できると説明した。Lightning V2はTenstorrentハードウェア上で即時に利用可能で、従量課金制で前払いのコミットメントは不要である。
「パフォーマンスとコストの間で選択しなければならない必要はありません。Tenstorrentは効率的でスケーラブルなコンピュートを構築し、既存ワークフローのコストを削減すると同時に、全く新しいワークロードを実用化できるようにしました」とTenstorrentの戦略・事業開発担当副社長Amr Elashmawiは述べた。
Galaxy Blackhole ハードウェア
発表で示されたサーバープラットフォームは、32個のBlackhole ASICを中心に構成され、Block FP8計算で23 PFLOPSを提供し、オンチップSRAMが6.2 GBで2.9 PB/s、GDDR6メモリが1 TBで16 TB/sという性能を持つとTenstorrentのGalaxy仕様は述べている。各ASICは10本の400 GbEリンクで接続され、32 TB/sのアクセラレーターファブリックを形成し、システムは最大56本の800 GbE QSFP‑DDポートでスケールアウトできる。6Uエアクーラー筐体はAMD EPYC 9004ホストプロセッサと最大576 GBのDDR5メモリを組み合わせ、Ubuntu 22.04を実行し、平均消費電力は8〜10 kWで、定価は$160,000である。
低精度設計と測定結果
パートナーシップの背後にあるエンジニアリングは、Smallest.aiのRanjith M S(シニアAI推論パフォーマンスエンジニア)、Chief Technology OfficerのAkshat Mandloi、Chief Executive OfficerのSudarshan Kamathが執筆した論文、「テキスト音声合成推論経済学の書き換え:Tenstorrent上のLightning V2はNVIDIA L40Sより4倍低コストを実現」に記録されている。この論文は2026年3月24日に初稿が提出され、2026年4月7日に改訂された。
論文の第一著者であるRanjithは発表で次のように述べた。「Tenstorrentのアーキテクチャは既存のパラダイムとは根本的に異なります。NoCと大容量SRAMを活用することで、同等のGPUインフラストラクチャのごく一部のコストで4倍の性能向上を実現し、推論経済学に構造的な変化をもたらしました。」
著者らは、テキスト音声合成モデルは大規模言語モデルに比べて数値的に非常に脆弱であると報告している。これは、連続波形を反復的に洗練させて生成するため、微小な数値誤差がデノイジングステップを通じて蓄積し、可聴なアーティファクトとして現れるからである。この制約に対し、論文はLightning V2の層の95%以上がLoFi計算精度で動作し、モデルの80%以上がBlockFloat8で展開され、音質の測定可能な劣化は見られないと報告している。また、拡散音響モデルの計算量が4倍削減され、ニューラルボコーダーが8倍削減され、モデルサイズが約2倍、メモリ転送量が1.8倍削減されたことも示している。
出力品質に関して、論文はNVIDIA L40SベースラインのDNSMOS知覚スコアが3.872、TenstorrentのP150が3.801であり、0.071の差は著者らが「軽微な知覚的変動の範囲内」と述べ、両システムの出力間の正規化語誤り率は0.009であると報告している。
単一デバイスのテストにおいて、論文はL40Sが同時実行数3、レイテンシ300ミリ秒を維持し、定価は$9,000であると報告している。一方、P150とP100はそれぞれ同時実行数1、レイテンシ250ミリ秒で、定価はそれぞれ$1,400と$1,000であり、コスト削減効果はそれぞれ2.6倍と3.6倍と示されている。Lightning V2はマルチチップの並列化やQSFPインターコネクトを使用せず単一チップで実行されるため、P100のレイテンシ数値は測定されたP150の結果から転用されたと論文は指摘している。
フリート規模では、著者らはフル稼働状態で550件の同時5秒TTSリクエストのワークロードをモデル化している。これを維持するには、アクセラレータコストが約$100,000のL40S GPUが11台必要になるのに対し、約$27,000のP100アクセラレータが27台、または約$37,000のP150アクセラレータが27台で済み、初期コストが3〜4倍削減できると算出している。
論文は、約60億の乗算加算演算を持つ高度に最適化された層がL40S上で約60マイクロ秒、P150上で約31マイクロ秒で実行されると報告している。著者らは、このようなカーネルレベルの最適化をより多くの層に拡張すれば、L40Sベースラインに対してコスト正規化された8〜12倍の改善が得られ、現在のシステムレベルでの3.6倍の向上からさらに上回ると予測している。
著者らは、ネイティブなBlockFloat8サポートをハードウェアコストの分岐点として位置付けている。彼らの報告によれば、その機能を持つ現代のGPUはデバイスあたりおおよそ$40,000の価格帯に属するのに対し、Tenstorrentは約$1,000の価格帯のハードウェアでBlockFloat8実行を可能にし、取得コストが桁違いに低いと説明している。
数値的脆弱性とPCCケース
本稿は、標準的な数値類似度指標であるピアソン相関係数を中心としたデバッグ事例研究を記録しています。著者らは、同一入力にもかかわらず、L40S と AMD EPYC 7352 CPU の出力がエンドツーエンドの係数がわずか 0.72 であったが、知覚上は区別できない音声を生成したと報告しています。別のケースでは、係数が 1.0 に丸められた層が音声の破綻を引き起こし、その原因の特定に1か月以上要したと述べています。著者らは、従来のテンソルレベルの類似度指標は TTS システムにおける知覚的音声品質の信頼できる指標ではなく、低精度展開にはエンドツーエンドの知覚検証が必要であると結論付けています。
制限事項と今後の課題
著者らは、特定の層は数値的に過度に敏感であり、知覚的劣化なしに低忠実度またはブロック浮動小数点実行を行うことができず、モデル全体の低精度カバレッジが制限されると述べており、さらにコンパイラおよびプログラム設定がまだ完全に最適化されていないことを指摘しています。
2026年9月28日の技術投稿で、Smallest.ai は Lightning V2 を、ブロック Float8 量子化と低精度演算を組み合わせて高品質な音声合成を実現する世界初の TTS モデルと位置付けました。同社は、より新しい Lightning V3 がすでに品質とアーキテクチャ効率の両面で V2 を上回っていると述べ、同様の共同設計原則に基づき Tenstorrent ハードウェア上で Lightning V3 を展開し、同等またはそれ以上のコスト突破を目指すとしています。












