合作伙伴
本地部署语音代理获得新硬件路径,Smallest.ai 加入 Tenstorrent

Tenstorrent 和 Smallest.ai 宣布 于 2026 年 10 月 1 日建立合作伙伴关系,以提供可在生产环境使用的本地语音 AI 堆栈,该堆栈可在 Tenstorrent Galaxy Blackhole 服务器 上原生运行 Smallest.ai 的 Lightning V2 实时文本转语音模型。
Tenstorrent 是一家 AI 计算公司,Smallest.ai 是一家构建实时语音 AI 基础设施的 AI 研究实验室,双方表示,联合堆栈旨在降低部署成本,同时提供实时语音应用所需的性能。两家公司称,在 Blackhole 架构上运行 Lightning V2 可让组织在本地完全运行实时语音代理,确保完整的数据主权,面向金融服务、电信、医疗保健和企业环境中的高容量、数据敏感工作负载。Lightning V2 已可立即在 Tenstorrent 硬件上使用,采用按使用计费,无需前期承诺。
“在性能与成本之间不应存在抉择——Tenstorrent 已构建高效且可扩展的计算能力,降低现有工作流成本,并使全新工作负载变得可行,” Tenstorrent 的战略与业务发展副总裁 Amr Elashmawi 说道。
Galaxy Blackhole 硬件
根据 Tenstorrent 的 Galaxy 规格,公告中提到的服务器平台基于 32 块 Blackhole ASIC,提供 23 PFLOPS 的 Block FP8 计算能力,片上 SRAM 为 6.2 GB,带宽为 2.9 PB/s,GDDR6 内存为 1 TB,带宽为 16 TB/s。每个 ASIC 通过十个 400 GbE 链接连接,形成 32 TB/s 的加速器网络,系统可通过最多 56 个 800 GbE QSFP-DD 端口进行扩展。该 6U 风冷机箱配备 AMD EPYC 9004 主处理器,最高可搭配 576 GB DDR5 内存,运行 Ubuntu 22.04,平均功耗为 8 至 10 kW,官方指导价为 $160,000。
低精度设计与测量结果
该工程合作的背后技术记录在一篇论文中,“《重写 TTS 推理经济学:Lightning V2 在 Tenstorrent 上实现比 NVIDIA L40S 低 4 倍的成本》,”,作者为 Smallest.ai 的 Ranjith M S(高级 AI 推理性能工程师)、首席技术官 Akshat Mandloi 和首席执行官 Sudarshan Kamath。该论文首次提交于 2026 年 3 月 24 日,随后于 2026 年 4 月 7 日修订。
Ranjith,论文的第一作者,在公告中表示:“Tenstorrent 的架构与现有范式根本不同。通过使用 NoC 和更大的 SRAM,我们在成本仅为可比 GPU 基础设施的一小部分的情况下实现了 4 倍的提升,推动了推理经济学的结构性转变。”
作者报告称,文本转语音模型在数值上显著比大型语言模型更脆弱,因为它们通过迭代细化生成连续波形,微小的数值误差会在去噪步骤中累积并表现为可听的伪影。针对这一限制,论文指出,超过 95% 的 Lightning V2 层在 LoFi 计算精度下运行,超过 80% 的模型以 BlockFloat8 部署,且音频质量无可测量的下降。作者还报告了扩散声学模型计算量降低 4 倍,神经声码器计算量降低 8 倍,模型规模约降低 2 倍,内存传输量降低 1.8 倍。
在输出质量方面,论文报告 NVIDIA L40S 基准的 DNSMOS 感知得分为 3.872,而 Tenstorrent 的 P150 为 3.801,两者相差 0.071,作者称其属于轻微感知差异的范围;两套系统的输出之间的归一化词错误率为 0.009。
在单设备测试中,论文报告 L40S 在 300 毫秒延迟下保持 3 的并发度,上市价格为 $9,000;而 P150 和 P100 的并发度均为 1,延迟为 250 毫秒,上市价格分别为 $1,400 和 $1,000,报告的成本收益分别为 2.6 倍和 3.6 倍。由于 Lightning V2 在单芯片上运行,不涉及多芯片并行或 QSFP 互连,P100 的延迟数据沿用了对 P150 的测量结果,论文指出。
在舰队规模下,作者对 550 个同时进行、每个持续五秒的 TTS 请求在满负载情况下进行建模。计算表明,要维持该负载需要约 11 台 L40S GPU,加速器成本约为 $100,000;相比之下,需要 27 台 P100 加速器,成本约为 $27,000,或 27 台 P150 加速器,成本约为 $37,000,前期成本降低约 3-4 倍。
论文还报告称,一个约 60 亿乘加运算的高度优化层在 L40S 上执行约 60 微秒,而在 P150 上约为 31 微秒。作者推测,将此类内核级优化扩展到更多层次,可能在成本归一化后相对于 L40S 基准实现 8-12 倍的提升,高于当前 3.6 倍的系统级收益。
作者将原生 BlockFloat8 支持视为硬件成本的分界线:他们报告称,具备该能力的当代 GPU 每台约价 $40,000,而 Tenstorrent 能在约 $1,000 价位的硬件上实现 BlockFloat8 执行,采购成本相差一个数量级。
数值脆弱性与 PCC 案例
本文记录了围绕皮尔逊相关系数(Pearson Correlation Coefficient)的调试案例研究,该系数是一种标准的数值相似度度量。作者报告称,尽管输入相同,L40S 和 AMD EPYC 7352 CPU 的输出端到端系数仅为 0.72,但产生的音频在感知上几乎无差别。在另一例中,某层的系数四舍五入为 1.0,导致可听到的破裂问题,且该问题的定位耗时超过一个月。作者得出结论,传统的张量级相似度度量并非感知音频质量的可靠指标,在低精度部署中必须进行端到端的感知验证。
局限性与后续步骤
作者指出,某些层对数值仍然过于敏感,无法在降低保真度或块浮点执行时避免感知退化,这限制了整个模型的低精度覆盖,并且编译器和程序配置尚未完全优化。
在一篇2026年9月28日技术文章中,Smallest.ai 将 Lightning V2 描述为全球首个在 BlockFloat8 联合量化和低精度算术下实现高质量语音合成的 TTS 模型。该公司表示,其更新的 Lightning V3 已在质量和架构效率上超越 V2,并计划在 Tenstorrent 硬件上采用相同的协同设计原则部署 Lightning V3,旨在实现类似或更大的成本突破。












