合作伙伴

本地部署语音代理获得新硬件路径,Smallest.ai 加入 Tenstorrent

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Tenstorrent 和 Smallest.ai 宣布 于 2026 年 10 月 1 日建立合作伙伴关系,以提供可在生产环境使用的本地语音 AI 堆栈,该堆栈可在 Tenstorrent Galaxy Blackhole 服务器 上原生运行 Smallest.ai 的 Lightning V2 实时文本转语音模型。

Tenstorrent 是一家 AI 计算公司,Smallest.ai 是一家构建实时语音 AI 基础设施的 AI 研究实验室,双方表示,联合堆栈旨在降低部署成本,同时提供实时语音应用所需的性能。两家公司称,在 Blackhole 架构上运行 Lightning V2 可让组织在本地完全运行实时语音代理,确保完整的数据主权,面向金融服务、电信、医疗保健和企业环境中的高容量、数据敏感工作负载。Lightning V2 已可立即在 Tenstorrent 硬件上使用,采用按使用计费,无需前期承诺。

“在性能与成本之间不应存在抉择——Tenstorrent 已构建高效且可扩展的计算能力,降低现有工作流成本,并使全新工作负载变得可行,” Tenstorrent 的战略与业务发展副总裁 Amr Elashmawi 说道。

Galaxy Blackhole 硬件

根据 Tenstorrent 的 Galaxy 规格,公告中提到的服务器平台基于 32 块 Blackhole ASIC,提供 23 PFLOPS 的 Block FP8 计算能力,片上 SRAM 为 6.2 GB,带宽为 2.9 PB/s,GDDR6 内存为 1 TB,带宽为 16 TB/s。每个 ASIC 通过十个 400 GbE 链接连接,形成 32 TB/s 的加速器网络,系统可通过最多 56 个 800 GbE QSFP-DD 端口进行扩展。该 6U 风冷机箱配备 AMD EPYC 9004 主处理器,最高可搭配 576 GB DDR5 内存,运行 Ubuntu 22.04,平均功耗为 8 至 10 kW,官方指导价为 $160,000。

低精度设计与测量结果

该工程合作的背后技术记录在一篇论文中,“《重写 TTS 推理经济学:Lightning V2 在 Tenstorrent 上实现比 NVIDIA L40S 低 4 倍的成本》,”,作者为 Smallest.ai 的 Ranjith M S(高级 AI 推理性能工程师)、首席技术官 Akshat Mandloi 和首席执行官 Sudarshan Kamath。该论文首次提交于 2026 年 3 月 24 日,随后于 2026 年 4 月 7 日修订。

Ranjith,论文的第一作者,在公告中表示:“Tenstorrent 的架构与现有范式根本不同。通过使用 NoC 和更大的 SRAM,我们在成本仅为可比 GPU 基础设施的一小部分的情况下实现了 4 倍的提升,推动了推理经济学的结构性转变。”

作者报告称,文本转语音模型在数值上显著比大型语言模型更脆弱,因为它们通过迭代细化生成连续波形,微小的数值误差会在去噪步骤中累积并表现为可听的伪影。针对这一限制,论文指出,超过 95% 的 Lightning V2 层在 LoFi 计算精度下运行,超过 80% 的模型以 BlockFloat8 部署,且音频质量无可测量的下降。作者还报告了扩散声学模型计算量降低 4 倍,神经声码器计算量降低 8 倍,模型规模约降低 2 倍,内存传输量降低 1.8 倍。

在输出质量方面,论文报告 NVIDIA L40S 基准的 DNSMOS 感知得分为 3.872,而 Tenstorrent 的 P150 为 3.801,两者相差 0.071,作者称其属于轻微感知差异的范围;两套系统的输出之间的归一化词错误率为 0.009。

在单设备测试中,论文报告 L40S 在 300 毫秒延迟下保持 3 的并发度,上市价格为 $9,000;而 P150 和 P100 的并发度均为 1,延迟为 250 毫秒,上市价格分别为 $1,400 和 $1,000,报告的成本收益分别为 2.6 倍和 3.6 倍。由于 Lightning V2 在单芯片上运行,不涉及多芯片并行或 QSFP 互连,P100 的延迟数据沿用了对 P150 的测量结果,论文指出。

在舰队规模下,作者对 550 个同时进行、每个持续五秒的 TTS 请求在满负载情况下进行建模。计算表明,要维持该负载需要约 11 台 L40S GPU,加速器成本约为 $100,000;相比之下,需要 27 台 P100 加速器,成本约为 $27,000,或 27 台 P150 加速器,成本约为 $37,000,前期成本降低约 3-4 倍。

论文还报告称,一个约 60 亿乘加运算的高度优化层在 L40S 上执行约 60 微秒,而在 P150 上约为 31 微秒。作者推测,将此类内核级优化扩展到更多层次,可能在成本归一化后相对于 L40S 基准实现 8-12 倍的提升,高于当前 3.6 倍的系统级收益。

作者将原生 BlockFloat8 支持视为硬件成本的分界线:他们报告称,具备该能力的当代 GPU 每台约价 $40,000,而 Tenstorrent 能在约 $1,000 价位的硬件上实现 BlockFloat8 执行,采购成本相差一个数量级。

数值脆弱性与 PCC 案例

本文记录了围绕皮尔逊相关系数(Pearson Correlation Coefficient)的调试案例研究,该系数是一种标准的数值相似度度量。作者报告称,尽管输入相同,L40S 和 AMD EPYC 7352 CPU 的输出端到端系数仅为 0.72,但产生的音频在感知上几乎无差别。在另一例中,某层的系数四舍五入为 1.0,导致可听到的破裂问题,且该问题的定位耗时超过一个月。作者得出结论,传统的张量级相似度度量并非感知音频质量的可靠指标,在低精度部署中必须进行端到端的感知验证。

局限性与后续步骤

作者指出,某些层对数值仍然过于敏感,无法在降低保真度或块浮点执行时避免感知退化,这限制了整个模型的低精度覆盖,并且编译器和程序配置尚未完全优化。

在一篇2026年9月28日技术文章中,Smallest.ai 将 Lightning V2 描述为全球首个在 BlockFloat8 联合量化和低精度算术下实现高质量语音合成的 TTS 模型。该公司表示,其更新的 Lightning V3 已在质量和架构效率上超越 V2,并计划在 Tenstorrent 硬件上采用相同的协同设计原则部署 Lightning V3,旨在实现类似或更大的成本突破。

Theo Nash 是 Unite.AI 的 AI 生成专家,专注于 AI 基础设施、计算以及驱动现代人工智能的硬件系统。他的工作聚焦于大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接在一起的软件堆栈。

凭借分析性和工程导向的视角,Theo 检视 GPU、定制硅片、内存架构以及分布式系统的进步如何推动新一代 AI 模型的出现。他特别关注性能权衡、能效、可扩展性以及塑造 AI 基础设施真实部署的实际约束。

由 Theo Nash 撰写的文章为 AI 生成,并经 Unite.AI 编辑团队审阅,以确保技术准确性、清晰度以及对快速演变的 AI 计算格局的负责任报道。