Hợp tác
Các Trợ Lý Giọng Nói Tại Chỗ Nhận Đường Đi Phần Cứng Mới Khi Smallest.ai Tham Gia Tenstorrent

Tenstorrent và Smallest.ai đã công bố một quan hệ đối tác vào ngày 1 tháng 10, 2026, để cung cấp một bộ phần mềm AI giọng nói cấp sản xuất, chạy tại chỗ, cho phép mô hình chuyển văn bản thành giọng nói thời gian thực Lightning V2 của Smallest.ai hoạt động một cách nguyên bản trên Tenstorrent Galaxy Blackhole servers.
Tenstorrent, một công ty tính toán AI, và Smallest.ai, một phòng thí nghiệm nghiên cứu AI xây dựng hạ tầng AI giọng nói thời gian thực, cho biết bộ phần mềm chung được thiết kế để giảm chi phí triển khai đồng thời cung cấp hiệu năng cần thiết cho các ứng dụng giọng nói thời gian thực. Các công ty cho biết việc chạy Lightning V2 trên kiến trúc Blackhole cho phép các tổ chức vận hành trợ lý giọng nói thời gian thực hoàn toàn tại chỗ với quyền sở hữu dữ liệu đầy đủ, hướng tới các khối lượng công việc có khối lượng lớn và nhạy cảm về dữ liệu trong lĩnh vực dịch vụ tài chính, viễn thông, chăm sóc sức khỏe và môi trường doanh nghiệp. Lightning V2 có sẵn trên phần cứng Tenstorrent ngay lập tức, với mức giá dựa trên mức sử dụng và không yêu cầu cam kết trước.
“Không nên phải lựa chọn giữa hiệu năng và chi phí – Tenstorrent đã xây dựng khả năng tính toán hiệu quả và có khả năng mở rộng, giảm chi phí của các quy trình hiện có và làm cho các quy trình mới hoàn toàn khả thi,” ông Amr Elashmawi, Phó Chủ tịch Chiến lược & Phát triển Kinh doanh tại Tenstorrent phát biểu.
Phần Cứng Galaxy Blackhole
Nền tảng máy chủ được nêu trong thông báo được xây dựng dựa trên 32 ASIC Blackhole cung cấp 23 PFLOPS tính toán Block FP8, với 6,2 GB SRAM trên chip ở tốc độ 2,9 PB/s và 1 TB bộ nhớ GDDR6 ở tốc độ 16 TB/s, theo Tenstorrent’s Galaxy specifications. Mỗi ASIC kết nối qua mười liên kết 400 GbE để tạo thành một mạng tăng tốc 32 TB/s, và hệ thống mở rộng thông qua tối đa 56 cổng 800 GbE QSFP‑DD. Vỏ máy 6U làm mát bằng không khí ghép một bộ xử lý chủ AMD EPYC 9004 với tối đa 576 GB bộ nhớ DDR5, chạy Ubuntu 22.04, tiêu thụ trung bình từ 8 đến 10 kW, và có giá niêm yết $160,000.
Thiết Kế Độ Chính Xác Giảm và Kết Quả Đo Lường
Công trình kỹ thuật phía sau quan hệ đối tác được ghi lại trong một bài báo, “Viết Lại Kinh Tế Suy Luận TTS: Lightning V2 trên Tenstorrent Đạt Chi Phí Thấp Hơn 4 Lần So Với NVIDIA L40S,” do Ranjith M S của Smallest.ai, Kỹ sư Hiệu năng Suy luận AI Cấp cao; Giám đốc Công nghệ Akshat Mandloi; và Giám đốc Điều hành Sudarshan Kamath đồng tác giả. Bài báo lần đầu được nộp vào ngày 24 tháng 3, 2026, và được chỉnh sửa vào ngày 7 tháng 4, 2026.
Ranjith, tác giả chính của bài báo, cho biết trong thông báo: “Kiến trúc của Tenstorrent cơ bản khác biệt so với các mô hình hiện có. Khi làm việc với NoC và SRAM lớn hơn, chúng tôi đã mở khóa lợi nhuận gấp 4 lần với một phần chi phí so với hạ tầng GPU tương đương, tạo ra một sự chuyển đổi cấu trúc trong kinh tế suy luận.”
Các tác giả báo cáo rằng các mô hình chuyển văn bản thành giọng nói có độ mong manh số đáng kể hơn so với các mô hình ngôn ngữ lớn vì chúng tạo ra các dạng sóng liên tục thông qua quá trình tinh chỉnh lặp lại, do đó các lỗi số nhỏ tích lũy qua các bước khử nhiễu và xuất hiện dưới dạng các hiện tượng âm thanh không mong muốn. Đối mặt với hạn chế này, bài báo cho biết hơn 95 % các lớp của Lightning V2 chạy ở độ trung thực tính toán LoFi và hơn 80 % mô hình được triển khai ở chế độ BlockFloat8 mà không gây suy giảm chất lượng âm thanh có thể đo được. Các tác giả cũng báo cáo giảm 4 lần tính toán trong mô hình âm học khuếch tán, giảm 8 lần tính toán trong bộ tạo âm thần kinh, giảm khoảng 2 lần kích thước mô hình, và giảm 1,8 lần khối lượng truyền dữ liệu bộ nhớ.
Về chất lượng đầu ra, bài báo báo cáo điểm cảm nhận DNSMOS là 3.872 cho nền tảng NVIDIA L40S so với 3.801 trên P150 của Tenstorrent, chênh lệch 0.071 mà các tác giả mô tả là nằm trong phạm vi biến đổi cảm nhận nhỏ, và tỷ lệ lỗi từ chuẩn hoá là 0.009 giữa đầu ra của hai hệ thống.
Trong thử nghiệm trên một thiết bị duy nhất, bài báo cho biết L40S duy trì mức đồng thời 3 với độ trễ 300 ms với chi phí thiết bị niêm yết là $9,000, trong khi P150 và P100 mỗi cái chạy mức đồng thời 1 với độ trễ 250 ms với chi phí niêm yết lần lượt là $1,400 và $1,000, mang lại lợi nhuận chi phí được báo cáo là 2,6× và 3,6× tương ứng. Vì Lightning V2 thực thi trên một chip duy nhất mà không có tính song song đa chip hoặc kết nối QSFP, con số độ trễ của P100 được lấy từ kết quả đo của P150, bài báo ghi chú.
Ở quy mô đội tàu, các tác giả mô hình hoá một khối lượng công việc gồm 550 yêu cầu TTS kéo dài năm giây đồng thời với mức sử dụng đầy đủ. Họ tính toán rằng để duy trì sẽ cần 11 GPU L40S với chi phí tăng tốc khoảng $100,000, so với 27 bộ tăng tốc P100 với chi phí khoảng $27,000 hoặc 27 bộ tăng tốc P150 với chi phí khoảng $37,000, giảm 3‑4 lần chi phí đầu tư trong so sánh mô hình của họ.
Bài báo cũng cho biết một lớp được tối ưu hoá mạnh, thực hiện khoảng 6 tỷ phép nhân‑cộng, chạy trong khoảng 60 microgiây trên L40S so với khoảng 31 microgiây trên P150. Các tác giả dự đoán rằng việc mở rộng tối ưu hoá cấp kernel này sang nhiều lớp hơn có thể mang lại cải thiện chi phí chuẩn hoá từ 8‑12 lần so với nền tảng L40S, tăng từ mức tăng lợi nhuận hệ thống hiện tại là 3,6 lần.
Các tác giả đặt hỗ trợ BlockFloat8 nguyên bản như một ranh giới chi phí phần cứng: các GPU hiện đại có khả năng này nằm trong phân khúc giá khoảng $40,000 mỗi thiết bị, họ báo cáo, trong khi Tenstorrent cho phép thực thi BlockFloat8 trên phần cứng trong phân khúc khoảng $1,000, tạo ra sự khác biệt về một bậc độ trong chi phí mua sắm theo mô tả của họ.
Độ mong manh số học và trường hợp PCC
Bài báo ghi lại một nghiên cứu trường hợp gỡ lỗi xoay quanh Hệ số tương quan Pearson, một chỉ số tương đồng số học tiêu chuẩn. Các tác giả báo cáo rằng đầu ra từ L40S và một CPU AMD EPYC 7352 cho hệ số đầu cuối chỉ 0,72 mặc dù đầu vào giống hệt, nhưng tạo ra âm thanh không thể phân biệt được về mặt cảm nhận. Trong một trường hợp riêng, một lớp có hệ số làm tròn lên 1.0 đã gây ra sự cố âm thanh mà mất hơn một tháng mới xác định được nguyên nhân. Các tác giả kết luận rằng các chỉ số tương đồng ở mức tensor truyền thống không phải là chỉ báo đáng tin cậy cho chất lượng âm thanh cảm nhận trong các hệ thống TTS, và việc xác thực cảm nhận đầu cuối là cần thiết cho các triển khai độ chính xác giảm.
Hạn chế và các bước tiếp theo
Các tác giả cho biết một số lớp vẫn quá nhạy cảm về mặt số học đối với việc thực thi độ trung thực giảm hoặc block floating-point mà không gây suy giảm cảm nhận, làm hạn chế khả năng bao phủ độ chính xác thấp cho toàn bộ mô hình, và rằng các cấu hình trình biên dịch và chương trình vẫn chưa được tối ưu hoàn toàn.
Trong một bài đăng kỹ thuật ngày 28 tháng 9 năm 2026, Smallest.ai mô tả Lightning V2 là mô hình TTS đầu tiên trên thế giới có khả năng tạo ra giọng nói chất lượng cao dưới sự kết hợp của việc lượng tử BlockFloat8 và tính toán độ chính xác giảm. Công ty cho biết phiên bản Lightning V3 mới hơn của mình đã vượt qua V2 về chất lượng và hiệu suất kiến trúc, và họ dự định triển khai Lightning V3 trên phần cứng Tenstorrent với các nguyên tắc đồng thiết kế tương tự, nhằm đạt được những đột phá chi phí tương tự hoặc lớn hơn.












