Kemitraan

Agen Suara On-Prem Mendapat Jalur Perangkat Keras Baru Saat Smallest.ai Bergabung dengan Tenstorrent

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Tenstorrent dan Smallest.ai mengumumkan kemitraan pada 1 Oktober 2026, untuk menyediakan tumpukan AI suara kelas produksi, yang dijalankan di lingkungan on-premises, yang menjalankan model teks-ke-suara waktu nyata Lightning V2 milik Smallest.ai secara native pada server Tenstorrent Galaxy Blackhole.

Tenstorrent, sebuah perusahaan komputasi AI, dan Smallest.ai, sebuah laboratorium riset AI yang membangun infrastruktur AI suara waktu nyata, mengatakan bahwa tumpukan bersama ini dirancang untuk mengurangi biaya penerapan sambil memberikan kinerja yang diperlukan untuk aplikasi suara waktu nyata. Kedua perusahaan menyatakan bahwa menjalankan Lightning V2 pada arsitektur Blackhole memungkinkan organisasi mengoperasikan agen suara waktu nyata sepenuhnya on-prem dengan kedaulatan data penuh, menargetkan beban kerja volume tinggi dan sensitif data di layanan keuangan, telekomunikasi, perawatan kesehatan, dan lingkungan perusahaan. Lightning V2 tersedia pada perangkat keras Tenstorrent segera, dengan harga berbasis penggunaan dan tanpa komitmen di muka.

“Tidak seharusnya ada pilihan antara kinerja dan biaya – Tenstorrent telah membangun komputasi yang efisien dan skalabel yang mengurangi biaya alur kerja yang ada dan menjadikan beban kerja baru sepenuhnya praktis,” kata Amr Elashmawi, Wakil Presiden Strategi & Pengembangan Bisnis di Tenstorrent.

Perangkat Keras Galaxy Blackhole

Platform server yang disebutkan dalam pengumuman dibangun di sekitar 32 ASIC Blackhole yang menyediakan 23 PFLOPS komputasi Block FP8, dengan 6,2 GB SRAM di dalam chip pada 2,9 PB/s dan 1 TB memori GDDR6 pada 16 TB/s, menurut spesifikasi Galaxy Tenstorrent. Setiap ASIC terhubung melalui sepuluh tautan 400 GbE untuk fabrik akselerator 32 TB/s, dan sistem dapat ditingkatkan melalui hingga 56 port 800 GbE QSFP‑DD. Chassis 6U berpendingin udara menggabungkan prosesor host AMD EPYC 9004 dengan hingga 576 GB memori DDR5, menjalankan Ubuntu 22.04, mengonsumsi rata‑rata 8 hingga 10 kW, dan memiliki harga daftar $160,000.

Desain Presisi Tereduksi dan Hasil Terukur

Rekayasa di balik kemitraan ini didokumentasikan dalam sebuah makalah, “Menulis Ulang Ekonomi Inferensi TTS: Lightning V2 pada Tenstorrent Mencapai Biaya 4x Lebih Rendah daripada NVIDIA L40S,” yang ditulis oleh Ranjith M S dari Smallest.ai, Senior AI Inference Performance Engineer; Chief Technology Officer Akshat Mandloi; dan Chief Executive Officer Sudarshan Kamath. Makalah tersebut pertama kali diserahkan pada 24 Maret 2026, dan direvisi pada 7 April 2026.

Ranjith, penulis pertama makalah tersebut, mengatakan dalam pengumuman: “Arsitektur Tenstorrent secara fundamental berbeda dari paradigma yang ada. Dengan bekerja bersama NoC dan SRAM yang lebih besar, kami membuka peningkatan 4x dengan sebagian kecil biaya infrastruktur GPU yang sebanding, mendorong pergeseran struktural dalam ekonomi inferensi.”

Para penulis melaporkan bahwa model teks-ke-suara secara signifikan lebih rapuh secara numerik dibandingkan model bahasa besar karena mereka menghasilkan gelombang kontinu melalui penyempurnaan iteratif, sehingga kesalahan numerik kecil terakumulasi sepanjang langkah denoising dan muncul sebagai artefak terdengar. Mengatasi batasan tersebut, makalah melaporkan bahwa lebih dari 95 % lapisan Lightning V2 berjalan pada fidelitas komputasi LoFi dan lebih dari 80 % model diterapkan dalam BlockFloat8 tanpa degradasi kualitas audio yang terukur. Penulis juga melaporkan pengurangan komputasi 4x pada model akustik difusi, pengurangan komputasi 8x pada vokoder neural, pengurangan ukuran model sekitar 2x, dan pengurangan volume transfer memori 1,8x.

Mengenai kualitas output, makalah melaporkan skor perseptual DNSMOS sebesar 3,872 untuk baseline NVIDIA L40S dibandingkan 3,801 pada P150 milik Tenstorrent, selisih 0,071 yang digambarkan penulis sebagai berada dalam rentang variasi perseptual kecil, serta tingkat kesalahan kata ternormalkan sebesar 0,009 antara output kedua sistem.

Dalam pengujian satu perangkat, makalah melaporkan L40S mempertahankan konkruensi 3 dengan latensi 300 milidetik dengan biaya perangkat terdaftar $9,000, sementara P150 dan P100 masing‑masing menjalankan konkruensi 1 dengan latensi 250 milidetik dengan biaya terdaftar $1,400 dan $1,000, menghasilkan peningkatan biaya masing‑masing sebesar 2,6x dan 3,6x. Karena Lightning V2 dijalankan pada satu chip tanpa paralelisme multi‑chip atau interkoneksi QSFP, angka latensi P100 diadopsi dari hasil P150 yang diukur, catatan makalah.

Pada skala armada, penulis memodelkan beban kerja sebesar 550 permintaan TTS simultan berdurasi lima detik dengan pemanfaatan penuh. Mereka menghitung bahwa untuk mempertahankannya diperlukan 11 GPU L40S dengan biaya akselerator sekitar $100,000, dibandingkan 27 akselerator P100 dengan biaya sekitar $27,000 atau 27 akselerator P150 dengan biaya sekitar $37,000, menghasilkan pengurangan biaya di muka sebesar 3‑4x dalam perbandingan model mereka.

Makalah juga melaporkan bahwa satu lapisan yang sangat dioptimalkan dengan kira‑kira 6 miliar operasi perkalian‑akumulasi dijalankan dalam sekitar 60 mikrodetik pada L40S dibandingkan sekitar 31 mikrodetik pada P150. Penulis memperkirakan bahwa memperluas optimisasi tingkat kernel semacam itu ke lebih banyak lapisan dapat menghasilkan perbaikan ternormalkan biaya sebesar 8‑12x dibandingkan baseline L40S, naik dari peningkatan tingkat sistem saat ini sebesar 3,6x.

Penulis menggambarkan dukungan native BlockFloat8 sebagai garis pembatas biaya perangkat keras: GPU modern dengan kemampuan tersebut berada di kelas harga sekitar $40,000 per perangkat, menurut laporan mereka, sementara Tenstorrent memungkinkan eksekusi BlockFloat8 pada perangkat keras kelas sekitar $1,000, selisih satu orde besaran dalam biaya akuisisi sebagaimana dijelaskan.

Kerapuhan Numerik dan Kasus PCC

Makalah ini mendokumentasikan studi kasus debugging terkait Pearson Correlation Coefficient, sebuah metrik kesamaan numerik standar. Penulis melaporkan bahwa output dari L40S dan CPU AMD EPYC 7352 menunjukkan koefisien end-to-end hanya 0,72 meskipun inputnya identik, namun menghasilkan audio yang secara persepsi tidak dapat dibedakan. Dalam contoh terpisah, sebuah lapisan yang koefisiennya dibulatkan menjadi 1,0 menyebabkan kerusakan audibel yang memakan waktu lebih dari satu bulan untuk diisolasi. Penulis menyimpulkan bahwa metrik kesamaan pada tingkat tensor konvensional tidak dapat diandalkan sebagai indikator kualitas audio perseptual dalam sistem TTS, dan bahwa validasi perseptual end-to-end diperlukan untuk penerapan dengan presisi tereduksi.

Keterbatasan dan Langkah Selanjutnya

Penulis menyatakan bahwa beberapa lapisan masih terlalu sensitif secara numerik untuk eksekusi dengan fidelitas tereduksi atau block floating-point tanpa degradasi perseptual, membatasi cakupan presisi rendah pada model penuh, dan bahwa konfigurasi kompiler serta program belum sepenuhnya dioptimalkan.

Dalam sebuah 28 September 2026 posting teknis, Smallest.ai menggambarkan Lightning V2 sebagai model TTS pertama di dunia yang menghasilkan sintesis suara berkualitas tinggi dengan kuantisasi BlockFloat8 gabungan dan aritmetika presisi tereduksi. Perusahaan menyatakan bahwa Lightning V3 yang lebih baru sudah melampaui V2 dalam kualitas dan efisiensi arsitektur, serta berencana untuk menerapkan Lightning V3 pada perangkat keras Tenstorrent dengan prinsip co‑design yang sama, menargetkan terobosan biaya yang serupa atau lebih besar.

Theo Nash adalah seorang spesialis yang dihasilkan AI di Unite.AI, yang mencakup infrastruktur AI, komputasi, dan sistem perangkat keras yang mendukung kecerdasan buatan modern. Pekerjaannya berfokus pada fondasi teknis di balik beban kerja AI berskala besar, termasuk pusat data, akselerator, jaringan, dan tumpukan perangkat lunak yang menghubungkannya.

Dengan perspektif analitis dan berorientasi rekayasa, Theo meneliti bagaimana kemajuan pada GPU, silikon khusus, arsitektur memori, dan sistem terdistribusi memungkinkan generasi baru model AI. Ia memberi perhatian khusus pada kompromi kinerja, efisiensi energi, skalabilitas, serta kendala praktis yang membentuk penerapan infrastruktur AI di dunia nyata.

Artikel yang ditulis oleh Theo Nash dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi teknis, kejelasan, dan liputan yang bertanggung jawab atas lanskap komputasi AI yang berkembang cepat.