Ortaklıklar

Yerinde Ses Ajanları, Smallest.ai Tenstorrent’a Katıldıktan Sonra Yeni Donanım Yolunu Kazanıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Tenstorrent ve Smallest.ai duyurdu 1 Ekim 2026’da, Smallest.ai’nın Lightning V2 gerçek zamanlı metin‑konuşma modelini yerel olarak Tenstorrent Galaxy Blackhole sunucuları üzerinde çalıştıran üretim‑düzeyi, yerinde ses AI yığını sunmak için bir ortaklık.

Tenstorrent, bir AI hesaplama şirketi ve Smallest.ai, gerçek zamanlı ses AI altyapısı inşa eden bir AI araştırma laboratuvarı, ortak yığının gerçek zamanlı ses uygulamaları için gereken performansı sağlarken dağıtım maliyetlerini azaltmak için tasarlandığını söyledi. Şirketler, Lightning V2’nin Blackhole mimarisinde çalıştırılmasının, kuruluşların yüksek hacimli, veri‑hassas iş yüklerini finans hizmetleri, telekom, sağlık ve kurumsal ortamlar gibi alanlarda tam veri egemenliğiyle tamamen yerinde gerçek zamanlı ses ajanları olarak işletmelerine olanak tanıdığını belirtti. Lightning V2, Tenstorrent donanımında hemen kullanılabilir; kullanım‑bazlı fiyatlandırma ve ön ödeme taahhüdü yok.

“Performans ve maliyet arasında bir seçim yapılmasına gerek olmamalı – Tenstorrent, mevcut iş akışlarının maliyetini azaltan ve tamamen yeni iş yüklerini pratik hâle getiren verimli ve ölçeklenebilir bir hesaplama altyapısı inşa etti,” dedi Tenstorrent’ta Strateji ve İş Geliştirme Başkan Yardımcısı Amr Elashmawi.

Galaxy Blackhole Donanımı

Duyuruda adı geçen sunucu platformu, 32 Blackhole ASIC’i etrafında inşa edilmiştir; bu ASIC’ler Block FP8 hesaplamada 23 PFLOPS sağlar ve 6,2 GB çip içi SRAM’i 2,9 PB/s ve 1 TB GDDR6 belleği 16 TB/s hızında sunar, Tenstorrent’un Galaxy özelliklerine göre. Her ASIC, on adet 400 GbE bağlantısı üzerinden 32 TB/s hızında bir hızlandırıcı kumaşı oluşturur ve sistemler en fazla 56 adet 800 GbE QSFP‑DD portu ile ölçeklenir. 6U hava soğutmalı kasada bir AMD EPYC 9004 ana işlemci, 576 GB’a kadar DDR5 bellek, Ubuntu 22.04 işletim sistemi bulunur, ortalama 8‑10 kW çeker ve liste fiyatı $160,000’dır.

Azaltılmış Hassasiyet Tasarımı ve Ölçülen Sonuçlar

Ortaklığın mühendisliği, Smallest.ai’nın Ranjith M S (Kıdemli AI Çıkarım Performans Mühendisi), CTO Akshat Mandloi ve CEO Sudarshan Kamath tarafından yazılan bir makalede belgelenmiştir; “TTS Çıkarım Ekonomisini Yeniden Yazma: Lightning V2, Tenstorrent’ta NVIDIA L40S’den 4 Kat Daha Düşük Maliyet Sağlıyor,” başlıklı. Makale ilk olarak 24 Mart 2026’da gönderilmiş ve 7 Nisan 2026’da revize edilmiştir.

Makalenin birinci yazarı Ranjith, duyuruda şunları söyledi: “Tenstorrent’un mimarisi mevcut paradigmalarından temelde farklıdır. NoC ve daha büyük SRAM ile çalışarak, karşılaştırılabilir GPU altyapısının maliyetinin bir kısmı karşılığında 4 kat kazanç elde ettik ve çıkarım ekonomisinde yapısal bir değişim yarattık.”

Yazarlar, metin‑konuşma modellerinin büyük dil modellerine göre sayısal olarak çok daha kırılgan olduğunu, çünkü sürekli dalga biçimlerini yinelemeli iyileştirme yoluyla ürettiklerini ve küçük sayısal hataların gürültü giderme adımları boyunca birikerek duyulabilir artefaktlar oluşturduğunu rapor ediyor. Bu kısıtlamaya karşı, makale Lightning V2’nin katmanlarının %95’inden fazlasının LoFi hesaplama doğruluğunda çalıştığını ve modelin %80’inden fazlasının BlockFloat8’de ölçülebilir bir ses kalitesi düşüşü olmadan dağıtıldığını belirtiyor. Yazarlar ayrıca difüzyon akustik modelinde 4 kat, sinir vokoderinde 8 kat, model boyutunda yaklaşık 2 kat ve bellek aktarım hacminde 1,8 kat hesaplama azaltması rapor ediyor.

Çıktı kalitesi açısından, makale NVIDIA L40S referans modeli için 3.872 DNSMOS algısal puanı, Tenstorrent’un P150’si için ise 3.801 rapor ediyor; yazarlar bu 0.071 farkı küçük algısal varyasyon aralığı içinde olarak tanımlıyor ve iki sistemin çıktıları arasındaki normalize edilmiş kelime hata oranı 0.009 olarak belirtiliyor.

Tek cihaz testinde, makale L40S’nin 300 milisaniye gecikme ile 3 eşzamanlılık sağladığını ve cihaz fiyatının $9,000 olduğunu rapor ediyor; P150 ve P100 ise her biri 250 milisaniye gecikme ile 1 eşzamanlılık çalıştırmış ve fiyatları sırasıyla $1,400 ve $1,000 olarak listelenmiş, bu da sırasıyla 2.6 kat ve 3.6 kat maliyet kazancı sağlıyor. Lightning V2’nin çoklu çip paralelliği veya QSFP bağlantısı olmadan tek çipte çalışması nedeniyle, P100 gecikme değeri ölçülen P150 sonuçlarından aktarılmıştır, makale belirtiyor.

Filo ölçeğinde, yazarlar tam kullanımda aynı anda 550 beş saniyelik TTS isteği iş yükünü modelliyor. Bu iş yükünü sürdürmek için yaklaşık $100,000 hızlandırıcı maliyetinde 11 L40S GPU’ya ihtiyaç duyulacağını, buna karşı 27 P100 hızlandırıcı için yaklaşık $27,000 veya 27 P150 hızlandırıcı için yaklaşık $37,000 gerektiğini, modelledikleri karşılaştırmada ön maliyetin 3‑4 kat azaldığını hesaplıyorlar.

Makale ayrıca yaklaşık 6 milyar çarpma‑toplama işlemi içeren bir katmanın, L40S’de yaklaşık 60 mikrosaniye, P150’de ise yaklaşık 31 mikrosaniye sürede yürütüldüğünü rapor ediyor. Yazarlar, bu tür çekirdek‑seviyesi optimizasyonun daha fazla katmana uygulanmasının, L50S referansına göre 8‑12 kat maliyet‑normlu iyileşme sağlayabileceğini, mevcut 3.6 kat sistem‑seviyesi kazançtan daha yüksek bir değer olacağını öngörüyorlar.

Yazarlar, yerel BlockFloat8 desteğini bir donanım‑maliyet sınırı olarak çerçeveliyor: bu yeteneğe sahip güncel GPU’ların cihaz başına yaklaşık $40,000 fiyat sınıfında olduğunu, Tenstorrent’un ise BlockFloat8 yürütmesini yaklaşık $1,000 sınıfındaki donanımda mümkün kıldığını, satın alma maliyetinde bir mertebe farkı olduğunu rapor ediyor.

Sayısal Kırılganlık ve PCC Durumu

Bu makale, standart bir sayısal benzerlik ölçütü olan Pearson Korelasyon Katsayısı etrafında bir hata ayıklama vaka çalışmasını belgelemektedir. Yazarlar, L40S ve bir AMD EPYC 7352 CPU’dan gelen çıktının aynı girdilere rağmen yalnızca 0,72 son‑uç katsayısı gösterdiğini, ancak algısal olarak ayırt edilemez ses ürettiğini rapor ediyor. Başka bir örnekte, katsayısı 1,0’a yuvarlanan bir katman, izole edilmesi bir aydan fazla süren işitsel bir bozulmaya neden oldu. Yazarlar, geleneksel tensör‑seviyesi benzerlik ölçütlerinin TTS sistemlerinde algısal ses kalitesinin güvenilir göstergesi olmadığını ve düşük‑hassasiyetli dağıtımlar için uçtan‑uyağa algısal doğrulamanın gerekli olduğunu sonucuna varıyorlar.

Sınırlamalar ve Sonraki Adımlar

Yazarlar, belirli katmanların algısal bozulma olmaksızın düşük‑doğruluklu veya blok kayan nokta yürütmesi için aşırı sayısal hassasiyet göstermeye devam ettiğini, bu durumun tam model düşük‑hassasiyet kapsamını sınırladığını ve derleyici ile program yapılandırmalarının henüz tam olarak optimize edilmediğini belirtiyor.

Bir 28 Eylül 2026 teknik gönderi içinde, Smallest.ai, Lightning V2’yi ortak BlockFloat8 kuantizasyonu ve düşük‑hassasiyetli aritmetik altında yüksek kaliteli konuşma sentezi sağlayan dünyanın ilk TTS modeli olarak tanımladı. Şirket, daha yeni Lightning V3’ün zaten kalite ve mimari verimlilik açısından V2’yi aştığını ve aynı ortak‑tasarım ilkeleriyle Lightning V3’ü Tenstorrent donanımında dağıtmayı planladığını, benzer ya da daha büyük maliyet atılımları hedeflediğini söyledi.

Theo Nash AI tarafından oluşturulan bir uzman Unite.AI'de, AI altyapısı, hesaplama ve modern yapay zekayı güçlendiren donanım sistemlerini kapsar. Çalışması, büyük ölçekli AI iş yüklerinin teknik temellerine odaklanır; veri merkezleri, hızlandırıcılar, ağ ve bunları birleştiren yazılım yığınları dahil.

Analitik ve mühendislik odaklı bir bakış açısıyla, Theo GPU'larda, özel silikonlarda, bellek mimarilerinde ve dağıtık sistemlerdeki ilerlemelerin yeni nesil AI modellerini nasıl mümkün kıldığını inceler. Performans ödünleşimleri, enerji verimliliği, ölçeklenebilirlik ve AI altyapısının gerçek dünyadaki dağıtımını şekillendiren pratik kısıtlamalara özellikle dikkat eder.

Theo Nash tarafından yazılan makaleler AI tarafından oluşturulmuş olup, Unite.AI’nin editöryal ekibi tarafından teknik doğruluk, açıklık ve hızla evrilen AI hesaplama ortamının sorumlu bir şekilde ele alınmasını sağlamak için gözden geçirilir.