साझेदारियाँ

ऑन-प्रेम वॉइस एजेंट्स को नया हार्डवेयर मार्ग मिला जब Smallest.ai ने Tenstorrent में शामिल हुआ

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Tenstorrent और Smallest.ai ने 1 अक्टूबर, 2026 को एक साझेदारी घोषित किया ताकि एक प्रोडक्शन-ग्रेड, ऑन-प्रेम वॉइस AI स्टैक प्रदान किया जा सके जो Smallest.ai के Lightning V2 रियल-टाइम टेक्स्ट-टू-स्पीच मॉडल को मूल रूप से Tenstorrent Galaxy Blackhole सर्वर पर चलाता है।

Tenstorrent, एक AI कंप्यूट कंपनी, और Smallest.ai, एक AI रिसर्च लैब जो रियल-टाइम वॉइस AI इन्फ्रास्ट्रक्चर बना रही है, ने कहा कि संयुक्त स्टैक को डिप्लॉयमेंट लागत को कम करने के लिए डिज़ाइन किया गया है जबकि रियल-टाइम वॉइस एप्लिकेशनों के लिए आवश्यक प्रदर्शन प्रदान करता है। कंपनियों ने कहा कि ब्लैकहोल आर्किटेक्चर पर Lightning V2 चलाने से संगठन पूरी तरह से ऑन-प्रेम रियल-टाइम वॉइस एजेंट्स को पूर्ण डेटा सार्वभौमिकता के साथ संचालित कर सकते हैं, और यह वित्तीय सेवाओं, टेलीकॉम, स्वास्थ्य देखभाल, और एंटरप्राइज़ पर्यावरण में उच्च-वॉल्यूम, डेटा-संवेदनशील कार्यभार को लक्षित करता है। Lightning V2 Tenstorrent हार्डवेयर पर तुरंत उपलब्ध है, उपयोग-आधारित मूल्य निर्धारण और कोई अग्रिम प्रतिबद्धता नहीं के साथ।

“प्रदर्शन और लागत के बीच चयन की आवश्यकता नहीं होनी चाहिए – Tenstorrent ने कुशल और स्केलेबल कंप्यूट बनाया है जो मौजूदा वर्कफ़्लो की लागत को कम करता है और पूरी तरह नए वर्कलोड को व्यावहारिक बनाता है,” Tenstorrent में Strategy & Business Development के उपाध्यक्ष Amr Elashmawi ने कहा।

Galaxy Blackhole हार्डवेयर

घोषणा में नामित सर्वर प्लेटफ़ॉर्म 32 Blackhole ASICs के चारों ओर निर्मित है जो 23 PFLOPS की Block FP8 कंप्यूट प्रदान करते हैं, साथ ही 6.2 GB ऑन-चिप SRAM 2.9 PB/s पर और 1 TB GDDR6 मेमोरी 16 TB/s पर, Tenstorrent की Galaxy विशिष्टताएँ के अनुसार। प्रत्येक ASIC दस 400 GbE लिंक के माध्यम से 32 TB/s एक्सेलेरेटर फैब्रिक से जुड़ता है, और सिस्टम अधिकतम 56 800 GbE QSFP-DD पोर्ट्स के माध्यम से स्केल आउट होते हैं। 6U एयर-कूल्ड चेसिस AMD EPYC 9004 होस्ट प्रोसेसर को अधिकतम 576 GB DDR5 मेमोरी के साथ जोड़ता है, Ubuntu 22.04 चलाता है, औसतन 8 से 10 kW खपत करता है, और इसकी सूची मूल्य $160,000 है।

कम-प्रेसिशन डिज़ाइन और मापे गए परिणाम

साझेदारी के पीछे का इंजीनियरिंग एक पेपर में दस्तावेज़ित है, “पुनर्लेखन TTS इनफ़रेंस अर्थशास्त्र: Lightning V2 ने Tenstorrent पर NVIDIA L40S की तुलना में 4x कम लागत हासिल की,” जिसे Smallest.ai के Ranjith M S, वरिष्ठ AI इनफ़रेंस प्रदर्शन इंजीनियर; मुख्य तकनीकी अधिकारी Akshat Mandloi; और मुख्य कार्यकारी अधिकारी Sudarshan Kamath ने लिखा है। यह पेपर पहली बार 24 मार्च, 2026 को प्रस्तुत किया गया था, और 7 अप्रैल, 2026 को संशोधित किया गया।

Ranjith, पेपर के प्रथम लेखक, ने घोषणा में कहा: “Tenstorrent की आर्किटेक्चर मौजूदा पैरेडाइम्स से मूलतः अलग है। NoC और बड़े SRAM के साथ काम करके, हमने तुलनीय GPU इन्फ्रास्ट्रक्चर की लागत के एक अंश पर 4x लाभ हासिल किए, जिससे इनफ़रेंस अर्थशास्त्र में एक संरचनात्मक बदलाव आया।”

लेखकों ने बताया कि टेक्स्ट-टू-स्पीच मॉडल बड़े भाषा मॉडलों की तुलना में संख्यात्मक रूप से काफी अधिक नाज़ुक होते हैं क्योंकि वे क्रमिक सुधार के माध्यम से निरंतर वेवफ़ॉर्म उत्पन्न करते हैं, जिससे छोटे संख्यात्मक त्रुटियाँ डिनॉइज़िंग चरणों में जुड़कर सुनने योग्य कलाकृतियों के रूप में प्रकट होती हैं। इस सीमा के बावजूद, पेपर रिपोर्ट करता है कि Lightning V2 की 95% से अधिक लेयर्स LoFi कम्प्यूटेशनल फ़िडेलिटी पर चलती हैं और मॉडल का 80% से अधिक भाग BlockFloat8 में बिना मापनीय ऑडियो गुणवत्ता गिरावट के तैनात होता है। लेखक additionally 4x कम्प्यूट कमी डिफ्यूज़न अकौस्टिक मॉडल में, 8x कम्प्यूट कमी न्यूरल वोकोडर में, लगभग 2x मॉडल आकार में कमी, और 1.8x मेमोरी ट्रांसफ़र वॉल्यूम में कमी की भी रिपोर्ट करते हैं।

आउटपुट गुणवत्ता के संदर्भ में, पेपर रिपोर्ट करता है कि NVIDIA L40S बेसलाइन के लिए DNSMOS परसेप्चुअल स्कोर 3.872 है, जबकि Tenstorrent के P150 पर 3.801 है, 0.071 का अंतर जिसे लेखक मामूली परसेप्चुअल परिवर्तन की सीमा में मानते हैं, और दोनों सिस्टम के आउटपुट के बीच सामान्यीकृत शब्द त्रुटि दर 0.009 है।

एकल-डिवाइस परीक्षण में, पेपर रिपोर्ट करता है कि L40S ने $9,000 की सूचीबद्ध डिवाइस लागत के खिलाफ 300 मिलीसेकंड लेटेंसी पर 3 की समवर्तीता बनाए रखी, जबकि P150 और P100 ने क्रमशः $1,400 और $1,000 की सूचीबद्ध लागत पर 250 मिलीसेकंड लेटेंसी पर 1 की समवर्तीता चलायी, जिससे क्रमशः 2.6x और 3.6x की लागत बचत रिपोर्ट की गई। चूँकि Lightning V2 एकल चिप पर बिना मल्टी-चिप पैरललिज़्म या QSFP इंटरकनेक्ट के चलता है, पेपर नोट करता है कि P100 की लेटेंसी संख्या मापी गई P150 परिणामों से ली गई है।

फ़्लीट स्केल पर, लेखक 550 समकालिक पाँच-सेकंड TTS अनुरोधों को पूर्ण उपयोग में मॉडल करते हैं। उन्होंने गणना की कि इसे बनाए रखने के लिए लगभग $100,000 के एक्सेलेरेटर लागत पर 11 L40S GPU की आवश्यकता होगी, जबकि 27 P100 एक्सेलेरेटर लगभग $27,000 पर या 27 P150 एक्सेलेरेटर लगभग $37,000 पर, जिससे उनके मॉडल तुलना में अग्रिम लागत में 3-4x की कमी आती है।

पेपर यह भी रिपोर्ट करता है कि लगभग 6 अरब मल्टिप्लाई-एक्यूमुलेट ऑपरेशन्स वाला एक अत्यधिक अनुकूलित लेयर L40S पर लगभग 60 माइक्रोसेकंड में चलता है, जबकि P150 पर लगभग 31 माइक्रोसेकंड में। लेखक अनुमान लगाते हैं कि ऐसे कर्नेल-स्तर अनुकूलन को अधिक लेयर्स में विस्तारित करने से L40S बेसलाइन की तुलना में 8-12x लागत-नॉर्मलाइज़्ड सुधार मिल सकता है, जो वर्तमान 3.6x सिस्टम-स्तर लाभ से ऊपर है।

लेखक मूल BlockFloat8 समर्थन को हार्डवेयर-लागत विभाजन रेखा के रूप में प्रस्तुत करते हैं: वे रिपोर्ट करते हैं कि इस क्षमता वाले समकालीन GPU प्रति डिवाइस लगभग $40,000 की मूल्य वर्ग में आते हैं, जबकि Tenstorrent लगभग $1,000 वर्ग के हार्डवेयर पर BlockFloat8 निष्पादन सक्षम करता है, जिससे अधिग्रहण लागत में एक क्रम magnitude अंतर उत्पन्न होता है।

संख्यात्मक नाज़ुकता और PCC मामला

यह पेपर पियर्सन सहसंबंध गुणांक (Pearson Correlation Coefficient) के आसपास एक डिबगिंग केस स्टडी को दस्तावेज़ करता है, जो एक मानक संख्यात्मक समानता मीट्रिक है। लेखकों ने रिपोर्ट किया कि L40S और AMD EPYC 7352 CPU से प्राप्त आउटपुट ने समान इनपुट के बावजूद केवल 0.72 का एंड‑टू‑एंड गुणांक दिखाया, फिर भी ध्वनि रूप से अपरिचित ऑडियो उत्पन्न किया। एक अलग मामले में, एक लेयर जिसका गुणांक 1.0 तक गोल हो गया था, ने सुनने योग्य टूटन पैदा की जिसे अलग करने में एक महीने से अधिक समय लगा। लेखक निष्कर्ष निकालते हैं कि पारंपरिक टेन्सर‑स्तरीय समानता मीट्रिक TTS सिस्टम में ध्वनि की धारणात्मक गुणवत्ता के विश्वसनीय संकेतक नहीं हैं, और कम‑प्रेसिशन डिप्लॉयमेंट के लिए एंड‑टू‑एंड धारणात्मक मान्यकरण आवश्यक है।

सीमाएँ और अगले कदम

लेखक बताते हैं कि कुछ लेयरें कम‑फ़िडेलिटी या ब्लॉक फ्लोटिंग‑पॉइंट निष्पादन के लिए अत्यधिक संख्यात्मक रूप से संवेदनशील बनी रहती हैं, जिससे धारणात्मक गिरावट के बिना संचालन संभव नहीं है, यह पूर्ण मॉडल की कम‑प्रेसिशन कवरेज को सीमित करता है, और कंपाइलर तथा प्रोग्राम कॉन्फ़िगरेशन अभी तक पूरी तरह से अनुकूलित नहीं हुए हैं।

In a 28 सितंबर, 2026 तकनीकी पोस्ट, Smallest.ai ने Lightning V2 को विश्व का पहला TTS मॉडल बताया जो संयुक्त BlockFloat8 क्वांटाइज़ेशन और कम‑प्रेसिशन अंकगणित के तहत उच्च‑गुणवत्ता वाली आवाज़ संश्लेषण प्रदान करता है। कंपनी ने कहा कि उसका नया Lightning V3 पहले से ही गुणवत्ता और वास्तुशिल्प दक्षता में V2 से बेहतर है, और वह Lightning V3 को Tenstorrent हार्डवेयर पर समान सह‑डिज़ाइन सिद्धांतों के साथ तैनात करने की योजना बना रहा है, जिससे समान या अधिक लागत में महत्वपूर्ण प्रगति हासिल की जा सके।

Theo Nash एक AI-जनित विशेषज्ञ हैं Unite.AI में, जो AI इन्फ्रास्ट्रक्चर, कंप्यूट, और आधुनिक कृत्रिम बुद्धिमत्ता को शक्ति देने वाले हार्डवेयर सिस्टम को कवर करते हैं। उनका काम बड़े पैमाने पर AI वर्कलोड्स के तकनीकी आधार पर केंद्रित है, जिसमें डेटा सेंटर, एक्सेलेरेटर, नेटवर्किंग, और उन्हें जोड़ने वाले सॉफ्टवेयर स्टैक शामिल हैं।

एक विश्लेषणात्मक और इंजीनियरिंग-उन्मुख दृष्टिकोण के साथ, Theo यह जांचते हैं कि GPUs, कस्टम सिलिकॉन, मेमोरी आर्किटेक्चर, और वितरित सिस्टम में प्रगति नई पीढ़ियों के AI मॉडल को कैसे सक्षम बनाती है। वे प्रदर्शन समझौते, ऊर्जा दक्षता, स्केलेबिलिटी, और व्यावहारिक प्रतिबंधों पर विशेष ध्यान देते हैं जो वास्तविक दुनिया में AI इन्फ्रास्ट्रक्चर की तैनाती को आकार देते हैं।

Theo Nash द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा तकनीकी शुद्धता, स्पष्टता, और तेजी से विकसित हो रहे AI कंप्यूट परिदृश्य की जिम्मेदार कवरेज सुनिश्चित करने के लिए समीक्षा किए जाते हैं।