Партнерства

On-Prem голосові агенти отримують новий апаратний шлях, оскільки Smallest.ai приєднується до Tenstorrent

mm
Додайте Unite.AI до бажаних джерел у Google

Tenstorrent і Smallest.ai оголосили партнерство 1 жовтня 2026 року, щоб надати виробничого класу, локальний on‑premises стек голосового ШІ, який запускає реальний час модель текст‑у‑мову Lightning V2 від Smallest.ai безпосередньо на Tenstorrent Galaxy Blackhole servers.

Tenstorrent, компанія з обчислень ШІ, і Smallest.ai, лабораторія досліджень ШІ, що створює інфраструктуру голосового ШІ в реальному часі, заявили, що спільний стек розроблений для зниження витрат на розгортання, забезпечуючи при цьому продуктивність, необхідну для застосувань голосу в реальному часі. Компанії зазначили, що запуск Lightning V2 на архітектурі Blackhole дозволяє організаціям повністю працювати з голосовими агентами в реальному часі локально, з повним суверенітетом даних, орієнтуючись на високонавантажені, чутливі до даних навантаження у фінансових послугах, телекомунікаціях, охороні здоров’я та корпоративному середовищі. Lightning V2 доступний на апаратному забезпеченні Tenstorrent негайно, за моделлю ціноутворення на основі використання без початкових зобов’язань.

“Не має бути вибору між продуктивністю та вартістю – Tenstorrent створив ефективні та масштабовані обчислення, які знижують витрати на існуючі робочі процеси та роблять цілком нові навантаження практичними”, — сказав Амр Елашмаві, віце‑президент зі стратегії та розвитку бізнесу в Tenstorrent.

Апаратне забезпечення Galaxy Blackhole

Платформа серверів, названу в анонсі, побудована навколо 32 ASIC Blackhole, що забезпечують 23 PFLOPS обчислень Block FP8, з 6,2 ГБ внутрішньої SRAM зі швидкістю 2,9 PB/s та 1 ТБ пам’яті GDDR6 зі швидкістю 16 TB/s, згідно специфікації Galaxy від Tenstorrent. Кожен ASIC підключається через десять 400‑GbE лінків, формуючи прискорювальну тканину швидкістю 32 TB/s, а системи масштабуються до 56 портів 800‑GbE QSFP‑DD. 6U корпус з повітряним охолодженням поєднує хост‑процесор AMD EPYC 9004 з до 576 ГБ DDR5 пам’яті, працює під Ubuntu 22.04, споживає в середньому 8‑10 кВт і має рекомендовану роздрібну ціну $160,000.

Дизайн з пониженою точністю та виміряні результати

“Переписування економіки інференції TTS: Lightning V2 на Tenstorrent досягає в 4 рази нижчої вартості, ніж NVIDIA L40S,” Папір був вперше поданий 24 березня 2026 року та переглянутий 7 квітня 2026 року.

Ранджіт, перший автор статті, сказав в анонсі: “Архітектура Tenstorrent принципово відрізняється від існуючих парадигм. Працюючи з NoC та більшою SRAM, ми досягли 4‑х кратних приростів за частину вартості порівнянної GPU‑інфраструктури, спричиняючи структурний зсув в економіці інференції”.

Автори повідомляють, що моделі текст‑у‑мову значно більш чисельно крихкі, ніж великі мовні моделі, оскільки вони генерують безперервні хвилі шляхом ітеративного уточнення, і малі числові помилки накопичуються протягом кроків денойзингу, проявляючись у вигляді чутних артефактів. Враховуючи це обмеження, у статті зазначено, що понад 95 % шарів Lightning V2 працюють у режимі LoFi з обчислювальною точністю, і понад 80 % моделі розгортаються у BlockFloat8 без вимірюваного погіршення якості аудіо. Автори також повідомляють про 4‑х кратне зменшення обчислень у дифузійному акустичному моделі, 8‑х кратне зменшення обчислень у нейронному вокодері, приблизно 2‑х кратне зменшення розміру моделі та 1,8‑х скорочення об’єму передачі пам’яті.

Щодо якості виходу, у статті зазначено перцептивний бал DNSMOS 3,872 для базової системи NVIDIA L40S порівняно з 3,801 у P150 від Tenstorrent, різниця 0,071, яку автори описують як знаходящуся в межах незначних перцептивних варіацій, а також нормалізовану помилку слів (WER) 0,009 між виходами двох систем.

У тестуванні на одному пристрої стаття повідомляє, що L40S підтримує одночасність 3 при затримці 300 мс при зазначеній ціні пристрою $9 000, тоді як P150 і P100 працювали з одночасністю 1 при затримці 250 мс при зазначених цінах $1 400 і $1 000 відповідно, що дає заявлені вигоди у вартості 2,6‑х та 3,6‑х. Оскільки Lightning V2 виконується на одному чипі без багаточипової паралельності чи інтерконнекту QSFP, показник затримки P100 перенесено з вимірюваних результатів P150, зазначає стаття.

У масштабі флоту автори моделюють навантаження з 550 одночасних п’ятисекундних запитів TTS при повному використанні. Вони розраховують, що для його підтримки знадобиться 11 GPU L40S приблизно за $100 000 вартості прискорювача, проти 27 прискорювачів P100 приблизно за $27 000 або 27 прискорювачів P150 приблизно за $37 000, що означає зниження початкових витрат у 3‑4‑х рази у їхньому порівнянні.

У статті також зазначено, що один сильно оптимізований шар приблизно з 6 мільярдами операцій множення‑накопичення виконується за приблизно 60 мікросекунд на L40S порівняно з приблизно 31 мікросекундою на P150. Автори прогнозують, що розширення такої оптимізації на рівні ядра на більше шарів може забезпечити 8‑12‑х покращення, нормоване за вартістю, порівняно з базовим L40S, підвищуючись від поточного 3,6‑х системного приросту.

Автори розглядають вбудовану підтримку BlockFloat8 як межу вартості апаратури: сучасні GPU з такою можливістю належать до класу цін приблизно $40 000 за пристрій, повідомляють вони, тоді як Tenstorrent забезпечує виконання BlockFloat8 на апаратурі класу приблизно $1 000, що становить різницю в один порядок величини у вартості придбання, за їхнім описом.

Числова крихкість та випадок PCC

У статті задокументовано дослідження налагодження, пов’язане з коефіцієнтом кореляції Пірсона, стандартною числовою метрикою схожості. Автори повідомляють, що виходи з L40S та процесора AMD EPYC 7352 показали кінцевий коефіцієнт лише 0,72, незважаючи на ідентичні вхідні дані, проте створили аудіо, яке не відрізняється сприйняттям. У окремому випадку шар, чий коефіцієнт округлився до 1,0, спричинив аудіо‑збій, який потребував понад місяця для виявлення. Автори роблять висновок, що традиційні метрики схожості на рівні тензорів не є надійними індикаторами сприйнятної якості аудіо у системах TTS, і що необхідна сквозна сприйнятна валідація для розгортань зі зниженою точністю.

Обмеження та подальші кроки

Автори зазначають, що деякі шари залишаються надто чисельно чутливими для виконання зі зниженою вірністю або блок‑плаваючою точкою без сприйнятної деградації, що обмежує повномодельне покриття низькою точністю, і що конфігурації компілятора та програми ще не повністю оптимізовані.

У 28 вересня 2026 технічному пості Smallest.ai охарактеризував Lightning V2 як перший у світі TTS‑модель, що забезпечує високоякісний синтез мови за спільної квантизації BlockFloat8 та арифметики зі зниженою точністю. Компанія заявила, що її новіша Lightning V3 вже перевершує V2 за якістю та архітектурною ефективністю, і що планує розгорнути Lightning V3 на апаратурі Tenstorrent за тими самими принципами спільного дизайну, орієнтуючись на подібні або ще більші досягнення у вартості.

Theo Nash є спеціалістом, створеним за допомогою ШІ, у Unite.AI, який охоплює AI‑інфраструктуру, обчислення та апаратні системи, що живлять сучасний штучний інтелект. Його робота зосереджена на технічних основах великих AI‑навантажень, включаючи дата‑центри, акселератори, мережі та програмні стеки, що їх об’єднують.

З аналітичної та інженерно‑орієнтованої точки зору, Тео досліджує, як прогрес у GPU, спеціальному кремнії, архітектурах пам’яті та розподілених системах дозволяє створювати нові покоління AI‑моделей. Він особливу увагу приділяє компромісам продуктивності, енергоефективності, масштабованості та практичним обмеженням, які формують реальне впровадження AI‑інфраструктури.

Статті, написані Theo Nash, створені за допомогою ШІ та перевірені редакційною командою Unite.AI, щоб забезпечити технічну точність, зрозумілість та відповідальне висвітлення швидко розвиваючогося ландшафту AI‑обчислень.