Партнёрства

Локальные голосовые агенты получают новый аппаратный путь, когда Smallest.ai присоединяется к Tenstorrent

mm
Добавьте Unite.AI в избранные источники в Google

Tenstorrent и Smallest.ai объявили о партнерстве 1 октября 2026 г., чтобы предоставить производительный, полностью локальный стек голосового ИИ, который запускает модель реального времени текст‑в‑речь Lightning V2 от Smallest.ai непосредственно на Tenstorrent Galaxy Blackhole servers.

Tenstorrent, компания по вычислениям ИИ, и Smallest.ai, исследовательская лаборатория ИИ, разрабатывающая инфраструктуру голосового ИИ в реальном времени, заявили, что совместный стек предназначен для снижения затрат на развертывание при сохранении необходимой производительности для приложений голосового ИИ в реальном времени. Компании отметили, что запуск Lightning V2 на архитектуре Blackhole позволяет организациям полностью локально эксплуатировать голосовых агентов в реальном времени с полной суверенностью данных, ориентируясь на высокообъёмные, чувствительные к данным нагрузки в финансовом секторе, телекоммуникациях, здравоохранении и корпоративных средах. Lightning V2 уже доступен на аппаратуре Tenstorrent, с ценообразованием на основе использования и без первоначальных обязательств.

«Не должно быть выбора между производительностью и стоимостью — Tenstorrent создал эффективные и масштабируемые вычисления, которые снижают затраты на существующие рабочие процессы и делают полностью новые нагрузки практичными», — сказал Амр Элашмави, вице‑президент по стратегии и развитию бизнеса в Tenstorrent.

Аппаратное обеспечение Galaxy Blackhole

Серверная платформа, названная в анонсе, построена вокруг 32 ASIC Blackhole, обеспечивающих 23 ПФЛОПС вычислений Block FP8, с 6,2 ГБ SRAM на кристалле со скоростью 2,9 ПБ/с и 1 ТБ памяти GDDR6 со скоростью 16 ТБ/с, согласно спецификациям Galaxy от Tenstorrent. Каждый ASIC соединяется через десять 400‑GbE каналов, образуя ускорительный фэбрик пропускной способностью 32 ТБ/с, а системы масштабируются через до 56 портов 800‑GbE QSFP‑DD. 6‑U корпус с воздушным охлаждением сочетает процессор хоста AMD EPYC 9004 с до 576 ГБ DDR5, работает под управлением Ubuntu 22.04, потребляет в среднем от 8 до 10 кВт и имеет рекомендованную розничную цену $160 000.

Дизайн с пониженной точностью и измеренные результаты

Технические детали партнерства описаны в статье «Переписывая экономику вывода TTS: Lightning V2 на Tenstorrent достигает в 4 раза более низкой стоимости, чем NVIDIA L40S», авторства Ranjith M S из Smallest.ai, старшего инженера по производительности вывода ИИ; технического директора Akshat Mandloi; и генерального директора Sudarshan Kamath. Статья была впервые представлена 24 марта 2026 г., а затем пересмотрена 7 апреля 2026 г.

Ранджит, первый автор статьи, сказал в анонсе: «Архитектура Tenstorrent принципиально отличается от существующих парадигм. Работая с NoC и более крупной SRAM, мы достигли прироста в 4 раза при доле стоимости по сравнению с сопоставимой GPU‑инфраструктурой, что приводит к структурному сдвигу в экономике вывода».

Авторы сообщают, что модели текст‑в‑речь значительно более численно хрупки, чем крупные языковые модели, поскольку они генерируют непрерывные волны посредством итеративного уточнения, и небольшие численные ошибки накапливаются на этапах подавления шума, проявляясь в виде слышимых артефактов. В рамках этих ограничений статья указывает, что более 95 % слоёв Lightning V2 работают с вычислительной точностью LoFi, а более 80 % модели развертывается в формате BlockFloat8 без измеримого ухудшения качества звука. Авторы также отмечают снижение вычислительных затрат в 4 раза для диффузионной акустической модели, в 8 раз для нейронного вокодера, приблизительно в 2 раза уменьшение размера модели и снижение объёма передачи памяти в 1,8 раза.

Что касается качества вывода, в статье указывается перцептивный показатель DNSMOS 3,872 для базовой модели NVIDIA L40S против 3,801 у Tenstorrent P150; разница в 0,071, по словам авторов, находится в диапазоне незначительных перцептивных отклонений, а нормализованная ошибка слов составляет 0,009 между выводами двух систем.

В тестировании на одном устройстве в статье указано, что L40S поддерживает конкурентность 3 при задержке 300 мс при заявленной стоимости устройства $9 000, тогда как P150 и P100 показывали конкурентность 1 при задержке 250 мс при заявленных ценах $1 400 и $1 000 соответственно, что соответствует экономии в 2,6‑ и 3,6‑кратном размере. Поскольку Lightning V2 работает на одном чипе без многочиповой параллельности и без соединения QSFP, показатель задержки P100 перенят из измеренных результатов P150, отмечает статья.

При масштабе флота авторы моделируют нагрузку из 550 одновременных пятисекундных запросов TTS при полной загрузке. Они рассчитывают, что поддержание такой нагрузки потребует 11 GPU L40S с приблизительной стоимостью ускорителей $100 000, против 27 ускорителей P100 стоимостью около $27 000 или 27 ускорителей P150 стоимостью около $37 000, что дает сокращение первоначальных расходов в 3‑4 раза в их сравнительной модели.

В статье также указано, что один сильно оптимизированный слой, содержащий примерно 6 млрд операций умножения‑накопления, выполняется за около 60 мкс на L40S против примерно 31 мкс на P150. Авторы прогнозируют, что расширение такой оптимизации уровня ядра на большее число слоёв может дать улучшение в 8‑12 раз с учётом стоимости по сравнению с базовым L40S, повышая текущий системный прирост в 3,6 раза.

Авторы рассматривают нативную поддержку BlockFloat8 как границу стоимости аппаратуры: современные GPU с такой возможностью находятся в ценовом классе около $40 000 за устройство, отмечают они, тогда как Tenstorrent позволяет выполнять BlockFloat8 на оборудовании класса около $1 000, что представляет собой разницу в порядке величины в стоимости приобретения, согласно их описанию.

Численная хрупкость и случай PCC

В статье документируется исследование отладки, посвящённое коэффициенту корреляции Пирсона, стандартному числовому метрику сходства. Авторы сообщают, что выводы с L40S и процессора AMD EPYC 7352 показали сквозной коэффициент всего 0,72 при идентичных входных данных, однако полученный звук был воспринимаемо неотличимым. В отдельном случае слой, коэффициент которого округлялся до 1,0, вызвал слышимые искажения, устранение которых заняло более месяца. Авторы делают вывод, что традиционные метрики сходства на уровне тензоров не являются надёжными индикаторами восприятия качества аудио в системах TTS, и что для развертываний с пониженной точностью необходима сквозная перцептивная валидация.

Ограничения и дальнейшие шаги

Авторы отмечают, что некоторые слои остаются слишком чувствительными к числовым изменениям для выполнения с пониженной точностью или блок‑плавающей точкой без деградации восприятия, что ограничивает покрытие модели низкой точностью, и что конфигурации компилятора и программы ещё не полностью оптимизированы.

В техническом посте от 28 сентября 2026 г. Smallest.ai охарактеризовала Lightning V2 как первую в мире модель TTS, способную обеспечивать синтез речи высокого качества при совместной квантизации BlockFloat8 и арифметике с пониженной точностью. Компания заявила, что её более новая Lightning V3 уже превосходит V2 по качеству и архитектурной эффективности, и что планирует развернуть Lightning V3 на аппаратуре Tenstorrent с теми же принципами совместного проектирования, стремясь к аналогичным или более значительным прорывам в стоимости.

Theo Nash — специалист, созданный ИИ, в Unite.AI, охватывающий инфраструктуру ИИ, вычисления и аппаратные системы, которые обеспечивают работу современных искусственных интеллектов. Его работа сосредоточена на технических основах крупномасштабных ИИ‑нагрузок, включая дата‑центры, ускорители, сетевые решения и программные стеки, связывающие их вместе.

С аналитической и инженерно‑ориентированной точки зрения Theo исследует, как прогресс в GPU, пользовательском кремнии, архитектурах памяти и распределённых системах позволяет создавать новые поколения моделей ИИ. Он уделяет особое внимание компромиссам производительности, энергоэффективности, масштабируемости и практическим ограничениям, формирующим реальное внедрение ИИ‑инфраструктуры.

Статьи, написанные Theo Nash, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и ответственное освещение быстро развивающегося ландшафта вычислений ИИ.