파트너십

온프레미스 음성 에이전트, Smallest.ai가 Tenstorrent와 합류하며 새로운 하드웨어 경로 확보

mm
Unite.AI를 Google의 선호 소스에 추가

Tenstorrent와 Smallest.ai가 2026년 10월 1일에 발표했다 파트너십을 체결하여 Smallest.ai의 Lightning V2 실시간 텍스트‑투‑스피치 모델을 Tenstorrent Galaxy Blackhole servers에서 네이티브로 실행하는 프로덕션급 온프레미스 음성 AI 스택을 제공한다.

AI 컴퓨팅 기업 Tenstorrent와 실시간 음성 AI 인프라를 구축하는 AI 연구소 Smallest.ai는 공동 스택이 배포 비용을 절감하면서 실시간 음성 애플리케이션에 필요한 성능을 제공하도록 설계되었다고 밝혔다. 양사는 Blackhole 아키텍처에서 Lightning V2를 실행하면 조직이 완전한 데이터 주권을 유지하면서 온프레미스에서 실시간 음성 에이전트를 전적으로 운영할 수 있게 되며, 금융 서비스, 통신, 의료 및 기업 환경 전반에 걸친 대용량·데이터 민감 워크로드를 목표로 한다고 말했다. Lightning V2는 Tenstorrent 하드웨어에서 즉시 사용할 수 있으며, 사용량 기반 가격 책정과 선불 계약이 필요하지 않다.

“성능과 비용 사이에서 선택을 해야 할 필요는 없습니다 – Tenstorrent는 기존 워크플로우의 비용을 낮추고 완전히 새로운 워크로드를 실용화할 수 있는 효율적이고 확장 가능한 컴퓨팅을 구축했습니다,” 라고 Tenstorrent의 전략 및 사업 개발 부사장 Amr Elashmawi가 말했다.

Galaxy Blackhole 하드웨어

발표에서 명명된 서버 플랫폼은 32개의 Blackhole ASIC을 중심으로 구성되어 Block FP8 연산에서 23 PFLOPS를 제공하며, 온칩 SRAM 6.2 GB를 2.9 PB/s, GDDR6 메모리 1 TB를 16 TB/s 속도로 지원한다고 Tenstorrent의 Galaxy 사양에 명시되어 있다. 각 ASIC은 10개의 400 GbE 링크를 통해 32 TB/s 가속기 패브릭에 연결되고, 시스템은 최대 56개의 800 GbE QSFP‑DD 포트를 통해 확장된다. 6U 공랭식 섀시는 AMD EPYC 9004 호스트 프로세서와 최대 576 GB DDR5 메모리를 결합하며, Ubuntu 22.04를 실행하고 평균 8~10 kW를 소비하고, 정가 $160,000이다.

저정밀 설계 및 측정 결과

파트너십의 엔지니어링은 “TTS 추론 경제 재작성: Tenstorrent에서 Lightning V2가 NVIDIA L40S보다 비용을 4배 낮추다,” 라는 논문에 문서화되어 있으며, Smallest.ai의 Ranjith M S(시니어 AI 추론 성능 엔지니어), 최고 기술 책임자 Akshat Mandloi, 최고 경영자 Sudarshan Kamath가 저술했다. 이 논문은 2026년 3월 24일에 처음 제출되었으며, 2026년 4월 7일에 수정되었다.

논문의 제1저자인 Ranjith는 발표에서 다음과 같이 말했다: “Tenstorrent의 아키텍처는 기존 패러다임과 근본적으로 다릅니다. NoC와 더 큰 SRAM을 활용함으로써 우리는 비교 가능한 GPU 인프라 비용의 일부만으로 4배의 성능 향상을 달성했으며, 추론 경제에 구조적인 변화를 촉진했습니다.”

저자들은 텍스트‑투‑스피치 모델이 연속 파형을 반복적으로 정제하여 생성하기 때문에 대형 언어 모델보다 수치적으로 훨씬 더 취약하며, 작은 수치 오류가 디노이징 단계마다 누적되어 청각적 아티팩트로 나타난다고 보고한다. 이러한 제약에도 불구하고 논문은 Lightning V2의 레이어 중 95% 이상이 LoFi 연산 정확도로 실행되고, 모델의 80% 이상이 BlockFloat8으로 배포되어 오디오 품질에 측정 가능한 저하가 없다고 밝혔다. 또한 저자들은 확산 음향 모델에서 4배, 신경 보코더에서 8배의 연산량 감소, 모델 크기 약 2배 감소, 메모리 전송량 1.8배 감소를 보고했다.

출력 품질에 대해 논문은 NVIDIA L40S 기준점에서 DNSMOS 지각 점수가 3.872인 반면 Tenstorrent의 P150에서는 3.801로, 0.071 차이는 저자들이 미세한 지각 변동 범위에 해당한다고 설명했으며, 두 시스템 출력 간의 정규화된 단어 오류율은 0.009라고 보고했다.

단일 디바이스 테스트에서 논문은 L40S가 $9,000의 정가 대비 300 ms 지연 시간에 동시성 3을 유지했으며, P150과 P100은 각각 $1,400와 $1,000의 정가로 250 ms 지연 시간에 동시성 1을 달성해 각각 2.6배와 3.6배의 비용 절감을 보였다고 보고한다. Lightning V2는 다중 칩 병렬 처리나 QSFP 인터커넥트 없이 단일 칩에서 실행되기 때문에, P100 지연 시간 수치는 측정된 P150 결과에서 가져온 것이라고 논문은 언급한다.

대규모 배치에서는 저자들이 전체 활용도에서 동시에 550개의 5초 TTS 요청 워크로드를 모델링했다. 이를 지속하려면 가속기 비용이 약 $100,000인 L40S GPU 11대가 필요하지만, P100 가속기 27대는 약 $27,000, P150 가속기 27대는 약 $37,000이 필요하므로 초기 비용이 3~4배 감소한다고 계산했다.

논문은 또한 약 60 µs에 L40S에서 실행되는 60억 정도의 곱셈-누적 연산을 수행하는 고도로 최적화된 레이어가 P150에서는 약 31 µs에 실행된다고 보고한다. 저자들은 이러한 커널 수준 최적화를 더 많은 레이어에 적용하면 현재 3.6배 시스템 수준 이득에서 벗어나 L40S 기준 대비 8~12배의 비용 정규화 개선을 달성할 수 있을 것으로 전망한다.

저자들은 네이티브 BlockFloat8 지원을 하드웨어 비용의 분수점으로 제시한다. 해당 기능을 갖춘 최신 GPU는 장치당 약 $40,000 수준의 가격대에 속하는 반면, Tenstorrent는 약 $1,000 수준의 하드웨어에서 BlockFloat8 실행을 가능하게 하여, 인수 비용에서 한 차례 규모 차이를 만든다고 보고한다.

수치적 취약성과 PCC 사례

이 논문은 표준 수치 유사도 지표인 피어슨 상관계수(Pearson Correlation Coefficient)를 중심으로 한 디버깅 사례 연구를 문서화한다. 저자들은 동일한 입력에도 불구하고 L40S와 AMD EPYC 7352 CPU의 출력이 최종 상관계수가 0.72에 불과했으며, 그럼에도 인지적으로 구별되지 않는 오디오를 생성했다고 보고한다. 별도의 사례에서는 상관계수가 1.0으로 반올림된 레이어가 청각적 결함을 일으켰으며, 이를 격리하는 데 한 달 이상이 걸렸다. 저자들은 기존 텐서 수준 유사도 지표가 TTS 시스템의 인지적 오디오 품질을 신뢰할 수 있는 지표가 아니며, 저정밀 배포를 위해서는 최종 인지 검증이 필요하다고 결론짓는다.

제한 사항 및 향후 과제

저자들은 특정 레이어가 인지적 저하 없이 감소된 정밀도 또는 블록 부동소수점 실행에 대해 여전히 수치적으로 민감하여 전체 모델의 저정밀 적용 범위를 제한하고, 컴파일러 및 프로그램 구성도 아직 완전히 최적화되지 않았다고 밝혔다.

In a 2026년 9월 28일 기술 포스트, Smallest.ai는 Lightning V2를 블록 부동소수점(BlockFloat8) 양자화와 저정밀 연산을 결합하여 고품질 음성 합성을 제공하는 세계 최초의 TTS 모델이라고 설명했다. 회사는 최신 Lightning V3가 이미 품질과 아키텍처 효율성 면에서 V2를 능가했으며, 동일한 공동 설계 원칙을 적용해 Tenstorrent 하드웨어에 Lightning V3를 배치하여 유사하거나 더 큰 비용 혁신을 목표로 할 계획이라고 밝혔다.

Theo Nash은 Unite.AI에서 AI 생성 전문가로서 AI 인프라, 컴퓨팅 및 현대 인공지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드의 기술적 기반에 초점을 맞추며, 데이터 센터, 가속기, 네트워킹 및 이를 연결하는 소프트웨어 스택을 포함합니다.

분석적이고 엔지니어링 중심의 관점으로 Theo는 GPU, 맞춤형 실리콘, 메모리 아키텍처 및 분산 시스템의 진보가 새로운 세대의 AI 모델을 어떻게 가능하게 하는지 검토합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성 및 AI 인프라의 실제 배포를 형성하는 실질적인 제약 조건에 특히 주목합니다.

Theo Nash가 작성한 기사들은 AI가 생성했으며, Unite.AI의 편집팀이 검토하여 빠르게 진화하는 AI 컴퓨팅 환경에 대한 기술적 정확성, 명확성 및 책임 있는 보도를 보장합니다.