Partnerschaften

On-Prem-Sprachagenten erhalten neuen Hardware-Pfad, da Smallest.ai zu Tenstorrent stößt

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Tenstorrent und Smallest.ai kündigte an am 1. Oktober 2026 eine Partnerschaft, um einen produktionsreifen, vor Ort betriebenen Voice‑AI‑Stack bereitzustellen, der das Echtzeit‑Text‑zu‑Sprache‑Modell Lightning V2 von Smallest.ai nativ auf Tenstorrent Galaxy Blackhole servers ausführt.

Tenstorrent, ein KI‑Rechenunternehmen, und Smallest.ai, ein KI‑Forschungslabor, das Echtzeit‑Sprach‑KI‑Infrastruktur aufbaut, sagten, dass der gemeinsame Stack darauf ausgelegt sei, die Bereitstellungskosten zu senken und gleichzeitig die für Echtzeit‑Sprachanwendungen erforderliche Leistung zu erbringen. Die Unternehmen erklärten, dass das Ausführen von Lightning V2 auf der Blackhole‑Architektur Organisationen ermögliche, Echtzeit‑Sprachagenten vollständig vor Ort mit voller Datensouveränität zu betreiben, wobei hochvolumige, daten‑sensible Workloads in den Bereichen Finanzdienstleistungen, Telekommunikation, Gesundheitswesen und Unternehmensumgebungen anvisiert werden. Lightning V2 ist sofort auf Tenstorrent‑Hardware verfügbar, mit nutzungsbasierten Preisen und ohne Vorabverpflichtungen.

“Es sollte keine Wahl zwischen Leistung und Kosten geben – Tenstorrent hat effiziente und skalierbare Rechenleistung entwickelt, die die Kosten bestehender Workflows senkt und völlig neue Workloads praktikabel macht,” sagte Amr Elashmawi, Vizepräsident für Strategie und Geschäftsentwicklung bei Tenstorrent.

Galaxy Blackhole‑Hardware

Die im Ankündigung genannte Serverplattform basiert auf 32 Blackhole‑ASICs, die 23 PFLOPS Block‑FP8‑Rechenleistung bereitstellen, mit 6,2 GB on‑chip SRAM bei 2,9 PB/s und 1 TB GDDR6‑Speicher bei 16 TB/s, laut Tenstorrent‑Galaxy‑Spezifikationen. Jeder ASIC verbindet sich über zehn 400‑GbE‑Links zu einem 32 TB/s‑Accelerator‑Fabric, und die Systeme skalieren über bis zu 56 800‑GbE‑QSFP‑DD‑Ports. Das 6U luftgekühlte Gehäuse kombiniert einen AMD EPYC 9004‑Host‑Prozessor mit bis zu 576 GB DDR5‑Arbeitsspeicher, läuft unter Ubuntu 22.04, verbraucht durchschnittlich 8 bis 10 kW und hat einen Listenpreis von 160.000 $.

Reduzierte Präzision und gemessene Ergebnisse

Die Technik hinter der Partnerschaft ist in einem Papier dokumentiert, “Neugestaltung der TTS‑Inference‑Wirtschaft: Lightning V2 auf Tenstorrent erzielt 4‑fach geringere Kosten als NVIDIA L40S,” verfasst von Ranjith M S von Smallest.ai, Senior Engineer für KI‑Inference‑Performance; Technischer Leiter Akshat Mandloi; und Geschäftsführer Sudarshan Kamath. Das Papier wurde erstmals am 24. März 2026 eingereicht und am 7. April 2026 überarbeitet.

Ranjith, der Erstautor des Papiers, sagte in der Ankündigung: “Die Architektur von Tenstorrent unterscheidet sich grundlegend von bestehenden Paradigmen. Durch die Arbeit mit dem NoC und größerem SRAM haben wir 4‑fach höhere Gewinne bei einem Bruchteil der Kosten vergleichbarer GPU‑Infrastrukturen erzielt, was zu einer strukturellen Verschiebung in der Inferenz‑Wirtschaft führt.”

Die Autoren berichten, dass Text‑zu‑Sprache‑Modelle deutlich numerisch fragiler sind als große Sprachmodelle, weil sie kontinuierliche Wellenformen durch iterative Verfeinerung erzeugen, sodass kleine numerische Fehler sich über die Denoising‑Schritte hinweg akkumulieren und als hörbare Artefakte erscheinen. Vor diesem Hintergrund berichtet das Papier, dass mehr als 95 % der Schichten von Lightning V2 mit LoFi‑Rechen‑Fidelity laufen und mehr als 80 % des Modells in BlockFloat8 eingesetzt werden, ohne messbare Verschlechterung der Audioqualität. Die Autoren berichten außerdem von einer 4‑fachen Reduktion des Rechenaufwands im Diffusions‑Akustikmodell, einer 8‑fachen Reduktion im neuronalen Vocoder, einer ungefähren 2‑fachen Reduktion der Modellgröße und einer 1,8‑fachen Reduktion des Speicher‑Transfer‑Volumens.

In Bezug auf die Ausgabequalität berichtet das Papier einen DNSMOS‑Wahrnehmungswert von 3,872 für die NVIDIA L40S‑Referenz gegenüber 3,801 für Tenstorrent’s P150, ein Unterschied von 0,071, den die Autoren als innerhalb der Bandbreite kleiner wahrnehmbarer Schwankungen beschreiben, sowie eine normalisierte Wortfehlerrate von 0,009 zwischen den Ausgaben der beiden Systeme.

In Einzelgerät‑Tests berichtet das Papier, dass das L40S bei einer gelisteten Geräte­kosten von 9.000 $ eine Parallelität von 3 bei 300 ms Latenz aufrechterhält, während das P150 und das P100 jeweils eine Parallelität von 1 bei 250 ms Latenz bei gelisteten Kosten von 1.400 $ bzw. 1.000 $ erreichen, was gemeldete Kostenvorteile von 2,6‑fach bzw. 3,6‑fach ergibt. Da Lightning V2 auf einem einzigen Chip ohne Multi‑Chip‑Parallelismus oder den QSFP‑Interconnect ausgeführt wird, wird die Latenz‑Zahl des P100 aus den gemessenen P150‑Ergebnissen übernommen, so das Papier.

Im Flottenmaßstab modellieren die Autoren eine Arbeitslast von 550 gleichzeitigen fünfsekündigen TTS‑Anfragen bei voller Auslastung. Sie berechnen, dass dafür etwa 11 L40S‑GPUs mit rund 100.000 $ Accelerator‑Kosten erforderlich wären, gegenüber 27 P100‑Acceleratoren mit etwa 27.000 $ oder 27 P150‑Acceleratoren mit etwa 37.000 $, was in ihrem Vergleich einer 3‑ bis 4‑fachen Reduktion der Vorabkosten entspricht.

Das Papier berichtet außerdem, dass eine stark optimierte Schicht mit etwa 6 Milliarden Multiply‑Accumulate‑Operationen auf dem L40S in etwa 60 µs und auf dem P150 in etwa 31 µs ausgeführt wird. Die Autoren prognostizieren, dass die Ausweitung solcher Kernel‑Optimierungen auf weitere Schichten eine 8‑ bis 12‑fach verbesserte, kosten‑normierte Leistung gegenüber der L40S‑Referenz ermöglichen könnte, im Vergleich zum derzeitigen 3,6‑fachen System‑Gewinn.

Die Autoren stellen die native BlockFloat8‑Unterstützung als Kosten‑Grenze der Hardware dar: Zeitgenössische GPUs mit dieser Fähigkeit liegen in etwa in der Preisklasse von 40.000 $ pro Gerät, berichten sie, während Tenstorrent die BlockFloat8‑Ausführung auf Hardware in etwa in der 1.000‑$‑Klasse ermöglicht – ein Unterschied von einer Größenordnung bei den Anschaffungskosten, so ihre Beschreibung.

Numerische Fragilität und der PCC-Fall

Das Papier dokumentiert eine Debugging‑Fallstudie zum Pearson Correlation Coefficient, einer standardisierten numerischen Ähnlichkeitsmetrik. Die Autoren berichten, dass Ausgaben des L40S und einer AMD EPYC 7352 CPU nur einen End‑zu‑Ende‑Koeffizienten von 0,72 zeigten, obwohl die Eingaben identisch waren, jedoch ein perceptuell nicht unterscheidbares Audio erzeugten. In einem anderen Fall verursachte eine Schicht, deren Koeffizient auf 1,0 gerundet wurde, hörbare Störungen, deren Ursache mehr als einen Monat zur Isolation benötigte. Die Autoren schließen, dass konventionelle tensorbasierte Ähnlichkeitsmetriken keine verlässlichen Indikatoren für die wahrgenommene Audioqualität in TTS‑Systemen sind und dass eine end‑zu‑end‑perzeptuelle Validierung für Deployments mit reduzierter Präzision notwendig ist.

Einschränkungen und nächste Schritte

Die Autoren stellen fest, dass bestimmte Schichten numerisch zu empfindlich für die Ausführung mit reduzierter Treue oder Block‑Floating‑Point bleiben, ohne dass eine perzeptuelle Verschlechterung auftritt, was die vollständige Modell‑Abdeckung mit niedriger Präzision einschränkt, und dass Compiler‑ und Programmkonfigurationen noch nicht vollständig optimiert sind.

In a Technischer Beitrag vom 28. September 2026, Smallest.ai charakterisierte Lightning V2 als das weltweit erste TTS‑Modell, das hochwertige Sprachsynthese unter gemeinsamer BlockFloat8‑Quantisierung und reduzierter Präzisionsarithmetik liefert. Das Unternehmen sagte, dass sein neueres Lightning V3 bereits V2 in Qualität und architektonischer Effizienz übertrifft und dass es plant, Lightning V3 auf Tenstorrent‑Hardware mit denselben Co‑Design‑Prinzipien einzusetzen, um ähnliche oder noch größere Kostendurchbrüche zu erzielen.

Theo Nash ist ein KI-generierter Spezialist bei Unite.AI, der KI-Infrastruktur, Rechenleistung und die Hardwaresysteme abdeckt, die moderne künstliche Intelligenz antreiben. Seine Arbeit konzentriert sich auf die technischen Grundlagen großer KI‑Workloads, einschließlich Rechenzentren, Beschleuniger, Netzwerke und die Software‑Stacks, die sie verbinden.

Mit einer analytischen und ingenieurorientierten Perspektive untersucht Theo, wie Fortschritte bei GPUs, kundenspezifischem Silizium, Speicherarchitekturen und verteilten Systemen neue Generationen von KI‑Modellen ermöglichen. Er legt besonderen Wert auf Leistungskompromisse, Energieeffizienz, Skalierbarkeit und die praktischen Einschränkungen, die die reale Implementierung von KI‑Infrastruktur prägen.

Artikel, die von Theo Nash verfasst wurden, sind KI-generiert und werden vom Redaktionsteam von Unite.AI geprüft, um technische Genauigkeit, Klarheit und eine verantwortungsvolle Berichterstattung über die sich schnell entwickelnde KI‑Rechenlandschaft sicherzustellen.