Συνεργασίες
Φωνητικοί πράκτορες On-Prem αποκτούν νέο υλικό καθώς η Smallest.ai εντάσσεται στην Tenstorrent

Η Tenstorrent και η Smallest.ai ανακοίνωσαν μια συνεργασία την 1 Οκτωβρίου 2026, για να προσφέρουν μια παραγωγικής κλάσης, on‑premises στοίβα φωνητικής AI που εκτελεί το μοντέλο πραγματικού χρόνου κειμένου‑σε‑ομιλία Lightning V2 της Smallest.ai εγγενώς σε Tenstorrent Galaxy Blackhole servers.
Η Tenstorrent, μια εταιρεία υπολογισμού AI, και η Smallest.ai, ένα ερευνητικό εργαστήριο AI που δημιουργεί υποδομή φωνητικής AI σε πραγματικό χρόνο, δήλωσαν ότι η κοινή στοίβα έχει σχεδιαστεί για να μειώνει τα κόστη ανάπτυξης ενώ παρέχει την απόδοση που απαιτείται για εφαρμογές φωνής σε πραγματικό χρόνο. Οι εταιρείες ανέφεραν ότι η εκτέλεση του Lightning V2 στην αρχιτεκτονική Blackhole επιτρέπει στους οργανισμούς να λειτουργούν φωνητικούς πράκτορες σε πραγματικό χρόνο εξ ολοκλήρου on‑prem με πλήρη κυριαρχία των δεδομένων, στοχεύοντας σε εργασίες υψηλού όγκου και ευαίσθητες σε δεδομένα σε χρηματοοικονομικές υπηρεσίες, τηλεπικοινωνίες, υγειονομική περίθαλψη και επιχειρησιακά περιβάλλοντα. Το Lightning V2 είναι διαθέσιμο στο υλικό της Tenstorrent άμεσα, με τιμολόγηση βάσει χρήσης και χωρίς προκαταβολικές δεσμεύσεις.
“Δεν θα έπρεπε να υπάρχει επιλογή μεταξύ απόδοσης και κόστους – η Tenstorrent έχει δημιουργήσει αποδοτικό και κλιμακώσιμο υπολογισμό που μειώνει το κόστος των υφιστάμενων ροών εργασίας και καθιστά πρακτικές εντελώς νέες ροές εργασίας”, δήλωσε ο Amr Elashmawi, Αντιπρόεδρος Στρατηγικής & Business Development στην Tenstorrent.
Υλικό Galaxy Blackhole
Η πλατφόρμα διακομιστών που αναφέρθηκε στην ανακοίνωση βασίζεται σε 32 ASIC Blackhole που παρέχουν 23 PFLOPS υπολογισμού Block FP8, με 6,2 GB SRAM ενσωματωμένης μνήμης στα 2,9 PB/s και 1 TB μνήμης GDDR6 στα 16 TB/s, σύμφωνα με προδιαγραφές Galaxy της Tenstorrent. Κάθε ASIC συνδέεται μέσω δέκα συνδέσμων 400 GbE για ένα επιταχυντικό υφασμάτινο δίκτυο 32 TB/s, και τα συστήματα κλιμακώνονται μέσω έως 56 θυρών 800 GbE QSFP‑DD. Το ψύξη αέρα 6U θήκη συνδυάζει έναν επεξεργαστή κεντρικού υπολογιστή AMD EPYC 9004 με έως 576 GB μνήμης DDR5, τρέχει Ubuntu 22.04, καταναλώνει κατά μέσο όρο 8‑10 kW και έχει τιμή λίστας 160.000 $.
Σχεδίαση Μειωμένης Ακρίβειας και Μετρημένα Αποτελέσματα
Η μηχανική πίσω από τη συνεργασία τεκμηριώνεται σε ένα άρθρο, “Ανασυγγραφή Οικονομίας Επαγωγής TTS: Lightning V2 στο Tenstorrent Επιτυγχάνει 4x Χαμηλότερο Κόστος από NVIDIA L40S,” που συντάχθηκε από τον Ranjith M S της Smallest.ai, Senior AI Inference Performance Engineer· τον Chief Technology Officer Akshat Mandloi· και τον Chief Executive Officer Sudarshan Kamath. Το άρθρο υποβλήθηκε αρχικά στις 24 Μαρτίου 2026 και αναθεωρήθηκε στις 7 Απριλίου 2026.
Ο Ranjith, πρώτος συγγραφέας του άρθρου, δήθηκε στην ανακοίνωση: “Η αρχιτεκτονική της Tenstorrent είναι θεμελιωδώς διαφορετική από τα υπάρχοντα παραδείγματα. Εργαζόμενοι με το NoC και μεγαλύτερη SRAM, αποκτήσαμε κέρδη 4x με ένα κλάσμα του κόστους συγκρίσιμης υποδομής GPU, προκαλώντας μια δομική αλλαγή στην οικονομία της επαγωγής.”
Οι συγγραφείς αναφέρουν ότι τα μοντέλα κειμένου‑σε‑ομιλία είναι σημαντικά πιο αριθμητικά ευαίσθητα από τα μεγάλα μοντέλα γλώσσας, επειδή παράγουν συνεχή κυματομορφή μέσω επαναληπτικής βελτίωσης, οπότε μικρά αριθμητικά σφάλματα συσσωρεύονται κατά τα βήματα αποθορυβοποίησης και εμφανίζονται ως ακουστικά εφέ. Ενάντια σε αυτόν τον περιορισμό, το άρθρο δηλώνει ότι πάνω από το 95 % των στρωμάτων του Lightning V2 λειτουργούν με υπολογιστική πιστότητα LoFi και πάνω από το 80 % του μοντέλου αναπτύσσεται σε BlockFloat8 χωρίς μετρήσιμη υποβάθμιση της ποιότητας ήχου. Οι συγγραφείς επίσης αναφέρουν μείωση υπολογιστικής ισχύος 4x στο διαχυτικό ακουστικό μοντέλο, μείωση 8x στον νευρωνικό βοηθό φωνής, περίπου 2x μείωση του μεγέθους του μοντέλου, και μείωση 1,8x του όγκου μεταφοράς μνήμης.
Σχετικά με την ποιότητα εξόδου, το άρθρο αναφέρει βαθμολογία αντιληπτικότητας DNSMOS 3,872 για το baseline NVIDIA L40S έναντι 3,801 στο P150 της Tenstorrent, μια διαφορά 0,071 που οι συγγραφείς περιγράφουν ως εντός του εύρους μικρής αντιληπτικής διακύμανσης, και ένα ομαλοποιημένο ποσοστό σφάλματος λέξεων 0,009 μεταξύ των εξόδων των δύο συστημάτων.
Σε δοκιμές με μία συσκευή, το άρθρο αναφέρει ότι το L40S διατηρεί συνεισφορά 3 με καθυστέρηση 300 ms έναντι τιμής συσκευής $9.000, ενώ το P150 και το P100 εκτέλεσαν συνεισφορά 1 με καθυστέρηση 250 ms σε τιμές $1.400 και $1.000 αντίστοιχα, με αναφερόμενα κέρδη κόστους 2,6x και 3,6x. Επειδή το Lightning V2 εκτελείται σε ένα μόνο chip χωρίς πολυ‑chip παράλληλο ή το διασύνδεσμο QSFP, η τιμή καθυστέρησης του P100 προέρχεται από τα μετρημένα αποτελέσματα του P150, σημειώνει το άρθρο.
Σε κλίμακα στόλου, οι συγγραφείς μοντελοποιούν ένα φορτίο εργασίας 550 ταυτόχρονων αιτημάτων TTS διάρκειας πέντε δευτερολέπτων με πλήρη αξιοποίηση. Υπολογίζουν ότι η διατήρηση του απαιτεί 11 GPU L40S με κόστος επιταχυντή περίπου $100.000, έναντι 27 επιταχυντών P100 με κόστος περίπου $27.000 ή 27 επιταχυντών P150 με κόστος περίπου $37.000, με μείωση 3‑4x του αρχικού κόστους στη μοντελοποιημένη σύγκριση.
Το άρθρο επίσης αναφέρει ότι ένα έντονα βελτιστοποιημένο στρώμα περίπου 6 δισεκατομμυρίων πράξεων πολλαπλασιασμού‑συσσώρευσης εκτελείται σε περίπου 60 µs στο L40S έναντι περίπου 31 µs στο P150. Οι συγγραφείς προβλέπουν ότι η επέκταση τέτοιας βελτιστοποίησης επιπέδου πυρήνα σε περισσότερα στρώματα θα μπορούσε να αποφέρει βελτίωση 8‑12x κανονισμένη ως προς το κόστος σε σχέση με το baseline L40S, αυξάνοντας το τρέχον κέρδος 3,6x σε επίπεδο συστήματος.
Οι συγγραφείς παρουσιάζουν την εγγενή υποστήριξη BlockFloat8 ως οριοθέτηση κόστους υλικού: σύγχρονα GPU με αυτή τη δυνατότητα ανήκουν στην κατηγορία τιμής περίπου $40.000 ανά συσκευή, σύμφωνα με την αναφορά, ενώ η Tenstorrent επιτρέπει εκτέλεση BlockFloat8 σε υλικό της κατηγορίας περίπου $1.000, διαφορά τάξης μεγέθους στο κόστος απόκτησης όπως περιγράφουν.
Αριθμητική Ευθραυστότητα και η Περίπτωση PCC
Το άρθρο τεκμηριώνει μια μελέτη περίπτωσης εντοπισμού σφαλμάτων γύρω από τον Συντελεστή Συσχέτισης Pearson, ένα τυπικό αριθμητικό μέτρο ομοιότητας. Οι συγγραφείς αναφέρουν ότι τα αποτελέσματα από το L40S και έναν επεξεργαστή AMD EPYC 7352 παρουσίασαν έναν συνολικό συντελεστή μόλις 0.72 παρά τις ταυτόσημες εισόδους, ωστόσο παρήγαγαν ήχο αδιάκριτο αντιληπτικά. Σε ξεχωριστό παράδειγμα, ένα επίπεδο του οποίου ο συντελεστής στρογγυλοποιήθηκε στο 1.0 προκάλεσε ακουστή διακοπή που χρειάστηκε περισσότερο από ένα μήνα για να εντοπιστεί. Οι συγγραφείς καταλήγουν στο συμπέρασμα ότι τα συμβατικά μετρικά ομοιότητας σε επίπεδο τανυστών δεν αποτελούν αξιόπιστους δείκτες της αντιληπτικής ποιότητας ήχου σε συστήματα TTS, και ότι απαιτείται ολοκληρωμένη αντιληπτική επικύρωση για υλοποιήσεις μειωμένης ακρίβειας.
Περιορισμοί και Επόμενα Βήματα
Οι συγγραφείς δηλώνουν ότι ορισμένα επίπεδα παραμένουν υπερβολικά αριθμητικά ευαίσθητα για εκτέλεση με μειωμένη πιστότητα ή block floating-point χωρίς αντιληπτική υποβάθμιση, περιορίζοντας την πλήρη κάλυψη του μοντέλου με χαμηλή ακρίβεια, και ότι οι ρυθμίσεις του μεταγλωττιστή και του προγράμματος δεν είναι ακόμη πλήρως βελτιστοποιημένες.
Σε μια τεχνική ανάρτηση 28 Σεπτεμβρίου 2026, η Smallest.ai χαρακτηρίσε το Lightning V2 ως το πρώτο παγκοσμίως μοντέλο TTS που προσφέρει υψηλής ποιότητας σύνθεση ομιλίας υπό κοινή κβαντοποίηση BlockFloat8 και μειωμένη ακρίβεια αριθμητικών πράξεων. Η εταιρεία δήλωσε ότι το νεότερο Lightning V3 ξεπερνά ήδη το V2 ως προς την ποιότητα και την αρχιτεκτονική αποδοτικότητα, και ότι σχεδιάζει να αναπτύξει το Lightning V3 σε υλικό Tenstorrent με τις ίδιες αρχές συν-σχεδίασης, στοχεύοντας σε παρόμοιες ή ακόμη μεγαλύτερες επιτυχίες κόστους.












