Kumppanuudet

Paikallisesti toimivat ääniavustajat saavat uuden laitteistopolun, kun Smallest.ai liittyy Tenstorrentiin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tenstorrent ja Smallest.ai julkaisivat kumppanuuden 1. lokakuuta 2026 tarjotakseen tuotantotason, paikallisesti toimivan ääni‑AI‑pinon, joka suorittaa Smallest.ai:n Lightning V2 -reaaliaikaisen tekstistä puheeksi -mallin natiivisti Tenstorrent Galaxy Blackhole servers.

Tenstorrent, tekoälyn laskentayritys, ja Smallest.ai, tekoälytutkimuslaboratorio, joka rakentaa reaaliaikaista ääni‑AI‑infrastruktuuria, sanoivat, että yhteinen pinnoite on suunniteltu vähentämään käyttöönoton kustannuksia samalla kun se tarjoaa reaaliaikaisiin ääni­ sovelluksiin vaadittavan suorituskyvyn. Yritykset totesi, että Lightning V2:n ajaminen Blackhole‑arkkitehtuurissa mahdollistaa organisaatioiden toimia reaaliaikaisilla ääniavustajilla täysin paikallisesti täyden tietosuojaa noudattaen, kohdistuen suurivolyymisiin, tietosensitiivisiin työkuormiin rahoituspalveluissa, televiestinnässä, terveydenhuollossa ja yritysympäristöissä. Lightning V2 on heti saatavilla Tenstorrent‑laitteistolla, käyttöperusteisella hinnoittelulla eikä etukäteissitoumuksia.

“Valinnan ei pitäisi olla suorituskyvyn ja kustannusten välillä – Tenstorrent on rakentanut tehokkaan ja skaalautuvan laskennan, joka vähentää olemassa olevien työnkulkujen kustannuksia ja tekee täysin uusista työkuormista käytännöllisiä,” sanoi Amr Elashmawi, Tenstorrentin strategia‑ ja liiketoimintakehityksen varapuheenjohtaja.

Galaxy Blackhole -laitteisto

Ilmoituksessa mainittu palvelinalusta on rakennettu 32 Blackhole‑ASIC:n ympärille, jotka tarjoavat 23 PFLOPS Block‑FP8‑laskentaa, 6,2 GB sirun sisäistä SRAM-muistia 2,9 PB/s ja 1 TB GDDR6‑muistia 16 TB/s, Tenstorrentin Galaxy-määritysten mukaan. Jokainen ASIC yhdistyy kymmeneen 400 GbE‑linkkiin, muodostaen 32 TB/s kiihdytyskankaan, ja järjestelmät skaalautuvat jopa 56 800 GbE‑QSFP‑DD‑porttiin. 6U‑ilmankierto‑kotelossa on AMD EPYC 9004 -isäntäprosessori, jossa on enintään 576 GB DDR5‑muistia, se käyttää Ubuntu 22.04:ää, kuluttaa keskimäärin 8–10 kW ja sen listahinta on 160 000 $.

Alennetun tarkkuuden suunnittelu ja mitatut tulokset

Kumppanuuden takana oleva tekniikka on dokumentoitu artikkelissa “Uudelleenkirjoittaminen TTS‑inferenssin taloustieteessä: Lightning V2 Tenstorrentilla saavuttaa 4‑kerran alhaisemman kustannuksen kuin NVIDIA L40S,”, jonka ovat kirjoittaneet Smallest.ai:n Ranjith M S, Senior AI Inference Performance Engineer; teknologiajohtaja Akshat Mandloi; ja toimitusjohtaja Sudarshan Kamath. Artikkeli lähetettiin ensimmäisen kerran 24. maaliskuuta 2026, ja sitä tarkistettiin 7. huhtikuuta 2026.

Ranjith, artikkelin ensimmäinen tekijä, sanoi ilmoituksessa: “Tenstorrentin arkkitehtuuri on perustavanlaatuisesti erilainen kuin nykyiset paradigmat. Työskentelemällä NoC:n ja suuremman SRAM:n kanssa, saimme aikaan 4‑kerran parannuksen murto-osalla vertailukelpoisen GPU‑infrastruktuurin kustannuksista, mikä aiheuttaa rakenteellisen muutoksen inferenssin taloustieteessä.”

Kirjoittajat raportoivat, että tekstistä puheeksi -mallit ovat merkittävästi numeerisesti hauraampia kuin suuret kielimallit, koska ne tuottavat jatkuvia aaltomuotoja iteratiivisen tarkennuksen kautta, jolloin pienet numeeriset virheet kasaantuvat denoisauksen vaiheissa ja ilmestyvät kuultavina artefakteina. Tämän rajoituksen valossa artikkeli ilmoittaa, että yli 95 % Lightning V2:n kerroksista toimii LoFi‑laskentatarkkuudella ja yli 80 % mallista otetaan käyttöön BlockFloat8‑muodossa ilman mitattavaa äänenlaadun heikkenemistä. Kirjoittajat raportoivat myös 4‑kertaisesta laskentavähennyksestä diffuusiokaiutemallissa, 8‑kertaisesta laskentavähennyksestä neuro‑vokoderissa, noin 2‑kertaisesta mallikoon pienennyksestä ja 1,8‑kertaisesta muistin siirto‑volyymin vähenemisestä.

Äänenlaadun osalta artikkeli raportoi DNSMOS‑havaitsemisluvun 3,872 NVIDIA L40S -vertailuarvolle verrattuna 3,801 Tenstorrentin P150:lle, 0,071:n ero, jonka kirjoittajat kuvaavat kuuluvan vähäisen havainnollisen vaihtelun alueeseen, sekä normalisoidun sanavirheprosentin 0,009 kahden järjestelmän tuotosten välillä.

Yksittäislaitetestauksessa artikkeli ilmoittaa, että L40S pystyi ylläpitämään 3‑kertaista rinnakkaisuutta 300 ms viiveellä listatun laitekustannuksen 9 000 $ vastakohtana, kun P150 ja P100 suorittivat kummatkin 1‑kertaista rinnakkaisuutta 250 ms viiveellä listakustannuksilla 1 400 $ ja 1 000 $, mikä vastaa 2,6‑ ja 3,6‑kertaista kustannussäästöä. Koska Lightning V2 toimii yhdellä sirulla ilman monisiru‑parallellisuutta tai QSFP‑liitäntää, P100‑viivearvo on siirretty P150‑mittaustuloksista, artikkeli toteaa.

Laivaston mittakaavassa kirjoittajat mallintavat 550 samanaikaista viiden sekunnin TTS‑pyyntöä täydessä hyötykuormassa. He laskevat, että sen ylläpitäminen vaatisi noin 11 L40S‑GPU:ta, joiden kiihdytyskustannus on noin 100 000 $, verrattuna 27 P100‑kiihdyttimeen, joiden kustannus on noin 27 000 $, tai 27 P150‑kiihdyttimeen, joiden kustannus on noin 37 000 $, mikä tarkoittaa 3–4‑kertaista etukäteiskustannusten vähenemistä heidän mallissaan.

Artikkeli raportoi myös, että yksi voimakkaasti optimoitu kerros, jossa on noin 6 miljardia kertolasku‑kertyminen‑operaatiota, suoritetaan noin 60 µs:ssä L40S:llä verrattuna noin 31 µs:iin P150:ssä. Kirjoittajat ennustavat, että tällaisen ydintason optimoinnin laajentaminen useampiin kerroksiin voisi tuottaa 8–12‑kertaisen kustannusnormeeratun parannuksen L40S‑vertailuarvoon nähden, nostaen nykyisestä 3,6‑kertaista järjestelmätason hyödystä.

Kirjoittajat asettavat natiivin BlockFloat8‑tuen laitteistokustannusten jakajaksi: nykyaikaiset GPU:t, joilla on tämä ominaisuus, sijoittuvat noin 40 000 $‑luokkaan per laite, he raportoivat, kun taas Tenstorrent mahdollistaa BlockFloat8‑suorituksen laitteistolla, jonka hinta on noin 1 000 $, mikä on kymmenkertainen ero hankintakustannuksissa heidän kuvauksessaan.

Numeraalinen haavoittuvuus ja PCC-tapaus

Artikkeli dokumentoi virheenkorjaustapaustutkimuksen Pearsonin korrelaatiokertoimen ympärillä, joka on standardi numeerinen samankaltaisuusmittari. Tekijät raportoivat, että L40S:n ja AMD EPYC 7352 -prosessorin tuotokset antoivat loppupisteen kertoimeksi vain 0,72 huolimatta identtisistä syötteistä, mutta tuottivat havaintokokemukseltaan erottamattoman äänen. Erillisessä tapauksessa kerros, jonka kerroin pyöristyi arvoon 1,0, aiheutti kuultavan rikkoutumisen, jonka erottaminen kesti yli kuukauden. Tekijät toteavat, että perinteiset tensori‑tason samankaltaisuusmittarit eivät ole luotettavia indikaattoreita TTS‑järjestelmien havaintoperusteiselle äänenlaadulle, ja että loppupisteen havaintotarkastus on välttämätöntä tarkkuuden vähentämistä varten.

Rajoitukset ja seuraavat askeleet

Tekijät toteavat, että tietyt kerrokset ovat edelleen liian numeerisesti herkkiä vähennetyn tarkkuuden tai lohko‑liukuluku‑suorituksen yhteydessä ilman havaintokorjausta, mikä rajoittaa koko mallin matalan tarkkuuden kattavuutta, ja että kääntäjän ja ohjelman asetuksia ei ole vielä täysin optimoitu.

28. syyskuuta 2026 tekninen julkaisu Smallest.ai:n mukaan Lightning V2 on maailman ensimmäinen TTS-malli, joka tuottaa korkealaatuista puhesynteesiä yhdistetyn BlockFloat8‑kvantisoinnin ja vähennetyn tarkkuuden aritmetiikan avulla. Yritys kertoi, että uudempi Lightning V3 ylittää jo V2:n laadussa ja arkkitehtonisessa tehokkuudessa, ja että se aikoo ottaa Lightning V3:n käyttöön Tenstorrent‑laitteistolla samoilla yhteissuunnitteluperiaatteilla, tavoitteena samankaltaiset tai suuremmat kustannusläpäisyt.

Theo Nash on AI‑luotu asiantuntija Unite.AI:ssa, joka kattaa AI‑infrastruktuurin, laskennan ja laitteistojärjestelmät, jotka mahdollistavat modernin tekoälyn. Hänen työnsä keskittyy suurten AI‑työkuormien teknisiin perusteisiin, mukaan lukien datakeskukset, kiihdyttimet, verkottuminen ja ohjelmistopino, jotka yhdistävät ne yhteen.

Analyyttisesta ja tekniikkavetoisesta näkökulmasta Theo tarkastelee, miten GPU:iden, räätälöidyn piisirun, muistirakenteiden ja hajautettujen järjestelmien edistysaskeleet mahdollistavat uudet AI‑mallien sukupolvet. Hän kiinnittää erityistä huomiota suorituskyvyn kompromisseihin, energiatehokkuuteen, skaalautuvuuteen ja käytännön rajoitteisiin, jotka muovaavat AI‑infrastruktuurin todellista käyttöönottoa.

Theo Nashin kirjoittamat artikkelit ovat AI‑luotuja ja Unite.AI:n toimituskunta tarkistaa ne varmistaakseen teknisen tarkkuuden, selkeyden ja vastuullisen kattavuuden nopeasti kehittyvässä AI‑laskentaympäristössä.