AI-mallit ja alustat

xAI julkaisee Grok Voice Transcribe 2.0 -puheentunnistusmallin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

xAI julkaisi Grok Voice Transcribe 2.0:n, sen uusimman puheentunnistusmallin, 18. syyskuuta 2026, pitäen erähinnoittelun $0.10 per hour of audio, ja kuvaili mallia kaksinkertaiseksi tarkemmaksi kuin Grok Voice Transcribe 1.0.

Grok Voice Transcribe 2.0 on rakennettu Grok Voice -taustalla olevan ääniperusmallin päälle. xAI:n mukaan Grok Voice jo ohjaa kymmeniä tuhansia asiakastukipuheluita päivittäin, litteroi miljoonia tunteja videokerrontaa ja toimii äänitoimijoina fyysisissä tuotteissa, mukaan lukien Grok‑avustaja Tesla‑ajoneuvoissa. Yritys kertoi, että uusi malli on koulutettu reaaliaikaisessa, meluisassa, monikielisessä äänessä, joka on tallennettu monipuolisissa ympäristöissä, ja sitä on viimeistelty jälkikoulutuksella, ja se kuvaili tulosta yhtenä tarkimmista saatavilla olevista puheentunnistuksen litterointimalleista todellisissa olosuhteissa.

Tarkkuusarvioinnit

xAI kertoi, että Grok Voice Transcribe 2.0 sijoittuu tarkkuudessa ensimmäiseksi 32 suoratoistomallin joukossa julkisella Artificial Analysis -tulostaululla. Julkisten mittareiden lisäksi yritys mittaa sanavirheprosenttia neljällä sisäisellä arviointijoukolla, jotka on poimittu tuotantoliikenteestä: puhelinääni asiakastukipuheluista, keskustelut Grokin kanssa, puhuttuja tunnistetietoja kuten tilikoodit ja sähköpostiosoitteet, sekä lyhyet monikieliset äänikomentojärjestelmät. Yritys raportoi, että uusi malli parantaa Grok Voice Transcribe 1.0:aa kaikilla neljällä joukkolla ja johtaa jokaisessa testissä puhelinjoukossa, joka koostuu 8 kHz englanninkielisistä asiakastukipuheluista. xAI:n julkaisemissa kaavioissa mallia verrataan Gemini 3.5 Transcribeen, MAI-Transcribe-2:een, ElevenLabs Scribe v2:een, Deepgram Nova-3:een ja Whisper Large v3:een näillä sisäisillä joukoilla.

Monikielinen litterointi on suurin tarkkuusparannus versioon 1.0 verrattuna, xAI:n mukaan. Yritys kertoi, että malli litteroi kymmeniä kieliä, tunnistaa kielen automaattisesti ja seuraa tallennuksen aikana tapahtuvia kielenvaihtoja yhdellä läpikäynnillä. Lyhyet ilmaukset, kuten auton sisäiset komennot, antavat mallille vähän kontekstia kielen tunnistamiseen; xAI:n 19 kieltä kattavassa lyhyiden fraasien ääniohjausjoukossa sanavirheprosentti laskee 20,6 prosentista 6,8 prosenttiin, yritys raportoi.

Ominaisuudet ja API‑pääsy

Speech-to-Text API:n kautta Grok Voice Transcribe 2.0 käsittelee erä‑litterointia tallennetuista tiedostoista ja URL‑osoitteista sekä reaaliaikaista suoratoistoa. Dokumentoidussa ominaisuuslistassa on sanatasoiset aikaleimat luottamusarvioilla, puheentunnistuksen erottelu ilman lisäkustannuksia, monikanavainen litterointi enintään kahdeksaan kanavaan, avainsanojen painotus enintään 100 toimialatermiä per pyyntö, tekstin muotoilu, joka palauttaa numerot, päivämäärät, valuutat, puhelinnumerot ja sähköpostiosoitteet kirjoitettuna, täytesanojen poisto sekä älykäs puheenvuoron tunnistus, joka havaitsee puhujan vuoron lopun äänitoimijoille. xAI kertoi, että olemassa olevat Speech-to-Text API‑integraatiot saavat tarkkuusparannuksen ilman koodimuutoksia.

Virallinen puheentunnistusdokumentaatio luettelee 12 tuettua ääniformaattia, enimmäistiedostokoon 500 MB, ja näytteenottotaajuudet 8000, 16000, 22050, 24000, 44100 ja 48000 Hz. Kielen parametri mahdollistaa kirjoitettuun muotoon tapahtuvan muotoilun 25 kielellä, joihin kuuluvat englanti, espanja, ranska, saksa, hindi, japani ja korea.

Eräpyynnöt käyttävät multipart‑lomaketietoja ja täytyy toimittaa joko ladattu tiedosto tai URL, jonka palvelin lataa ja litteroi; vastaus palauttaa koko litteroinnin, havaittua kieltä BCP‑47‑koodina, äänen keston sekunneissa sekä sanatasoiset segmentit aloitus- ja lopetusaikoineen. Suoratoistossa asiakkaat lähettävät raakaa ääntä binäärikehyksinä WebSocket‑päätepisteeseen wss://api.x.ai/v1/stt ja vastaanottavat JSON‑litterointitapahtumia äänen käsittelyn aikana, valinnaisten väliaikaisresultaattien ollessa lähetetty noin 500 millisekunnin välein.

Loomin käyttöönotto, hinnoittelu ja vanhentuminen

xAI kertoi, että Atlassian arvioi Grok Voice Transcribe 2.0:n olemassa olevaa litterointiratkaisuaan vastaan, totesi sen tarkemmaksi ja käyttää nyt mallia litteroidakseen jokaisen Loom‑videon, sen näytönkaappausproduktissa. xAI:n ilmoitus lainasi Sanchan Saxenaa, Atlassianin senior vice president of Teamwork Collection -roolia, työvirroista, jotka ohjaavat Loom‑litteroinnit Cursor‑koodausvälineeseen: “Kun Grok tehostaa Loomin puhe‑tekstiksi ja Cursor muuntaa sen koodiksi, suljemme silmukan kontekstista koodiin: tallenna mitä tarkoitat, ja työ tehdään.”

Hinnoittelu on identtinen Grok Voice Transcribe 1.0:n kanssa: $0.10 per ääni tunti erälitterointiin ja $0.20 per ääni tunti suoratoistoon, sisältäen erottelun, aikaleimat ja avainsanat. xAI kertoi, että Grok Voice Transcribe 2.0 tulee pian oletusmalliksi Speech-to-Text API:ssa ja että versio 1.0 vanhenee tulevina viikkoina; asiakkaat, jotka haluavat pysyä vanhemmassa mallissa siirtymän aikana, voivat kiinnittää grok-voice-transcribe-1.0:n pyyntöihinsä. Dokumentaatio listaa tällä hetkellä grok-voice-transcribe-1.0:n oletuksena, kun malliparametri jätetään pois, ja grok-voice-transcribe-2.0 on valittavissa sekä REST- että WebSocket‑päätepisteissä.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.