AI-modeller og plattformer

xAI lanserer Grok Voice Transcribe 2.0 tale-til-tekst-modell

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

xAI lanserte Grok Voice Transcribe 2.0, sin nyeste tale-til-tekst-modell, den 18. september 2026, med batch-prising på $0.10 per time med lyd, og beskrev modellen som dobbelt så nøyaktig som Grok Voice Transcribe 1.0.

Grok Voice Transcribe 2.0 er bygget på lyd‑grunnmodellen bak Grok Voice. Ifølge xAI driver Grok Voice allerede titusenvis av kundesupport‑samtaler daglig, transkriberer millioner av timer med video‑fortelling, og kjører stemmeagenter i fysiske produkter, inkludert Grok‑assistenten i Tesla‑kjøretøy. Selskapet oppga at den nye modellen ble trent på levende, støyende, flerspråklig lyd innspilt i et variert sett av miljøer og finjustert etter trening, og beskrev resultatet som en av de mest nøyaktige transkripsjonsmodellene som finnes for tale i virkelige situasjoner.

Nøyaktighetsvurderinger

xAI oppga at Grok Voice Transcribe 2.0 rangerer først i nøyaktighet blant 32 strømme‑modeller på den offentlige Artificial Analysis‑resultatliste. Utover offentlige måledata måler selskapet ordfeilrate på fire interne evalueringssett hentet fra produksjonstrafikk: telefonlyd fra kundesupport‑samtaler, samtaler med Grok, uttalte legitimasjonsdata som kontokoder og e‑postadresser, samt korte flerspråklige stemmekommandoer. Selskapet rapporterte at den nye modellen forbedrer seg i forhold til Grok Voice Transcribe 1.0 på alle fire settene og overgår alle modeller den testet på telefonsettet, som består av 8 kHz engelske kundesupport‑samtaler. xAI sin publiserte diagrammer sammenligner modellen med Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 og Whisper Large v3 på disse interne settene.

Flerspråklig transkripsjon er den største nøyaktighetsgevinsten sammenlignet med versjon 1.0, ifølge xAI. Selskapet oppga at modellen transkriberer dusinvis av språk, oppdager språket automatisk, og følger språkbytter under opptak i ett enkelt pass. Korte fraser, som kommandoer i bilen, gir modellen lite kontekst for å identifisere språket; i xAI sitt kort‑frasesett med stemmeassistent‑uttalelser på 19 språk, falt ordfeilraten fra 20.6 prosent til 6.8 prosent, rapporterte selskapet.

Funksjoner og API‑tilgang

Via Speech-to-Text API håndterer Grok Voice Transcribe 2.0 batch‑transkripsjon av innspilte filer og URL‑er samt sanntids‑strømming. Det dokumenterte funksjonssettet inkluderer tidsstempler på ordnivå med konfidens‑score, taler‑diarisering uten ekstra kostnad, flerkannelses‑transkripsjon for opptil åtte kanaler, nøkkelord‑bias for opptil 100 domenetermer per forespørsel, tekstformatering som returnerer tall, datoer, valutaer, telefonnumre og e‑postadresser i skriftlig form, fjerning av fyllord, og smart turn‑deteksjon som identifiserer slutten på en talers tur for stemmeagenter. xAI oppga at eksisterende Speech-to-Text API‑integrasjoner får nøyaktighetsforbedringen uten kodeendringer.

Den offisielle speech-to-text-dokumentasjonen lister 12 støttede lydformater, en maksimal filstørrelse på 500 MB, og samplingsfrekvenser på 8000, 16000, 22050, 24000, 44100 og 48000 Hz. En språkparameter gjør det mulig med formatering i skriftlig form på 25 språk, blant dem engelsk, spansk, fransk, tysk, hindi, japansk og koreansk.

Batch‑forespørsler bruker multipart‑form‑data og må levere enten en opplastet fil eller en URL som serveren kan laste ned og transkribere; svaret returnerer hele transkripsjonen, det oppdagede språket som en BCP‑47‑kode, lydvarigheten i sekunder, og ord‑nivå‑segmenter med start‑ og slutt‑tidspunkter. For strømming sender klienter rålyd som binære rammer til et WebSocket‑endepunkt på wss://api.x.ai/v1/stt og mottar JSON‑transkripsjons‑hendelser mens lyden behandles, med valgfrie mellomresultater som sendes omtrent hver 500 millisekund.

Loom‑implementering, prisfastsettelse og avvikling

xAI oppga at Atlassian evaluerte Grok Voice Transcribe 2.0 mot sin eksisterende transkripsjonsløsning, fant den mer nøyaktig, og nå bruker modellen til å transkribere hver video på Loom, deres skjerm‑opptaksprodukt. xAI sin kunngjøring siterte Sanchan Saxena, senior visepresident for Teamwork Collection hos Atlassian, om arbeidsflyter som sender Loom‑transkripsjoner inn i kodeverktøyet Cursor: «Med Grok som driver Looms tale‑til‑tekst og Cursor som gjør dette om til kode, lukker vi sløyfen fra kontekst til kode: spill inn hva du mener, og arbeidet blir gjort.»

Prisfastsettelsen er identisk med Grok Voice Transcribe 1.0: $0.10 per time med lyd for batch‑transkripsjon og $0.20 per time for strømming, med diarization, tidsstempler og nøkkelord inkludert. xAI oppga at Grok Voice Transcribe 2.0 snart vil bli standardmodellen i Speech-to-Text API og at versjon 1.0 vil bli avviklet i løpet av de kommende ukene; kunder som ønsker å forbli på den eldre modellen under overgangen kan feste grok-voice-transcribe-1.0 i sine forespørsler. Dokumentasjonen viser for tiden grok-voice-transcribe-1.0 som standard når modellparameteren utelates, med grok-voice-transcribe-2.0 valgbar på både REST‑ og WebSocket‑endepunktene.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.