AI-modeller og plattformer
xAI lanserer Grok Voice Transcribe 2.0 tale-til-tekst-modell

xAI lanserte Grok Voice Transcribe 2.0, sin nyeste tale-til-tekst-modell, den 18. september 2026, med batch-prising på $0.10 per time med lyd, og beskrev modellen som dobbelt så nøyaktig som Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 er bygget på lyd‑grunnmodellen bak Grok Voice. Ifølge xAI driver Grok Voice allerede titusenvis av kundesupport‑samtaler daglig, transkriberer millioner av timer med video‑fortelling, og kjører stemmeagenter i fysiske produkter, inkludert Grok‑assistenten i Tesla‑kjøretøy. Selskapet oppga at den nye modellen ble trent på levende, støyende, flerspråklig lyd innspilt i et variert sett av miljøer og finjustert etter trening, og beskrev resultatet som en av de mest nøyaktige transkripsjonsmodellene som finnes for tale i virkelige situasjoner.
Nøyaktighetsvurderinger
xAI oppga at Grok Voice Transcribe 2.0 rangerer først i nøyaktighet blant 32 strømme‑modeller på den offentlige Artificial Analysis‑resultatliste. Utover offentlige måledata måler selskapet ordfeilrate på fire interne evalueringssett hentet fra produksjonstrafikk: telefonlyd fra kundesupport‑samtaler, samtaler med Grok, uttalte legitimasjonsdata som kontokoder og e‑postadresser, samt korte flerspråklige stemmekommandoer. Selskapet rapporterte at den nye modellen forbedrer seg i forhold til Grok Voice Transcribe 1.0 på alle fire settene og overgår alle modeller den testet på telefonsettet, som består av 8 kHz engelske kundesupport‑samtaler. xAI sin publiserte diagrammer sammenligner modellen med Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 og Whisper Large v3 på disse interne settene.
Flerspråklig transkripsjon er den største nøyaktighetsgevinsten sammenlignet med versjon 1.0, ifølge xAI. Selskapet oppga at modellen transkriberer dusinvis av språk, oppdager språket automatisk, og følger språkbytter under opptak i ett enkelt pass. Korte fraser, som kommandoer i bilen, gir modellen lite kontekst for å identifisere språket; i xAI sitt kort‑frasesett med stemmeassistent‑uttalelser på 19 språk, falt ordfeilraten fra 20.6 prosent til 6.8 prosent, rapporterte selskapet.
Funksjoner og API‑tilgang
Via Speech-to-Text API håndterer Grok Voice Transcribe 2.0 batch‑transkripsjon av innspilte filer og URL‑er samt sanntids‑strømming. Det dokumenterte funksjonssettet inkluderer tidsstempler på ordnivå med konfidens‑score, taler‑diarisering uten ekstra kostnad, flerkannelses‑transkripsjon for opptil åtte kanaler, nøkkelord‑bias for opptil 100 domenetermer per forespørsel, tekstformatering som returnerer tall, datoer, valutaer, telefonnumre og e‑postadresser i skriftlig form, fjerning av fyllord, og smart turn‑deteksjon som identifiserer slutten på en talers tur for stemmeagenter. xAI oppga at eksisterende Speech-to-Text API‑integrasjoner får nøyaktighetsforbedringen uten kodeendringer.
Den offisielle speech-to-text-dokumentasjonen lister 12 støttede lydformater, en maksimal filstørrelse på 500 MB, og samplingsfrekvenser på 8000, 16000, 22050, 24000, 44100 og 48000 Hz. En språkparameter gjør det mulig med formatering i skriftlig form på 25 språk, blant dem engelsk, spansk, fransk, tysk, hindi, japansk og koreansk.
Batch‑forespørsler bruker multipart‑form‑data og må levere enten en opplastet fil eller en URL som serveren kan laste ned og transkribere; svaret returnerer hele transkripsjonen, det oppdagede språket som en BCP‑47‑kode, lydvarigheten i sekunder, og ord‑nivå‑segmenter med start‑ og slutt‑tidspunkter. For strømming sender klienter rålyd som binære rammer til et WebSocket‑endepunkt på wss://api.x.ai/v1/stt og mottar JSON‑transkripsjons‑hendelser mens lyden behandles, med valgfrie mellomresultater som sendes omtrent hver 500 millisekund.
Loom‑implementering, prisfastsettelse og avvikling
xAI oppga at Atlassian evaluerte Grok Voice Transcribe 2.0 mot sin eksisterende transkripsjonsløsning, fant den mer nøyaktig, og nå bruker modellen til å transkribere hver video på Loom, deres skjerm‑opptaksprodukt. xAI sin kunngjøring siterte Sanchan Saxena, senior visepresident for Teamwork Collection hos Atlassian, om arbeidsflyter som sender Loom‑transkripsjoner inn i kodeverktøyet Cursor: «Med Grok som driver Looms tale‑til‑tekst og Cursor som gjør dette om til kode, lukker vi sløyfen fra kontekst til kode: spill inn hva du mener, og arbeidet blir gjort.»
Prisfastsettelsen er identisk med Grok Voice Transcribe 1.0: $0.10 per time med lyd for batch‑transkripsjon og $0.20 per time for strømming, med diarization, tidsstempler og nøkkelord inkludert. xAI oppga at Grok Voice Transcribe 2.0 snart vil bli standardmodellen i Speech-to-Text API og at versjon 1.0 vil bli avviklet i løpet av de kommende ukene; kunder som ønsker å forbli på den eldre modellen under overgangen kan feste grok-voice-transcribe-1.0 i sine forespørsler. Dokumentasjonen viser for tiden grok-voice-transcribe-1.0 som standard når modellparameteren utelates, med grok-voice-transcribe-2.0 valgbar på både REST‑ og WebSocket‑endepunktene.












