AI-modeller og platforme
xAI udgiver Grok Voice Transcribe 2.0 tale-til-tekst-model

xAI udgav Grok Voice Transcribe 2.0, deres seneste tale-til-tekst-model, den 18. september 2026, med batch-pris på $0.10 pr. time lyd, mens de beskrev modellen som dobbelt så præcis som Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 er bygget på lyd‑grundmodellen bag Grok Voice. Ifølge xAI driver Grok Voice allerede titusinder af kundesupport‑opkald om dagen, transskriberer millioner af timers video‑fortælling og kører stemme‑agenter i fysiske produkter, herunder Grok‑assistenten i Tesla‑køretøjer. Virksomheden sagde, at den nye model blev trænet på live, støjende, flersproget lyd optaget i en bred vifte af miljøer og finjusteret efter træning, og beskrev resultatet som en af de mest præcise transskriptionsmodeller til tale i virkelige situationer.
Nøjagtighedsvurderinger
xAI sagde, at Grok Voice Transcribe 2.0 rangerer som nummer ét i nøjagtighed blandt 32 streaming‑modeller på den offentlige Artificial Analysis‑leaderboard. Ud over offentlige benchmarks måler virksomheden ordfejlrate på fire interne evalueringssæt hentet fra produktions‑trafik: telefonisk lyd fra kundesupport‑opkald, samtaler med Grok, talte legitimationsoplysninger såsom kontokoder og e‑mail‑adresser samt korte flersprogede stemmekommandoer. Virksomheden rapporterede, at den nye model forbedrer Grok Voice Transcribe 1.0 på alle fire sæt og overgår alle modeller, den testede på telefon‑sættet, som består af 8 kHz engelske kundesupport‑opkald. xAI’s offentliggjorte diagrammer sammenligner modellen med Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 og Whisper Large v3 på de interne sæt.
Flersproget transskription er den største nøjagtighedsforbedring i forhold til version 1.0, ifølge xAI. Virksomheden sagde, at modellen transskriberer dusinvis af sprog, automatisk opdager sproget og følger sprogskift midt i optagelsen i ét forløb. Korte sætninger, såsom kommandoer i bilen, giver modellen lidt kontekst til at identificere sproget; på xAI’s kort‑sæt af stemmeassistent‑udtalelser på 19 sprog falder ordfejlraten fra 20,6 % til 6,8 %, rapporterede virksomheden.
Funktioner og API‑adgang
Via Speech-to-Text‑API’en håndterer Grok Voice Transcribe 2.0 batch‑transskription af optagede filer og URL’er samt real‑time streaming. Det dokumenterede funktionssæt omfatter ord‑niveau tidsstempler med tillids‑score, taler‑diarisering uden ekstra omkostninger, multikanal‑transskription af op til otte kanaler, nøgleord‑bias på op til 100 domæne‑termer pr. anmodning, tekstformatering der returnerer tal, datoer, valutaer, telefonnumre og e‑mail‑adresser i skriftlig form, fjernelse af fyldord og intelligent tur‑detektion som identificerer afslutningen på en talers tur for stemme‑agenter. xAI sagde, at eksisterende Speech-to-Text‑API‑integrationer får nøjagtighedsforbedringen uden kodeændringer.
Den officielle speech-to-text-dokumentation angiver 12 understøttede lydformater, en maksimal filstørrelse på 500 MB og samplingshastigheder på 8000, 16000, 22050, 24000, 44100 og 48000 Hz. En sprogparameter muliggør formatering i skriftlig form på tværs af 25 sprog, herunder engelsk, spansk, fransk, tysk, hindi, japansk og koreansk.
Batch‑anmodninger bruger multipart‑form‑data og skal levere enten en uploadet fil eller en URL, som serveren kan downloade og transskribere; svaret returnerer den fulde transskribering, det detekterede sprog som en BCP‑47‑kode, lydvarighed i sekunder og ord‑niveau segmenter med start‑ og sluttider. For streaming sender klienter rå lyd som binære rammer til et WebSocket‑endpoint på wss://api.x.ai/v1/stt og modtager JSON‑transskript‑begivenheder, mens lyden behandles, med valgfrie mellemliggende resultater udsendt ca. hver 500 millisekund.
Loom‑implementering, prisfastsættelse og udfasning
xAI sagde, at Atlassian evaluerede Grok Voice Transcribe 2.0 mod deres eksisterende transskriptionsløsning, fandt den mere præcis og bruger nu modellen til at transskribere hver video på Loom, deres skærm‑optagelsesprodukt. xAI’s meddelelse citerede Sanchan Saxena, senior vice president for Teamwork Collection hos Atlassian, om arbejdsgange der fører Loom‑transskriberinger ind i Cursor‑kodningsværktøjet: “Med Grok som driver Looms tale‑til‑tekst og Cursor som omsætter det til kode, lukker vi løkken fra kontekst til kode: optag hvad du mener, og arbejdet bliver udført.”
Prisen er identisk med Grok Voice Transcribe 1.0: $0.10 pr. time lyd for batch‑transskription og $0.20 pr. time for streaming, med diarisation, tidsstempler og nøgleord inkluderet. xAI sagde, at Grok Voice Transcribe 2.0 snart bliver standardmodellen i Speech-to-Text‑API’en, og at version 1.0 vil blive udfaset i de kommende uger; kunder, der ønsker at blive på den ældre model under overgangen, kan fastgøre grok-voice-transcribe-1.0 i deres anmodninger. Dokumentationen angiver i øjeblikket grok-voice-transcribe-1.0 som standard, når modelparameteren udelades, med grok-voice-transcribe-2.0 som valgmulighed på både REST‑ og WebSocket‑endpoints.












