AI-modellen en platforms
xAI brengt Grok Voice Transcribe 2.0 spraak-naar-tekstmodel uit

xAI bracht op 18 september 2026 Grok Voice Transcribe 2.0, zijn nieuwste spraak-naar-tekstmodel, uit, met een batchprijs van $0.10 per uur audio, en beschreef het model als twee keer zo nauwkeurig als Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 is gebouwd op het audio‑fundamentmodel achter Grok Voice. Volgens xAI ondersteunt Grok Voice al tienduizenden klantenservice‑gesprekken per dag, transcribeert miljoenen uren video‑narratie en draait spraakagenten in fysieke producten, waaronder de Grok‑assistent in Tesla‑voertuigen. Het bedrijf zei dat het nieuwe model is getraind op live, lawaaierige, meertalige audio die in diverse omgevingen is opgenomen en vervolgens is verfijnd met post‑training, en beschreef het resultaat als een van de meest nauwkeurige transcriptiemodellen die beschikbaar zijn voor spraak in real‑world‑omgevingen.
Nauwkeurigheidsevaluaties
xAI zei dat Grok Voice Transcribe 2.0 qua nauwkeurigheid op de openbare Artificial Analysis‑ranglijst de eerste plaats behaalt onder 32 streaming‑modellen. Naast openbare benchmarks meet het bedrijf de woordfoutpercentage op vier interne evaluatiesets die zijn afgeleid van productieverkeer: telefonische audio van klantenservice‑gesprekken, gesprekken met Grok, gesproken inloggegevens zoals accountcodes en e‑mailadressen, en korte meertalige spraakopdrachten. Het bedrijf meldde dat het nieuwe model beter presteert dan Grok Voice Transcribe 1.0 op alle vier de sets en elk model dat het testte op de telefonische set, die bestaat uit Engelstalige klantenservice‑gesprekken van 8 kHz, voorloopt. De door xAI gepubliceerde grafieken vergelijken het model met Gemini 3.5 Transcribe, MAI‑Transcribe‑2, ElevenLabs Scribe v2, Deepgram Nova‑3 en Whisper Large v3 op die interne sets.
Volgens xAI is meertalige transcriptie de grootste nauwkeurigheidswinst ten opzichte van versie 1.0. Het bedrijf zei dat het model tientallen talen transcribeert, de taal automatisch detecteert en tijdens een opname taalwisselingen in één doorloop volgt. Korte zinnen, zoals commando’s in de auto, geven het model weinig context om de taal te identificeren; op xAI’s korte‑zinnen‑set van spraakassistent‑uitingen in 19 talen daalde het woordfoutpercentage van 20,6 procent naar 6,8 procent, meldde het bedrijf.
Functies en API‑toegang
Via de Speech-to-Text‑API verwerkt Grok Voice Transcribe 2.0 batch‑transcriptie van opgenomen bestanden en URL’s, evenals realtime streaming. De gedocumenteerde functieset omvat woord‑niveau tijdstempels met vertrouwensscores, spreker‑diarisatie zonder extra kosten, multikanaal‑transcriptie tot acht kanalen, biasing van sleuteltermen tot 100 domeintermen per aanvraag, tekstopmaak die getallen, data, valuta, telefoonnummers en e‑mailadressen in geschreven vorm retourneert, het verwijderen van vulwoorden, en slimme beurtdetectie die het einde van de beurt van een spreker voor spraak‑agenten identificeert. xAI zei dat bestaande Speech-to-Text‑API‑integraties de nauwkeurigheidsverbetering ontvangen zonder code‑wijzigingen.
De officiële speech-to-text documentatie vermeldt 12 ondersteunde audioformaten, een maximale bestandsgrootte van 500 MB en sample‑rates van 8000, 16000, 22050, 24000, 44100 en 48000 Hz. Een taalparameter maakt tekstopmaak in geschreven vorm mogelijk voor 25 talen, waaronder Engels, Spaans, Frans, Duits, Hindi, Japans en Koreaans.
Batch‑aanvragen gebruiken multipart‑form‑data en moeten ofwel een geüpload bestand of een URL leveren die de server kan downloaden en transcriberen; het antwoord retourneert de volledige transcriptie, de gedetecteerde taal als een BCP‑47‑code, de audioduur in seconden en woord‑niveau segmenten met begin‑ en eindtijden. Voor streaming sturen clients ruwe audio als binaire frames naar een WebSocket‑endpoint op wss://api.x.ai/v1/stt en ontvangen JSON‑transcriptie‑events terwijl de audio wordt verwerkt, met optionele tussentijdse resultaten die ongeveer elke 500 milliseconden worden uitgezonden.
Loom-implementatie, prijsstelling en veroudering
xAI zei dat Atlassian Grok Voice Transcribe 2.0 heeft geëvalueerd ten opzichte van zijn bestaande transcriptieoplossing, het nauwkeuriger vond, en nu het model gebruikt om elke video op Loom, hun schermopname‑product, te transcriberen. xAI’s aankondiging citeerde Sanchan Saxena, senior vice president van Teamwork Collection bij Atlassian, over werkstromen die Loom‑transcripties naar de Cursor‑codeertool leiden: “Met Grok die Loom’s spraak‑naar‑tekst aandrijft en Cursor die dat naar code omzet, sluiten we de lus van context naar code: neem op wat je bedoelt, en het werk wordt gedaan.”
De prijsstelling is identiek aan Grok Voice Transcribe 1.0: $0.10 per uur audio voor batch‑transcriptie en $0.20 per uur voor streaming, met diarisatie, tijdstempels en sleuteltermen inbegrepen. xAI zei dat Grok Voice Transcribe 2.0 binnenkort het standaardmodel wordt in de Speech-to-Text‑API en dat versie 1.0 in de komende weken zal worden uitgefaseerd; klanten die tijdens de overgang op het eerdere model willen blijven, kunnen grok-voice-transcribe-1.0 in hun aanvragen vastzetten. De documentatie vermeldt momenteel grok-voice-transcribe-1.0 als standaard wanneer de modelparameter wordt weggelaten, met grok-voice-transcribe-2.0 selecteerbaar op zowel de REST‑ als WebSocket‑endpoints.












