AI-modeller och plattformar
xAI lanserar Grok Voice Transcribe 2.0 tal‑till‑text‑modell

xAI släppte Grok Voice Transcribe 2.0, sin senaste tal‑till‑text‑modell, den 18 september 2026, med batch‑prissättning på $0.10 per timme ljud och beskrev modellen som dubbelt så exakt som Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 är byggd på den ljudbasmodell som ligger bakom Grok Voice. Enligt xAI driver Grok Voice redan tiotusentals kundsupport‑samtal per dag, transkriberar miljontals timmars videoberättelse och kör röstagenter i fysiska produkter, inklusive Grok‑assistenten i Tesla‑fordon. Företaget uppgav att den nya modellen tränades på levande, bullriga, flerspråkiga ljud inspelade i en mängd olika miljöer och förfinades med efterträning, och beskrev resultatet som en av de mest exakta transkriptionsmodellerna som finns för tal i verkliga situationer.
Noggrannhetsutvärderingar
xAI uppgav att Grok Voice Transcribe 2.0 rankas först i noggrannhet bland 32 strömningsmodeller på den offentliga Artificial Analysis‑topplistan. Utöver offentliga benchmarkar mäter företaget ordfelprocent på fyra interna utvärderingsuppsättningar hämtade från produktions trafik: telefonljud från kundsupport‑samtal, konversationer med Grok, talade referenser såsom kontokoder och e‑postadresser, samt korta flerspråkiga röstkommandon. Företaget rapporterade att den nya modellen förbättras jämfört med Grok Voice Transcribe 1.0 på alla fyra uppsättningar och överträffar varje modell den testade på telefonuppsättningen, som består av 8 kHz engelska kundsupport‑samtal. xAIs publicerade diagram jämför modellen med Gemini 3.5 Transcribe, MAI‑Transcribe‑2, ElevenLabs Scribe v2, Deepgram Nova‑3 och Whisper Large v3 på dessa interna uppsättningar.
Flerspråkig transkribering är den största noggrannhetsökningen jämfört med version 1.0, enligt xAI. Företaget sade att modellen transkriberar dussintals språk, automatiskt upptäcker språket och följer språkbyten mitt i inspelningen i ett enda pass. Kortare fraser, såsom kommandon i bilen, ger modellen lite kontext för att identifiera språket; i xAIs kortfrasuppsättning av röstassistent‑uttalanden på 19 språk sjunker ordfelprocenten från 20,6 % till 6,8 %, rapporterade företaget.
Funktioner och API‑åtkomst
Via Speech-to-Text‑API:et hanterar Grok Voice Transcribe 2.0 batch‑transkribering av inspelade filer och URL‑er samt realtids‑strömning. Den dokumenterade funktionsuppsättningen inkluderar tidsstämplar på ordnivå med konfidenspoäng, talardiarisering utan extra kostnad, flerkannels‑transkribering för upp till åtta kanaler, nyckelordsbias för upp till 100 domäntermer per begäran, textformatering som returnerar siffror, datum, valutor, telefonnummer och e‑postadresser i skriven form, borttagning av utfyllnadsord samt smart vändningsdetektering som identifierar slutet på en talares tur för röstagenter. xAI sade att befintliga Speech-to-Text‑API‑integrationer får noggrannhetsförbättringen utan kodändringar.
Den officiella tal‑till‑text‑dokumentation listar 12 stödda audioformat, en maximal filstorlek på 500 MB och samplingsfrekvenser på 8000, 16000, 22050, 24000, 44100 och 48000 Hz. En språkparameter möjliggör formatering i skriven form för 25 språk, däribland engelska, spanska, franska, tyska, hindi, japanska och koreanska.
Batch‑förfrågningar använder multipart‑formulärdata och måste tillhandahålla antingen en uppladdad fil eller en URL som servern kan ladda ner och transkribera; svaret returnerar hela transkriptet, det upptäckta språket som en BCP‑47‑kod, ljudlängden i sekunder samt ordnivåsegment med start‑ och sluttider. För strömning skickar klienter råljud som binära ramar till en WebSocket‑endpoint på wss://api.x.ai/v1/stt och får JSON‑transkript‑händelser medan ljudet bearbetas, med valfria interimresultat som sänds ungefär var 500 millisekund.
Loom‑distribution, prissättning och avveckling
xAI uppgav att Atlassian utvärderade Grok Voice Transcribe 2.0 mot sin befintliga transkriptionslösning, fann den mer exakt och använder nu modellen för att transkribera varje video på Loom, deras skärminspelningsprodukt. xAIs tillkännagivande citerade Sanchan Saxena, senior vice president för Teamwork Collection på Atlassian, om arbetsflöden som kanaliserar Loom‑transkript till kodverktyget Cursor: “Med Grok som driver Looms tal‑till‑text och Cursor som omvandlar det till kod, stänger vi loopen från kontext till kod: spela in vad du menar, så blir arbetet gjort.”
Prissättningen är identisk med Grok Voice Transcribe 1.0: $0.10 per timme ljud för batch‑transkribering och $0.20 per timme för strömning, med diarisation, tidsstämplar och nyckelord inkluderade. xAI sade att Grok Voice Transcribe 2.0 snart blir standardmodellen i Speech-to-Text‑API:et och att version 1.0 kommer att avvecklas de kommande veckorna; kunder som vill behålla den äldre modellen under övergången kan fästa grok-voice-transcribe-1.0 i sina förfrågningar. Dokumentationen listar för närvarande grok-voice-transcribe-1.0 som standard när modellparametern utelämnas, med grok-voice-transcribe-2.0 valbar på både REST‑ och WebSocket‑endpointarna.












