KI-Modelle und Plattformen
xAI veröffentlicht Grok Voice Transcribe 2.0 Sprach‑zu‑Text‑Modell

xAI hat am 18. September 2026 Grok Voice Transcribe 2.0, sein neuestes Sprach‑zu‑Text‑Modell, veröffentlicht und die Batch‑Preisgestaltung bei $0.10 pro Stunde Audio beibehalten, während es das Modell als doppelt so genau wie Grok Voice Transcribe 1.0 beschreibt.
Grok Voice Transcribe 2.0 basiert auf dem Audio‑Grundlagenmodell hinter Grok Voice. Laut xAI unterstützt Grok Voice bereits täglich Zehntausende von Kunden‑Support‑Anrufen, transkribiert Millionen Stunden Videonarration und betreibt Sprach‑Agents in physischen Produkten, einschließlich des Grok‑Assistenten in Tesla‑Fahrzeugen. Das Unternehmen erklärte, dass das neue Modell mit Live‑, rauschen‑ und mehrsprachigem Audio, das in einer Vielzahl von Umgebungen aufgenommen wurde, trainiert und anschließend nachträglich verfeinert wurde, und es beschrieb das Ergebnis als eines der genauesten Transkriptionsmodelle, die für Sprache in realen Einsatzszenarien verfügbar sind.
Genauigkeitsbewertungen
xAI sagte, dass Grok Voice Transcribe 2.0 in Bezug auf Genauigkeit unter 32 Streaming‑Modellen auf dem öffentlichen Artificial Analysis‑Leaderboard den ersten Platz belegt. Neben öffentlichen Benchmarks misst das Unternehmen die Wortfehlerrate in vier internen Evaluationssets, die aus Produktionsverkehr stammen: Telefon‑Audio von Kunden‑Support‑Anrufen, Unterhaltungen mit Grok, gesprochene Zugangsdaten wie Kontocodes und E‑Mail‑Adressen sowie kurze mehrsprachige Sprachbefehle. Das Unternehmen berichtete, dass das neue Modell im Vergleich zu Grok Voice Transcribe 1.0 in allen vier Sets Verbesserungen zeigt und jedes getestete Modell im Telefon‑Set, das aus 8 kHz‑englischen Kunden‑Support‑Anrufen besteht, übertrifft. Die von xAI veröffentlichten Diagramme vergleichen das Modell mit Gemini 3.5 Transcribe, MAI‑Transcribe‑2, ElevenLabs Scribe v2, Deepgram Nova‑3 und Whisper Large v3 in diesen internen Sets.
Laut xAI ist die mehrsprachige Transkription der größte Genauigkeitszuwachs gegenüber Version 1.0. Das Unternehmen erklärte, dass das Modell Dutzende von Sprachen transkribiert, die Sprache automatisch erkennt und Sprachwechsel während der Aufnahme in einem Durchgang verarbeitet. Kurze Phrasen, wie Befehle im Auto, bieten dem Modell wenig Kontext, um die Sprache zu identifizieren; in xAIs Kurzphrasen‑Set von Sprachassistent‑Äußerungen in 19 Sprachen sinkt die Wortfehlerrate laut Bericht des Unternehmens von 20,6 % auf 6,8 %.
Funktionen und API‑Zugang
Über die Speech-to-Text API verarbeitet Grok Voice Transcribe 2.0 Batch‑Transkriptionen von aufgezeichneten Dateien und URLs sowie Echtzeit‑Streaming. Der dokumentierte Funktionsumfang umfasst Wort‑Zeitstempel mit Konfidenz‑Scores, Sprecher‑Diarisierung ohne Zusatzkosten, Mehrkanal‑Transkription von bis zu acht Kanälen, Schlüsselwort‑Biasing von bis zu 100 Domänenbegriffen pro Anfrage, Textformatierung, die Zahlen, Daten, Währungen, Telefonnummern und E‑Mail‑Adressen in ausgeschriebener Form zurückgibt, das Entfernen von Füllwörtern sowie intelligente Turn‑Erkennung, die das Ende einer Sprecherrunde für Sprach‑Agents identifiziert. xAI erklärte, dass bestehende Speech-to-Text API‑Integrationen die Genauigkeitsverbesserung ohne Code‑Änderungen erhalten.
Die offizielle Spracherkennungsdokumentation listet 12 unterstützte Audioformate, eine maximale Dateigröße von 500 MB und Abtastraten von 8000, 16000, 22050, 24000, 44100 und 48000 Hz auf. Ein Sprachparameter ermöglicht die Formatierung in Schreibform für 25 Sprachen, darunter Englisch, Spanisch, Französisch, Deutsch, Hindi, Japanisch und Koreanisch.
Batch‑Anfragen verwenden multipart‑Formulardaten und müssen entweder eine hochgeladene Datei oder eine URL bereitstellen, die der Server herunterladen und transkribieren kann; die Antwort liefert das vollständige Transkript, die erkannte Sprache als BCP‑47‑Code, die Audiodauer in Sekunden sowie wort‑level Segmente mit Start‑ und Endzeit. Für Streaming senden Clients Roh‑Audio als Binär‑Frames an einen WebSocket‑Endpunkt unter wss://api.x.ai/v1/stt und erhalten JSON‑Transkript‑Ereignisse, während das Audio verarbeitet wird, wobei optionale Zwischenergebnisse etwa alle 500 Millisekunden ausgegeben werden.
Loom‑Einsatz, Preisgestaltung und Stilllegung
xAI sagte, Atlassian habe Grok Voice Transcribe 2.0 gegenüber seiner bestehenden Transkriptionslösung evaluiert, es als genauer befunden und verwendet nun das Modell, um jedes Video auf Loom, seinem Bildschirm‑Aufnahme‑Produkt, zu transkribieren. xAI-Ankündigung zitierte Sanchan Saxena, Senior Vice President of Teamwork Collection bei Atlassian, zu Workflows, die Loom‑Transkripte in das Cursor‑Coding‑Tool leiten: „Mit Grok, das Looms Sprach‑zu‑Text betreibt, und Cursor, das das in Code umwandelt, schließen wir die Schleife von Kontext zu Code: Aufzeichnen, was Sie meinen, und die Arbeit wird erledigt.“
Die Preisgestaltung entspricht der von Grok Voice Transcribe 1.0: $0.10 pro Stunde Audio für Batch‑Transkription und $0.20 pro Stunde für Streaming, wobei Diarisierung, Zeitstempel und Schlüsselbegriffe enthalten sind. xAI erklärte, dass Grok Voice Transcribe 2.0 bald das Standardmodell in der Speech-to-Text API wird und dass Version 1.0 in den kommenden Wochen eingestellt wird; Kunden, die während der Umstellung beim früheren Modell bleiben möchten, können grok-voice-transcribe-1.0 in ihren Anfragen festlegen. Die Dokumentation listet derzeit grok-voice-transcribe-1.0 als Standard, wenn der Modell‑Parameter weggelassen wird, wobei grok-voice-transcribe-2.0 sowohl an den REST‑ als auch an den WebSocket‑Endpunkten auswählbar ist.












