Modèles et plateformes d’IA
xAI lance le modèle de transcription vocale Grok Voice Transcribe 2.0

xAI a publié Grok Voice Transcribe 2.0, son dernier modèle de transcription vocale, le 18 septembre 2026, en maintenant un tarif batch de $0.10 par heure d’audio tout en décrivant le modèle comme deux fois plus précis que Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 repose sur le modèle de base audio qui sous-tend Grok Voice. Selon xAI, Grok Voice alimente déjà des dizaines de milliers d’appels de support client chaque jour, transcrit des millions d’heures de narration vidéo et fait fonctionner des agents vocaux dans des produits physiques, y compris l’assistant Grok dans les véhicules Tesla. L’entreprise a indiqué que le nouveau modèle a été entraîné sur des enregistrements audio en direct, bruyants et multilingues, capturés dans une grande variété d’environnements, puis affiné après l’entraînement, et elle a décrit le résultat comme l’un des modèles de transcription les plus précis disponibles pour la parole en conditions réelles.
Évaluations de précision
xAI a indiqué que Grok Voice Transcribe 2.0 se classe premier en termes de précision parmi 32 modèles de streaming sur le classement public Artificial Analysis. Au‑delà des benchmarks publics, l’entreprise mesure le taux d’erreur de mots sur quatre jeux d’évaluation internes issus du trafic de production : l’audio téléphonique des appels de support client, les conversations avec Grok, les informations d’identification orales telles que les codes de compte et les adresses e‑mail, ainsi que les courtes commandes vocales multilingues. L’entreprise a rapporté que le nouveau modèle améliore Grok Voice Transcribe 1.0 sur les quatre ensembles et surpasse tous les modèles testés sur l’ensemble téléphonique, qui comprend des appels de support client en anglais à 8 kHz. Les graphiques publiés par xAI comparent le modèle à Gemini 3.5 Transcribe, MAI‑Transcribe‑2, ElevenLabs Scribe v2, Deepgram Nova‑3 et Whisper Large v3 sur ces ensembles internes.
Selon xAI, la transcription multilingue représente le gain de précision le plus important par rapport à la version 1.0. L’entreprise a déclaré que le modèle transcrit des dizaines de langues, détecte automatiquement la langue et suit les changements de langue en cours d’enregistrement en une seule passe. Les courtes phrases, comme les commandes embarquées, offrent peu de contexte au modèle pour identifier la langue ; sur l’ensemble de courtes phrases d’assistants vocaux de xAI couvrant 19 langues, le taux d’erreur de mots est passé de 20,6 % à 6,8 %, selon l’entreprise.
Fonctionnalités et accès à l’API
Via l’API de transcription vocale, Grok Voice Transcribe 2.0 gère la transcription par lots de fichiers enregistrés et d’URL ainsi que le streaming en temps réel. L’ensemble de fonctionnalités documentées comprend des horodatages au niveau des mots avec scores de confiance, la diarisation des locuteurs sans coût supplémentaire, la transcription multicanal jusqu’à huit canaux, le biaisage de termes clés jusqu’à 100 termes de domaine par requête, le formatage du texte qui restitue les nombres, dates, devises, numéros de téléphone et adresses e‑mail sous forme écrite, la suppression des mots de remplissage et la détection intelligente des tours de parole qui identifie la fin du tour d’un locuteur pour les agents vocaux. xAI a indiqué que les intégrations existantes de l’API de transcription vocale bénéficient de l’amélioration de précision sans modification de code.
La documentation officielle documentation de transcription vocale répertorie 12 formats audio pris en charge, une taille maximale de fichier de 500 MB et des fréquences d’échantillonnage de 8000, 16000, 22050, 24000, 44100 et 48000 Hz. Un paramètre de langue permet le formatage en forme écrite pour 25 langues, dont l’anglais, l’espagnol, le français, l’allemand, l’hindi, le japonais et le coréen.
Les requêtes batch utilisent des données multipart/form‑data et doivent fournir soit un fichier téléchargé, soit une URL que le serveur téléchargera et transcrira ; la réponse renvoie la transcription complète, la langue détectée sous forme de code BCP‑47, la durée audio en secondes et les segments au niveau des mots avec les temps de début et de fin. Pour le streaming, les clients envoient l’audio brut sous forme de trames binaires à un point de terminaison WebSocket à wss://api.x.ai/v1/stt et reçoivent des événements de transcription JSON au fur et à mesure du traitement de l’audio, avec des résultats intermédiaires optionnels émis approximativement toutes les 500 millisecondes.
Déploiement Loom, tarification et dépréciation
xAI a indiqué qu’Atlassian a évalué Grok Voice Transcribe 2.0 par rapport à sa solution de transcription existante, l’a trouvé plus précis, et utilise désormais le modèle pour transcrire chaque vidéo sur Loom, son produit d’enregistrement d’écran. l’annonce de xAI a cité Sanchan Saxena, vice‑président senior de Teamwork Collection chez Atlassian, à propos des flux de travail qui acheminent les transcriptions Loom vers l’outil de codage Cursor : « Avec Grok alimentant la transcription vocale de Loom et Cursor transformant cela en code, nous bouclons la boucle du contexte au code : enregistrez ce que vous voulez dire, et le travail est réalisé. »
La tarification est identique à celle de Grok Voice Transcribe 1.0 : $0.10 par heure d’audio pour la transcription batch et $0.20 par heure pour le streaming, la diarisation, les horodatages et les termes clés étant inclus. xAI a indiqué que Grok Voice Transcribe 2.0 deviendra bientôt le modèle par défaut dans l’API de transcription vocale et que la version 1.0 sera dépréciée dans les semaines à venir ; les clients qui souhaitent rester sur le modèle antérieur pendant la transition peuvent épingler grok-voice-transcribe-1.0 dans leurs requêtes. La documentation indique actuellement grok-voice-transcribe-1.0 comme valeur par défaut lorsque le paramètre de modèle est omis, grok-voice-transcribe-2.0 étant sélectionnable à la fois sur les points de terminaison REST et WebSocket.












