Modelos y plataformas de IA
xAI lanza el modelo de reconocimiento de voz Grok Voice Transcribe 2.0

xAI lanzó Grok Voice Transcribe 2.0, su último modelo de reconocimiento de voz, el 18 de septiembre de 2026, manteniendo un precio por lotes de $0.10 por hora de audio, y describió el modelo como dos veces más preciso que Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 se basa en el modelo de base de audio que sustenta a Grok Voice. Según xAI, Grok Voice ya gestiona decenas de miles de llamadas de soporte al cliente al día, transcribe millones de horas de narración de video y ejecuta agentes de voz en productos físicos, incluido el asistente Grok en vehículos Tesla. La compañía afirmó que el nuevo modelo se entrenó con audio en vivo, ruidoso y multilingüe, grabado en una amplia variedad de entornos y refinado mediante post‑entrenamiento, y describió el resultado como uno de los modelos de transcripción más precisos disponibles para el habla en entornos reales.
Evaluaciones de precisión
xAI dijo que Grok Voice Transcribe 2.0 ocupa el primer lugar en precisión entre 32 modelos de transmisión en la tabla pública Artificial Analysis. Más allá de los benchmarks públicos, la compañía mide la tasa de error de palabras en cuatro conjuntos de evaluación internos extraídos del tráfico de producción: audio telefónico de llamadas de soporte al cliente, conversaciones con Grok, credenciales habladas como códigos de cuenta y direcciones de correo electrónico, y comandos de voz multilingües cortos. La empresa informó que el nuevo modelo mejora a Grok Voice Transcribe 1.0 en los cuatro conjuntos y supera a todos los modelos probados en el conjunto telefónico, que consiste en llamadas de soporte al cliente en inglés a 8 kHz. Los gráficos publicados por xAI comparan el modelo con Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 y Whisper Large v3 en esos conjuntos internos.
Según xAI, la transcripción multilingüe es la mayor mejora de precisión respecto a la versión 1.0. La compañía afirmó que el modelo transcribe decenas de idiomas, detecta automáticamente el idioma y sigue los cambios de idioma a mitad de la grabación en una sola pasada. Las frases cortas, como los comandos dentro del coche, proporcionan poco contexto al modelo para identificar el idioma; en el conjunto de frases cortas de asistentes de voz de xAI, que abarca 19 idiomas, la tasa de error de palabras disminuye del 20,6 % al 6,8 %, informó la empresa.
Funciones y acceso a la API
A través de la API de reconocimiento de voz, Grok Voice Transcribe 2.0 gestiona la transcripción por lotes de archivos y URL grabados, así como la transmisión en tiempo real. El conjunto de funciones documentado incluye marcas de tiempo a nivel de palabra con puntuaciones de confianza, diarización de hablantes sin costo adicional, transcripción multicanal de hasta ocho canales, sesgo de términos clave de hasta 100 términos de dominio por solicitud, formato de texto que devuelve números, fechas, monedas, números de teléfono y direcciones de correo electrónico en forma escrita, eliminación de palabras de relleno y detección inteligente de turnos que identifica el final del turno de un hablante para agentes de voz. xAI dijo que las integraciones existentes de la API de reconocimiento de voz reciben la mejora de precisión sin cambios de código.
La documentación de reconocimiento de voz oficial enumera 12 formatos de audio compatibles, un tamaño máximo de archivo de 500 MB y frecuencias de muestreo de 8000, 16000, 22050, 24000, 44100 y 48000 Hz. Un parámetro de idioma permite el formato en forma escrita en 25 idiomas, entre ellos inglés, español, francés, alemán, hindi, japonés y coreano.
Las solicitudes por lotes utilizan datos de formulario multipartes y deben proporcionar un archivo cargado o una URL para que el servidor lo descargue y transcriba; la respuesta devuelve la transcripción completa, el idioma detectado como un código BCP‑47, la duración del audio en segundos y los segmentos a nivel de palabra con tiempos de inicio y fin. Para la transmisión, los clientes envían audio sin procesar como tramas binarias a un punto final WebSocket en wss://api.x.ai/v1/stt y reciben eventos de transcripción JSON a medida que se procesa el audio, con resultados interinos opcionales emitidos aproximadamente cada 500 milisegundos.
Implementación en Loom, precios y desactivación
xAI dijo que Atlassian evaluó Grok Voice Transcribe 2.0 frente a su solución de transcripción existente, la encontró más precisa y ahora utiliza el modelo para transcribir cada video en Loom, su producto de grabación de pantalla. el anuncio de xAI citó a Sanchan Saxena, vicepresidente senior de Teamwork Collection en Atlassian, sobre los flujos de trabajo que canalizan las transcripciones de Loom al herramienta de codificación Cursor: “Con Grok impulsando el reconocimiento de voz de Loom y Cursor convirtiéndolo en código, cerramos el ciclo del contexto al código: graba lo que quieres decir y el trabajo se realiza.”
El precio es idéntico al de Grok Voice Transcribe 1.0: $0.10 por hora de audio para transcripción por lotes y $0.20 por hora para transmisión, con diarización, marcas de tiempo y términos clave incluidos. xAI dijo que Grok Voice Transcribe 2.0 pronto será el modelo predeterminado en la API de reconocimiento de voz y que la versión 1.0 será desactivada en las próximas semanas; los clientes que deseen permanecer con el modelo anterior durante la transición pueden fijar grok-voice-transcribe-1.0 en sus solicitudes. La documentación actualmente enumera grok-voice-transcribe-1.0 como predeterminado cuando se omite el parámetro de modelo, y grok-voice-transcribe-2.0 es seleccionable tanto en los puntos finales REST como WebSocket.












