Модели и платформы ИИ
xAI выпускает модель распознавания речи в текст Grok Voice Transcribe 2.0

xAI выпустила Grok Voice Transcribe 2.0, свою новейшую модель распознавания речи в текст, 18 сентября 2026 года, установив цену за пакетную обработку в $0.10 за час аудио и заявив, что модель в два раза точнее, чем Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 построена на аудиофундаментальной модели, лежащей в основе Grok Voice. По данным xAI, Grok Voice уже обслуживает десятки тысяч звонков службы поддержки в день, расшифровывает миллионы часов видеокомментариев и управляет голосовыми агентами в физических продуктах, включая помощника Grok в автомобилях Tesla. Компания заявила, что новая модель обучалась на живом, шумном, многоязычном аудио, записанном в различных условиях, и была доработана после обучения; результат описан как одна из самых точных моделей транскрипции речи, доступных для реальных условий.
Оценка точности
xAI заявила, что Grok Voice Transcribe 2.0 занимает первое место по точности среди 32 потоковых моделей в публичном Artificial Analysis leaderboard. Помимо публичных бенчмарков, компания измеряет процент ошибок слов на четырёх внутренних наборах оценок, полученных из производственного трафика: телефонный аудио из звонков службы поддержки, диалоги с Grok, произносимые учётные данные, такие как коды аккаунтов и электронные адреса, а также короткие многоязычные голосовые команды. Компания сообщила, что новая модель превосходит Grok Voice Transcribe 1.0 во всех четырёх наборах и опережает каждую протестированную модель в телефонном наборе, который состоит из английских звонков службы поддержки с частотой 8 кГц. Опубликованные xAI диаграммы сравнивают модель с Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 и Whisper Large v3 по этим внутренним наборам.
Согласно xAI, многоязычная транскрипция обеспечивает наибольший прирост точности по сравнению с версией 1.0. Компания заявила, что модель расшифровывает десятки языков, автоматически определяет язык и отслеживает переключения языка в процессе записи в одном проходе. Краткие фразы, такие как команды в автомобиле, дают модели мало контекста для определения языка; в наборе коротких фраз голосового помощника, охватывающем 19 языков, процент ошибок слов снизился с 20,6 процента до 6,8 процента, как сообщила компания.
Функции и доступ к API
Через API распознавания речи в текст Grok Voice Transcribe 2.0 обрабатывает пакетную транскрипцию записанных файлов и URL, а также потоковую обработку в реальном времени. Документированный набор функций включает пометки времени на уровне слов с оценкой достоверности, диаризацию говорящих без дополнительной платы, многоканальную транскрипцию до восьми каналов, смещение ключевых терминов до 100 доменных терминов за запрос, форматирование текста, возвращающее числа, даты, валюты, телефонные номера и электронные адреса в письменном виде, удаление слов‑заполнителей и интеллектуальное определение конца реплики говорящего для голосовых агентов. xAI заявила, что существующие интеграции API распознавания речи в текст получают улучшение точности без изменения кода.
Официальная документация по распознаванию речи в текст перечисляет 12 поддерживаемых аудиоформатов, максимальный размер файла 500 МБ и частоты дискретизации 8000, 16000, 22050, 24000, 44100 и 48000 Гц. Параметр языка включает форматирование в письменной форме для 25 языков, среди которых английский, испанский, французский, немецкий, хинди, японский и корейский.
Пакетные запросы используют multipart‑form‑data и должны предоставлять либо загруженный файл, либо URL, чтобы сервер мог загрузить и расшифровать его; ответ возвращает полный транскрипт, обнаруженный язык в виде кода BCP‑47, длительность аудио в секундах и сегменты на уровне слов с началом и концом. Для потоковой обработки клиенты отправляют необработанное аудио в виде бинарных фреймов на WebSocket‑конечную точку по адресу wss://api.x.ai/v1/stt и получают события JSON‑транскрипции по мере обработки аудио, при желании получая промежуточные результаты примерно каждые 500 миллисекунд.
Развёртывание в Loom, цены и вывод из эксплуатации
В объявлении xAI была процитирована Санчан Саксена, старший вице‑президент подразделения Teamwork Collection в Atlassian, о рабочих процессах, которые передают транскрипции Loom в инструмент кодирования Cursor: “С помощью Grok, обеспечивающего распознавание речи в Loom, и Cursor, преобразующего её в код, мы замыкаем цикл от контекста к коду: записываете, что имеете в виду, и работа выполняется.”
Цены совпадают с Grok Voice Transcribe 1.0: $0.10 за час аудио для пакетной транскрипции и $0.20 за час для потоковой обработки, при этом включены диаризация, метки времени и ключевые термины. xAI заявила, что Grok Voice Transcribe 2.0 скоро станет моделью по умолчанию в API распознавания речи в текст, а версия 1.0 будет выведена из эксплуатации в ближайшие недели; клиенты, желающие оставаться на более ранней модели в период перехода, могут закрепить grok-voice-transcribe-1.0 в своих запросах. Текущая документация указывает grok-voice-transcribe-1.0 как модель по умолчанию, если параметр модели опущен, при этом grok-voice-transcribe-2.0 доступна для выбора как на REST‑, так и на WebSocket‑конечных точках.












