Моделі та платформи ШІ

xAI випускає модель розпізнавання мови Grok Voice Transcribe 2.0

mm
Додайте Unite.AI до бажаних джерел у Google

xAI випустила Grok Voice Transcribe 2.0, свою останню модель розпізнавання мови, 18 вересня 2026 року, встановивши пакетну ціну $0.10 за годину аудіо, описавши модель як удвічі точнішу, ніж Grok Voice Transcribe 1.0.

Grok Voice Transcribe 2.0 побудована на аудіо‑фонковій моделі, що стоїть за Grok Voice. За даними xAI, Grok Voice вже обслуговує десятки тисяч дзвінків служби підтримки клієнтів щодня, транскрибує мільйони годин відео‑нарації та працює як голосовий агент у фізичних продуктах, включаючи асистента Grok у транспортних засобах Tesla. Компанія заявила, що нову модель навчали на живому, шумному, багатомовному аудіо, записаному в різноманітних умовах, і доопрацювали її після навчання, і описала результат як одну з найточніших моделей транскрипції мови, доступних у реальних умовах.

Оцінка точності

xAI повідомила, що Grok Voice Transcribe 2.0 посідає перше місце за точністю серед 32 потокових моделей у публічному рейтингу Artificial Analysis. Окрім публічних бенчмаркiв, компанія вимірює рівень помилок слів на чотирьох внутрішніх наборах оцінки, отриманих з виробничого трафіку: телефонне аудіо з дзвінків служби підтримки, розмови з Grok, усні облікові дані, такі як коди акаунтів і електронні адреси, та короткі багатомовні голосові команди. Компанія повідомила, що нова модель покращує результати Grok Voice Transcribe 1.0 за всіма чотирма наборами і випереджає кожну протестовану модель у телефонному наборі, який складається з англомовних дзвінків служби підтримки з частотою 8 кГц. Опубліковані xAI діаграми порівнюють модель з Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 та Whisper Large v3 за цими внутрішніми наборами.

Багатомовна транскрипція є найбільшим приростом точності порівняно з версією 1.0, за даними xAI. Компанія повідомила, що модель транскрибує десятки мов, автоматично визначає мову та слідує за переключенням мови під час запису в одному проході. Короткі фрази, такі як команди в автомобілі, залишають моделі мало контексту для визначення мови; у наборі коротких фраз голосового асистента, що охоплює 19 мов, рівень помилок слів знизився з 20,6 % до 6,8 %, повідомила компанія.

Функції та доступ до API

Через Speech-to-Text API Grok Voice Transcribe 2.0 виконує пакетну транскрипцію записаних файлів і URL‑адрес, а також потокове розпізнавання в реальному часі. Документований набір функцій включає мітки часу на рівні слів із оцінками впевненості, діарізацію спікерів без додаткових витрат, багатоканальну транскрипцію до восьми каналів, зміщення ключових термінів до 100 доменних термінів на запит, форматування тексту, що повертає числа, дати, валюти, телефонні номери та електронні адреси у письмовій формі, видалення заповнювальних слів та розумне визначення кінця репліки спікера для голосових агентів. xAI повідомила, що існуючі інтеграції Speech-to-Text API отримують підвищення точності без змін коду.

Офіційна документація з розпізнавання мови перераховує 12 підтримуваних аудіоформатів, максимальний розмір файлу 500 МБ та частоти дискретизації 8000, 16000, 22050, 24000, 44100 і 48000 Гц. Параметр мови дозволяє форматування у письмовій формі для 25 мов, серед яких англійська, іспанська, французька, німецька, хінді, японська та корейська.

Пакетні запити використовують multipart form data і повинні надати або завантажений файл, або URL‑адресу, яку сервер завантажить і транскрибує; відповідь повертає повну транскрипцію, виявлену мову у вигляді коду BCP‑47, тривалість аудіо в секундах та сегменти на рівні слів з часами початку і кінця. Для потокового режиму клієнти надсилають необроблене аудіо у вигляді бінарних кадрів до WebSocket‑ендпоінту за адресою wss://api.x.ai/v1/stt і отримують події транскрипції у форматі JSON під час обробки аудіо, з опціональними проміжними результатами, що генеруються приблизно кожні 500 мс.

Впровадження в Loom, ціноутворення та виведення з експлуатації

xAI повідомила, що Atlassian оцінила Grok Voice Transcribe 2.0 у порівнянні зі своїм існуючим рішенням транскрипції, визнала її більш точною і тепер використовує модель для транскрибування кожного відео в Loom, її продукті для запису екрану. оголошення xAI цитувало Санчана Саксени, старшого віце‑президента Teamwork Collection у Atlassian, щодо робочих процесів, які передають транскрипти Loom у інструмент кодування Cursor: “З Grok, що живить розпізнавання мови в Loom, і Cursor, що перетворює це в код, ми замкнули цикл від контексту до коду: записуйте, що маєте на увазі, і робота виконується.”

Ціноутворення ідентичне Grok Voice Transcribe 1.0: $0.10 за годину аудіо для пакетної транскрипції та $0.20 за годину для потокової, з включеними діарізацією, мітками часу та ключовими термінами. xAI повідомила, що Grok Voice Transcribe 2.0 незабаром стане моделлю за замовчуванням у Speech-to-Text API, а версія 1.0 буде виведена з експлуатації в найближчі тижні; клієнти, які хочуть залишитися на попередній моделі під час переходу, можуть закріпити grok-voice-transcribe-1.0 у своїх запитах. Документація наразі вказує grok-voice-transcribe-1.0 як модель за замовчуванням, якщо параметр model пропущено, при цьому grok-voice-transcribe-2.0 можна вибрати як у REST, так і у WebSocket ендпоінтах.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.