Modele i platformy AI

xAI wydaje model rozpoznawania mowy Grok Voice Transcribe 2.0

mm
Dodaj Unite.AI do preferowanych źródeł w Google

xAI wypuściło Grok Voice Transcribe 2.0, swój najnowszy model rozpoznawania mowy, 18 września 2026 r., ustalając cenę przetwarzania wsadowego na $0.10 za godzinę nagrania, opisując model jako dwa razy dokładniejszy niż Grok Voice Transcribe 1.0.

Grok Voice Transcribe 2.0 opiera się na modelu bazowym audio stojącym za Grok Voice. Według xAI, Grok Voice już obsługuje dziesiątki tysięcy połączeń wsparcia klienta dziennie, transkrybuje miliony godzin narracji wideo i uruchamia agenty głosowe w produktach fizycznych, w tym asystenta Grok w pojazdach Tesla. Firma poinformowała, że nowy model został wytrenowany na żywym, hałaśliwym, wielojęzycznym dźwięku nagranym w różnorodnych środowiskach i udoskonalony po treningu, a wynik opisano jako jeden z najdokładniejszych dostępnych modeli transkrypcji mowy w warunkach rzeczywistych.

Oceny dokładności

xAI poinformowało, że Grok Voice Transcribe 2.0 zajmuje pierwsze miejsce pod względem dokładności wśród 32 modeli strumieniowych w publicznym rankingu Artificial Analysis. Poza publicznymi benchmarkami firma mierzy wskaźnik błędów słów na czterech wewnętrznych zestawach oceny pochodzących z ruchu produkcyjnego: audio telefoniczne z połączeń wsparcia klienta, rozmowy z Grok, wypowiedziane dane uwierzytelniające, takie jak kody kont i adresy e‑mail, oraz krótkie wielojęzyczne polecenia głosowe. Firma zgłosiła, że nowy model przewyższa Grok Voice Transcribe 1.0 we wszystkich czterech zestawach i wyprzedza każdy testowany model w zestawie telefonicznym, który składa się z połączeń wsparcia klienta w języku angielskim o częstotliwości 8 kHz. Opublikowane wykresy xAI porównują model z Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 oraz Whisper Large v3 w tych wewnętrznych zestawach.

Według xAI, transkrypcja wielojęzyczna przynosi największy wzrost dokładności w porównaniu z wersją 1.0. Firma stwierdziła, że model transkrybuje dziesiątki języków, automatycznie wykrywa język i śledzi zmiany języka w trakcie nagrania w jednym przebiegu. Krótkie frazy, takie jak polecenia w samochodzie, dają modelowi niewiele kontekstu do identyfikacji języka; w zestawie krótkich fraz asystenta głosowego obejmującym 19 języków, wskaźnik błędów słów spadł z 20,6 % do 6,8 %, podała firma.

Funkcje i dostęp do API

Za pośrednictwem API rozpoznawania mowy, Grok Voice Transcribe 2.0 obsługuje transkrypcję wsadową nagranych plików i adresów URL oraz strumieniowanie w czasie rzeczywistym. Dokumentowany zestaw funkcji obejmuje znaczniki czasu na poziomie słowa z oceną pewności, diarację mówcy bez dodatkowych kosztów, transkrypcję wielokanałową do ośmiu kanałów, ukierunkowanie kluczowych terminów na maksymalnie 100 terminów domenowych na żądanie, formatowanie tekstu zwracające liczby, daty, waluty, numery telefonów i adresy e‑mail w formie pisemnej, usuwanie słów wypełniających oraz inteligentne wykrywanie zakończenia wypowiedzi, które identyfikuje koniec wypowiedzi mówcy dla agentów głosowych. xAI poinformowało, że istniejące integracje z API rozpoznawania mowy otrzymują poprawę dokładności bez zmian w kodzie.

Oficjalna dokumentacja rozpoznawania mowy wymienia 12 obsługiwanych formatów audio, maksymalny rozmiar pliku 500 MB oraz częstotliwości próbkowania 8000, 16000, 22050, 24000, 44100 i 48000 Hz. Parametr języka umożliwia formatowanie w formie pisemnej w 25 językach, w tym po angielsku, hiszpańsku, francusku, niemiecku, hindi, japońsku i koreańsku.

Żądania wsadowe używają danych multipart/form-data i muszą dostarczyć albo przesłany plik, albo adres URL, który serwer pobierze i przetranskrybuje; odpowiedź zwraca pełną transkrypcję, wykryty język jako kod BCP‑47, czas trwania audio w sekundach oraz segmenty na poziomie słowa z czasami rozpoczęcia i zakończenia. W przypadku strumieniowania klienci wysyłają surowe audio jako ramki binarne do punktu końcowego WebSocket pod adresem wss://api.x.ai/v1/stt i otrzymują zdarzenia transkrypcji JSON w miarę przetwarzania audio, z opcjonalnymi wynikami pośrednimi emitowanymi mniej więcej co 500 ms.

Wdrożenie w Loom, ceny i wycofanie

xAI poinformowało, że Atlassian oceniło Grok Voice Transcribe 2.0 w porównaniu z istniejącym rozwiązaniem transkrypcyjnym, uznało je za bardziej dokładne i teraz używa modelu do transkrypcji każdego wideo w Loom, produkcie do nagrywania ekranu. ogłoszenie xAI przytoczyło Sanchana Saxenę, starszego wiceprezesa ds. kolekcji Teamwork w Atlassian, na temat przepływów pracy, które kierują transkrypcje Loom do narzędzia programistycznego Cursor: “Dzięki Grok napędzającemu rozpoznawanie mowy w Loom i Cursor przekształcającemu to w kod, zamykamy pętlę od kontekstu do kodu: nagraj, co masz na myśli, a praca zostanie wykonana.”

Ceny są identyczne jak w Grok Voice Transcribe 1.0: $0.10 za godzinę audio dla transkrypcji wsadowej i $0.20 za godzinę dla strumieniowania, przy włączonej diaracji, znacznikach czasu i kluczowych terminach. xAI poinformowało, że Grok Voice Transcribe 2.0 wkrótce stanie się domyślnym modelem w API rozpoznawania mowy, a wersja 1.0 zostanie wycofana w nadchodzących tygodniach; klienci, którzy chcą pozostać przy starszym modelu w trakcie przejścia, mogą przypiąć grok-voice-transcribe-1.0 w swoich żądaniach. Dokumentacja obecnie wymienia grok-voice-transcribe-1.0 jako domyślny, gdy parametr modelu jest pominięty, przy czym grok-voice-transcribe-2.0 można wybrać zarówno w endpointach REST, jak i WebSocket.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.