Modele și platforme AI
xAI lansează modelul de transcriere vocală Grok Voice Transcribe 2.0

xAI a lansat Grok Voice Transcribe 2.0, cel mai recent model de recunoaștere vocală, pe 18 septembrie 2026, menținând prețul pentru procesare în lot la $0.10 pe oră de audio, descriind modelul ca fiind de două ori mai precis decât Grok Voice Transcribe 1.0.
Grok Voice Transcribe 2.0 este construit pe modelul de bază audio care susține Grok Voice. Conform xAI, Grok Voice deja susține zeci de mii de apeluri de asistență pentru clienți pe zi, transcrie milioane de ore de narațiune video și rulează agenți vocali în produse fizice, inclusiv asistentul Grok în vehiculele Tesla. Compania a declarat că noul model a fost antrenat pe audio live, zgomotos și multilingv înregistrat în diverse medii și rafinat prin post‑training, descriind rezultatul ca fiind unul dintre cele mai precise modele de transcriere disponibile pentru vorbire în contexte reale.
Evaluări ale Preciziei
xAI a declarat că Grok Voice Transcribe 2.0 ocupă primul loc în termeni de precizie dintre 32 de modele de streaming pe clasamentul public Artificial Analysis. Dincolo de benchmark‑urile publice, compania măsoară rata de eroare a cuvintelor pe patru seturi interne de evaluare prelevate din traficul de producție: audio telefonic din apeluri de asistență pentru clienți, conversații cu Grok, date de autentificare vorbite, cum ar fi coduri de cont și adrese de email, și comenzi vocale scurte multilingve. Compania a raportat că noul model îmbunătățește performanța față de Grok Voice Transcribe 1.0 pe toate cele patru seturi și depășește fiecare model testat pe setul telefonic, care constă în apeluri de asistență pentru clienți în limba engleză la 8 kHz. Graficele publicate de xAI compară modelul cu Gemini 3.5 Transcribe, MAI-Transcribe‑2, ElevenLabs Scribe v2, Deepgram Nova‑3 și Whisper Large v3 pe acele seturi interne.
Conform xAI, transcrierea multilingvă reprezintă cel mai mare câștig de precizie față de versiunea 1.0. Compania a declarat că modelul transcrie zeci de limbi, detectează automat limba și urmărește schimbările de limbă în timpul înregistrării într-un singur pas. Expresiile scurte, cum ar fi comenzile din mașină, oferă modelului puțin context pentru a identifica limba; pe setul de expresii scurte al xAI, care cuprinde enunțuri ale asistentului vocal în 19 limbi, rata de eroare a cuvintelor scade de la 20,6% la 6,8%, conform raportului companiei.
Funcționalități și Acces API
Prin API‑ul Speech-to-Text, Grok Voice Transcribe 2.0 gestionează transcrierea în lot a fișierelor înregistrate și a URL‑urilor, precum și streamingul în timp real. Setul documentat de funcționalități include marcaje temporale la nivel de cuvânt cu scoruri de încredere, diarizare a vorbitorilor fără cost suplimentar, transcriere multicanală pentru până la opt canale, biasare a termenilor cheie pentru până la 100 de termeni de domeniu per cerere, formatare a textului care returnează numere, date, monede, numere de telefon și adrese de email în formă scrisă, eliminarea cuvintelor de umplutură și detectare inteligentă a schimbării de vorbă care identifică sfârșitul intervenției unui vorbitor pentru agenții vocali. xAI a declarat că integrările existente ale API‑ului Speech-to-Text beneficiază de îmbunătățirea preciziei fără modificări de cod.
Documentația oficială documentație speech-to-text enumeră 12 formate audio acceptate, o dimensiune maximă a fișierului de 500 MB și rate de eșantionare de 8000, 16000, 22050, 24000, 44100 și 48000 Hz. Un parametru de limbă permite formatarea în formă scrisă pentru 25 de limbi, printre care engleza, spaniola, franceza, germana, hindi, japoneza și coreeana.
Cereri în lot utilizează date de tip multipart/form‑data și trebuie să furnizeze fie un fișier încărcat, fie un URL pentru ca serverul să îl descarce și să îl transcrie; răspunsul returnează transcrierea completă, limba detectată ca un cod BCP‑47, durata audio în secunde și segmente la nivel de cuvânt cu timpi de început și sfârșit. Pentru streaming, clienții trimit audio brut ca cadre binare către un endpoint WebSocket la wss://api.x.ai/v1/stt și primesc evenimente de transcriere JSON pe măsură ce audio este procesat, cu rezultate intermediare opționale emise aproximativ la fiecare 500 de milisecunde.
Implementarea în Loom, Prețuri și Deprecare
xAI a declarat că Atlassian a evaluat Grok Voice Transcribe 2.0 comparativ cu soluția sa de transcriere existentă, a constatat că este mai precis și acum folosește modelul pentru a transcrie fiecare video din Loom, produsul său de înregistrare a ecranului. anunțul xAI a citat pe Sanchan Saxena, vicepreședinte senior al Teamwork Collection la Atlassian, referitor la fluxurile de lucru care direcționează transcrierile Loom către instrumentul de codare Cursor: „Cu Grok alimentând speech‑to‑text‑ul din Loom și Cursor transformându‑l în cod, închidem bucla de la context la cod: înregistrezi ce vrei să spui, iar munca este realizată.”
Prețurile sunt identice cu cele ale Grok Voice Transcribe 1.0: $0.10 pe oră de audio pentru transcriere în lot și $0.20 pe oră pentru streaming, cu diarizare, marcaje temporale și termeni cheie incluse. xAI a declarat că Grok Voice Transcribe 2.0 va deveni în curând modelul implicit în API‑ul Speech-to-Text și că versiunea 1.0 va fi depreciată în săptămânile următoare; clienții care doresc să rămână pe modelul anterior în timpul tranziției pot fixa grok‑voice‑transcribe‑1.0 în cererile lor. Documentația enumeră în prezent grok‑voice‑transcribe‑1.0 ca implicit atunci când parametrul model este omis, iar grok‑voice‑transcribe‑2.0 poate fi selectat atât pe endpoint‑urile REST, cât și pe cele WebSocket.












