Modelli e piattaforme di IA

xAI rilascia il modello Speech-to-Text Grok Voice Transcribe 2.0

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

xAI ha rilasciato Grok Voice Transcribe 2.0, il suo più recente modello speech-to-text, il 18 settembre 2026, mantenendo un prezzo batch di $0.10 per ora di audio, descrivendo il modello come due volte più preciso rispetto a Grok Voice Transcribe 1.0.

Grok Voice Transcribe 2.0 è costruito sul modello di base audio alla base di Grok Voice. Secondo xAI, Grok Voice già gestisce decine di migliaia di chiamate di assistenza clienti al giorno, trascrive milioni di ore di narrazione video e alimenta agenti vocali in prodotti fisici, incluso l’assistente Grok nei veicoli Tesla. L’azienda ha dichiarato che il nuovo modello è stato addestrato su audio multilingue, dal vivo e rumoroso, registrato in una vasta gamma di ambienti e perfezionato con post‑training, e ha descritto il risultato come uno dei modelli di trascrizione più precisi disponibili per il parlato in contesti reali.

Valutazioni di Accuratezza

xAI ha affermato che Grok Voice Transcribe 2.0 si classifica al primo posto per accuratezza tra 32 modelli di streaming nella classifica pubblica Artificial Analysis. Oltre ai benchmark pubblici, l’azienda misura il tasso di errore delle parole su quattro set di valutazione interni derivati dal traffico di produzione: audio telefonico delle chiamate di assistenza clienti, conversazioni con Grok, credenziali vocali come codici di account e indirizzi email, e brevi comandi vocali multilingue. L’azienda ha riferito che il nuovo modello migliora rispetto a Grok Voice Transcribe 1.0 su tutti e quattro i set e supera tutti i modelli testati sul set telefonico, che comprende chiamate di assistenza clienti in inglese a 8 kHz. I grafici pubblicati da xAI confrontano il modello con Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 e Whisper Large v3 su questi set interni.

Secondo xAI, la trascrizione multilingue rappresenta il maggior guadagno in accuratezza rispetto alla versione 1.0. L’azienda ha dichiarato che il modello trascrive decine di lingue, rileva automaticamente la lingua e gestisce i cambi di lingua a metà registrazione in un unico passaggio. Frasi brevi, come i comandi in auto, forniscono al modello pochi contesti per identificare la lingua; nel set di frasi brevi di assistenti vocali di xAI, che copre 19 lingue, il tasso di errore delle parole è sceso dal 20.6 percento al 6.8 percento, ha riferito l’azienda.

Funzionalità e Accesso API

Attraverso l’API Speech-to-Text, Grok Voice Transcribe 2.0 gestisce la trascrizione batch di file registrati e URL, nonché lo streaming in tempo reale. Il set di funzionalità documentato comprende timestamp a livello di parola con punteggi di confidenza, diarizzazione degli speaker senza costi aggiuntivi, trascrizione multicanale fino a otto canali, bias dei termini chiave fino a 100 termini di dominio per richiesta, formattazione del testo che restituisce numeri, date, valute, numeri di telefono e indirizzi email in forma scritta, rimozione di parole di riempimento e rilevamento intelligente dei turni che identifica la fine del turno di un speaker per gli agenti vocali. xAI ha dichiarato che le integrazioni esistenti dell’API Speech-to-Text ricevono il miglioramento di accuratezza senza modifiche al codice.

La documentazione speech-to-text ufficiale elenca 12 formati audio supportati, una dimensione massima del file di 500 MB e frequenze di campionamento di 8000, 16000, 22050, 24000, 44100 e 48000 Hz. Un parametro lingua consente la formattazione in forma scritta per 25 lingue, tra cui inglese, spagnolo, francese, tedesco, hindi, giapponese e coreano.

Le richieste batch utilizzano dati multipart/form-data e devono fornire un file caricato o un URL affinché il server lo scarichi e lo trascriva; la risposta restituisce la trascrizione completa, la lingua rilevata come codice BCP‑47, la durata dell’audio in secondi e segmenti a livello di parola con tempi di inizio e fine. Per lo streaming, i client inviano audio grezzo come frame binari a un endpoint WebSocket su wss://api.x.ai/v1/stt e ricevono eventi di trascrizione JSON mentre l’audio viene elaborato, con risultati intermedi opzionali emessi circa ogni 500 millisecondi.

Distribuzione su Loom, Prezzi e Deprecazione

xAI ha dichiarato che Atlassian ha valutato Grok Voice Transcribe 2.0 rispetto alla sua soluzione di trascrizione esistente, l’ha trovata più accurata e ora utilizza il modello per trascrivere ogni video su Loom, il suo prodotto di registrazione schermo. l’annuncio di xAI ha citato Sanchan Saxena, senior vice president of Teamwork Collection di Atlassian, sui flussi di lavoro che inviano le trascrizioni di Loom allo strumento di codifica Cursor: “Con Grok che alimenta il speech-to-text di Loom e Cursor che lo trasforma in codice, chiudiamo il ciclo dal contesto al codice: registra ciò che intendi e il lavoro viene svolto.”

Il prezzo è identico a quello di Grok Voice Transcribe 1.0: $0.10 per ora di audio per la trascrizione batch e $0.20 per ora per lo streaming, con diarizzazione, timestamp e termini chiave inclusi. xAI ha dichiarato che Grok Voice Transcribe 2.0 diventerà presto il modello predefinito nell’API Speech-to-Text e che la versione 1.0 sarà deprecata nelle prossime settimane; i clienti che desiderano rimanere sul modello precedente durante la transizione possono fissare grok-voice-transcribe-1.0 nelle loro richieste. La documentazione elenca attualmente grok-voice-transcribe-1.0 come predefinito quando il parametro modello è omesso, con grok-voice-transcribe-2.0 selezionabile sia sugli endpoint REST sia su quelli WebSocket.

Jonas Reeve è un analista generato da AI presso Unite.AI, che si concentra sull'intelligenza artificiale cognitiva, l'intelligenza artificiale generale (AGI) e i fondamenti teorici dell'intelligenza delle macchine. Il suo lavoro esplora come l'apprendimento, il ragionamento, la memoria e l'astrazione emergano sia in sistemi biologici che artificiali, stabilendo collegamenti tra le moderne architetture di intelligenza artificiale e le lunghe domande della scienza cognitiva e della filosofia della mente.
Con un approccio concettuale e riflessivo, Jonas esamina framework come modelli di ragionamento, sistemi agente, cognizione emergente e teoria dell'allineamento, con l'obiettivo di chiarire cosa significhi realmente il progresso verso l'AGI - e cosa no. Piuttosto che inseguire le scadenze o l'entusiasmo, enfatizza i primi principi, la rigorosità concettuale e i limiti dei modelli attuali.
Gli articoli scritti da Jonas Reeve sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza, la chiarezza e la discussione responsabile dei concetti di intelligenza artificiale avanzata.