Modelli e piattaforme di IA
Google lancia i modelli vocali Gemini 3.8 nell’API e in AI Studio

Google, il 23 settembre 2026, ha introdotto Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, due modelli di sintesi vocale che ha descritto come i suoi modelli di generazione audio più espressivi finora. Entrambi i modelli sono stati lanciati lo stesso giorno nell’API Gemini e in Google AI Studio.
L’annuncio, redatto dal Group Product Manager Leland Rechis e dal Director of Research Science Alan Cowen per conto del Gemini Audio Team, colloca Gemini 3.8 Flash TTS per una direzione creativa profonda e per la progettazione di personaggi nel gaming, negli audiolibri immersivi, nei podcast e nei media interattivi. Gemini 3.8 Flash-Lite TTS è progettato per un uso ad alto volume e a costi contenuti, ottimizzato per il doppiaggio, la creazione di contenuti audio e gli agenti vocali con un controllo fine su tono, ritmo e sfumature espressive. L’annuncio presenta la coppia come successiva alle precedenti versioni Gemini Audio: 3.5 Live Translate, 3.5 Transcribe e i modelli Gemini 3.8 Live e 3.8 Live Extended Thinking. Secondo la scheda modello di Gemini 3.8 Audio, i modelli si basano su Gemini 3 Pro e le varianti TTS accettano input testuale fino a 8K token e restituiscono output audio fino a 64K token.
Progettazione e Replicazione della Voce
Google ha dichiarato che Gemini 3.8 Flash TTS può creare voci su misura da zero tramite prompt in linguaggio naturale, personalizzando ruolo, accento e caratteristiche vocali in più di 100 lingue e dialetti. L’azienda ha affermato che il rilascio amplia il set originale di 30 voci in una libreria di oltre 2.000 voci pronte per la produzione, con ampia copertura linguistica, includendo varianti regionali come lo spagnolo messicano, il francese del Quebec e l’inglese scozzese. Gli utenti possono salvare e gestire le proprie voci personalizzate per mantenere prestazioni costanti nei progetti in corso, e una funzione di remix vocale che regola timbro, intonazione, ritmo e accento sulle voci della libreria è prevista a breve.
La replicazione vocale ricrea un profilo vocale coerente a partire da un campione audio di 30 secondi della propria voce o di una voce per la quale l’utente possiede i diritti d’uso. Google ha dichiarato che la funzionalità è fornita con verifica del consenso integrata, watermark SynthID e credenziali C2PA.
Direzione delle Prestazioni e Benchmark Segnalati
Entrambi i modelli consentono una direzione riga per riga di ogni performance: gli utenti possono scrivere le proprie indicazioni di scena o lasciare che Gemini guidi l’interpretazione a partire da segnali naturali del copione. Google ha affermato che la generazione a lungo termine mantiene costanti la qualità della voce, il ritmo e il timbro del personaggio per ore di audio continuo con minima deriva del parlante, destinata a podcast e audiolibri. La messa in scena nativa a due speaker dirige conversazioni a più turni da un unico copione mantenendo le due voci separate con turni naturali. Scatti vocali sceneggiati e backchannel aggiungono segnali non verbali come <laughs>, <sigh>, e <gasp>, oltre a interiezioni come “mhm” e “yeah”.
Nelle valutazioni, Google ha segnalato che Gemini 3.8 Flash TTS ha ottenuto la prima posizione complessiva nel Voice Design Benchmark di Hume AI con un punteggio di 71,4 e ha anche guidato la modellazione degli accenti con 60,8. Ha dichiarato che Flash TTS e Flash-Lite TTS occupano rispettivamente la prima e la seconda posizione nell’Overall Quality Index di Hume AI, e che i nuovi modelli mostrano miglioramenti significativi rispetto a Gemini 3.1 Flash TTS in casi d’uso quali contenuti a lungo termine e controllo di sceneggiature a due speaker. In valutazioni cieche di preferenza umana su Voice Arena, Google ha affermato che i due modelli hanno conquistato le posizioni di vertice tra i concorrenti in lingue tra cui giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi.
Sicurezza, Limitazioni e Disponibilità
Con il sistema di verifica del consenso, l’utente deve fornire una registrazione verbale di consenso dal proprietario della voce che corrisponda al parlante di riferimento prima che possa essere creata una voce replicata. Ogni clip audio generata dai modelli Gemini Audio contiene un watermark SynthID, che Google descrive come impercettibile e incorporato direttamente nell’output audio affinché il parlato generato dall’IA rimanga rilevabile.
La scheda modello elenca le limitazioni note, tra cui allucinazioni e occasionali rallentamenti o problemi di timeout, e indica un cutoff di conoscenza a gennaio 2025. Per la sicurezza di frontiera, Google DeepMind ha affermato che le sue valutazioni non hanno riscontrato nuove capacità significative né aumenti di prestazioni materiali nei modelli Gemini 3.8 Audio rispetto a Gemini 3.7 Flash, i cui test non hanno raggiunto alcun Livello di Capacità Tracciata o Critica secondo il suo Frontier Safety Framework. Sulla base di ciò, ha dichiarato che i modelli Gemini 3.8 Audio probabilmente non raggiungeranno tali livelli.
Gemini 3.8 Flash TTS è disponibile anche in Gemini Notebook e Flash-Lite TTS in Google Vids, con accesso enterprise tramite API in Gemini Enterprise indicato come in arrivo. Google AI Studio aggiunge un laboratorio audio costruito come uno spazio di lavoro per la progettazione vocale, dove gli sviluppatori possono creare nuove identità vocali da zero o replicare una voce e poi dirigere la consegna riga per riga in un editor di sceneggiatura a due speaker. Una nota a piè di pagina nell’annuncio indica che la replicazione vocale tramite AI Studio non è disponibile in Illinois, Texas, nello Spazio Economico Europeo, nel Regno Unito, in Svizzera e in India. Le piattaforme per sviluppatori Agora, LiveKit, Pipecat e Vercel supportano i modelli tramite l’API Gemini, e Google ha elencato Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang come partner che integrano i nuovi modelli TTS per doppiaggio globale, localizzazione dei media e agenti vocali conversazionali.












