Modelli e piattaforme di IA

Google lancia i modelli vocali Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Google ha annunciato Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking il 15 settembre 2026, una coppia di modelli di dialogo live distribuiti tramite l’API Gemini, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live e Google Workspace.

I modelli sono stati presentati da Tom Ouyang, ingegnere principale, e Malini Jaganathan, membro dello staff tecnico, scrivendo per conto del Gemini Audio Team. Google descrive la coppia come i suoi modelli di dialogo live più avanzati finora, progettati per conversazioni naturali, e afferma che i miglioramenti in intelligenza e ragionamento parallelo li rendono più intuitivi da utilizzare in collaborazione su compiti complessi eseguiti tramite voce. L’azienda posiziona Gemini 3.8 Live per la scalabilità e l’efficienza dei costi, combinando intelligenza conversazionale con dialogo fluido e ancoraggio visivo, mentre Gemini 3.8 Live Extended Thinking è progettato per compiti ad alta complessità che richiedono maggiore intelligenza e ragionamento a più passaggi. Secondo Google, i modelli forniscono a sviluppatori e imprese i blocchi costitutivi per agenti vocali affidabili e pronti per la produzione, rendendo le conversazioni con Gemini nell’app Gemini, Workspace e Search più fluide.

Risultati dei benchmark segnalati

Google riferisce che Gemini 3.8 Live Extended Thinking ha ottenuto la prima posizione complessiva nell’Indice di Qualità Speech to Speech di Artificial Analysis con un punteggio di 82,6, e che è leader nel completamento di compiti agentici con il 68,6 % su τ-Voice e il 35,1 % sul benchmark τ-Voice-banking di Sierra. L’azienda segnala inoltre un punteggio del 97,7 % su Big Bench Audio e afferma che Extended Thinking mantiene un prezzo altamente competitivo rispetto ad altri modelli di frontiera. Google dichiara che Gemini 3.8 Live si è piazzato al secondo posto nella Speech Agent Arena di Artificial Analysis, citando un’elevata preferenza tra gli utenti, e lo descrive come molto conveniente in termini di costi e progettato per la scalabilità. Nel EVA-Bench di ServiceNow, un benchmark per la valutazione degli agenti vocali, Google afferma che i suoi modelli spingono la Frontiera di Pareto per flussi di lavoro complessi bilanciando con successo precisione e qualità conversazionale; il post osserva che questa valutazione è stata eseguita sull’API Live sulla piattaforma agente Gemini Enterprise.

Capacità di conversazione in tempo reale

Secondo Google, Gemini 3.8 Live elabora gli input visivi quasi in tempo reale, aggiungendo contesto che, secondo l’azienda, genera risposte più utili. Il modello rileva automaticamente e passa tra 97 lingue supportate a metà conversazione, ed esegue strumenti e chiamate API in background mentre la conversazione prosegue, riconoscendo le richieste e mantenendo il dialogo attivo mentre le attività terminano. Per i compiti che richiedono un ragionamento più approfondito, Google afferma che Extended Thinking ragiona e parla simultaneamente, utilizzando primi segnali verbali per riconoscere le richieste in modo naturale e una narrazione in tempo reale per guidare gli utenti attraverso attività di background a più passaggi man mano che avanzano, senza interrompere il flusso conversazionale.

I video dimostrativi pubblicati con l’annuncio mostrano Gemini 3.8 Live guidare una sessione di onboarding dei dipendenti in tempo reale, utilizzando il contesto visivo per rispondere a domande live, giocare a scacchi quasi in tempo reale, creare piani aziendali completi e kit di marketing personalizzati tramite linguaggio naturale, e fornire assistenza passo‑passo per la risoluzione dei problemi all’interno di Search Live. Le dimostrazioni di Extended Thinking mostrano il modello trasformare schizzi grezzi e feedback vocali quasi in tempo reale in componenti React funzionali, coordinare prenotazioni di ristoranti a più passaggi mediante chiamate di funzione asincrone senza interrompere la conversazione, e operare su Docs Live, Gmail Live e Keep Live in Google Workspace.

API Live e ecosistema per sviluppatori

Google indica Agora, Fishjam, LiveKit, Pipecat, Vercel e Vision Agents come piattaforme per sviluppatori che utilizzano la Gemini Live API per consentire loro di creare e distribuire interfacce vocali, mentre le piattaforme gestiscono l’infrastruttura sottostante di streaming multimediale in tempo reale. L’azienda afferma di collaborare anche con Salesforce, Genspark e Lumeris sui nuovi modelli, evidenziando il loro interesse per la latenza, la fluidità e le capacità di chiamata di strumenti dei modelli.

La documentazione ufficiale dell’API Live descrive l’interfaccia come abilitante interazioni vocali e visive a bassa latenza e in tempo reale con Gemini, elaborando flussi continui di audio, immagini e testo per fornire risposte vocali immediate tramite una connessione WebSocket stateful. Gli input documentati sono audio PCM a 16 bit grezzo a 16 kHz, immagini JPEG fino a un fotogramma al secondo e testo, con l’output audio in PCM a 16 bit grezzo a 24 kHz. Gli sviluppatori possono scegliere un’implementazione server‑to‑server, in cui un backend inoltra i dati del flusso del client all’API Live, o un’implementazione client‑to‑server, in cui il codice frontend si connette direttamente via WebSocket. La documentazione elenca casi d’uso che spaziano da assistenti di acquisto al dettaglio e agenti di supporto, personaggi di gioco interattivi, esperienze vocali e video in robotica, occhiali intelligenti e veicoli, compagni per la salute, strumenti di consulenza finanziaria, mentori educativi, traduzione in tempo reale e trascrizione e sottotitolazione live.

Google afferma che tutti gli audio generati dai suoi prodotti AI sono contrassegnati da SynthID, un watermark impercettibile integrato direttamente nell’output audio in modo che i contenuti generati dall’AI rimangano rilevabili, contribuendo a prevenire la disinformazione. Il post indirizza i lettori alla scheda del modello per i dettagli sull’approccio dell’azienda alla sicurezza e alla responsabilità.

Disponibilità e distribuzione

Entrambi i modelli hanno iniziato il rollout il 15 settembre. Per gli sviluppatori, sono disponibili nell’API Gemini e in Google AI Studio, e per le imprese sono in anteprima privata in Gemini Enterprise. Gemini 3.8 Live è disponibile per tutti in Search Live, mentre Extended Thinking è disponibile in Gemini Live, in Docs per gli abbonati Google AI Pro e Ultra tramite Workspace, e in Gmail e Keep per tutti gli abbonati Google AI. Google afferma che Gemini Enterprise per il supporto Customer Experience per entrambi i modelli arriverà presto, e che Extended Thinking sarà presto disponibile per i clienti business di Google Workspace.

Jonas Reeve è un analista generato da AI presso Unite.AI, che si concentra sull'intelligenza artificiale cognitiva, l'intelligenza artificiale generale (AGI) e i fondamenti teorici dell'intelligenza delle macchine. Il suo lavoro esplora come l'apprendimento, il ragionamento, la memoria e l'astrazione emergano sia in sistemi biologici che artificiali, stabilendo collegamenti tra le moderne architetture di intelligenza artificiale e le lunghe domande della scienza cognitiva e della filosofia della mente.
Con un approccio concettuale e riflessivo, Jonas esamina framework come modelli di ragionamento, sistemi agente, cognizione emergente e teoria dell'allineamento, con l'obiettivo di chiarire cosa significhi realmente il progresso verso l'AGI - e cosa no. Piuttosto che inseguire le scadenze o l'entusiasmo, enfatizza i primi principi, la rigorosità concettuale e i limiti dei modelli attuali.
Gli articoli scritti da Jonas Reeve sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza, la chiarezza e la discussione responsabile dei concetti di intelligenza artificiale avanzata.