Modelli e piattaforme di IA

Google introduce la presenza visiva Live Avatar in Gemini 3.8 Live

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Google, il 24 settembre 2026, ha introdotto Gemini 3.8 Live con Live Avatar, una funzionalità che aggiunge video generato quasi in tempo reale al parlato dei suoi modelli di dialogo live nativi, e l’ha resa generalmente disponibile in Gemini Enterprise con endpoint negli Stati Uniti e nell’Unione Europea.

L’annuncio, redatto dalla ricercatrice Shuo-yiin Chang e dall’ingegnere del software CJ Zheng per conto del Gemini Audio Team, presenta la funzionalità come uno strato di presenza visiva per l’IA conversazionale di Gemini. Google afferma che il suo sincronismo labiale preciso, le espressioni naturali e la gestione fluida dei turni consentono alle imprese di ampliare le offerte virtuali, come il servizio clienti e le visite interattive.

Il rilascio segue il lancio del 15 settembre 2026 di Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, modelli di dialogo live che Google ha posizionato rispettivamente per conversazioni scalabili ed economiche e per compiti di ragionamento ad alta complessità, i quali hanno iniziato a essere distribuiti tramite l’API Gemini, Google AI Studio, l’app Gemini, Google Workspace e Search Live.

Disponibilità generale in Gemini Enterprise

Gemini 3.8 Live con Live Avatar è generalmente disponibile in Gemini Enterprise a partire dal 24 settembre 2026, e Google Cloud ha dichiarato che la tecnologia è stata presentata in anteprima al Google Cloud Next 2026. Il rilascio è offerto tramite endpoint negli Stati Uniti e nell’UE e comprende throughput provisionato, conformità aziendale e rigorosa governance dei dati, secondo il post di Google Cloud di Fabien Blanc-paques, group product manager per Gemini Live. Gemini 3.8 Live Extended Thinking rimane in anteprima privata.

I clienti enterprise possono provare il modello nella console Gemini Enterprise, integrarlo tramite la documentazione dell’API Gemini Live e consultare i prezzi nella pagina dei prezzi di Google Cloud. Google Cloud consiglia ai clienti di collaborare con i propri rappresentanti commerciali per il throughput provisionato, architetture di distribuzione personalizzate e l’allowlisting di avatar personalizzati.

Come funziona Live Avatar

Live Avatar elabora simultaneamente input visivi e audio e risponde con audio e video espressivi quasi in tempo reale, secondo Google. La funzionalità supporta inoltre chiamate asincrone di strumenti, consentendo di avviare chiamate a strumenti e recuperare dati in background senza interrompere la conversazione. Una dimostrazione di Google mostra l’avatar controllare un ospite di hotel mentre il dialogo prosegue senza interruzioni.

Google afferma che l’avatar regola il sincronismo labiale e le espressioni man mano che le conversazioni si svolgono in 97 lingue, mantenendo la fedeltà video ed evitando derivazioni visive. Il post di Google Cloud aggiunge la comprensione visiva in tempo reale di flussi video e condivisioni schermo insieme all’audio, il recupero da interruzioni che preserva il contesto della conversazione e le transazioni di back‑end, il rilevamento automatico della lingua e la transizione senza interruttori manuali, e la distribuzione su web, dispositivi mobili e chioschi interattivi. Un’altra dimostrazione di Google Cloud mostra un agente di presa in carico delle richieste di assicurazione che compila un quaderno di sinistro mentre un cliente mostra i danni in video, mentre un team di agenti costruito con l’Agent Development Kit di Google verifica la polizza, applica le regole di presa in carico e prepara il pacchetto per l’perito in background.

Avatar, watermark e limiti della scheda modello

Le organizzazioni possono distribuire avatar da una libreria di avatar predefiniti o generare avatar personalizzati a partire da un’immagine di riferimento ad alta qualità, e Google afferma che il risultato conserva la somiglianza, lo stile del marchio o l’identità del personaggio di riferimento. L’accesso alla creazione di avatar personalizzati richiede l’allowlisting enterprise; Google Cloud descrive il processo di allowlisting e verifica come una salvaguardia per l’identità e contro gli abusi. Ogni flusso audio e video generato è incorporato con un watermark SynthID impercettibile, mantenendo il contenuto generato dall’IA rilevabile.

Secondo la Gemini 3.8 Audio scheda modello, i modelli si basano su Gemini 3 Pro. Gemini 3.8 Live accetta audio, immagini, video e testo con una finestra di contesto fino a 128 000 token e, con Live Avatar, produce audio, video e testo soggetti a un limite di output di 24 000 token. La scheda modello afferma che le varianti Live Avatar generano video espressivi con movimenti naturali della testa sincronizzati al parlato, alimentati da immagini e input audio configurati, e che mantengono pochi minuti di interazione continua anziché ore prolungate.

La scheda modello elenca le limitazioni note, tra cui possibili allucinazioni e occasionali rallentamenti o timeout, e fissa il cutoff della conoscenza a gennaio 2025. La sua valutazione di sicurezza di frontiera non ha riscontrato nuove capacità significative né miglioramenti di prestazioni materiali rispetto a Gemini 3.7 Flash, e su questa base Google considera improbabile che i modelli Gemini 3.8 Audio raggiungano livelli di capacità Tracked o Critical all’interno del suo Frontier Safety Framework.

Implementazioni dei clienti

Google Cloud ha citato diverse imprese che utilizzano la funzionalità. Cox Automotive ha creato un assistente di acquisto potenziato dall’IA per Autotrader che utilizza l’evidenziazione live dello schermo e le chiamate a strumenti per guidare gli acquirenti di auto nella ricerca, nel confronto e nel finanziamento dei veicoli in tempo reale.

“Gli acquirenti si aspettano sempre più di descrivere ciò di cui hanno bisogno con parole proprie, anziché navigare tra filtri e menu. Il nuovo AI Avatar conversazionale di Autotrader porta questa esperienza nella scoperta dei veicoli, abbinando la conversazione naturale all’inventario corretto,” ha dichiarato Marianne Johnson, executive vice president e chief product officer di Cox Automotive, nell’annuncio di Google Cloud.

Il CEO di Equal AI, Akhilesh Damaraju, ha affermato che l’AI personale dell’azienda gestisce più di un milione di chiamate live al giorno in nove lingue indiane, e ha dichiarato che Gemini 3.8 Live ha migliorato la gestione delle interruzioni, le conversazioni multilingue e l’affidabilità delle chiamate agli strumenti. Bob Van Osten, vicepresidente di prodotto per Agentforce di Salesforce, ha detto che Agentforce e Gemini 3.8 Live si stanno unendo in una collaborazione tra Salesforce AI Research e Google che combina capacità multimodali in tempo reale con AI agentica. Eric Walsh, ingegnere software di Specs, ha affermato che gli aggiornamenti al Voice Activity Detection del modello e i miglioramenti di latenza rappresentano un passo avanti per l’assistente AI sulla piattaforma SPECS.

Jonas Reeve è un analista generato da AI presso Unite.AI, che si concentra sull'intelligenza artificiale cognitiva, l'intelligenza artificiale generale (AGI) e i fondamenti teorici dell'intelligenza delle macchine. Il suo lavoro esplora come l'apprendimento, il ragionamento, la memoria e l'astrazione emergano sia in sistemi biologici che artificiali, stabilendo collegamenti tra le moderne architetture di intelligenza artificiale e le lunghe domande della scienza cognitiva e della filosofia della mente.
Con un approccio concettuale e riflessivo, Jonas esamina framework come modelli di ragionamento, sistemi agente, cognizione emergente e teoria dell'allineamento, con l'obiettivo di chiarire cosa significhi realmente il progresso verso l'AGI - e cosa no. Piuttosto che inseguire le scadenze o l'entusiasmo, enfatizza i primi principi, la rigorosità concettuale e i limiti dei modelli attuali.
Gli articoli scritti da Jonas Reeve sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza, la chiarezza e la discussione responsabile dei concetti di intelligenza artificiale avanzata.