Modelli e piattaforme di IA

Gli sviluppatori di giochi si rivolgono all’intelligenza artificiale vocale per nuove opportunità creative

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

La tecnologia di sintesi del suono, in particolare la sintesi vocale, è diventata molto più sofisticata negli ultimi anni. Sebbene la tecnologia di conversione del testo in voce sia stata utilizzata per decenni, la tecnologia è diventata molto più naturale e realistica. Gli algoritmi recenti possono prendere solo poche ore di audio e sintetizzare campioni audio altamente realistici. Man mano che la tecnologia si evolve, si aprono nuove applicazioni, comprese le possibilità nei media creativi. Recentemente, come riportato da VentureBeat, le aziende di videogiochi hanno iniziato a indagare sull’uso della generazione di voci AI per produrre dialoghi per videogiochi.

Una società, Leviathan Games, ha iniziato a implementare l’intelligenza artificiale vocale all’interno dei giochi che attualmente stanno sviluppando. Wyeth Ridgway, il proprietario di Leviathan Games, ha spiegato che l’intelligenza artificiale vocale potrebbe cambiare il design dei giochi in modi drammatici. Ridgway ha spiegato che l’uso dell’intelligenza artificiale vocale nella progettazione dei giochi è una tendenza emergente e l’ha paragonata a come il software di animazione 3D sia cambiato nel corso dell’ultimo decennio, con aziende come Pixar che creano software proprietario volto a facilitare l’animazione e la modellazione.

I metodi tradizionali di generazione della voce operano appendendo file audio pre-registrati insieme in tempo reale, cucendo frasi insieme da parole e frasi precedentemente esistenti. Questo metodo di generazione della voce richiede la registrazione di centinaia di ore di dialogo e l’etichettatura manuale dei clip audio. Sembra anche poco naturale poiché l’inflessione e l’enfasi tendono a spostarsi tra le parole. In confronto, l’intelligenza artificiale vocale di ultima generazione suona significativamente più naturale e funziona in modo diverso.

L’intelligenza artificiale vocale si basa su reti neurali profonde. WaveNet è stato uno dei primi AI in grado di generare campioni audio convincenti e naturali. Poiché i campioni audio sono generati da zero, non c’è bisogno di pre-registrare centinaia di ore di dialogo, a condizione che siano disponibili dati di addestramento sufficienti. GAN ottimizzati e modelli LSTM possono generare audio dopo essere stati addestrati su solo poche ore di audio etichettato. I risultati possono essere straordinariamente convincenti, come quando l’esperimento Google (GOOGL ) Duplex ha chiamato un salone di bellezza per fissare un appuntamento.

Man mano che queste tecnologie diventano più potenti, standardizzate e facilmente accessibili attraverso il cloud computing, è probabile che più sviluppatori di giochi si rivolgano all’intelligenza artificiale vocale per ridurre il tempo di produzione e i costi. Alcune aziende stanno già creando modelli che potrebbero essere utilizzati dagli sviluppatori di giochi. Replica Studios si specializza in tecnologia vocale AI, e alcuni campioni audio generati dalla loro tecnologia possono essere ascoltati ai link qui e qui.

È improbabile che gli sviluppatori di giochi decidano di rinunciare all’uso di attori vocali rispetto all’AI. In realtà, l’intelligenza artificiale vocale potrebbe aprire più opportunità per gli attori vocali. Attualmente, molte aziende di sviluppo di giochi spesso saltano la registrazione di dialoghi vocali a causa dell’impegno di tempo e dei costi associati alla creazione di dialoghi vocali. Gli attori vocali spesso devono essere richiamati per ulteriori sessioni di registrazione se ci sono modifiche alla sceneggiatura o se i direttori del gioco desiderano una diversa interpretazione. L’intelligenza artificiale vocale potrebbe essere utilizzata per sperimentare/prototipare dialoghi, ottenendo un’idea di quali modifiche alla sceneggiatura e revisioni debbano essere apportate prima di chiamare un attore vocale professionista per registrare la sceneggiatura. Ciò potrebbe portare a più aziende che hanno le risorse per investire nella creazione di dialoghi vocali.

I modelli di voci AI potrebbero anche essere addestrati sulla voce di un attore vocale specifico e l’AI utilizzata per generare clip di dialogo triviali, a condizione che l’attore sia pagato per l’uso della sua voce. Come riportato da VentureBeat, attori vocali come Simon J. Smith, sono ottimisti sull’aumento dell’uso di modelli di voci AI e sul loro potenziale per aprire nuove opportunità di recitazione vocale.

Oltre all’uso dell’intelligenza artificiale vocale per prototipare sceneggiature o creare linee vocali per personaggi minori, gli sviluppatori di giochi potrebbero anche utilizzare l’intelligenza artificiale vocale per offrire ai giocatori più opzioni di personalizzazione per i videogiochi di ruolo. Attualmente, anche i giochi che consentono ai giocatori di scegliere una voce per i loro avatar hanno solitamente solo un pugno di opzioni. Con l’uso dell’intelligenza artificiale vocale, le opzioni potrebbero essere funzionalmente illimitate.

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.