AI-mallit ja alustat

Pelinkehittäjät katsovat ääni-AI: hen uusia luovia mahdollisuuksia

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Äänen synteesiteknologia, erityisesti puheen synteesi, on kehittynyt paljon viime vuosina. Vaikka teksti-ääneksi -teknologia on ollut olemassa jo vuosikymmeniä, teknologia on tullut paljon luonnollisemman kuuloiseksi. Viimeaikaiset algoritmit voivat ottaa vain muutaman tunnin ääninäytteitä ja syntetisoida erittäin realistisia ääninäytteitä. Kun teknologia kehittyy, avautuu enemmän sovelluksia, mukaan lukien mahdollisuuksia luovassa mediassa. Viimeksi, kuten VentureBeat raportoi, videopeliyhtiöt ovat alkaneet tutkia ääni-AI:n käyttöä videopelien dialogin tuottamiseen.

Toinen yhtiö, Leviathan Games, on jo alkanut käyttää ääni-AI:ta kehittämissään peleissä. Leviathan Gamesin omistaja Wyeth Ridgway selitti, että ääni-AI voi muuttaa pelisuunnittelua dramaattisesti. Ridgway selitti, että ääni-AI:n käyttö pelisuunnittelussa on uusi suuntaus, ja vertasi sitä siihen, miten 3D-animointiohjelmistot ovat kehittyneet viimeisen vuosikymmenen aikana, ja yhtiöt kuten Pixar ovat luoneet omia ohjelmistoja animoinnin ja mallinnuksen helpottamiseksi.

Perinteiset menetelmät puheen generoimiseen toimivat liittämällä ennalta äänitetyt äänitiedostot yhteen lennossa, ompelemalla lauseita yhteen aiemmin olemassa olevista sanoista ja lauseista. Tämä puheen generoimisen menetelmä vaatii satoja tunteja dialogia ja manuaalista ääniklipien merkintää. Se kuulostaa myös jonkin verran epäluonnolliselta, koska sävy ja painotus taipuvat muuttumaan sanojen yli. Vertailun mukaan, ääni-AI kuulostaa merkittävästi luonnollisemmalta ja toimii toisella tavalla.

Ääni-AI perustuu syvään neuroniverkkoihin. WaveNet oli yksi ensimmäisistä tekoälyistä, jotka pystyivät generoimaan vakuuttavia, luonnollisen kuuloisia ääninäytteitä. Koska ääninäytteet generoidaan alusta alkaen, ei ole tarpeen ennalta äänittää satoja tunteja dialogia, kunhan riittävästi koulutusdataa on saatavilla. Optimoidut GAN-mallit ja LSTM-mallit voivat generoida ääniä vain muutaman tunnin merkityn äänen avulla. Tulokset voivat olla erittäin vakuuttavia, kuten kun Google (GOOGL ) Duplex -kokeilu soitti parturiin varataksesi ajan.

Kun nämä teknologiat tulevat voimakkaammaksi, standardoiduksi ja helpommin saataville pilvilaskennan kautta, on todennäköistä, että enemmän pelinkehittäjiä kääntyy ääni-AI: n puoleen vähentääksesi tuotantoaikaa ja kustannuksia. Joitakin yhtiöitä on jo luomassa malleja, jotka voivat potentiaalisesti olla pelinkehittäjien käytettävissä. Replica Studios on erikoistunut ääni-AI-teknologiaan, ja joitakin heidän teknologiansa generoimia ääninäytteitä voidaan kuulla linkeistä tässä ja tässä.

On epätodennäköistä, että pelinkehittäjät päättävät luopua ääninäyttelijöiden käytöstä ääni-AI:n hyväksi. Itse asiassa ääni-AI voi avata enemmän mahdollisuuksia ääninäyttelijöille. Nykyään monet pelinkehittäjäyhtiöt usein jättävät äänidialogin pois johtuen siitä, että äänidialogin luominen vaatii paljon aikaa ja rahaa. Ääninäyttelijöiden on usein palattava äänittämään lisää, jos käsikirjoitukseen tehdään muutoksia tai jos peliohjaajat haluavat erilaisen esitystavan. Ääni-AI voidaan käyttää kokeilemaan/prototyyppiinä dialogia, saadakseen tietää, mitä käsikirjoituksen muutoksia ja korjauksia on tehtävä ennen kuin ammattimainen ääninäyttelijä tulee äänittämään käsikirjoituksen. Tämä voi johtaa siihen, että enemmän yhtiöillä on varaa investoida äänidialogin luomiseen.

Ääni-AI-malleja voidaan jopa kouluttaa tietyn ääninäyttelijän äänen mukaan, ja ääni-AI:ta voidaan käyttää generoimaan triviaaleja dialogiklippejä, kunhan näyttelijä saa korvausta äänen käytöstä. Kuten VentureBeat raportoi, ääninäyttelijät kuten Simon J. Smith ovat optimistisia ääni-AI-mallien kasvavasta käytöstä ja niiden potentiaalista avata uusia ääninäyttelemisen mahdollisuuksia.

Pelinkehittäjät voivat käyttää ääni-AI:ta myös antaakseen pelaajille enemmän mukautusvaihtoehtoja roolipeleissä. Nykyään jopa pelit, jotka sallivat pelaajien valita äänen heidän hahmoilleen, tarjoavat vain muutaman vaihtoehdon. Ääni-AI:n avulla vaihtoehtojen määrä voi olla käytännössä rajaton.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.