AI-modeller og platforme
Spiludviklere ser på tale-AI for nye kreative muligheder
Lyd-syntesteknologi, især tale-syntese, er blevet meget mere avanceret de seneste år. Mens tekst-til-tale-teknologi har eksisteret i årtier, er teknologien blevet meget mere naturlig lydende. Seneste algoritmer kan tage kun få timer af lyd og syntetisere meget realistiske lydprøver. Da teknologien avancerer, åbner der sig flere muligheder, herunder muligheder i kreative medier. For nylig, som rapporteret af VentureBeat, har videospilsvirksomheder begyndt at undersøge brugen af AI-stemme-generering til at producere dialog for videospil.
Et selskab, Leviathan Games, har begyndt at implementere tale-AI i spil, som de for øjeblikket udvikler. Wyeth Ridgway, ejeren af Leviathan Games, forklarede, at tale-AI kunne ændre spildesign dramatisk. Ridgway forklarede, at brugen af tale-AI i spildesign er en opblomstrende trend, og sammenlignede det med, hvordan 3D-animationssoftware er skiftet over de sidste ti år, med selskaber som Pixar, der skaber proprietær software til at faciliterer animation og modellering.
Traditionelle metoder til at generere tale fungerer ved at sætte forudindspillede lydfiler sammen på fly, syning sammen af sætninger fra tidligere eksisterende ord og fraser. Denne metode til tale-generering kræver optagelse af hundredvis af timers værdi af dialog og manuel mærkning af lydklip. Det lyder også noget unaturligt, da betoning og accent tenderer til at skifte over ord. I sammenligning lyder den nyeste tale-AI betydeligt mere naturlig og fungerer på en anden måde.
Tale-AI er baseret på dybe neurale netværk. WaveNet var en af de første AI’er, der kunne generere overbevisende, naturlig lydende lydprøver. Da lydprøverne genereres fra scratch, er der ingen behov for at optage hundredvis af timers værdi af dialog, så længe der er tilstrækkelig træningsdata til rådighed. Optimerede GAN’er og LSTM-modeller kan generere lyd efter at være trænet på kun få timer af mærket lyd. Resultaterne kan være ekstraordinært overbevisende, såsom da Google’s Duplex-eksperiment ringede til en frisør for at aftale en tid.
Da disse teknologier bliver mere kraftfulde, standardiserede og lettilgængelige gennem cloud-computing, er det sandsynligt, at flere spiludviklere vil vende sig til tale-AI for at reducere produktions tid og omkostninger. Nogle selskaber er allerede i gang med at oprette modeller, der potentielt kan bruges af spiludviklere. Replica Studios specialiserer sig i AI-stemme-teknologi, og nogle af de lydprøver, der er genereret af deres teknologi, kan høres på links her og her.
Det er usandsynligt, at spiludviklere vil vælge at undlade at bruge stemme-skuespillere over AI. Faktisk kan tale-AI åbne op for flere muligheder for stemme-skuespillere. For øjeblikket springer mange spiludviklingsselskaber ofte over at have tale-dialog, på grund af den tidsinvestering og omkostninger, der er forbundet med oprettelsen af tale-dialog. Stemme-skuespillere skal ofte tilbagekalde for yderligere optagelsessessioner, hvis der er ændringer i manuskriptet eller hvis spildirektører ønsker en anden slags præstation. Tale-AI kan bruges til at eksperimentere med/prototype dialog, og få en fornemmelse af, hvilke slags manuskript-ændringer og revisioner, der skal gøres, før man kalder en professionel stemme-skuespiller til at optage manuskriptet. Dette kan føre til, at flere selskaber har ressourcerne til at investere i oprettelsen af tale-dialog.
AI-stemme-modeller kan endda blive trænet på stemmen af en bestemt stemme-skuespiller, og AI’en kan bruges til at generere ubetydelige dialogklip, så længe skuespilleren betales for brugen af deres stemme. Som rapporteret af VentureBeat, er stemme-skuespillere som Simon J. Smith optimistiske omkring den øgede brug af AI-stemme-modeller og deres potentiale til at åbne op for nye stemme-skuespiller-muligheder.
Ud over brugen af tale-AI til at prototypere manuskripter eller oprette tale-linjer for mindre karakterer, kan spiludviklere også bruge tale-AI til at give spillere flere muligheder for tilpasning af rollespil-videospil. For øjeblikket har selv spil, der tillader spillere at vælge en stemme til deres avatarer, typisk kun et par muligheder. Med brugen af tale-AI kan mulighederne være funktionelt ubegrænsede.












