AI-modellen en platforms

Game-ontwikkelaars kijken naar voice-AI voor nieuwe creatieve kansen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Geluidssynthesetechnologie, met name spraaksynthese, is de afgelopen jaren veel geavanceerder geworden. Hoewel tekst-naar-spraaktechnologie al decennialang bestaat, klinkt de technologie nu veel natuurlijker. Recent ontwikkelde algoritmes kunnen met slechts een paar uur aan audio zeer realistische audiosamples synthetiseren. Naarmate de technologie vordert, komen er meer toepassingen beschikbaar, waaronder mogelijkheden in creatieve media. Onlangs, zoals gerapporteerd door VentureBeat, zijn videogamebedrijven begonnen met het onderzoeken van het gebruik van AI-stemgeneratie om dialoog voor videogames te produceren.

Een bedrijf, Leviathan Games, is begonnen met het implementeren van voice-AI in games die momenteel in ontwikkeling zijn. Wyeth Ridgway, de eigenaar van Leviathan Games, legde uit dat voice-AI de game-ontwerp op dramatische wijze kan veranderen. Ridgway legde uit dat het gebruik van voice-AI in game-ontwerp een opkomende trend is en vergeleek het met hoe 3D-animatiesoftware in de loop van het afgelopen decennium is veranderd, met bedrijven als Pixar die propriëtaire software ontwikkelen om animatie en modellering te faciliteren.

Traditionele methoden voor het genereren van spraak werken door vooraf opgenomen geluidsbestanden samen te voegen, zinnen samen te stellen uit eerder bestaande woorden en zinnen. Deze methode van spraakgeneratie vereist het opnemen van honderden uren aan dialoog en het handmatig labelen van geluidsclips. Het klinkt ook enigszins onnatuurlijk, omdat intonatie en nadruk neigen te veranderen over woorden. In vergelijking klinkt state-of-the-art voice-AI aanzienlijk natuurlijker en werkt het op een andere manier.

Voice-AI is gebaseerd op diepe neurale netwerken. WaveNet was een van de eerste AI’s die overtuigende, natuurlijk klinkende audiosamples kon genereren. Aangezien de audiosamples van scratch worden gegenereerd, is er geen behoefte aan het opnemen van honderden uren aan dialoog, zolang er voldoende trainingsdata beschikbaar is. Geoptimaliseerde GAN’s en LSTM-modellen kunnen audio genereren na training op slechts een paar uur aan gelabelde audio. De resultaten kunnen buitengewoon overtuigend zijn, zoals toen Google’s Duplex-experiment een kapperszaak belde om een afspraak te maken.

Naarmate deze technologieën krachtiger, gestandaardiseerd en gemakkelijker toegankelijk worden via cloud computing, is het waarschijnlijk dat meer game-ontwikkelaars voice-AI zullen gebruiken om productietijd en -kosten te verminderen. Sommige bedrijven zijn al modellen aan het creëren die mogelijk door game-ontwikkelaars kunnen worden gebruikt. Replica Studios specialiseert zich in AI-stemtechnologie, en sommige audiosamples gegenereerd door hun technologie kunnen worden gehoord op links hier en hier.

Het is onwaarschijnlijk dat game-ontwikkelaars zullen kiezen voor het niet gebruiken van voice-acteurs ten gunste van AI. In feite kan voice-AI meer kansen openen voor voice-acteurs. Momenteel slaan veel game-ontwikkelingsbedrijven vaak het hebben van gesproken dialoog over omdat het een tijdsinvestering en kosten met zich meebrengt. Voice-acteurs moeten vaak terugkomen voor meer opnamesessies als er veranderingen in het script zijn of als game-regisseurs een andere soort prestatie willen. Voice-AI kan worden gebruikt om dialoog te experimenteren/prototypen, om een gevoel te krijgen voor welke soort scriptwijzigingen en revisies moeten worden gemaakt voordat een professionele voice-actor wordt ingehuurd om het script op te nemen. Dit kan ertoe leiden dat meer bedrijven de middelen hebben om te investeren in de creatie van gesproken dialoog.

AI-stemmodellen kunnen zelfs worden getraind op de stem van een specifieke voice-actor, en de AI kan worden gebruikt om triviale dialoogclips te genereren, zolang de acteur wordt betaald voor het gebruik van hun stem. Zoals gerapporteerd door VentureBeat, zijn voice-acteurs zoals Simon J. Smith, optimistisch over het toenemende gebruik van AI-stemmodellen en hun potentieel om nieuwe kansen voor voice-acteurs te openen.

Behalve het gebruik van voice-AI om scripts te prototypen of gesproken regels te creëren voor minder belangrijke personages, kunnen game-ontwikkelaars ook voice-AI gebruiken om spelers meer aanpassingsmogelijkheden te geven voor rollenspellen. Momenteel hebben zelfs games die spelers toelaten om een stem voor hun avatars te kiezen, meestal slechts een handvol opties. Met het gebruik van voice-AI kunnen de opties functioneel onbeperkt zijn.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.