AI-modeller og plattformer
Spillutviklere ser på tale-AI for nye kreative muligheter
Lyd-synteseteknologi, særlig tale-syntese, har blitt mye mer avansert de siste årene. Mens tekst-til-tale-teknologi har vært til stede i flere tiår, har teknologien blitt mye mer naturlig lydende. Nyere algoritmer kan ta bare noen timer med audio og syntetisere svært realistiske audio-eksempler. Etterhvert som teknologien utvikles, åpnes det opp for flere anvendelser, inkludert muligheter i kreative medier. Nylig, som rapportert av VentureBeat, har videospillselskaper begynt å undersøke bruken av AI-stemme-generering til å produsere dialog for videospill.
Et selskap, Leviathan Games, har startet å implementere tale-AI i spill de for tiden utvikler. Wyeth Ridgway, eieren av Leviathan Games, forklarte at tale-AI kunne endre spill-design på dramatisk vis. Ridgway forklarte at bruken av tale-AI i spill-design er en oppblomstringstrend, og sammenlignet det med hvordan 3D-animasjonsprogramvare har skiftet over de siste ti årene, med selskaper som Pixar som skaper proprietær programvare for å fasilitere animasjon og modellering.
Tradisjonelle metoder for å generere tale fungerer ved å legge sammen forhåndsinnspilte lydfiler på fly, syer sammen setninger fra tidligere eksisterende ord og fraser. Denne metoden for tale-generering krever innspilling av hundrevis av timer med dialog og manuell merking av lydklipp. Den høres også noe unaturlig ut, da betoning og vekt tenderer til å skifte over ord. I sammenligning høres den nyeste tale-AI mye mer naturlig ut og fungerer på en annen måte.
Tale-AI er basert på dype neurale nettverk. WaveNet var en av de første AI-ene som kunne generere overbevisende, naturlig lydende audio-eksempler. Ettersom lydeksemplene genereres fra scratch, er det ingen behov for å innspille hundrevis av timer med dialog, så lenge det er tilstrekkelig treningdata tilgjengelig. Optimaliserte GANs og LSTM-modeller kan generere audio etter å ha blitt trenet på bare noen timer med merket audio. Resultatene kan være ekstraordinært overbevisende, som når Google’s Duplex-eksperiment ringte en frisørsalong for å avtale en time.
Ettersom disse teknologiene blir mer kraftfulle, standardiserte og lett tilgjengelige gjennom skytjenester, er det sannsynlig at flere spillutviklere vil vende seg til tale-AI for å redusere produksjonstid og kostnader. Noen selskaper har allerede laget modeller som potensielt kan brukes av spillutviklere. Replica Studios spesialiserer seg på AI-stemme-teknologi, og noen audio-eksempler generert av deres teknologi kan høres på lenkene her og her.
Det er usannsynlig at spillutviklere vil velge å gi opp bruken av stemmeskuespillere over AI. Faktisk kan tale-AI åpne opp for flere muligheter for stemmeskuespillere. For tiden hopper mange spillutviklingsselskaper ofte over å ha tale i dialogen på grunn av tidsinvesteringen og kostnadene forbundet med å lage tale i dialogen. Stemmeskuespillere må ofte komme tilbake for flere innspillingsessioner hvis det er endringer i manuset eller hvis spillregissørene ønsker en annen type fremføring. Tale-AI kan brukes til å eksperimentere med/prototype dialog, å få en følelse av hva slags manusendringer og revisjoner som må gjøres før man tar inn en profesjonell stemmeskuespiller for å innspille manuset. Dette kan føre til at flere selskaper har ressurser til å investere i å lage tale i dialogen.
AI-stemme-modeller kan sogar bli trenet på stemmen til en bestemt stemmeskuespiller, og AI-en kan brukes til å generere mindre dialog-klipp, så lenge skuespilleren blir betalt for bruken av sin stemme. Som rapportert av VentureBeat, er stemmeskuespillere som Simon J. Smith optimistiske om den økende bruken av AI-stemme-modeller og deres potensiale til å åpne opp for nye stemmeskuespiller-muligheter.
Utenom bruken av tale-AI til å prototype manus eller lage tale-linjer for mindre karakterer, kan spillutviklere også bruke tale-AI til å gi spillere flere tilpasningsmuligheter for rollespill-videospill. For tiden har selv spill som tillater spillere å velge en stemme for sine avatarer typisk bare et håndfull muligheter. Med bruk av tale-AI kan mulighetene være funksjonelt ubegrensede.












