Modely a platformy AI
Vývojáři her se zaměřují na hlasový AI pro nové tvůrčí příležitosti
Technologie syntézy zvuku, zejména syntéza řeči, se v posledních letech výrazně zlepšila. Zatímco technologie text-to-speech existuje již desetiletí, stalo se to mnohem přirozenějším. Recentní algoritmy mohou zpracovat pouze několik hodin audiozáznamu a syntetizovat velmi realistické audio vzorky. Jakmile se technologie dále rozvíjí, otevírají se nové aplikace, včetně možností v oblasti kreativních médií. Nedávno, jak uvádí VentureBeat, společnosti entwickující videohry začaly zkoumat použití generování hlasu pomocí AI pro produkci dialogů ve videohrách.
Jedna společnost, Leviathan Games, již začala implementovat hlasový AI do her, které目前 entwickují. Wyeth Ridgway, vlastník Leviathan Games, vysvětlil, že hlasový AI může dramaticky změnit design her. Ridgway vysvětlil, že použití hlasového AI v designu her je vznikajícím trendem, a porovnal to s tím, jak se software pro 3D animaci změnil v průběhu posledních deseti let, kdy společnosti jako Pixar vytvořily proprietární software pro usnadnění animace a modelování.
Tradiční metody generování řeči fungují tak, že se na vyžádání skládají předem nahrané zvukové soubory, spojují věty z předem existujících slov a frází. Tato metoda generování řeči vyžaduje nahrání stovek hodin dialogu a ruční označení zvukových klipů. Také zní somewhat nepřirozeně, protože intonace a důraz se mění přes slova. Naopak, nejmodernější hlasový AI zní mnohem přirozeněji a funguje jinak.
Hlasový AI je založen na hlubokých neuronových sítích. WaveNet byl jedním z prvních AI, které mohly generovat přesvědčivé, přirozeně znějící audio vzorky. Protože se zvukové vzorky generují od začátku, není třeba předem nahrát stovky hodin dialogu, pokud je k dispozici dostatečné trénovací data. Optimalizované GANy a LSTM modely mohou generovat audio po tréninku na pouze několik hodin označeného audio. Výsledky mohou být mimořádně přesvědčivé, jako když experiment Google (GOOGL ) Duplex zavolal do kadeřnictví, aby dohodl schůzku.
Jakmile se tyto technologie stanou ještě výkonnějšími, standardizovanějšími a snadno přístupnými prostřednictvím cloud computingu, je pravděpodobné, že více vývojářů her se bude obracet na hlasový AI, aby snížili dobu produkce a náklady. Některé společnosti již vytvářejí modely, které mohou být potenciálně použity vývojáři her. Replica Studios se specializuje na technologii hlasového AI, a některé audio vzorky generované jejich technologií lze slyšet na odkazech zde a zde.
Je nepravděpodobné, že by vývojáři her zvolili zrušení použití hlasových herců ve prospěch AI. Ve skutečnosti může hlasový AI otevřít více příležitostí pro hlasové herce. V současné době mnoho společností entwickujících hry často vynechává hlasový dialog kvůli časové investici a nákladům spojeným s vytvořením hlasového dialogu. Hlasoví herci často musí být povoláni zpět pro další nahrávací sezení, pokud dojde ke změnám scénáře nebo pokud režiséři chtějí jiný typ výkonu. Hlasový AI může být použit k experimentování s/protypování dialogu, získání pocitu, jaký druh scénářových změn a revizí je třeba provést, než bude povolán profesionální hlasový herec, aby nahrál scénář. To může vést k tomu, že více společností bude mít zdroje k investování do vytváření hlasového dialogu.
Modely hlasového AI mohou být甚至 trénovány na hlas konkrétního hlasového herce, a AI lze použít k generování triviálních dialogových klipů, pokud je herec placen za použití svého hlasu. Jak uvádí VentureBeat, hlasoví herci jako Simon J. Smith jsou optimističtí ohledně rostoucího použití modelů hlasového AI a jejich potenciálu otevřít nové příležitosti pro hlasové herce.
Mimo použití hlasového AI k prototypování scénářů nebo vytváření hlasových linek pro vedlejší postavy, vývojáři her mohou také použít hlasový AI, aby poskytli hráčům více možností přizpůsobení pro role-playing videohry. V současné době, i když hry umožňují hráčům zvolit hlas pro své avatary, obvykle mají pouze několik možností. S použitím hlasového AI by možnosti mohly být prakticky neomezené.












