Modele i platformy AI

Deweloperzy gier zwracają uwagę na Voice AI dla nowych możliwości twórczych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Technologia syntezy dźwięku, w szczególności synteza mowy, stała się znacznie bardziej zaawansowana w ostatnich latach. Chociaż technologia tekst-do-mowy istnieje od dziesięcioleci, stała się znacznie bardziej naturalnie brzmiąca. Ostatnie algorytmy mogą w ciągu zaledwie kilku godzin nagrania audio wygenerować wysoko realistyczne próbki audio. Wraz z postępem techniki, otwierają się nowe możliwości zastosowania, w tym w mediach twórczych. Jak donosi VentureBeat, firmy produkujące gry zaczęły badać wykorzystanie generacji głosu AI do tworzenia dialogów w grach wideo.

Jedna z firm, Leviathan Games, rozpoczęła wdrażanie technologii Voice AI w grach, które są obecnie w trakcie rozwoju. Wyeth Ridgway, właściciel Leviathan Games, wyjaśnił, że Voice AI może zmienić projektowanie gier w dramatyczny sposób. Ridgway powiedział, że użycie Voice AI w projektowaniu gier jest nowym trendem i porównał to do tego, jak oprogramowanie do animacji 3D zmieniło się w ciągu ostatniej dekady, z firmami takimi jak Pixar tworzącymi oprogramowanie własne w celu ułatwienia animacji i modelowania.

Tradycyjne metody generowania mowy polegają na łączeniu nagranych plików dźwiękowych na bieżąco, łącząc zdania z wcześniej istniejących słów i fraz. Ta metoda generowania mowy wymaga nagrania setek godzin dialogów i ręcznego oznaczania klipów dźwiękowych. Brzmi to również nieco nienaturalnie, ponieważ intonacja i akcent mają tendencję do zmiany wzdłuż słów. W porównaniu z tym, najnowsza technologia Voice AI brzmi znacznie bardziej naturalnie i działa w inny sposób.

Voice AI opiera się na głębokich sieciach neuronowych. WaveNet był jednym z pierwszych AI, które mogły generować przekonywujące, naturalnie brzmiące próbki audio. Ponieważ próbki audio są generowane od podstaw, nie ma potrzeby nagrywania setek godzin dialogów, o ile jest dostępne wystarczająco dużo danych szkoleniowych. Optymalizowane modele GAN i LSTM mogą generować audio po przeszkoleniu na zaledwie kilku godzinach oznaczonych danych audio. Wyniki mogą być nadzwyczaj przekonywujące, tak jak w przypadku eksperymentu Google (GOOGL ) Duplex wykonującego telefon do salonu fryzjerskiego w celu umówienia wizyty.

Wraz z tym, jak te technologie stają się bardziej potężne, standaryzowane i łatwo dostępne za pomocą chmury obliczeniowej, prawdopodobne jest, że więcej deweloperów gier zwróci uwagę na Voice AI, aby zmniejszyć czas produkcji i koszty. Niektóre firmy już tworzą modele, które mogą być wykorzystywane przez deweloperów gier. Replica Studios specjalizuje się w technologii głosu AI, a niektóre próbki audio wygenerowane przez ich technologię można usłyszeć w linkach tutaj i tutaj.

Mało prawdopodobne jest, że deweloperzy gier zrezygnują z użycia aktorów głosowych na rzecz AI. W rzeczywistości, Voice AI może otworzyć więcej możliwości dla aktorów głosowych. Obecnie wiele firm deweloperskich często pomija dialogi z głosem z powodu nakładu czasu i kosztów związanych z tworzeniem dialogów z głosem. Aktorzy głosowi często muszą być przywoływani na dodatkowe sesje nagraniowe, jeśli są zmiany w scenariuszu lub jeśli dyrektorzy gry chcą innego rodzaju wykonania. Voice AI może być wykorzystywana do eksperymentowania z/prototypowania dialogów, aby uzyskać poczucie, jakie zmiany w scenariuszu i rewizje są potrzebne, zanim wezwie się profesjonalnego aktora głosowego do nagrania scenariusza. Może to doprowadzić do tego, że więcej firm będzie miało środki, aby zainwestować w tworzenie dialogów z głosem.

Modele głosu AI mogą być nawet szkolone na głosie konkretnego aktora głosowego, a AI może być wykorzystywana do generowania nieistotnych klipów dialogowych, o ile aktor jest wynagradzany za użycie jego głosu. Jak donosi VentureBeat, aktorzy głosowi tacy jak Simon J. Smith są optymistami co do coraz częstszego wykorzystania modeli głosu AI i ich potencjału do otwierania nowych możliwości dla aktorów głosowych.

Poza użyciem Voice AI do prototypowania scenariuszy lub tworzenia wypowiedzi dla postaci drugoplanowych, deweloperzy gier mogą również wykorzystywać Voice AI, aby dać graczom więcej opcji personalizacji dla gier RPG. Obecnie nawet gry, które pozwalają graczom wybrać głos dla swoich awatarów, zwykle mają tylko kilka opcji. Z użyciem Voice AI, opcje mogą być funkcjonalnie nieograniczone.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.