Modele și platforme AI
Dezvoltatorii de jocuri se uită spre inteligența vocală pentru noi oportunități creative
Tehnologia de sinteză a sunetului, în special sinteza vorbirii, a devenit mult mai sofisticată în ultimii ani. În timp ce tehnologia text-to-speech a existat de decenii, tehnologia a devenit mult mai naturală. Algoritmii recenți pot lua doar câteva ore de audio și sintetiza mostre de audio foarte realiste. Pe măsură ce tehnologia evoluează, se deschid mai multe aplicații, inclusiv posibilități în mass-media creative. Recent, după cum a fost raportat de VentureBeat, companiile de jocuri video au început să investigheze utilizarea generației de voce AI pentru a produce dialoguri pentru jocuri video.
O companie, Leviathan Games, a început să implementeze inteligența vocală în jocurile pe care le dezvoltă în prezent. Wyeth Ridgway, proprietarul Leviathan Games, a explicat că inteligența vocală poate schimba proiectarea jocurilor în moduri dramatice. Ridgway a explicat că utilizarea inteligenței vocale în proiectarea jocurilor este o tendință emergentă și a comparat-o cu modul în care software-ul de animație 3D s-a schimbat de-a lungul ultimului deceniu, cu companii precum Pixar care creează software proprietar destinat să faciliteze animația și modelarea.
Metodele tradiționale de generare a vorbirii funcționează prin atașarea fișierelor audio preînregistrate împreună pe loc, cusând propoziții împreună din cuvinte și fraze existente anterior. Această metodă de generare a vorbirii necesită înregistrarea a sute de ore de dialog și etichetarea manuală a clipei sunet. De asemenea, sună puțin natural, deoarece inflexiunea și accentul tind să se schimbe pe cuvinte. În comparație, inteligența vocală de ultimă generație sună semnificativ mai naturală și funcționează într-un mod diferit.
Inteligența vocală se bazează pe rețele neuronale profunde. WaveNet a fost unul dintre primele IA care puteau genera mostre audio convingătoare și naturale. Deoarece mostrele de sunet sunt generate de la zero, nu există nevoie de a preînregistra sute de ore de dialog, atâta timp cât există suficiente date de antrenament. Modelele GAN și LSTM optimizate pot genera audio după ce au fost antrenate pe doar câteva ore de audio etichetate. Rezultatele pot fi extraordinar de convingătoare, cum ar fi atunci când experimentul Google (GOOGL ) Duplex a sunat la un salon de coafură pentru a programa o programare.
Pe măsură ce aceste tehnologii devin mai puternice, standardizate și ușor accesibile prin calculul în cloud, este probabil ca mai mulți dezvoltatori de jocuri să se îndrepte spre inteligența vocală pentru a reduce timpul de producție și costurile. Unele companii creează deja modele care pot fi utilizate de dezvoltatorii de jocuri. Replica Studios se specializează în tehnologia vocală AI, iar unele mostre audio generate de tehnologia lor pot fi auzite la link-urile aici și aici.
Este puțin probabil ca dezvoltatorii de jocuri să renunțe la utilizarea actorilor de voce în favoarea inteligenței vocale. De fapt, inteligența vocală poate deschide mai multe oportunități pentru actorii de voce. În prezent, multe companii de dezvoltare de jocuri frecvent sar peste dialogurile vocalizate din cauza investiției de timp și a costurilor asociate cu crearea dialogurilor vocalizate. Actorii de voce trebuie adesea aduși înapoi pentru mai multe sesiuni de înregistrare dacă există modificări ale scenariului sau dacă regizorii de jocuri doresc o interpretare diferită. Inteligența vocală poate fi utilizată pentru a experimenta/proiecta dialoguri, obținând o senzație de ce fel de modificări ale scenariului și revizuiri trebuie făcute înainte de a chema un actor de voce profesionist pentru a înregistra scenariul. Acest lucru poate duce la mai multe companii care au resurse pentru a investi în crearea dialogurilor vocalizate.
Modelele de voce AI pot fi chiar antrenate pe vocea unui actor de voce specific și pot fi utilizate pentru a genera clipuri de dialog trivial, atâta timp cât actorul este plătit pentru utilizarea vocii sale. După cum a fost raportat de VentureBeat, actori de voce precum Simon J. Smith sunt optimiști cu privire la utilizarea tot mai mare a modelelor de voce AI și la potențialul lor de a deschide noi oportunități de voce.
Dincolo de utilizarea inteligenței vocale pentru a proiecta scenarii sau a crea linii vocalizate pentru personaje minore, dezvoltatorii de jocuri pot utiliza, de asemenea, inteligența vocală pentru a oferi jucătorilor mai multe opțiuni de personalizare pentru jocurile video de rol. În prezent, chiar și jocurile care permit jucătorilor să aleagă o voce pentru avatarurile lor au de obicei doar câteva opțiuni. Cu utilizarea inteligenței vocale, opțiunile pot fi funcțional nelimitate.












