Μοντέλα και πλατφόρμες AI

Οι Δημιουργοί Παιχνιδιών Στρέφονται στη Φωνητική Νοημοσύνη για Νέες Δημιουργικές Ευκαιρίες

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η τεχνολογία σύνθεσης ήχου, ιδιαίτερα η σύνθεση ομιλίας, έχει γίνει πολύ πιο εξελιγμένη τα τελευταία χρόνια. Ενώ η τεχνολογία κειμένου-σε-ομιλία υπάρχει για δεκαετίες, η τεχνολογία έχει γίνει πολύ πιο φυσική και φυσιολογική. Τα πρόσφατα αλγόριθμοι μπορούν να πάρουν μόνο quelques ώρες ήχου και να συνθέσουν πολύ πραγματιστικές δείγματα ήχου. Όσο η τεχνολογία προχωρά, περισσότερες εφαρμογές ανοίγουν, συμπεριλαμβανομένων των δυνατοτήτων στις δημιουργικές μεσαίες. Πρόσφατα, όπως αναφέρθηκε από το VentureBeat, οι εταιρείες βιντεοπαιχνιδιών έχουν αρχίσει να ερευνάν την χρήση της φωνητικής νοημοσύνης για την παραγωγή διαλόγου για βιντεοπαιχνίδια.

Μια εταιρεία, Leviathan Games, έχει αρχίσει να εφαρμόζει τη φωνητική νοημοσύνη μέσα στα παιχνίδια που αναπτύσσει. Ο Wyeth Ridgway, ο ιδιοκτήτης της Leviathan Games, εξήγησε ότι η φωνητική νοημοσύνη θα μπορούσε να αλλάξει τον σχεδιασμό του παιχνιδιού με δραματικούς τρόπους. Ο Ridgway εξήγησε ότι η χρήση της φωνητικής νοημοσύνης στον σχεδιασμό του παιχνιδιού είναι μια αναδυόμενη τάση και την σύγκρινε με τον τρόπο που το λογισμικό 3D animation έχει αλλάξει κατά τη διάρκεια της τελευταίας δεκαετίας, με εταιρείες όπως η Pixar να δημιουργούν ιδιόκτητο λογισμικό για να διευκολύνουν την animation και το modeling.

Οι παραδοσιακές μεθόδους γεννήσης ομιλίας λειτουργούν με την προσάρτηση προ-ηχογραφημένων αρχείων ήχου μαζί, συνδέοντας προτάσεις μαζί από προϋπάρχουσες λέξεις και φράσεις. Αυτή η μέθοδος γεννήσης ομιλίας απαιτεί την ηχογράφηση εκατοντάδων ωρών διαλόγου και την χειροκίνητη επισήμανση των κλιπ ήχου. Επίσης, ακούγεται κάπως μη φυσιολογικά, καθώς η πτώση και η έμφαση έχουν την τάση να αλλάξουν μέσα στις λέξεις. Σε σύγκριση, η φωνητική νοημοσύνη ήχος πολύ πιο φυσιολογικά και λειτουργεί με διαφορετικό τρόπο.

Η φωνητική νοημοσύνη βασίζεται σε βαθιά νευρωνικά δίκτυα. WaveNet ήταν ένα από τα πρώτα AI που θα μπορούσαν να γεννήσουν πειστικές, φυσιολογικές δείγματα ήχου.既然 τα δείγματα ήχου γεννιούνται από την αρχή, δεν υπάρχει ανάγκη να προ-ηχογραφήσουμε εκατοντάδες ώρες διαλόγου, εφόσον υπάρχουν επαρκή δεδομένα εκπαίδευσης. Οι βελτιστοποιημένες GANs και LSTM μοντέλα μπορούν να γεννήσουν ήχο μετά από εκπαίδευση σε μόνο quelques ώρες σημειωμένου ήχου. Τα αποτελέσματα μπορούν να είναι εξαιρετικά πειστικά, όπως όταν το πείραμα Google (GOOGL ) Duplex κάλεσε ένα κομμωτήριο για να κλείσει ραντεβού.

Όσο αυτές οι τεχνολογίες γίνονται πιο ισχυρές, τυποποιημένες και εύκολες στην πρόσβαση μέσω του cloud computing, είναι πιθανό ότι περισσότεροι δημιουργοί παιχνιδιών θα στρέφονται στη φωνητική νοημοσύνη για να μειώσουν τον χρόνο παραγωγής και το κόστος. Κάποιες εταιρείες έχουν ήδη δημιουργήσει μοντέλα που θα μπορούσαν να χρησιμοποιηθούν από τους δημιουργούς παιχνιδιών. Replica Studios ειδικεύεται στη φωνητική τεχνολογία AI, και κάποια δείγματα ήχου που γεννήθηκαν από την τεχνολογία τους μπορούν να ακουστούν στις συνδέσεις εδώ και εδώ.

Είναι απίθανο ότι οι δημιουργοί παιχνιδιών θα επιλέξουν να παρατήσουν τη χρήση των ηθοποιών φωνής πάνω στην φωνητική νοημοσύνη. Στην πραγματικότητα, η φωνητική νοημοσύνη θα μπορούσε να ανοίξει περισσότερες ευκαιρίες για τους ηθοποιούς φωνής. Τώρα, πολλές εταιρείες ανάπτυξης παιχνιδιών συχνά παραλείπουν να έχουν διαλόγους φωνής λόγω του χρόνου και του κόστους που συνδέονται με τη δημιουργία διαλόγου φωνής. Οι ηθοποιοί φωνής συχνά πρέπει να επιστρέψουν για περισσότερες συνεδρίες ηχογράφησης εάν υπάρχουν αλλαγές στο σενάριο ή εάν οι σκηνοθέτες του παιχνιδιού θέλουν μια διαφορετική ερμηνεία. Η φωνητική νοημοσύνη θα μπορούσε να χρησιμοποιηθεί για να πειραματιστεί/προτοποποιηθεί ο διάλογος, να πάρει μια αίσθηση του τι είδους αλλαγές του σεναρίου και αναθεωρήσεων πρέπει να γίνουν πριν να καλεστεί ένας επαγγελματίας ηθοποιός φωνής για να ηχογραφήσει το σενάριο. Αυτό θα μπορούσε να οδηγήσει σε περισσότερες εταιρείες να έχουν τους πόρους για να επενδύσουν στη δημιουργία διαλόγου φωνής.

Τα μοντέλα φωνής AI θα μπορούσαν ακόμη και να εκπαιδευτούν στη φωνή ενός συγκεκριμένου ηθοποιού φωνής, και η φωνητική νοημοσύνη να χρησιμοποιηθεί για να γεννήσει ασήμαντες δείγματα διαλόγου, εφόσον ο ηθοποιός πληρώνεται για τη χρήση της φωνής του. Όπως αναφέρθηκε από το VentureBeat, οι ηθοποιοί φωνής όπως ο Simon J. Smith, είναι αισιόδοξοι για την αυξανόμενη χρήση των μοντέλων φωνής AI και τη δυνατότητά τους να ανοίξουν νέες ευκαιρίες για τους ηθοποιούς φωνής.

Πέρα από τη χρήση της φωνητικής νοημοσύνης για να προτοποποιηθεί το σενάριο ή να δημιουργηθούν γραμμές φωνής για δευτερεύοντες χαρακτήρες, οι δημιουργοί παιχνιδιών θα μπορούσαν επίσης να χρησιμοποιήσουν τη φωνητική νοημοσύνη για να δώσουν στους παίκτες περισσότερες επιλογές για την προσωποποίηση των χαρακτήρων τους σε βιντεοπαιχνίδια ρόλων. Τώρα, ακόμη και τα παιχνίδια που επιτρέπουν στους παίκτες να επιλέξουν μια φωνή για τους अवταράκους τους έχουν συνήθως μόνο quelques επιλογές. Με τη χρήση της φωνητικής νοημοσύνης, οι επιλογές θα μπορούσαν να είναι λειτουργικά απεριόριστες.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.