Modèles et plateformes d’IA
Les développeurs de jeux vidéo se tournent vers l’intelligence artificielle vocale pour de nouvelles opportunités créatives
La technologie de synthèse sonore, en particulier la synthèse vocale, est devenue beaucoup plus sophistiquée ces dernières années. Alors que la technologie de reconnaissance vocale existe depuis des décennies, la technologie est devenue beaucoup plus naturelle. Les algorithmes récents peuvent prendre seulement quelques heures d’audio et synthétiser des échantillons audio très réalistes. À mesure que la technologie progresse, davantage d’applications s’ouvrent, notamment des possibilités dans les médias créatifs. Récemment, selon un rapport de VentureBeat, les sociétés de jeux vidéo ont commencé à étudier l’utilisation de la génération de voix par intelligence artificielle pour produire des dialogues pour les jeux vidéo.
Une société, Leviathan Games, a commencé à mettre en œuvre l’intelligence artificielle vocale dans les jeux qu’elle développe actuellement. Wyeth Ridgway, le propriétaire de Leviathan Games, a expliqué que l’intelligence artificielle vocale pourrait changer la conception de jeu de manière dramatique. Ridgway a expliqué que l’utilisation de l’intelligence artificielle vocale dans la conception de jeu est une tendance émergente, et l’a comparée à la façon dont les logiciels d’animation 3D ont évolué au cours de la dernière décennie, avec des sociétés comme Pixar créant des logiciels propriétaires destinés à faciliter l’animation et la modélisation.
Les méthodes traditionnelles de génération de parole fonctionnent en ajoutant des fichiers audio préenregistrés ensemble en temps réel, en assemblant des phrases à partir de mots et de phrases existants. Cette méthode de génération de parole nécessite l’enregistrement de centaines d’heures de dialogue et le marquage manuel des extraits audio. Elle sonne également de manière peu naturelle, car l’intonation et l’accent tendent à changer entre les mots. En revanche, l’intelligence artificielle vocale de pointe sonne beaucoup plus naturellement et fonctionne d’une manière différente.
L’intelligence artificielle vocale est basée sur des réseaux de neurones profonds. WaveNet était l’un des premiers algorithmes d’intelligence artificielle capables de générer des échantillons audio convaincants et naturels. Puisque les échantillons audio sont générés à partir de zéro, il n’y a pas besoin d’enregistrer des centaines d’heures de dialogue, à condition que des données de formation suffisantes soient disponibles. Les GAN et les modèles LSTM optimisés peuvent générer de l’audio après avoir été formés sur seulement quelques heures d’audio étiqueté. Les résultats peuvent être extrêmement convaincants, comme lorsque l’expérience Duplex de Google (GOOGL ) a appelé un salon de coiffure pour prendre rendez-vous.
À mesure que ces technologies deviennent plus puissantes, standardisées et facilement accessibles via le cloud computing, il est probable que davantage de développeurs de jeux vidéo se tournent vers l’intelligence artificielle vocale pour réduire le temps de production et les coûts. Certaines sociétés créent déjà des modèles qui pourraient potentiellement être utilisés par les développeurs de jeux. Replica Studios se spécialise dans la technologie vocale par intelligence artificielle, et certains échantillons audio générés par leur technologie peuvent être entendus aux liens ici et ici.
Il est peu probable que les développeurs de jeux vidéo choisissent d’abandonner l’utilisation d’acteurs vocaux pour l’intelligence artificielle. En fait, l’intelligence artificielle vocale pourrait ouvrir plus d’opportunités pour les acteurs vocaux. Actuellement, de nombreuses sociétés de développement de jeux vidéo sautent souvent les dialogues vocalisés en raison de l’investissement de temps et des coûts associés à la création de dialogues vocalisés. Les acteurs vocaux doivent souvent être ramenés pour d’autres sessions d’enregistrement si des changements sont apportés au script ou si les directeurs de jeu veulent un type de performance différent. L’intelligence artificielle vocale pourrait être utilisée pour expérimenter/prototyper des dialogues, pour avoir une idée de ce que les changements de script et les révisions doivent être effectués avant d’appeler un acteur vocal professionnel pour enregistrer le script. Cela pourrait conduire à plus de sociétés ayant les ressources pour investir dans la création de dialogues vocalisés.
Les modèles de voix par intelligence artificielle pourraient même être formés sur la voix d’un acteur vocal spécifique, et l’intelligence artificielle utilisée pour générer des extraits de dialogue mineurs, à condition que l’acteur soit payé pour l’utilisation de sa voix. Selon un rapport de VentureBeat, les acteurs vocaux comme Simon J. Smith sont optimistes quant à l’utilisation croissante de modèles de voix par intelligence artificielle et leur potentiel pour ouvrir de nouvelles opportunités de doublage.
Au-delà de l’utilisation de l’intelligence artificielle vocale pour prototyper des scripts ou créer des lignes vocalisées pour les personnages mineurs, les développeurs de jeux vidéo pourraient également utiliser l’intelligence artificielle vocale pour offrir aux joueurs plus d’options de personnalisation pour les jeux de rôle vidéo. Actuellement, même les jeux qui permettent aux joueurs de choisir une voix pour leurs avatars n’ont généralement que quelques options. Avec l’utilisation de l’intelligence artificielle vocale, les options pourraient être fonctionnellement illimitées.












