KI-Modelle und Plattformen

Spieleentwickler nutzen Voice-AI für neue kreative Möglichkeiten

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Die Sound-Synthese-Technologie, insbesondere die Sprachsynthese, ist in den letzten Jahren viel fortschrittlicher geworden. Während die Text-to-Speech-Technologie bereits seit Jahrzehnten existiert, klingt die Technologie nun viel natürlicher. Aktuelle Algorithmen können innerhalb weniger Stunden Audioaufnahmen erstellen und hochrealistische Audio-Proben synthesieren. Mit dem Fortschreiten der Technologie eröffnen sich weitere Anwendungen, einschließlich Möglichkeiten in den kreativen Medien. Kürzlich wurde, wie von VentureBeat berichtet, von Videospielunternehmen begonnen, die Verwendung von AI-Stimmen-Generierung zur Erstellung von Dialogen für Videospiele zu untersuchen.

Ein Unternehmen, Leviathan Games, hat bereits begonnen, Voice-AI in Spielen zu implementieren, die derzeit entwickelt werden. Wyeth Ridgway, der Besitzer von Leviathan Games, erklärte, dass Voice-AI das Spieldesign auf dramatische Weise verändern könnte. Ridgway erklärte, dass die Verwendung von Voice-AI im Spieldesign ein aufkommender Trend ist und verglich es mit der Art und Weise, wie 3D-Animationssoftware im Laufe des letzten Jahrzehnts verändert wurde, wobei Unternehmen wie Pixar proprietäre Software entwickelten, um Animation und Modellierung zu erleichtern.

Traditionelle Methoden der Sprachgenerierung funktionieren, indem sie vorgefertigte Sound-Dateien zusammenfügen, Sätze aus vorher existierenden Wörtern und Phrasen zusammenstellen. Diese Methode der Sprachgenerierung erfordert die Aufnahme von Hunderten von Stunden Dialog und die manuelle Kennzeichnung von Sound-Clips. Sie klingt auch eher unnatürlich, da die Betonung und der Nachdruck über Wörter hinweg wechseln. Im Vergleich dazu klingt die aktuelle Voice-AI viel natürlicher und funktioniert auf eine andere Weise.

Die Voice-AI basiert auf tiefen neuronalen Netzen. WaveNet war einer der ersten KI-Systeme, die überzeugende, natürlich klingende Audio-Proben generieren konnten. Da die Sound-Proben von Grund auf generiert werden, ist es nicht notwendig, Hunderte von Stunden Dialog aufzunehmen, solange ausreichend Trainingsdaten verfügbar sind. Optimierte GANs und LSTM-Modelle können Audio generieren, nachdem sie nur wenige Stunden lang mit gekennzeichneten Audio-Daten trainiert wurden. Die Ergebnisse können außerordentlich überzeugend sein, wie bei Googles Duplex-Experiment, bei dem ein Friseursalon angerufen wurde, um einen Termin zu vereinbaren.

Wenn diese Technologien leistungsfähiger, standardisierter und leichter zugänglich durch Cloud-Computing werden, ist es wahrscheinlich, dass mehr Spieleentwickler auf Voice-AI zurückgreifen, um die Produktionszeit und -kosten zu reduzieren. Einige Unternehmen erstellen bereits Modelle, die von Spieleentwicklern verwendet werden können. Replica Studios spezialisiert sich auf AI-Stimmen-Technologie, und einige Audio-Beispiele, die mit ihrer Technologie generiert wurden, können unter den Links hier und hier gehört werden.

Es ist unwahrscheinlich, dass Spieleentwickler auf die Verwendung von Voice-AI gegenüber Schauspielern verzichten werden. Tatsächlich könnte Voice-AI mehr Möglichkeiten für Schauspieler eröffnen. Viele Spieleentwicklungsunternehmen verzichten derzeit häufig auf gesprochene Dialoge, da die Zeitinvestition und die Kosten für die Erstellung von gesprochenen Dialogen sehr hoch sind. Schauspieler müssen oft für weitere Aufnahmesitzungen zurückgebracht werden, wenn es Änderungen am Drehbuch gibt oder wenn Spiele-Regisseure eine andere Art von Leistung wünschen. Voice-AI könnte verwendet werden, um Dialoge zu experimentieren oder zu prototypisieren und ein Gefühl dafür zu bekommen, welche Art von Drehbuchänderungen und -revisionen erforderlich sind, bevor ein professioneller Schauspieler angerufen wird, um das Drehbuch aufzunehmen. Dies könnte dazu führen, dass mehr Unternehmen die Ressourcen haben, um in die Erstellung von gesprochenen Dialogen zu investieren.

AI-Stimmen-Modelle könnten sogar auf die Stimme eines bestimmten Schauspielers trainiert werden, und die AI könnte verwendet werden, um unwichtige Dialog-Clips zu generieren, solange der Schauspieler für die Verwendung seiner Stimme bezahlt wird. Wie von VentureBeat berichtet, sind Schauspieler wie Simon J. Smith optimistisch hinsichtlich der zunehmenden Verwendung von AI-Stimmen-Modellen und ihrer möglichen Fähigkeit, neue Möglichkeiten für Schauspieler zu eröffnen.

Über die Verwendung von Voice-AI zur Prototypisierung von Drehbüchern oder zur Erstellung von gesprochenen Zeilen für unwichtige Charaktere hinaus könnten Spieleentwickler auch Voice-AI verwenden, um Spielern mehr Anpassungsoptionen für Rollenspiele zu bieten. Derzeit bieten sogar Spiele, die es Spielern ermöglichen, eine Stimme für ihre Avatare auszuwählen, in der Regel nur eine Handvoll Optionen. Durch die Verwendung von Voice-AI könnten die Optionen funktionell unbegrenzt sein.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.