Модели и платформы ИИ
Разработчики игр обращаются к голосовому ИИ для новых творческих возможностей
Технология звуковой синтеза, в частности, синтез речи, стала намного более совершенной в последние годы. Хотя технология текста в речь существует уже несколько десятилетий, она стала намного более естественной. Недавние алгоритмы могут взять всего несколько часов аудио и синтезировать очень реалистичные аудио-примеры. По мере развития технологии открываются новые возможности, включая возможности в творческих медиа. Недавно, как сообщает VentureBeat, компании, производящие видеоигры, начали исследовать использование генерации голоса ИИ для создания диалогов для видеоигр.
Одна компания, Leviathan Games, начала реализовывать голосовой ИИ в играх, которые они в настоящее время разрабатывают. Вайет Ридгвей, владелец Leviathan Games, объяснил, что голосовой ИИ может изменить дизайн игр кардинально. Ридгвей объяснил, что использование голосового ИИ в дизайне игр – это возникающая тенденция, и сравнил его с тем, как программное обеспечение 3D-анимации сместилось за последнее десятилетие, когда компании, такие как Pixar, создают проприетарное программное обеспечение, предназначенное для облегчения анимации и моделирования.
Традиционные методы генерации речи работают путем присоединения предварительно записанных аудиофайлов вместе на лету, соединяя предложения из ранее существовавших слов и фраз. Этот метод генерации речи требует записи сотен часов диалога и ручного маркирования аудиоклипов. Он также звучит несколько неестественно, поскольку интонация и акцент имеют тенденцию к изменению через слова. В сравнении с этим современный голосовой ИИ звучит намного более естественно и работает по-другому.
Голосовой ИИ основан на глубоких нейронных сетях. WaveNet был одним из первых ИИ, которые могли генерировать убедительные, естественно звучащие аудио-примеры. Поскольку аудио-примеры генерируются с нуля, нет необходимости предварительно записывать сотни часов диалога, если есть достаточные данные для обучения. Оптимизированные GAN и модели LSTM могут генерировать аудио после обучения всего на несколько часов помеченного аудио. Результаты могут быть чрезвычайно убедительными, такими как когда эксперимент Google (GOOGL ) Duplex позвонил в парикмахерскую, чтобы записаться на прием.
По мере того, как эти технологии становятся более мощными, стандартизированными и легко доступными через облачные вычисления, вероятно, что больше разработчиков игр будут обращаться к голосовому ИИ, чтобы сократить время производства и затраты. Некоторые компании уже создают модели, которые потенциально могут быть использованы разработчиками игр. Replica Studios специализируется на технологии голоса ИИ, и некоторые аудио-примеры, сгенерированные их технологией, можно услышать по ссылкам здесь и здесь.
Маловероятно, что разработчики игр будут отказываться от использования голосовых актеров в пользу ИИ. На самом деле, голосовой ИИ может открыть больше возможностей для голосовых актеров. В настоящее время многие компании, производящие игры, часто отказываются от озвучивания диалогов из-за времени и затрат, связанных с созданием озвученных диалогов. Голосовые актеры часто нужно вызывать на дополнительные записи, если есть изменения в сценарии или если режиссеры игр хотят другой тип выступления. Голосовой ИИ может быть использован для экспериментов с диалогами, получения представления о том, какие изменения сценария и пересмотры необходимо сделать, прежде чем вызвать профессионального голосового актера, чтобы записать сценарий. Это может привести к тому, что больше компаний будут иметь ресурсы, чтобы инвестировать в создание озвученных диалогов.
Модели голоса ИИ даже могут быть обучены на голосе конкретного голосового актера, и ИИ может быть использован для генерации незначительных диалоговых клипов, пока актер не будет оплачен за использование своего голоса. Как сообщает VentureBeat, голосовые актеры, такие как Саймон Дж. Смит, оптимистично настроены относительно растущего использования моделей голоса ИИ и их потенциала для открытия новых возможностей для голосовых актеров.
Помимо использования голосового ИИ для прототипирования сценариев или создания озвученных строк для незначительных персонажей, разработчики игр также могут использовать голосовой ИИ, чтобы дать игрокам больше вариантов настройки для ролевых видеоигр. В настоящее время даже игры, которые позволяют игрокам выбирать голос для своих аватаров, обычно имеют только несколько вариантов. С использованием голосового ИИ варианты могут быть практически безграничными.












