AIモデルとプラットフォーム

ゲーム開発者が新しい創造的機会のためにボイスAIを利用しようとしている

mm
Unite.AI を Google の優先ソースに追加

音声合成技術、特に音声合成は、近年大幅に進化しました。テキスト読み上げ技術は数十年前から存在していましたが、音声の自然さが大幅に向上しました。最新のアルゴリズムは、わずか数時間のオーディオから非常にリアルな音声サンプルを合成できます。技術の進化に伴い、創造的なメディアでの応用も可能になりました。最近、VentureBeatの記事によると、ゲーム会社は、ゲームのダイアログを生成するためにAIボイス生成技術を利用することを検討し始めています。

Leviathan Gamesという会社は、現在開発中のゲームでボイスAIを実装し始めています。Leviathan GamesのオーナーであるWyeth Ridgwayは、ボイスAIがゲームデザインを劇的に変える可能性があると説明しました。Ridgwayは、ゲームデザインにおけるボイスAIの使用は、新しいトレンドであり、過去10年間に3Dアニメーションソフトウェアが変化したように、会社が独自のソフトウェアを開発する可能性があると比較しました。

従来の音声生成方法は、事前に録音された音声ファイルを組み合わせて音声を生成します。これには、数百時間のダイアログを録音し、音声クリップを手動でラベル付けする必要があります。また、自然な音声にはなりません。なぜなら、単語やフレーズの間でイントネーションや強調が変化するからです。一方、最新のボイスAIは、より自然な音声になります。

ボイスAIは、ディープラーニングをベースにしています。WaveNetは、初めて自然な音声サンプルを生成できるAIの1つでした。事前に録音された音声ファイルがなくても、十分なトレーニングデータがあれば、音声サンプルを生成できます。最適化されたGANsとLSTMモデルは、わずか数時間のラベル付きオーディオでトレーニングできます。結果は非常にリアルな音声になります。たとえば、GoogleのDuplex実験がヘアサロンに電話して予約を取ったときなどです。

これらの技術がより強力で、標準化され、クラウドコンピューティングで容易にアクセスできるようになると、ゲーム開発者がボイスAIを利用して制作時間とコストを削減する可能性が高くなります。すでにいくつかの会社が、ゲーム開発者が利用できるモデルを作成しています。Replica Studiosは、AIボイス技術を専門とし、同社の技術で生成されたオーディオサンプルは、こちらこちらで聴くことができます。

ゲーム開発者がボイスアクターを利用しない可能性は低いです。実際、ボイスAIは、ボイスアクターに新しい機会を提供する可能性があります。現在、多くのゲーム開発会社は、ボイスダイアログの作成に伴う時間とコストのため、ボイスダイアログを実装しません。ボイスアクターは、スクリプトの変更やゲームディレクターが異なる演技を求める場合、追加のレコーディングセッションに呼ばれる必要があります。ボイスAIは、ダイアログのプロトタイプを作成したり、スクリプトの変更や修正が必要かどうかを確認するために利用できます。プロのボイスアクターを呼ばずに、ボイスダイアログの作成に必要なリソースを確保できる可能性があります。

AIボイスモデルは、特定のボイスアクターの声でトレーニングできます。AIは、トリビアルなダイアログクリップを生成するために利用できます。ただし、アクターの声の使用に伴う権利料は支払われる必要があります。VentureBeatの記事によると、ボイスアクターのSimon J. Smithは、ボイスAIモデルがボイスアクティングの新しい機会を提供する可能性について楽観的です。

スクリプトのプロトタイプ作成やマイナーなキャラクターのボイスライン作成のためにボイスAIを利用すること以外に、ゲーム開発者は、ロールプレイングゲームのプレイヤーに更多のカスタマイズオプションを提供するためにボイスAIを利用する可能性があります。現在、プレイヤーがアバターの声の選択肢を提供するゲームでも、選択肢は限られています。ボイスAIを利用することで、選択肢はほぼ無限になります。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。