AIモデルとプラットフォーム
オープンAI、ジャンルに基づいて音楽を生成する新しいAIプログラムを開発
独立した研究機関であるOpenAIは、最近、新しい形の生成的なAIであるJukeboxを発表しました。Jukebox AIは、楽器や歌詞などの属性に基づいて音を生成することができます。OpenAIの研究チームは、圧縮されたオーディオクリップと歌詞のスニペットを使用して、このAIをトレーニングしました。
テッククランチは報告したように、OpenAIの研究者は、生のオーディオクリップを使用してモデルをトレーニングし、オーディオを生成する能力を与えました。これは、他の音楽生成アプリケーションで使用されるアプローチとは対照的です。通常、これらのアプリケーションは「シンボリックミュージック」(MIDIミュージックなど)を使用しますが、これはノートやピッチに関する情報ですが、実際のオーディオではありません。研究チームは、モデルをトレーニングするために畳み込みニューラルネットワークを使用し、オーディオを圧縮して、ニューラルネットワークが解釈できる形式にエンコードしました。その後、トランスフォーマーを使用して圧縮されたオーディオを生成し、データをオーディオ形式に変換するためにアップサンプリングしました。
Jukeboxを作成する際、OpenAIはオーディオの複雑で密度の高い性質に対処する方法を見つける必要がありました。研究者は、オーディオの連続的な性質を扱うために、1/128秒の長さの小さなセクションに分割しました。目標は、問題が解決不能にならない程度に大きく、しかし、小さくて正確なセクションに分割することで、モデルが曲のパターンを学習し、再構築できるようにすることでした。
OpenAIが使用したテクニックは、同社が以前開発した音楽生成AIであるMuseNetと共通点があります。MuseNetはMIDIファイルでトレーニングされており、様々なスタイルで音楽を生成することができましたが、曲全体のメロディーに焦点を当てており、歌詞を生成することはできませんでした。一方、Jukeboxは音楽に合わせて歌詞を書くことができます。歌詞は、OpenAIの研究者によって「共同で」書かれ、モデルが特定のスタイルで歌詞を生成するように導かれます。Jukeboxシステムは、LyricWikiからスクラップされた歌詞でトレーニングされており、トレーニングデータは1.2百万曲のテキストとメタデータで構成されています。
モデルが生成する歌詞について、研究者は最初に、歌詞を曲の長さに合わせて伸ばすという単純なヒューリスティックを使用しました。歌詞の特定の部分と対応する曲の部分を分析しました。このアプローチは一般的にうまく機能しましたが、研究者は、歌詞が特に速い場合には機能しなかったことを発見しました。この問題に対処するために、歌詞を曲から抽出し、歌詞のテキストと合わせて単語レベルのアラインメントを取得しました。その後、歌詞のエンコード層と、音楽のセクションを歌詞にマッピングするためのアテンション層を使用しました。結果として、歌詞とボーカルはかなり正確に一致しました。
論文の著者は、Jukeboxにはいくつかの限界があることを指摘し、将来的にはAIの能力を向上させることを目指しています。著者はブログ投稿で次のように書いています。
「Jukeboxは、音楽の品質、連続性、オーディオサンプルの長さ、芸術家、ジャンル、歌詞に基づいて条件付けする能力において、進歩を表しています。ただし、生成された音楽と人間が制作した音楽の間にはまだ大きなギャップがあります。たとえば、生成された曲は地元の音楽的連続性を示し、伝統的なコードパターンに従い、印象的なソロを特徴としているかもしれませんが、コーラスなどの馴染みのある大きな音楽的構造を聞くことはできません。」
現在、モデルは特定のジャンルやアーティストのスタイルで曲を生成することができます。たとえば、エルビス・プレスリー、ケイティ・ペリー、レージ・アゲインスト・ザ・マシンのスタイルで曲を生成することができます。曲はジャンルやアーティストのスタイルに基づいて生成されていますが、粗いもので、パロディーまたは曲の悪いカバー版のように聞こえることがあります。ただし、技術的な成果は印象的です。AI生成システムを作成した研究者は、音楽を生成するプログラムに取り組んだのは、タスクが難しいからです。研究者は技術をさらに磨き続ける予定です。ここで生成された曲の一部を聞くことができます。












