AIモデルとプラットフォーム

テキストから音楽を生成するジェネレーティブAI:Stability Audio、GoogleのMusicLMなど

mm
Unite.AI を Google の優先ソースに追加

音楽は、人々の魂に共鳴する芸術形式であり、私たちすべての常連です。人工知能を使用して音楽を作成することは、数十年前に始まりました。初期の試みはシンプルで直感的でしたが、基本的なアルゴリズムで単調なメロディーを作成していました。ただし、技術が進歩すると、AI音楽ジェネレーターの複雑さと能力も向上し、ディープラーニングと自然言語処理(NLP)がこの分野で重要な役割を果たすようになりました。

今日、Spotifyのようなプラットフォームは、ユーザーのリスニング体験を微調整するためにAIを利用しています。これらのディープラーニングアルゴリズムは、テンポやムードなどのさまざまな音楽要素に基づいて個人の好みを分析し、カスタマイズされた曲の提案を行います。さらに、より広範なリスニングパターンを分析し、インターネット上の曲に関する議論を調べ、詳細な曲のプロファイルを構築します。

音楽におけるAIの起源:アルゴリズミックな作曲からジェネレーティブモデリングへの旅

音楽界におけるAIの初期段階では、1950年代から1970年代にかけて、アルゴリズミックな作曲が主な焦点でした。これは、コンピューターが定義されたルールに基づいて音楽を作成する方法でした。この期間中の最初の著名な作品は、1957年のIlliac Suite for String Quartetでした。これは、Monte Carloアルゴリズムを使用して、伝統的な音楽理論と統計的確率の範囲内でピッチとリズムを決定しました。

Midjourneyを使用して作者が生成した画像

Midjourneyを使用して作者が生成した画像

この時期に、別の先駆者であるイアニス・クセナキスは、ランダムな確率分布を含む概念である確率過程を使用して音楽を作成しました。彼はコンピューターとFORTRAN言語を使用して、複数の確率関数を接続し、グラフィカルな表現がさまざまな音空間に対応するパターンを作成しました。

テキストを音楽に翻訳する複雑さ

音楽は、メロディー、ハーモニー、リズム、テンポなどの要素を含む豊富で多次元的なデータ形式で保存されており、テキストを音楽に翻訳するタスクは非常に複雑です。標準的な曲は、コンピューターでは約100万個の数字で表されます。これは、画像やテキストなどの他のデータ形式よりもはるかに高い数字です。

オーディオ生成の分野では、リアルな音を生成するための革新的なアプローチが見られます。1つの方法は、スペクトログラムを生成し、それをオーディオに戻すことです。

別の戦略は、シートミュージックのような音楽のシンボリックな表現を使用します。これは、ミュージシャンによって解釈され、演奏できます。この方法は、MagentaのChamber Ensemble Generatorを使用してMIDI形式で音楽を作成することで成功裏にデジタル化されています。MIDIは、コンピューターと楽器の間で通信を可能にするプロトコルです。

これらのアプローチは、この分野を前進させましたが、それぞれ独自の限界があり、オーディオ生成の複雑さを強調しています。

Transformerベースの自己回帰モデルとU-Netベースの拡散モデルは、オーディオ、テキスト、音楽などを生成する分野で最先端の結果を生み出しています。OpenAIのGPTシリーズとほぼすべてのLLMは、Transformerを使用しており、エンコーダー、デコーダー、または両方のアーキテクチャを利用しています。アート/画像の分野では、MidJourney、Stability AI、DALL-E 2はすべて拡散フレームワークを利用しています。これらの2つの核心技術は、オーディオセクターでも最先端の結果を達成する上で重要な役割を果たしています。この記事では、GoogleのMusicLMとStable Audioについて詳しく説明します。これらは、これらの技術の驚くべき能力を示すものです。

GoogleのMusicLM

GoogleのMusicLMは今年の5月にリリースされました。MusicLMは、テキストで記述された感情に合った高品質の音楽を生成できます。階層的なシーケンスからシーケンスへのモデリングを使用して、MusicLMはテキストの説明を、24 kHzで長時間にわたって共鳴する音楽に変換する能力を持っています。

このモデルは、テキスト入力に従うだけでなく、メロディーにも条件付けられることができます。これは、口笛や歌ったメロディーをテキストのスタイルの説明に従って変換できることを意味します。

技術的な洞察

MusicLMは、2022年に導入されたAudioLMの原理を利用しています。AudioLMは、離散的な表現空間内でオーディオ生成を言語モデリングのタスクとして合成し、階層的な粗いから細かいオーディオの離散的な単位(トークン)を使用します。このアプローチにより、高品質で長時間にわたる一貫性が保証されます。

生成プロセスを容易にするために、MusicLMはAudioLMの機能を拡張してテキストの条件付けを含め、入力テキストのニュアンスと生成されたオーディオを一致させます。これは、MuLanという共同の音楽テキストモデルを使用して実現され、音楽とその対応するテキストの説明を埋め込み空間内で近づけることで、キャプションを必要とせずに大量のオーディオのみのコーパスでモデルをトレーニングできます。

MusicLMモデルは、SoundStreamをオーディオトークナイザーとして使用し、6 kbpsで24 kHzの音楽を印象的な忠実度で再構築できます。さらに、残差ベクトル量子化(RVQ)を使用して、高品質で効率的なオーディオ圧縮を実現します。

MusicLMの事前トレーニングプロセスのイラスト

MusicLMの事前トレーニングプロセス、画像ソース:ここ

さらに、MusicLMはメロディーの条件付けを可能にし、単純な口笛のメロディーを、テキストのスタイルの説明に合わせて微調整された壮大な音響体験の基盤にすることができます。

MusicLMの開発者は、MusicCapsというデータセットもオープンソース化しました。これは、5.5千の音楽テキストのペアで構成されており、各ペアには、専門家によって作成された豊富なテキストの説明が付いています。こちらで確認できます:Hugging FaceのMusicCaps

GoogleのMusicLMでAIサウンドトラックを作成する準備はできましたか?ここから始める方法は以下のとおりです:

  1. 公式のMusicLMウェブサイトを訪れて「開始」をクリックします。
  2. 「登録する」を選択して待ちリストに登録します。
  3. Googleアカウントでログインします。
  4. アクセスが許可されると、「今すぐ試す」をクリックして開始します。

以下は、私がMusicLMで実験したいくつかの例のプロンプトです。

「瞑想的な曲、静かで心地よい、フルートとギターが使われている。音楽は遅く、平和と静寂を創造することに焦点を当てています。」

「ジャズ、サックスが使われている」

MusicLMは、RiffusionやMubertなどの以前の最先端モデルと比較して、10秒のオーディオクリップのテキストキャプションの互換性を高く評価されました。

MusicLMのパフォーマンス比較

MusicLMのパフォーマンス、画像ソース:ここ

Stability Audio

Stability AIは先週、「Stable Audio」と呼ばれる潜在的な拡散モデルアーキテクチャを導入しました。これは、テキストメタデータ、オーディオファイルの長さ、開始時間に基づいて条件付けられます。このアプローチは、GoogleのMusicLMと同様に、生成されたオーディオの内容と長さを制御することができます。

技術的な洞察

Stable Audioは、変分自己符号化器(VAE)とU-Netベースの条件付き拡散モデルで構成されています。これらは、テキストエンコーダーとともに機能します。

VAE、テキストエンコーダー、U-Netベースの条件付き拡散モデルの統合を示すイラスト

Stable Audioアーキテクチャ、画像ソース:ここ

VAEは、ステレオオーディオをデータ圧縮されたノイズ耐性のある可逆的な損失圧縮潜在的なエンコードに圧縮することで、生成とトレーニングを高速化します。これにより、生のオーディオサンプルで作業する必要がなくなります。

テキストエンコーダーは、CLAPモデルから派生しており、単語と音の関係を理解する上で重要な役割を果たします。テキストエンコーダーのペナルティ層からのテキスト機能を使用して、拡散U-Netへのクロスアテンション層を介して情報的なテキストの表現を提供します。

タイミングの埋め込みは、オーディオチャンクの開始秒と元のオーディオファイルの合計時間に基づいて計算されます。これらの値は、1秒ごとに学習された離散的な埋め込みに変換され、プロンプトトークンとともにU-Netのクロスアテンション層に供給され、ユーザーが出力オーディオの全体的な長さを指定できるようにします。

Stable Audioモデルは、オーディオファイル8万以上の膨大なデータセットを使用して、ストックミュージックプロバイダーのAudioSparxと共同でトレーニングされました。

Stable Audioコマーシャル

Stable Audioコマーシャル

Stable Audioには、無料バージョンが用意されており、20秒までのトラックを20回生成できます。また、12ドル/月のProプランもあり、90秒までのトラックを500回生成できます。

以下は、Stable Audioを使用して作成したオーディオクリップです。

Midjourneyを使用して作者が生成した画像

Midjourneyを使用して作者が生成した画像

「シネマティック、サウンドトラック、優しい雨、アンビエント、静か、遠くから犬の鳴き声、落ち着いた葉の rustle、微風、40 BPM」

このような繊細に作られたオーディオピースの応用は無限大です。映画製作者は、この技術を使用して豊かで没入感のあるサウンドスケープを作成できます。商業セクターでは、広告主はこれらのカスタマイズされたオーディオトラックを利用できます。また、このツールは、個人のクリエイターとアーティストに、物語を語り、感情を呼び起こし、以前は大きな予算や技術的な専門知識が必要だった深みのある音を作成するための無限の可能性のキャンバスを提供します。

プロンプトのヒント

テキストプロンプトを使用して完璧なオーディオを作成するには、以下のガイドに従ってください:

  1. 詳細に:ジャンル、ムード、楽器を指定します。例:シネマティック、ワイルドウエスト、パーカッション、テンポが良く、アンビエント
  2. ムードの設定:音楽用語と感情用語を組み合わせて、望ましいムードを伝えます。
  3. 楽器の選択:楽器の名前を形容詞で強調します。例:「リバーブのあるギター」または「パワフルなコーラス」
  4. BPM:ジャンルに合わせてテンポを調整して、調和のとれた出力が得られます。例:ドラムアンドベースのトラックの場合、170 BPM

最終的なノート

この記事では、AI生成の音楽/オーディオから、アルゴリズミックな作曲から今日のGoogleのMusicLMやStable Audioのような高度なジェネレーティブAIフレームワークまでについて説明しました。これらの技術は、ディープラーニングと最先端の圧縮モデルを利用して、音楽生成を向上させると同時に、リスナーの体験を微調整しています。

しかし、これは常に進化する分野であり、長期的な一貫性を維持する課題や、AIによって作成された音楽の正当性に関する議論が、分野の先駆者に課せられた課題です。先週、AIによって作成された曲が、ドレイクやウィークエンドのスタイルを模倣しており、最初はオンラインで話題になったものの、グラミー賞のノミネートリストから除外され、AI生成音楽の正当性に関する議論を浮き彫りにしました (ソース)。AIが音楽とリスナーを橋渡しするにつれて、技術と芸術が共存し、革新を促進し、伝統を尊重するエコシステムが生まれています。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。