AIモデルとプラットフォーム
研究者が開発した「Audeo」AIは、サイレントピアノ演奏から音を生成できる

ワシントン大学の研究者チームは、サイレントピアノ演奏から音を生成できる人工知能(AI)システム「Audeo」を開発した。このテストでは、SoundHoundのような音楽認識アプリがAudeoから生成された音楽を約86%の確率で正しく識別した。
この研究は、2020年12月8日にNeurlPS 2020会議で発表された。
この研究の主任著者であるEli Shlizermanは、ワシントン大学の応用数学と電気・コンピュータ工学の助教授である。
「音楽演奏のように聞こえる音楽を作ることは、以前は不可能と考えられていた」とShlizermanは述べた。「アルゴリズムは、ビデオフレーム内の音楽生成に関連するヒントや『特徴』を特定する必要があり、ビデオフレームの間で起こっている音を『想像』する必要がある。正確で想像力のあるシステムが必要である。音楽がかなり良かったことは驚きだった」
Audeoの仕組み
Audeoシステムは、ビデオを解析して音楽に変換する。最初のステップは、AIが各ビデオフレームで押されたキーを検出し、図を作成することである。図は、音楽シンセサイザーが音を認識できるように変換される。
次のステップは、データをクリーンアップし、追加情報を付加することである。これには、各キープレスの圧力や持続時間などの情報が含まれる。
「最初のステップだけから音楽を合成しようとすると、音楽の質は不十分である」とShlizermanは述べた。「2番目のステップは、教師が生徒の作曲した音楽を確認し、改善するのと同じようなものである」
このシステムは、ピアニストのPaul BartonのYouTubeビデオで訓練され、約17万2000フレームのビデオで構成されていた。Audeoは、バートンがさまざまなクラシック音楽を演奏する約1万9000フレームでテストされた。
シンセサイザー
訓練後、Audeoは音楽のトランスクリプトを生成し、それをシンセサイザーに渡して音に変換する。音楽の音質は、シンセサイザーの種類によって異なる。これは、電子キーボードの楽器設定を変更するのと同等である。
チームは2つの別々のシンセサイザーを使用した。
「Fluidsynthは、我々が慣れ親しんだシンセサイザーピアノ音を生成する。これはやや機械的な音質だが、かなり正確である」とShlizermanは述べた。「また、豊かで表現力のある音楽を生成する新しいAIシンセサイザーであるPerfNetも使用した。しかし、ノイズも生成する」
「この研究の目的は、ビデオ録音されたピアニストの演奏から音楽を生成できるかどうかを調べることであった。私たちは、Paul Bartonのようなヴィルトゥオーソを再現しようとしていない。音楽との新しいやり取り方法を可能にすることを希望する。例えば、Audeoは、カメラで人の手だけを録画する仮想ピアノに拡張できる。実際のピアノの上にカメラを置くことで、学生が演奏する方法を教える新しい方法でAudeoを支援できる」
電気・コンピュータ工学の博士課程の学生であるKung SuとZiulong Liuが、この研究の共同著者であった。












