Моделі та платформи ШІ
Дослідники розробили «Audeo» – штучний інтелект, здатний грати на фортепіано

Команда дослідників з Університету Вашингтону розробила систему штучного інтелекту під назвою Audeo, яка може створювати аудіо з тихих фортепіанних виступів. Фаза тестування включала програми розпізнавання музики, такі як SoundHound, які могли правильно ідентифікувати музику з Audeo близько 86% часу.
Дослідження було представлено на конференції NeurlPS 2020 8 грудня.
Старший автор Елі Шліцερμαν є асистентом професора в департаменті прикладної математики та електротехніки та комп’ютерних наук університету.
“Створити музику, яка звучала б так, як якщо б вона була зіграна під час музичного виступу, раніше вважалося неможливим”, – сказав Шліцερμαν. “Алгоритм повинен визначити сигнали або “функції” у відеокадрах, які пов’язані з генерацією музики, і він повинен “уявити” звук, який відбувається між відеокадрами. Це вимагає системи, яка є одночасно точною і уявною. Те, що ми досягли музики, яка звучала досить добре, було сюрпризом.”
Як працює Audeo
Система Audeo працює шляхом декодування відео та перекладу його в музику. Перший із декількох кроків включає виявлення клавіш, натиснутих у кожному відеокадрі, і в кінцевому підсумку розробляє діаграму. Діаграма потім перекладується так, щоб музичний синтезатор міг розпізнавати звуки.
Наступний крок полягає в тому, щоб очистити дані та додати додаткову інформацію. Ця інформація може включати речі, такі як тиск за кожною клавішею та тривалість.
“Якщо ми спробуємо синтезувати музику лише з першого кроку, ми виявимо, що якість музики буде незадовільною”, – сказав Шліцερμαν. “Другий крок схожий на те, як вчитель переглядає музику студента-композитора та допомагає вдосконалити її.”
Система була навчена та протестована з відео на YouTube піаніста Пола Бартона, і вона складалася з близько 172 000 відеокадрів музиканта, який грав різні класичні композитори, такі як Моцарт. Audeo був протестований з 19 000 кадрів Бартона, який грав різні музику.
Синтезатор
Після навчання Audeo генерує транскрипцію музики, яку потім подають синтезатору для перекладу в звук. Музика звучить по-різному залежно від кожного синтезатора, що еквівалентно зміні інструменту на електронній клавіатурі.
Команда використала два окремі синтезатори.
“Fluidsynth створює звуки синтезатора фортепіано, які нам знайомі. Вони трохи механічні, але досить точні”, – сказав Шліцερμαν. “Ми також використали PerfNet, новий синтезатор штучного інтелекту, який генерує багатшу та виразнішу музику. Але він також генерує більше шуму.”
“Метою цього дослідження було побачити, чи може штучний інтелект генерувати музику, яку грає піаніст у відеозаписі – хоча ми не мали на меті повторити Пола Бартона, оскільки він такий віртуоз”, – продовжував Шліцερμαν. “Ми сподіваємося, що наше дослідження дозволить нові способи взаємодії з музикою. Наприклад, одним з майбутніх застосувань є те, що Audeo можна розширити до віртуального фортепіано з камерою, яка записує лише руки людини. А також, розмістивши камеру на верхньому фортепіано, Audeo потенційно може допомогти у нових способах навчання студентів грати.”
Кунг Су та Цзюлонг Ліу, докторанти електротехніки та комп’ютерних наук, були співавторами статті.












