Моделі та платформи ШІ
OpenAI створила нову програму AI для створення музики на основі жанрів
Незалежна дослідницька організація OpenAI недавно випустила нову форму генеративного ІІ, яку назвали Jukebox, так названу через її здатність генерувати музику. Jukebox AI може генерувати звуки на основі атрибутів, таких як інструментування та навіть тексти пісень, а команда дослідників OpenAI створила цю систему ІІ, тренуючи її на стиснутих аудіокліпах та різних уривках текстів пісень.
Як повідомляє TechCrunch, дослідники OpenAI тренували модель, використовуючи сирі аудіокліпи, надавши моделі можливість виробляти аудіо. Це на відміну від підходів, використовуваних для створення інших програм генерації музики, які часто покладаються на “символічну музику” (як MIDI-музику), яка містить інформацію про ноти та висоти, але не справжнє аудіо. Команда дослідників використала卷волюційні нейронні мережі для тренування моделі, стискаючи аудіо та кодуючи його у формат, який нейронна мережа могла б інтерпретувати. Після цього трансформер був використаний для генерації стиснутого аудіо, яке потім було підвищено у якості для перетворення даних у формат аудіо.
Під час створення Jukebox OpenAI мала створити метод боротьби з складною, густою природою аудіо. Дослідники займалися безперервною природою аудіо, розділивши її на більш окремі, засвоювані секції, розділивши пісні на біти, які тривають 1/128 секунди. Метою було створити модель ІІ, здатну розділити пісні на шматки, достатньо великі, щоб проблема не стала нерозв’язною, але достатньо малими та точними, щоб моделі могли вивчити схему пісні та відтворити цю схему.
Техніка, використана OpenAI, має деяку схожість з старішим музично-генеруючим ІІ, створеним компанією, яке називається MuseNet. MuseNet була тренована на файлах MIDI та могла генерувати музику у різних стилях, хоча вона зосереджувалася на загальній мелодії пісні та не могла створювати тексти пісень. На відміну від цього, Jukebox може писати自己的 тексти пісень, щоб супроводжувати музику. Тексти пісень “співавторами” є дослідниками OpenAI, які спрямовують модель на створення текстів у певних стилях. Система Jukebox була тренована на текстах пісень, взятіх з LyricWiki, з навчальними даними, що складаються з текстів та метаданих про 1,2 мільйона пісень.
Відносно текстів пісень моделі, дослідники спочатку спробували використовувати просту евристичну функцію, яка розтягувала тексти пісень до приблизної тривалості пісні, аналізуючи текст, який відповідав певному шматкові/сегменту пісні. Цей простий підхід добре працював у загальному, хоча дослідники виявили, що коли тексти пісень були особливо швидкими, це розбивалося. Для боротьби з цією проблемою були виділені вокали з пісні та вирівняні з текстом пісні для отримання словесних вирівнянь для текстів пісень. Після цього був використаний шар кодування для текстів пісень разом із шаром уваги, який відображав секції музики на тексти пісень, використовуючи пари ключ-значення. Результатом було те, що тексти пісень та вокали мали досить точну відповідність.
Автори статті також зазначають, що є кілька обмежень, які має Jukebox, і що майбутня робота буде спрямована на поліпшення можливостей ІІ. Як пишуть автори у блог-пості:
“Хоча Jukebox представляє крок вперед у музичній якості, узгодженості, довжині аудіозразка та здатності умовно залежати від виконавця, жанру та текстів пісень, існує значний розрив між цими генераціями та музикою, створеною людьми. Наприклад, хоча згенеровані пісні демонструють місцеву музичну узгодженість, слідують традиційним акордним схемам та можуть навіть містити вражаючі соло, ми не чуємо знайомі більші музичні структури, такі як приспіви, які повторюються.”
Наразі модель здатна виробляти пісню, яка впізнавана у стилі конкретного жанру або навіть конкретного виконавця. Наприклад, вона може створювати пісні у стилі Елвіса Преслі, Кеті Перрі або Rage Against the Machine. Хоча пісні впізнавані у жанрі або тематизовані навколо стилю співака, вони також досить грубі, часто звучать як пародія або погана кавер-версія пісні. Тим не менш, технічне досягнення вражаюче. Дослідники, відповідальні за створення системи генерації ІІ, обрали роботу над програмою, здатною генерувати музику, зокрема тому, що завдання було складним, а дослідники планують продовжувати вдосконалювати свої техніки. Ви можете послухати деякі з цих пісень тут.












