Моделі та платформи ШІ

Текст-музика Генеративний AI: Стабільний Аудіо, Google’s MusicLM та інше

mm
Додайте Unite.AI до бажаних джерел у Google

Музика, вид мистецтва, який резонує з людською душею, була постійним супутником нас усіх. Створення музики за допомогою штучного інтелекту розпочалося кілька десятиліть тому. Спочатку спроби були простими та інтуїтивними, з базовими алгоритмами, які створювали монотонні мелодії. Однак, оскільки технології просунулися вперед, так само зробили й складність та можливості генераторів музики AI, відкривши шлях для глибокого навчання та обробки природної мови (NLP) для відігравання важливої ролі в цій галузі.

Сьогодні платформи, такі як Spotify, використовують AI для доопрацювання досвіду прослуховування музики своїми користувачами. Ці алгоритми глибокого навчання розбирають індивідуальні вподобання на основі різних музичних елементів, таких як темп і настрій, для створення персоналізованих пропозицій пісень. Вони навіть аналізують ширші моделі прослуховування та шукають у мережі обговорення пісень, щоб створити детальні профILI пісень.

Походження AI в музиці: Подорож від алгоритмічної композиції до генеративного моделювання

На ранніх етапах змішування AI у світі музики, що охоплював період з 1950-х до 1970-х років, основний акцент був на алгоритмічній композиції. Це був метод, при якому комп’ютери використовували визначений набір правил для створення музики. Першою помітною творчістю під час цього періоду була Illiac Suite для струнного квартету у 1957 році. Вона використовувала алгоритм Монте-Карло, процес, що涉овує випадкові числа для визначення висоти звуку та ритму в межах традиційної музичної теорії та статистичних ймовірностей.

Зображення, згенероване автором за допомогою Midjourney

Зображення, згенероване автором за допомогою Midjourney

Під час цього часу інший піонер, Янніс Ксенакіс, використовував стохастичні процеси, концепцію, що涉овує випадкові розподіли ймовірностей, для створення музики. Він використовував комп’ютери та мову FORTRAN для підключення декількох функцій ймовірностей, створюючи модель, в якій різні графічні представлення відповідали різним просторам звуку.

Складність перекладу тексту в музику

Музика зберігається у багатому та багатовимірному форматі даних, який охоплює елементи, такі як мелодія, гармонія, ритм та темп, що робить завдання перекладу тексту в музику надзвичайно складним. Стандартна пісня представлена майже мільйоном чисел у комп’ютері, цифра, суттєво вища за інші формати даних, такі як зображення, текст тощо.

Область генерації аудіо переживає інноваційні підходи для подолання викликів створення реалістичного звуку. Одним із методів є генерація спектрограми, а потім її перетворення назад в аудіо.

Інший підхід використовує символічне представлення музики, як ноти, які можуть бути інтерпретовані та виконані музикантами. Цей метод був оцифрованний успішно, з інструментами, такими як Chamber Ensemble Generator від Magenta, який створює музику у форматі MIDI, протокол, який дозволяє спілкуватися між комп’ютерами та музичними інструментами.

Хоча ці підходи просунули цю галузь вперед, вони мають свої власні обмеження, підкреслюючи складну природу генерації аудіо.

Transformer-базовані автoregresивні моделі та U-Net-базовані дифузійні моделі знаходяться на передовій технології, створюючи результати рівня стану мистецтва (SOTA) у генерації аудіо, тексту, музики та багатьох інших речей. Серія GPT від OpenAI та几乎 усі інші LLM зараз працюють на трансформерах, використовуючи або архітектуру кодувача, або декодувача, або обидві архітектури. На стороні мистецтва/зображення MidJourney, Stability AI та DALL-E 2 усі використовують дифузійні рамки. Ці дві основні технології були ключовими у досягненні результатів рівня SOTA в аудіосекторі. У цій статті ми погрузимося у Google’s MusicLM та Stable Audio, які стоять як свідчення видатних можливостей цих технологій.

Google’s MusicLM

Google’s MusicLM була випущена у травні цього року. MusicLM може генерувати високоякісні музичні твори, які резонують з точно описаним у тексті настроєм. Використовуючи ієрархічне послідовне моделювання, MusicLM має можливість перетворити тексти в музику, яка резонує на частоті 24 кГц протягом тривалих періодів.

Модель працює на багатовимірному рівні, не тільки дотримуючись текстових входів, але також демонструючи здатність бути умовною на мелодіях. Це означає, що вона може взяти гуману або свистану мелодію та перетворити її згідно зі стилем, описаним у текстовому підписі.

Технічні інсайти

MusicLM використовує принципи AudioLM, рамки, введеної у 2022 році для генерації аудіо. AudioLM синтезує аудіо як завдання моделювання мови у дискретному просторі представлення, використовуючи ієрархію грубих-до-тонких аудіо дискретних одиниць, також відомих як токени. Цей підхід забезпечує високоякісність та довготривалу узгодженість протягом суттєвих періодів.

Для полегшення процесу генерації MusicLM розширює можливості AudioLM для включення умовної текстової обробки, техніки, яка вирівнює згенероване аудіо з нюансами вхідного тексту. Це досягається шляхом спільного простору вкладення, створеного за допомогою MuLan, спільної музично-текстової моделі, навченої проєктувати музику та відповідні текстові описи близько один до одного у просторі вкладення. Ця стратегія ефективно усуває необхідність у підписах під час навчання, дозволяючи моделі бути навченою на величезних аудіо-коллекціях.

Модель MusicLM також використовує SoundStream як свій аудіо-токенізаційний інструмент, який може реконструювати 24-кГц музику на 6 кбпс з вражаючою вірністю, використовуючи векторну квантизацію (RVQ) для ефективного та високоякісного аудіо-стиснення.

Ілюстрація незалежного процесу попереднього навчання для фундаментальних моделей MusicLM: SoundStream, w2v-BERT та MuLan,

Ілюстрація процесу попереднього навчання MusicLM: SoundStream, w2v-BERT та Mulan | Джерело зображення: тут

Крім того, MusicLM розширює свої можливості, дозволяючи умовну мелодію. Цей підхід забезпечує, що навіть проста гумана мелодія може стати основою для величезного аудіо- досвіду, доопрацьованого згідно з точним текстовим описом стилю.

Розробники MusicLM також відкрили джерело MusicCaps, набір даних, що складається з 5,5 тис. музично-текстових пар, кожна з яких супроводжується багаті текстові описи, створені експертами. Ви можете переглянути його тут: MusicCaps на Hugging Face.

Готові створити звукові доріжки AI за допомогою Google’s MusicLM? Ось як почати:

  1. Відвідайте офіційний сайт MusicLM та натисніть “Почати.”
  2. Приєднайтесь до списку очікування, вибравши “Зареєструвати інтерес.”
  3. Увійдіть до свого облікового запису Google.
  4. Як тільки вам буде надано доступ, натисніть “Спробувати” для початку.

Нижче наведено кілька прикладів промптів, з якими я експериментував:

“Медитативна пісня, заспокійлива та успокаюча, з флейтами та гітарами. Музика повільна, з акцентом на створенні відчуття миру та спокою.”

“джаз з саксофоном”

При порівнянні з попередніми моделями SOTA, такими як Riffusion та Mubert, у кваліфікаційній оцінці MusicLM була віддана перевага над іншими, з учасниками, які позитивно оцінили сумісність текстових підписів з 10-секундними аудіокліпами.

MusicLM Performance порівняння

MusicLM Performance, Джерело зображення: тут

Стабільний Аудіо

Stability AI минулого тижня представила “Стабільний Аудіо” – латентну дифузійну модель архітектури, умовну на текстових метаданих поряд з тривалістю аудіофайлу та часом початку. Цей підхід, як і Google’s MusicLM, має контроль над вмістом та тривалістю згенерованого аудіо, дозволяючи створювати аудіокліпи з заданою тривалістю до розміру вікна навчання.

Технічні інсайти

Стабільний Аудіо складається з кількох компонентів, включаючи варіаційний автоенкодер (VAE) та умовну дифузійну модель на основі U-Net, які працюють разом з текстовим кодувачем.

Ілюстрація, що демонструє інтеграцію варіаційного автоенкодера (VAE), текстового кодувача та умовної дифузійної моделі на основі U-Net

Архітектура Стабільного Аудіо, Джерело зображення: тут

VAE дозволяє швидшу генерацію та навчання, стискаючи стерео-аудіо у дані-компресований, шумостійкий та інвертований втратний латентний код, обходячи необхідність працювати з сирими аудіо-зразками.

Текстовий кодувач, отриманий з моделі CLAP, відіграє важливу роль у розумінні складних відносин між словами та звуками, пропонуючи інформативне представлення токенізаційного вхідного тексту. Це досягається шляхом використання текстових функцій з передостаннього шару текстового кодувача CLAP, які потім інтегруються у дифузійну модель U-Net через шари крос-аттенції.

Важливим аспектом є включення таймінгових вкладень, які обчислюються на основі двох властивостей: початку секунди аудіочанку та загальної тривалості оригінального аудіофайлу. Ці значення, перекладені у пересічні дискретні навчені вкладення, поєднуються з промпт-токенами та вводяться у шари крос-аттенції U-Net, надають користувачам можливість диктувати загальну тривалість вихідного аудіо.

Модель Стабільного Аудіо була навчена за допомогою великого набору даних, що складається з понад 800 тис. аудіофайлів, у співпраці зі стоковим постачальником аудіо AudioSparx.

Реклами Стабільного Аудіо

Реклами Стабільного Аудіо

Стабільний Аудіо пропонує безкоштовну версію, яка дозволяє 20 генерацій треків до 20 секунд на місяць, та план Pro за $12/місяць, який дозволяє 500 генерацій треків до 90 секунд.

Нижче наведено аудіокліп, який я створив за допомогою Стабільного Аудіо.

Зображення, згенероване автором за допомогою Midjourney

Зображення, згенероване автором за допомогою Midjourney

“Кіно, Саундтрек Легкий дощ, Амбієнт, Спокійний, Віддалений гавкіт собак, Спокійний шелест листя, Ніжний вітер, 40 BPM”

 

Застосування таких ретельно створених аудіо-п’єс є безмежними. Режисери фільмів можуть використовувати цю технологію для створення багатих та іммерсивних звукових пейзажів. У комерційній сфері рекламодавці можуть використовувати ці персоналізовані аудіо-треки. Крім того, цей інструмент відкриває можливості для індивідуальних творців та художників експериментувати та інновувати, пропонуючи полотно безмежного потенціалу для створення звукових п’єс, які розповідають історії, викликають емоції та створюють атмосферу з глибиною, яку раніше було важко досягти без суттєвого бюджету чи технічної експертизи.

Совіти щодо промптів

Створіть ідеальну аудіо за допомогою текстових промптів. Ось швидкий гід, щоб почати:

  1. Будьте детальними: Вкажіть жанри, настрої та інструменти. Наприклад: Кіно, Дикі Захід, Перкусія, Напружений, Атмосферний
  2. Налаштування настрою: Об’єднайте музичні та емоційні терміни, щоб передати бажаний настрій.
  3. Вибір інструменту: Покращуйте назви інструментів епітетами, такими як “Відлунний гітар” або “Потужний хор”.
  4. BPM: Вирівнюйте темп з жанром для гармонійного виходу, наприклад “170 BPM” для треку Drum and Bass.

Заключні нотатки

Зображення, згенероване автором за допомогою Midjourney

Зображення, згенероване автором за допомогою Midjourney

У цій статті ми погрузилися у генерацію музики/аудіо AI, від алгоритмічних композицій до складних генеративних рамок AI сьогодні, таких як Google’s MusicLM та Стабільний Аудіо. Ці технології, що використовують глибоке навчання та моделі стиснення рівня стану мистецтва, не тільки покращують генерацію музики, але також доопрацьовують досвід слухачів.

Все ж, це область постійної еволюції, з перешкодами, такими як підтримання довготривалої узгодженості та триваючою дискусією про автентичність музики, створеної AI, що викликає виклик піонерам у цій галузі. Просто минулого тижня було все про пісню, створену AI, яка наслідувала стиль Drake та The Weeknd, яка спочатку викликала ажіотаж у мережі на початку цього року. Однак її було видалено з списку номінантів на премію Греммі, демонструючи триваючу дискусію щодо легітимності музики, створеної AI, у галузі (джерело). Коли AI продовжує звужувати розрив між музикою та слухачами, воно точно сприяє створенню екосистеми, в якій технології співіснують з мистецтвом, сприяючи інноваціям та повазі до традицій.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.