Модели и платформы ИИ

Текст-в-музыку Генеративный ИИ: Stability Audio, Google’s MusicLM и многое другое

mm
Добавьте Unite.AI в избранные источники в Google

Музыка, искусство, которое резонирует с человеческой душой, была нашим постоянным спутником на протяжении веков. Создание музыки с помощью искусственного интеллекта началось несколько десятилетий назад. Первоначально попытки были простыми и интуитивными, с базовыми алгоритмами, создающими монотонные мелодии. Однако по мере развития технологий росла и сложность, и возможности генераторов музыки ИИ, открывая путь для глубокого обучения и обработки естественного языка (NLP) в этой области.

Сегодня платформы như Spotify используют ИИ для тонкой настройки опыта прослушивания пользователей. Эти алгоритмы глубокого обучения анализируют индивидуальные предпочтения на основе различных музыкальных элементов, таких как темп и настроение, для создания персонализированных предложений песен. Они даже анализируют более широкие закономерности прослушивания и ищут в интернете обсуждения песен, чтобы создать подробные профили песен.

Происхождение ИИ в музыке: Путешествие от алгоритмической композиции к генеративному моделированию

На ранних этапах ИИ в музыкальном мире, охватывающих 1950-1970-е годы, основное внимание уделялось алгоритмической композиции. Это был метод, при котором компьютеры использовали определенный набор правил для создания музыки. Первым заметным творением в этот период стала Иллиак-Сюит для струнного квартета в 1957 году. Она использовала алгоритм Монте-Карло, процесс, включающий случайные числа для определения высоты и ритма в рамках традиционной музыкальной теории и статистических вероятностей.

Изображение, сгенерированное автором с помощью Midjourney

Изображение, сгенерированное автором с помощью Midjourney

Сложность перевода текста в музыку

Музыка хранится в богатом и многомерном формате данных, который включает элементы, такие как мелодия, гармония, ритм и темп, что делает задачу перевода текста в музыку чрезвычайно сложной. Стандартная песня представлена почти миллионом чисел в компьютере, цифра значительно превышающая другие форматы данных, такие как изображения, текст и т. д.

Область генерации аудио переживает инновационные подходы к преодолению проблем создания реалистичного звука. Одним из методов является генерация спектрограммы, а затем ее обратное преобразование в аудио.

Другой подход использует символическое представление музыки, такое как нотная запись, которое может быть интерпретировано и сыграно музыкантами. Этот метод был оцифрован успешно, с инструментами, такими как Chamber Ensemble Generator от Magenta, создающим музыку в формате MIDI, протоколе, который позволяет компьютерам и музыкальным инструментам общаться.

Google’s MusicLM

MusicLM от Google (GOOGL ) был выпущен в мае этого года. MusicLM может генерировать высококачественные музыкальные произведения, которые резонируют с точным настроением, описанным в тексте. Используя иерархическое последовательное моделирование, MusicLM имеет возможность преобразовывать текстовые описания в музыку, которая резонирует на частоте 24 кГц в течение длительного времени.

Технические детали

MusicLM использует принципы AudioLM, рамки, представленной в 2022 году для генерации аудио. AudioLM синтезирует аудио как задачу моделирования языка в дискретном представительном пространстве, используя иерархию грубых-к-файным аудио дискретных единиц, также известных как токены. Этот подход обеспечивает высокое качество и долгосрочную согласованность в течение значительных периодов.

Чтобы облегчить процесс генерации, MusicLM расширяет возможности AudioLM, включая текстовую условность, технику, которая выравнивает сгенерированное аудио с нюансами входного текста. Это достигается с помощью общего пространства вложения, созданного с помощью MuLan, совместной музыкально-текстовой модели, обученной проецировать музыку и ее соответствующие текстовые описания близко друг к другу в пространстве вложения. Эта стратегия эффективно устраняет необходимость в подписях во время обучения, позволяя модели быть обученной на огромных аудио-кorpora.

Stability Audio

Stability AI представила “Stable Audio” – латентную модель диффузии, условленную на текстовую метаданные, а также на продолжительность аудиофайла и время начала. Этот подход, как и MusicLM от Google, имеет контроль над содержанием и длиной сгенерированного аудио, позволяя создавать аудиоклипы с указанными длинами до размера окна обучения.

Технические детали

Stable Audio состоит из нескольких компонентов, включая вариационный автокодировщик (VAE) и условленную модель диффузии на основе U-Net, работающую вместе с текстовым кодировщиком.

VAE облегчает более быструю генерацию и обучение, сжимая стереоаудио в сжатое, устойчивое к шуму и обратимое потерянное латентное кодирование, обходя необходимость работать с сырыми аудио-выборками.

Текстовый кодировщик, полученный из модели CLAP, играет решающую роль в понимании сложных отношений между словами и звуками, предлагая информативное представление токенизированного входного текста. Это достигается с помощью использования текстовых особенностей из предпоследнего слоя текстового кодировщика CLAP, которые затем интегрируются в модель диффузии U-Net через слои кросс-аттенции.

Советы по формулировке запросов

Создайте идеальный аудио с помощью текстовых запросов. Вот быстрое руководство, чтобы начать:

  1. Будьте подробны: Укажите жанры, настроения и инструменты. Например: Кинематографический, Дикий Запад, Перкуссия, Напряженный, Атмосферный
  2. Настройка настроения: Объедините музыкальные и эмоциональные термины, чтобы передать желаемое настроение.
  3. Выбор инструмента: Улучшите имена инструментов с помощью прилагательных, таких как “Реверберированная Гитара” или “Мощный Хор”.
  4. БПМ: Согласуйте темп с жанром для гармоничного вывода, например “170 БПМ” для трека Drum and Bass.

Заключительные заметки

В этой статье мы углубились в музыку, сгенерированную ИИ/аудио, от алгоритмических композиций до сложных генеративных ИИ-рамок сегодня, таких как MusicLM от Google и Stability Audio. Эти технологии, использующие глубокое обучение и модели сжатия SOTA, не только улучшают генерацию музыки, но и тонко настраивают опыт слушателей.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.