Модели и платформы ИИ
Текст-в-музыку Генеративный ИИ: Stability Audio, Google’s MusicLM и многое другое
Музыка, искусство, которое резонирует с человеческой душой, была нашим постоянным спутником на протяжении веков. Создание музыки с помощью искусственного интеллекта началось несколько десятилетий назад. Первоначально попытки были простыми и интуитивными, с базовыми алгоритмами, создающими монотонные мелодии. Однако по мере развития технологий росла и сложность, и возможности генераторов музыки ИИ, открывая путь для глубокого обучения и обработки естественного языка (NLP) в этой области.
Сегодня платформы như Spotify используют ИИ для тонкой настройки опыта прослушивания пользователей. Эти алгоритмы глубокого обучения анализируют индивидуальные предпочтения на основе различных музыкальных элементов, таких как темп и настроение, для создания персонализированных предложений песен. Они даже анализируют более широкие закономерности прослушивания и ищут в интернете обсуждения песен, чтобы создать подробные профили песен.
Происхождение ИИ в музыке: Путешествие от алгоритмической композиции к генеративному моделированию
На ранних этапах ИИ в музыкальном мире, охватывающих 1950-1970-е годы, основное внимание уделялось алгоритмической композиции. Это был метод, при котором компьютеры использовали определенный набор правил для создания музыки. Первым заметным творением в этот период стала Иллиак-Сюит для струнного квартета в 1957 году. Она использовала алгоритм Монте-Карло, процесс, включающий случайные числа для определения высоты и ритма в рамках традиционной музыкальной теории и статистических вероятностей.
Сложность перевода текста в музыку
Музыка хранится в богатом и многомерном формате данных, который включает элементы, такие как мелодия, гармония, ритм и темп, что делает задачу перевода текста в музыку чрезвычайно сложной. Стандартная песня представлена почти миллионом чисел в компьютере, цифра значительно превышающая другие форматы данных, такие как изображения, текст и т. д.
Область генерации аудио переживает инновационные подходы к преодолению проблем создания реалистичного звука. Одним из методов является генерация спектрограммы, а затем ее обратное преобразование в аудио.
Другой подход использует символическое представление музыки, такое как нотная запись, которое может быть интерпретировано и сыграно музыкантами. Этот метод был оцифрован успешно, с инструментами, такими как Chamber Ensemble Generator от Magenta, создающим музыку в формате MIDI, протоколе, который позволяет компьютерам и музыкальным инструментам общаться.
Google’s MusicLM
MusicLM от Google (GOOGL ) был выпущен в мае этого года. MusicLM может генерировать высококачественные музыкальные произведения, которые резонируют с точным настроением, описанным в тексте. Используя иерархическое последовательное моделирование, MusicLM имеет возможность преобразовывать текстовые описания в музыку, которая резонирует на частоте 24 кГц в течение длительного времени.
Технические детали
MusicLM использует принципы AudioLM, рамки, представленной в 2022 году для генерации аудио. AudioLM синтезирует аудио как задачу моделирования языка в дискретном представительном пространстве, используя иерархию грубых-к-файным аудио дискретных единиц, также известных как токены. Этот подход обеспечивает высокое качество и долгосрочную согласованность в течение значительных периодов.
Чтобы облегчить процесс генерации, MusicLM расширяет возможности AudioLM, включая текстовую условность, технику, которая выравнивает сгенерированное аудио с нюансами входного текста. Это достигается с помощью общего пространства вложения, созданного с помощью MuLan, совместной музыкально-текстовой модели, обученной проецировать музыку и ее соответствующие текстовые описания близко друг к другу в пространстве вложения. Эта стратегия эффективно устраняет необходимость в подписях во время обучения, позволяя модели быть обученной на огромных аудио-кorpora.
Stability Audio
Stability AI представила “Stable Audio” – латентную модель диффузии, условленную на текстовую метаданные, а также на продолжительность аудиофайла и время начала. Этот подход, как и MusicLM от Google, имеет контроль над содержанием и длиной сгенерированного аудио, позволяя создавать аудиоклипы с указанными длинами до размера окна обучения.
Технические детали
Stable Audio состоит из нескольких компонентов, включая вариационный автокодировщик (VAE) и условленную модель диффузии на основе U-Net, работающую вместе с текстовым кодировщиком.
VAE облегчает более быструю генерацию и обучение, сжимая стереоаудио в сжатое, устойчивое к шуму и обратимое потерянное латентное кодирование, обходя необходимость работать с сырыми аудио-выборками.
Текстовый кодировщик, полученный из модели CLAP, играет решающую роль в понимании сложных отношений между словами и звуками, предлагая информативное представление токенизированного входного текста. Это достигается с помощью использования текстовых особенностей из предпоследнего слоя текстового кодировщика CLAP, которые затем интегрируются в модель диффузии U-Net через слои кросс-аттенции.
Советы по формулировке запросов
Создайте идеальный аудио с помощью текстовых запросов. Вот быстрое руководство, чтобы начать:
- Будьте подробны: Укажите жанры, настроения и инструменты. Например: Кинематографический, Дикий Запад, Перкуссия, Напряженный, Атмосферный
- Настройка настроения: Объедините музыкальные и эмоциональные термины, чтобы передать желаемое настроение.
- Выбор инструмента: Улучшите имена инструментов с помощью прилагательных, таких как “Реверберированная Гитара” или “Мощный Хор”.
- БПМ: Согласуйте темп с жанром для гармоничного вывода, например “170 БПМ” для трека Drum and Bass.
Заключительные заметки
В этой статье мы углубились в музыку, сгенерированную ИИ/аудио, от алгоритмических композиций до сложных генеративных ИИ-рамок сегодня, таких как MusicLM от Google и Stability Audio. Эти технологии, использующие глубокое обучение и модели сжатия SOTA, не только улучшают генерацию музыки, но и тонко настраивают опыт слушателей.













