Модели и платформы ИИ
AudioSep: Отделите Все, Что Вы Опишите

LASS или Language-queried Audio Source Separation – это новая парадигма для CASA или Computational Auditory Scene Analysis, целью которой является разделение целевого звука из данной смеси аудио с помощью естественного языка запроса, который обеспечивает естественный, но масштабируемый интерфейс для цифровых аудио задач и приложений. Хотя фреймворки LASS значительно продвинулись в последние годы в плане достижения желаемой производительности на конкретных аудио источниках, таких как музыкальные инструменты, они не способны разделить целевой аудио в открытом домене.
AudioSep – это базовая модель, целью которой является решение текущих ограничений фреймворков LASS, обеспечивая разделение целевого аудио с помощью естественного языка запросов. Разработчики фреймворка AudioSep обширно обучили модель на широком спектре крупномасштабных мультимодальных наборов данных и оценили производительность фреймворка на широком спектре аудио задач, включая разделение музыкальных инструментов, разделение аудио событий и улучшение речи среди многих других. Начальная производительность AudioSep удовлетворяет бенчмаркам, демонстрируя впечатляющие возможности нулевого шотового обучения и обеспечивая сильную производительность аудио разделения.
В этой статье мы более глубоко рассмотрим работу фреймворка AudioSep, оценивая архитектуру модели, наборы данных, используемые для обучения и оценки, и основные концепции, участвующие в работе модели AudioSep. Итак, начнем с основного введения в фреймворк CASA.
CASA, USS, QSS, LASS Фреймворки: Основой для AudioSep
Фреймворк CASA или Computational Auditory Scene Analysis – это фреймворк, используемый разработчиками для проектирования систем машинного слуха, которые имеют способность воспринимать сложные звуковые среды подобно тому, как люди воспринимают звук с помощью своих слуховых систем. Звуковое разделение, с особым акцентом на целевом звуковом разделении, является фундаментальной областью исследований в рамках фреймворка CASA, и оно направлено на решение проблемы “коктейльной вечеринки” или разделения реальных аудио записей от отдельных аудио источников или файлов. Важность звукового разделения можно отнести в основном к его широким применениям, включая музыкальное источниковое разделение, аудио источниковое разделение, улучшение речи, идентификацию целевого звука и многое другое.
Большинство работ по звуковому разделению, выполненных в прошлом, вращаются в основном вокруг разделения одного или нескольких аудио источников, таких как музыкальное разделение или речевое разделение. Новая модель, называемая USS или Universal Sound Separation, направлена на разделение произвольных звуков в реальных аудио записях. Однако это сложная и ограничительная задача разделить каждый звуковой источник из аудио смеси, главным образом из-за широкого спектра различных звуковых источников, существующих в мире, что является основной причиной, по которой метод USS не является осуществимым для реальных приложений, работающих в реальном времени.
Феазимым альтернативой методу USS является метод QSS или Query-based Sound Separation, который направлен на разделение отдельного или целевого звукового источника из аудио смеси на основе конкретного набора запросов. Благодаря этому фреймворк QSS позволяет разработчикам и пользователям извлекать желаемые источники аудио из смеси на основе их требований, что делает метод QSS более практическим решением для цифровых реальных приложений, таких как редактирование мультимедийного контента или аудио редактирование.
Кроме того, разработчики недавно предложили расширение фреймворка QSS, фреймворк LASS или Language-queried Audio Source Separation, который направлен на разделение произвольных источников звука из аудио смеси с помощью естественного языка описаний целевого аудио источника. Поскольку фреймворк LASS позволяет пользователям извлекать целевые аудио источники с помощью набора естественного языка инструкций, он может стать мощным инструментом с широкими применениями в цифровых аудио приложениях. По сравнению с традиционными аудио-запросными или зрительно-запросными методами, использование естественного языка инструкций для аудио разделения обеспечивает большую степень преимущества, добавляя гибкость и делая получение информации запроса намного проще и удобнее.
Первоначально фреймворк LASS полагается на обучение с учителем, при котором модель обучается на наборе помеченных аудио-текстовых пар данных. Однако основной проблемой этого подхода является ограниченная доступность помеченных и помеченных аудио-текстовых данных. Чтобы уменьшить зависимость фреймворка LASS от помеченных аудио-текстовых данных, модели обучаются с помощью подхода мультимодального надзора обучения. Основная цель использования подхода мультимодального надзора заключается в использовании мультимодальных контрастных предварительно обученных моделей, таких как CLIP или Contrastive Language Image Pre Training, в качестве запроса кодировщика для фреймворка.
Чтобы решить текущие ограничения, с которыми сталкиваются фреймворки LASS, разработчики представили AudioSep, базовую модель, целью которой является разделение звука из аудио смеси с помощью естественного языка описаний. Текущий фокус для AudioSep – разработать предварительно обученную модель звукового разделения, которая использует существующие крупномасштабные мультимодальные наборы данных для обеспечения обобщения моделей LASS в открытом домене. Чтобы суммировать, модель AudioSep – это: “Базовая модель для универсального звукового разделения в открытом домене с помощью естественного языка запросов или описаний, обученная на крупномасштабных аудио и мультимодальных наборах данных”.
AudioSep: Ключевые Компоненты и Архитектура
Архитектура фреймворка AudioSep состоит из двух ключевых компонентов: текстового кодировщика и модели разделения.
Текстовый Кодировщик
Фреймворк AudioSep использует текстовый кодировщик модели CLIP или Contrastive Language Image Pre Training или модели CLAP или Contrastive Language Audio Pre Training для извлечения текстовых вложений из естественного языка запроса. Входной текстовый запрос состоит из последовательности “N” токенов, который затем обрабатывается текстовым кодировщиком для извлечения текстовых вложений для данного входного языка запроса.
Модель CLIP предварительно обучена на крупномасштабном наборе данных изображений и текста с помощью контрастного обучения, что является основной причиной, по которой текстовый кодировщик модели CLIP учитывает отображение текстовых описаний на семантическом пространстве, которое также разделяется визуальными представлениями. Преимущество, которое получает AudioSep от использования текстового кодировщика модели CLIP, заключается в том, что он может теперь масштабироваться или обучать модель LASS из неаннотированных аудио-визуальных данных, используя визуальные вложения в качестве альтернативы, что позволяет обучать модели LASS без требования аннотированных или помеченных аудио-текстовых данных.
Модель CLAP работает аналогично модели CLIP и использует контрастную цель обучения, используя текстовый и аудио кодировщик для соединения аудио и языка, что позволяет текстовым и аудио описаниям находиться в аудио-текстовом латентном пространстве.
Модель Разделения
Фреймворк AudioSep использует модель ResUNet, работающую в частотной области, которая подается на смесь аудио клипов в качестве основы для разделения фреймворка. Фреймворк работает, применяя к волновой форме преобразование STFT или Short-Time Fourier Transform для извлечения комплексного спектрограммы, магнитудной спектрограммы и фазы X.
Модель ResUNet состоит из 6 резидуальных блоков, 6 декодировочных блоков и 4 бутылочных блоков. Спектрограмма в каждом кодировочном блоке использует 4 резидуальных свертки для снижения разрешения до бутылочного признака, в то время как декодировочные блоки используют 4 резидуальных деconvolutional блоков для получения компонентов разделения путем увеличения разрешения признаков. Каждый кодировочный блок и соответствующий декодировочный блок устанавливают соединение, работающее на том же уровне увеличения или уменьшения разрешения.

В фреймворке AudioSep используется слой FiLm или Feature-wise Linearly модулированный для соединения модели разделения и текстового кодировщика после развертывания свертки блоков в ResUNet.
Обучение и Потери
Во время обучения модели AudioSep разработчики используют метод усиления громкости и обучают фреймворк AudioSep от начала до конца, используя функцию потерь L1 между реальными и предсказанными волновыми формами.
Наборы Данных и Бенчмарки
Как упоминалось в предыдущих разделах, AudioSep – это базовая модель, целью которой является решение текущей зависимости моделей LASS от аннотированных аудио-текстовых пар данных. Модель AudioSep обучена на широком спектре наборов данных для обеспечения мультимодальных возможностей обучения, и ниже приведено подробное описание набора данных и бенчмарков, используемых разработчиками для обучения фреймворка AudioSep.
AudioSet
AudioSet – это слабо помеченный крупномасштабный аудио набор данных, состоящий из более 2 миллионов 10-секундных аудио клипов, извлеченных直接 из YouTube. Каждый аудио клип в наборе данных AudioSet категоризируется по отсутствию или присутствию звуковых классов без конкретных временных деталей звуковых событий.
VGGSound
Набор данных VGGSound – это крупномасштабный визуально-аудио набор данных, который, как и AudioSet, был получен напрямую из YouTube и содержит более 200 000 видео клипов, каждый из которых имеет длину 10 секунд. Набор данных VGGSound категоризируется на более 300 звуковых классов, включая человеческие звуки, природные звуки, птичьи звуки и многое другое.
AudioCaps
AudioCaps – это самый большой аудио описательный набор данных, доступный публично, и он состоит из более 50 000 10-секундных аудио клипов, извлеченных из набора данных AudioSet. Данные в AudioCaps разделены на три категории: обучающие данные, тестовые данные и данные проверки, и аудио клипы помечены естественными языковыми описаниями с помощью платформы Amazon (AMZN ) Mechanical Turk.
ClothoV2
ClothoV2 – это аудио описательный набор данных, который состоит из клипов, полученных из платформы FreeSound, и, как и AudioCaps, каждый аудио клип помечен естественными языковыми описаниями с помощью платформы Amazon Mechanical Turk.
WavCaps
Как и AudioSet, WavCaps – это слабо помеченный крупномасштабный аудио набор данных, состоящий из более 400 000 аудио клипов с подписями, и общее время воспроизведения, приближающееся к 7568 часам обучающих данных. Аудио клипы в наборе данных WavCaps получены из широкого спектра аудио источников, включая BBC Sound Effects, AudioSet, FreeSound, SoundBible и многое другое.

Детали Обучения
Во время фазы обучения модель AudioSep случайным образом выбирает два аудио сегмента из двух разных аудио клипов из обучающего набора данных и затем смешивает их вместе для создания обучающей смеси, где длина каждого аудио сегмента составляет около 5 секунд.
Модель затем извлекает комплексную спектрограмму из волновой формы сигнала с помощью окна Hann размером 1024 с шагом 320. Модель затем использует текстовый кодировщик моделей CLIP/CLAP для извлечения текстовых вложений с текстовым надзором в качестве конфигурации по умолчанию для AudioSep.
Результаты Оценки
На Виденных Наборах Данных
Следующая фигура сравнивает производительность фреймворка AudioSep на виденных наборах данных во время фазы обучения, включая обучающие наборы данных. Ниже приведена фигура, представляющая результаты оценки фреймворка AudioSep по сравнению с базовыми системами, включая модели улучшения речи, LASS и CLIP.

Как можно увидеть на фигуре, фреймворк AudioSep работает хорошо, когда используются аудио подписи или текстовые метки в качестве входных запросов, и результаты указывают на превосходную производительность фреймворка AudioSep по сравнению с предыдущими бенчмарками моделями LASS и аудио-запросными моделями звукового разделения.
На Невиденных Наборах Данных
Чтобы оценить производительность AudioSep в нулевом шотовом режиме, разработчики продолжили оценку производительности на невиденных наборах данных, и фреймворк AudioSep обеспечивает впечатляющую производительность разделения в нулевом шотовом режиме, и результаты представлены на фигуре ниже.

Кроме того, изображение ниже показывает результаты оценки модели AudioSep против улучшения речи Voicebank-Demand.

Оценка фреймворка AudioSep указывает на сильную и желаемую производительность на невиденных наборах данных в нулевом шотовом режиме, и таким образом обеспечивает выполнение звуковых операций на новых распределениях данных.
Визуализация Результатов Разделения
Ниже приведена фигура, показывающая результаты, полученные при использовании фреймворка AudioSep-CLAP для визуализации спектрограмм для реальных целевых аудио источников, аудио смесей и разделенных аудио источников с помощью текстовых запросов различных аудио или звуков.

Сравнение Текстовых Запросов
Разработчики оценивают производительность AudioSep-CLAP и AudioSep-CLIP на AudioCaps Mini, и разработчики используют метки событий AudioSet, подписи AudioCaps и переаннотированные естественные языковые описания для изучения эффектов различных запросов, и ниже приведена фигура, показывающая пример AudioCaps Mini в действии.

Заключение
AudioSep – это базовая модель, разработанная с целью быть открытым фреймворком универсального звукового разделения, который использует естественные языковые описания для аудио разделения. Как было наблюдено во время оценки, фреймворк AudioSep способен выполнять нулевое шотовое и несUPERвизионное обучение без проблем, используя аудио подписи или текстовые метки в качестве запросов. Результаты и производительность оценки AudioSep указывают на сильную производительность, которая превосходит текущее состояние искусства звукового разделения фреймворков, таких как LASS, и она может быть достаточно способна решить текущие ограничения популярных фреймворков звукового разделения.












