Взгляд Anderson
Исследования в области ИИ предусматривают отдельные регуляторы громкости для диалога, музыки и звуковых эффектов

Новое исследовательское сотрудничество под руководством Mitsubishi изучает возможность извлечения трех отдельных звуковых дорожек из исходного аудиоисточника, разбивая аудиодорожку на речь, музыку и звуковые эффекты (т.е. ambiente).
Поскольку это постфактум-процессорная структура, она предлагает потенциал для более поздних поколений платформ мультимедийного просмотра, включая потребительское оборудование, для предложения трехточечных регуляторов громкости, позволяющих пользователю увеличить громкость диалога или уменьшить громкость саундтрека.
В коротком клипе ниже из сопровождающего видео для исследования (см. конец статьи для полного видео), мы видим различные аспекты саундтрека, подчеркиваемые при перемещении пользователя управления по треугольнику с каждым из трех аудиокомпонентов в одном углу:
Короткий клип из видео, сопровождающего статью (см. встроенное видео в конце статьи). Когда пользователь перемещает курсор к одному из трех выделенных аспектов в треугольном интерфейсе (справа), аудио подчеркивает эту часть трипартитного саундтрека. Хотя более длинное видео цитирует ряд дополнительных примеров на YouTube, они в настоящее время seem недоступными. Источник: https://vimeo.com/634073402
Статья называется Проблема коктейльной вилки: трехстеммое аудиоразделение для реальных саундтреков и исходит от исследователей Mitsubishi Electric Research Laboratories (MERL) в Кембридже, штат Массачусетс, и Департамента интеллектуальных систем инженерии в Университете Индианы в Иллинойсе.
Разделение аспектов саундтрека
Исследователи назвали эту задачу ‘Проблемой коктейльной вечеринки’, поскольку она включает в себя изоляцию сильно переплетенных элементов саундтрека, что создает дорожную карту, похожую на вилку (см. изображение ниже). На практике многоканальные (т.е. стерео и более) саундтреки могут иметь различное количество типов контента, таких как диалог, музыка и ambiente, особенно поскольку диалог склонен доминировать в центральном канале в миксах Dolby 5.1. В настоящее время, однако, очень активная область исследований аудиоразделения концентрируется на захвате этих нитей из одного, запечатанного саундтрека, как и в текущем исследовании.

Коктейльная вилка – получение трех отдельных саундтреков из объединенного и единого саундтрека. Источник: https://arxiv.org/pdf/2110.09958.pdf
Недавние исследования были сосредоточены на извлечении речи в различных средах, часто для целей денойзинга речевого аудио для последующего взаимодействия с системами обработки естественного языка (NLP), но также на изоляции архивных певческих голосов, либо для создания синтетических версий реальных (даже умерших) певцов, либо для облегчения музыкальной изоляции в стиле караоке.
Датасет для каждого аспекта
До сих пор мало внимания было уделено использованию этого типа технологии ИИ для предоставления пользователям большего контроля над миксом саундтрека. Поэтому исследователи формализовали проблему и сгенерировали новый датасет в качестве помощи для продолжения исследований по разделению многотипных саундтреков, а также протестировали его на различных существующих аудиоразделительных рамках.
Новый датасет, разработанный авторами, называется Divide and Remaster (DnR), и получен из предыдущих датасетов LibriSpeech, Free Music Archive и Freesound Dataset 50k (FSD50K). Для тех, кто хочет работать с DnR с нуля, датасет должен быть восстановлен из трех источников; в противном случае он скоро будет доступен на Zenodo, утверждают авторы. Однако на момент написания предоставленная ссылка на GitHub для утилит извлечения источников в настоящее время неактивна, поэтому те, кто заинтересован, могут потребовать подождать некоторое время.
Исследователи обнаружили, что архитектура CrossNet un-mix (XUMX) предложенная Sony в мае, работает особенно хорошо с DnR.

Архитектура аудио CrossNet от Sony.
Авторы утверждают, что их модели машинного обучения для извлечения работают хорошо на саундтреках из YouTube, хотя оценки, представленные в статье, основаны на синтетических данных, и предоставленное основное поддерживающее видео (встроенное ниже) в настоящее время является единственным, которое, кажется, доступно.
Три датасета, использованных каждым, состоят из коллекции того типа выходных данных, которые необходимо разделить из саундтрека: FSD50K занимается звуковыми эффектами и включает 50 000 аудиоклипов с частотой 44,1 кГц в моно, помеченных 200 метками классов из онтологии AudioSet Google; Free Music Archive включает 100 000 стерео-песен, покрывающих 161 музыкальный жанр, хотя авторы использовали подмножество, содержащее 25 000 песен, для паритета с FSD50K; и LibriSpeech предоставляет DnR 100 часов аудио-книг в виде аудиофайлов mp3 с частотой 44,1 кГц.
Будущая работа
Авторы предвидят дальнейшую работу над датасетом и комбинацией отдельных моделей, разработанных для дополнительных исследований по распознаванию речи и классификации звуков, включающих автоматическую генерацию подписей для речи и неречевых звуков. Они также намерены оценить возможности подходов к ремиксу, которые могут уменьшить перцептивные артефакты, что остается центральной проблемой при разделении объединенного аудиосаундтрека на его составные компоненты.
Такой тип разделения может в будущем быть доступен как потребительская коммерческая продукция в умных телевизорах, которые включают высокооптимизированные сети вывода, хотя, кажется, что ранние реализации потребуют некоторого уровня предварительной обработки времени и места хранения. Samsung уже использует локальные нейронные сети для апскейлинга, в то время как Когнитивный процессор XR Sony, используемый в линейке Bravia, анализирует и переинтерпретирует саундтреки в режиме реального времени посредством легковесных интегрированных ИИ.
Требования к большему контролю над миксом саундтрека периодически повторяются, и большинство решений должны иметь дело с тем, что саундтрек уже был объединен в соответствии с текущими стандартами (и предположениями о том, чего хотят зрители) в кино- и телевизионной промышленности.
Один зритель, разочарованный в шокирующей диспропорции уровней громкости между различными элементами саундтреков фильмов, стал настолько отчаянным, что разработал аппаратный автоматический регулятор громкости, способный уравнять громкость для фильмов и телевидения.
Хотя умные телевизоры предлагают разнообразные методы для попытки увеличить громкость диалога против грандиозных уровней громкости для музыки, они все борются против решений, принятых на этапе микширования, и, возможно, против видений создателей контента, которые хотят, чтобы аудитория испытывала их саундтреки именно так, как они были установлены.
Создатели контента, вероятно, будут возражать против этого потенциального дополнения к ‘культуре ремиксов’, поскольку несколько известных деятелей индустрии уже выразили недовольство по поводу алгоритмов постобработки по умолчанию, основанных на телевидении, таких как сглаживание движения.
https://vimeo.com/634073402












