Моделі та платформи ШІ

AudioSep: Відділіть Все, Що Ви Описуєте

mm
Додайте Unite.AI до бажаних джерел у Google

LASS або Language-queried Audio Source Separation – це новий парадигма для CASA або Computational Auditory Scene Analysis, яка спрямована на відділення цільового звуку від заданої суміші аудіо за допомогою природної мови запиту, який забезпечує природний, але масштабований інтерфейс для цифрових аудіо завдань та застосунків. Хоча фреймворки LASS значно покращились за останні роки щодо досягнення бажаної продуктивності на конкретних аудіо джерелах, таких як музичні інструменти, вони не можуть відділити цільовий аудіо в відкритому домені.

AudioSep – це фундаментальна модель, яка спрямована на вирішення поточних обмежень фреймворків LASS, забезпечуючи відділення цільового аудіо за допомогою природної мови запитів. Розробники фреймворку AudioSep тренували модель широко на великомасштабних багатомодальних наборах даних і оцінили продуктивність фреймворку на широкому спектрі аудіо завдань, включаючи відділення музичних інструментів, відділення аудіо подій і покращення мови серед багатьох інших. Початкова продуктивність AudioSep задовольняє бенчмарки, демонструючи вражаючі можливості нульового навчання і забезпечуючи сильну продуктивність аудіо відділення.

У цій статті ми глибше розглянемо роботу фреймворку AudioSep, оцінимо архітектуру моделі, набори даних, використані для тренування та оцінки, і основні концепції, залучені до роботи моделі AudioSep. Тому почнемо з базового введення у фреймворк CASA.

CASA, USS, QSS, LASS Фреймворки: Основи для AudioSep

Фреймворк CASA або Computational Auditory Scene Analysis – це фреймворк, який використовується розробниками для створення систем машинного слуху, які мають можливість сприймати складні звукові середовища подібно до того, як люди сприймають звук за допомогою своїх слухових систем. Відділення звуку, з особливим акцентом на відділенні цільового звуку, є фундаментальною областю дослідження у фреймворку CASA, і воно спрямоване на вирішення проблеми “коктейльної партії” або відділення реальних аудіо записів від окремих аудіо джерел або файлів. Важливість відділення звуку можна пояснити його широкими застосунками, включаючи музичне джерело відділення, аудіо джерело відділення, покращення мови, ідентифікацію цільового звуку і багато іншого.

Більшість робіт над відділенням звуку, виконаних у минулому, обертаються навколо відділення одного або декількох аудіо джерел, таких як музичне відділення або відділення мови. Нова модель, яка називається USS або Universal Sound Separation, спрямована на відділення довільних звуків у реальних аудіо записах. Однак це складне і обмежене завдання відділити кожне джерело звуку від аудіо суміші, головним чином через широкий спектр різних джерел звуку, які існують у світі, що є основною причиною, чому метод USS не є життєздатним для реальних застосунків, які працюють в реальному часі.

Життєздатною альтернативою методу USS є метод QSS або Query-based Sound Separation, який спрямований на відділення індивідуального або цільового джерела звуку від аудіо суміші на основі певного набору запитів. Завдяки цьому фреймворк QSS дозволяє розробникам і користувачам витягувати бажані джерела аудіо з суміші на основі їхніх вимог, що робить метод QSS більш практичним рішенням для цифрових реальних застосунків, таких як мультимедійне редагування вмісту або аудіо редагування.

Крім того, розробники недавно запропонували розширення фреймворку QSS, фреймворку LASS або Language-queried Audio Source Separation, який спрямований на відділення довільних джерел звуку від аудіо суміші за допомогою природної мови описів цільового джерела звуку. Оскільки фреймворк LASS дозволяє користувачам витягувати цільові джерела аудіо за допомогою набору природної мови інструкцій, він може стати потужним інструментом із широкими застосунками у цифрових аудіо застосунках. Коли порівнюється з традиційними аудіо-запитуваними або візуально-запитуваними методами, використання природної мови інструкцій для аудіо відділення пропонує більшу гнучкість і робить отримання інформації про запит легшим і зручнішим. Крім того, коли порівнюється з методами відділення аудіо на основі попередньо визначених інструкцій або запитів, фреймворк LASS не обмежує кількість вхідних запитів і має гнучкість бути узагальненим до відкритого домену безшовно.

Спочатку фреймворк LASS залежить від наглядового навчання, при якому модель тренується на наборі під-etiketованих аудіо-текстових пар даних. Однак основною проблемою цього підходу є обмежена доступність анотованих і під-etiketованих аудіо-текстових даних. Для зменшення залежності фреймворку LASS від анотованих аудіо-текстових даних розробники тренують моделі за допомогою багатомодального наглядового навчання. Основною метою використання багатомодального наглядового підходу є використання моделей багатомодального контрастного попереднього тренування, таких як модель CLIP або Contrastive Language Image Pre Training, як кодувальника запиту для фреймворку. Оскільки модель CLIP має можливість співставляти текстові описи з іншими модальностями, такими як аудіо або візуальні представлення, вона дозволяє розробникам тренувати моделі LASS за допомогою даних-багатих модальностей і дозволяє інтерферувати з текстовими даними у нульовому режимі. Поточні фреймворки LASS однак використовують малих масштабних наборів даних для тренування, і застосування фреймворку LASS у сотнях потенційних доменів ще не досліджені.

Для вирішення поточних обмежень, з якими стикаються фреймворки LASS, розробники запропонували AudioSep, фундаментальну модель, яка спрямована на відділення звуку від аудіо суміші за допомогою природної мови описів. Поточна увага для AudioSep полягає у розробці попередньо тренованої моделі відділення звуку, яка використовує існуючі великомасштабні багатомодальні набори даних для забезпечення узагальнення моделей LASS у відкритому домені. Підставити, модель AudioSep – це: “Фундаментальна модель для універсального відділення звуку у відкритому домені за допомогою природної мови запитів або описів, тренована на великомасштабних аудіо та багатомодальних наборах даних”.

AudioSep: Ключові Компоненти та Архітектура

Архітектура фреймворку AudioSep складається з двох ключових компонентів: текстового кодувальника і моделі відділення.

Текстовий Кодувальник

Фреймворк AudioSep використовує текстовий кодувальник моделі CLIP або Contrastive Language Image Pre Training, або моделі CLAP або Contrastive Language Audio Pre Training, для витягування текстових вкладень у природній мові запиту. Вхідний текстовий запит складається з послідовності “N” токенів, який потім обробляється текстовим кодувальником для витягування текстових вкладень для заданого вхідного мови запиту. Текстовий кодувальник використовує стек трансформерних блоків для кодування вхідних текстових токенів, і вихідні представлення агрегуються після проходження через трансформерні шари, що призводить до розробки D-мірного векторного представлення з фіксованою довжиною, де D відповідає розмірам моделей CLAP або CLIP, а текстовий кодувальник заморожений під час періоду тренування.

Модель CLIP попередньо тренується на великомасштабному наборі даних зображень і тексту за допомогою контрастного навчання, що є основною причиною, чому її текстовий кодувальник вивчає відображення текстових описів на семантичному просторі, який також спільний для візуальних представлень. Перевага, яку AudioSep отримує від використання текстового кодувальника CLIP, полягає в тому, що вона може тепер масштабуватися або тренуватися модель LASS з необроблених аудіо-візуальних даних, використовуючи візуальні вкладення як альтернативу, що дозволяє тренувати моделі LASS без вимог до анотованих або під-etiketованих аудіо-текстових даних.

Модель CLAP працює подібно до моделі CLIP і використовує контрастне навчання як мету, використовуючи текстовий і аудіо кодувальник для зв’язку аудіо і мови, що призводить до того, що текстові і аудіо описи знаходяться у спільному аудіо-текстовому латентному просторі.

Модель Відділення

Фреймворк AudioSep використовує модель ResUNet у 频域і, яка подається суміші аудіо кліпів як основа для відділення. Фреймворк працює шляхом застосування STFT або Short-Time Fourier Transform на хвиляовий сигнал для витягування комплексного спектрограми, магнітудної спектрограми і фази X. Модель потім слідує相同ній установці і будує кодувальник-декодувальник для обробки магнітудної спектрограми.

Модель ResUNet складається з 6 залишкових блоків, 6 декодувальних блоків і 4 бутербродних блоків. Спектрограма в кожному кодувальному блоці використовує 4 залишкові конволюційні блоки для зменьшення себе у бутербродну особливість, тоді як декодувальні блоки використовують 4 залишкові деконволюційні блоки для отримання компонентів відділення шляхом апсамплінгу особливостей. Після цього кожний кодувальний блок і відповідний декодувальний блок встановлюють зв’язок, який працює на одному і тому ж апсамплінговому або зменьшувальному коефіцієнті. Залишковий блок фреймворку складається з 2 Leaky-ReLU активаційних шарів, 2 шарів нормалізації батчу і 2 шарів CNN, а також фреймворк вводить додатковий залишковий шорткат, який з’єднує вхід і вихід кожного окремого залишкового блоку. Модель ResUNet приймає комплексну спектрограму X як вхід і виробляє масштабну маску M як вихід з фазовим залишком, який умовно залежить від текстових вкладень, що контролює масштабування і обертання кута спектрограми. Відділений комплексний спектрограму можна витягнути шляхом множення передбаченої масштабної маски і фазового залишку з STFT (Short-Time Fourier Transform) суміші.

У своєму фреймворку AudioSep використовує FiLm або Feature-wise Linearly модульований шар для зв’язку моделі відділення і текстового кодувальника після розгортання конволюційних блоків у ResUNet.

Тренування і Втрата

Під час тренування моделі AudioSep розробники використовують метод посилення гучності, і тренують фреймворк AudioSep з кінцем у кінці, використовуючи функцію L1 втрати між справжнім і передбаченим хвилями.

Набори Даних і Бенчмарки

Як згадувалося у попередніх розділах, AudioSep – це фундаментальна модель, яка спрямована на вирішення поточної залежності моделей LASS від анотованих аудіо-текстових пар даних. Модель AudioSep тренується на широкому спектрі наборів даних для забезпечення багатомодального навчання, і тут знаходиться детальний опис набору даних і бенчмарків, використаних розробниками для тренування фреймворку AudioSep.

AudioSet

AudioSet – це слабко-etiketований великомасштабний аудіо набір даних, який складається з понад 2 мільйонів 10-секундних аудіо кліпів, витягнутих безпосередньо з YouTube. Кожен аудіо кліп у наборі даних AudioSet категоризується за відсутністю або присутністю звукових класів без конкретних деталей часу звукових подій. Набір даних AudioSet має понад 500 різних аудіо класів, включаючи природні звуки, людські звуки, звуки транспорту і багато іншого.

VGGSound

Набір даних VGGSound – це великомасштабний візуально-аудіо набір даних, який, подібно до AudioSet, витягнутий безпосередньо з YouTube, і містить понад 200 000 відео кліпів, кожний з яких має тривалість 10 секунд. Набір даних VGGSound категоризується у понад 300 звукових класів, включаючи людські звуки, природні звуки, пташині звуки і багато іншого. Використання набору даних VGGSound забезпечує, що об’єкт, який відповідає за виробництво цільового звуку, також описується у відповідному візуальному кліпі.

AudioCaps

AudioCaps – це найбільший публічний аудіо описувальний набір даних, який складається з понад 50 000 10-секундних аудіо кліпів, витягнутих з набору даних AudioSet. Дані у AudioCaps розділені на три категорії: тренувальні дані, тестові дані і валідувальні дані, а аудіо кліпи анотовані людьми за допомогою платформи Amazon (AMZN ) Mechanical Turk. Варто відзначити, що кожен аудіо кліп у тренувальному наборі даних має один опис, тоді як дані у тестових і валідувальних наборах мають по 5 справжніх описів.

ClothoV2

Набір даних ClothoV2 – це аудіо описувальний набір даних, який складається з кліпів, витягнутих з платформи FreeSound, і, подібно до AudioCaps, кожен аудіо кліп анотований людьми за допомогою платформи Amazon Mechanical Turk.

WavCaps

Подібно до AudioSet, WavCaps – це слабко-etiketований великомасштабний аудіо набір даних, який складається з понад 400 000 аудіо кліпів з описами, і загальний час роботи приблизно 7568 годин тренувальних даних. Аудіо кліпи у наборі даних WavCaps витягнуті з широкого спектру аудіо джерел, включаючи BBC Sound Effects, AudioSet, FreeSound, SoundBible і багато іншого.

Деталі Тренування

Під час тренування моделі AudioSep розробники випадково вибірково два аудіо сегменти з двох різних аудіо кліпів з тренувального набору даних, і потім змішують їх разом для створення тренувальної суміші, де довжина кожного аудіо сегмента становить близько 5 секунд. Модель потім витягує комплексну спектрограму з хвиляового сигналу за допомогою вікна Hann розміром 1024 з кроком 320.

Модель потім використовує текстовий кодувальник моделей CLIP/CLAP для витягування текстових вкладень з текстовим наглядом як замовчуваною конфігурацією для AudioSep. Для моделі відділення фреймворк AudioSep використовує модель ResUNet, яка складається з 30 шарів, 6 кодувальних блоків і 6 декодувальних блоків, подібно до архітектури, яку слідує універсальне відділення звуку. Крім того, кожний кодувальний блок має два конволюційні шари з розміром ядра 3×3, а кількість вихідних особливостей кодувальних блоків становить 32, 64, 128, 256, 512 і 1024 відповідно. Декодувальні блоки мають симетрію з кодувальними блоками, а розробники застосовують оптимізатор Adam для тренування моделі AudioSep з розміром батчу 96.

Результати Оцінки

На Відомі Набори Даних

Наступна фігура порівнює продуктивність фреймворку AudioSep на відомих наборах даних під час тренування, включаючи тренувальні набори даних. Нижче фігура представляє результати бенчмарку фреймворку AudioSep у порівнянні з базовими системами, включаючи моделі покращення мови, LASS і CLIP. Модель AudioSep з текстовим кодувальником CLIP представлена як AudioSep-CLIP, тоді як модель AudioSep з текстовим кодувальником CLAP представлена як AudioSep-CLAP.

Як можна побачити на фігурі, фреймворк AudioSep працює добре, коли використовуються аудіо описи або текстові мітки як вхідні запити, і результати вказують на вищу продуктивність фреймворку AudioSep у порівнянні з попередніми бенчмарками LASS і аудіо-запитуваними моделями відділення звуку.

На Невідомі Набори Даних

Для оцінки продуктивності AudioSep у нульовому режимі розробники продовжили оцінювати продуктивність на невідомих наборах даних, і фреймворк AudioSep демонструє вражаючу продуктивність відділення у нульовому режимі, і результати представлені на фігурі нижче.

Крім того, нижче зображення показує результати оцінки моделі AudioSep проти Voicebank-Demand покращення мови.

Оцінка фреймворку AudioSep вказує на сильну і бажану продуктивність на невідомих наборах даних у нульовому режимі, і тим самим відкриває можливість виконання завдань обробки звуку на нових розподілах даних.

Візуалізація Результатів Відділення

Нижче фігура показує результати, отримані розробниками при використанні фреймворку AudioSep-CLAP для візуалізації спектрограм для справжніх цільових джерел звуку, аудіо сумішей і відділених джерел звуку за допомогою текстових запитів різних аудіо чи звуків. Результати дозволили розробникам спостерігати, що спектрограма відділених джерел звуку близька до джерела справжніх даних, що ще більше підтверджує об’єктивні результати, отримані під час експериментів.

Порівняння Текстових Запитів

Розробники оцінюють продуктивність AudioSep-CLAP і AudioSep-CLIP на AudioCaps Mini, і використовують мітки подій AudioSet, описи AudioCaps і переанотовані природні мови описів для вивчення впливу різних запитів, і нижче фігура показує приклад AudioCaps Mini в дії.

Висновок

AudioSep – це фундаментальна модель, розроблена з метою бути відкритим універсальним фреймворком відділення звуку, який використовує природну мову описів для аудіо відділення. Як можна побачити під час оцінки, фреймворк AudioSep здатний виконувати нульове навчання і несупервізійне навчання безшовно, використовуючи аудіо описи або текстові мітки як запити. Результати і продуктивність оцінки AudioSep вказують на сильну продуктивність, яка перевершує сучасний стан мистецтва фреймворків відділення звуку, таких як LASS, і вона може бути достатньо потужною, щоб вирішити поточні обмеження популярних фреймворків відділення звуку.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.