AI 모델 및 플랫폼

AudioSep : 설명한 대로 분리하는 모든 것

mm
Unite.AI를 Google의 선호 소스에 추가

LASS 또는 언어 쿼리 오디오 소스 분리是一种新的 CASA 또는 계산적 청각 장면 분석 패러다임으로, 자연어 쿼리를 사용하여 오디오 믹스에서 대상 사운드를 분리하는 것을 목표로 합니다. 최근 몇 년 동안 LASS 프레임워크는 특정 오디오 소스에 대한 원하는 성능을 달성하는 측면에서 크게 발전했지만, 오픈 도메인에서 대상 오디오를 분리하는 데에는 여전히 한계가 있습니다.

AudioSep는 이러한 LASS 프레임워크의 현재 한계를 해결하기 위한 기초 모델입니다. AudioSep는 자연어 쿼리를 사용하여 대상 오디오를 분리하는 것을 목표로 합니다. 개발자들은 AudioSep 모델을 대규모 멀티모달 데이터셋에 대해 광범위하게 훈련시키고, 음악 악기 분리, 오디오 이벤트 분리, 음성 강화 등 다양한 오디오 작업에 대한 성능을 평가했습니다. AudioSep의 초기 성능은 벤치마크를 충족하며, 인상적인 제로샷 학습 능력과 강한 오디오 분리 성능을 보여줍니다.

이 기사에서는 AudioSep 프레임워크의 작동 방식에 대해 자세히 살펴보겠습니다. AudioSep 모델의 아키텍처, 훈련 및 평가에 사용된 데이터셋, AudioSep 모델의 작동에涉及된 주요 개념 등에 대해 설명하겠습니다.

CASA, USS, QSS, LASS 프레임워크 : AudioSep의 기초

CASA 또는 계산적 청각 장면 분석 프레임워크는 개발자가 인간의 청각 시스템과 유사한 방식으로 복잡한 사운드 환경을 인식할 수 있는 기계 청취 시스템을 설계하기 위한 프레임워크입니다. 사운드 분리, 특히 대상 사운드 분리는 CASA 프레임워크 내에서 기본적인 연구 영역입니다. 사운드 분리의 중요성은 음악 소스 분리, 오디오 소스 분리, 음성 강화, 대상 사운드 식별 등 다양한 응용 분야에서 비롯됩니다.

과거의 사운드 분리 연구 대부분은 음악 분리 또는 음성 분리와 같은 하나 이상의 오디오 소스를 분리하는 데 중점을 두었습니다. USS 또는 유니버설 사운드 분리라는 새로운 모델은 실제 오디오 녹음에서 임의의 사운드를 분리하는 것을 목표로 합니다. 그러나 실제 응용 분야에서 실시간으로 작동하는 데에는 여전히 한계가 있습니다.

USS 방법의 대안은 QSS 또는 쿼리 기반 사운드 분리 방법입니다. QSS 프레임워크는 개발자와 사용자가 특정 쿼리 세트를 기반으로 오디오 믹스에서 대상 사운드 소스를 분리할 수 있도록 합니다. 이는 디지털 실시간 응용 분야에서 더 실제적인 해결책을 제공합니다.

개발자들은 최근 QSS 프레임워크의 확장인 LASS 또는 언어 쿼리 오디오 소스 분리 프레임워크를 제안했습니다. LASS 프레임워크는 자연어 설명을 사용하여 오디오 믹스에서 임의의 사운드를 분리하는 것을 목표로 합니다. 이는 사용자가 대상 오디오 소스를 자연어 지침을 사용하여 추출할 수 있도록 하는 강력한 도구가 될 수 있습니다.

원래 LASS 프레임워크는 지도 학습에 의존하며, 모델은 레이블이 지정된 오디오-텍스트 페어 데이터에 대해 훈련됩니다. 그러나 이 접근 방식의 주요 문제는 레이블이 지정된 오디오-텍스트 데이터의 제한된 가용성입니다. 이를 해결하기 위해 개발자들은 멀티모달 감독 학습 접근 방식을 사용하여 모델을 훈련합니다.

AudioSep는 이러한 LASS 프레임워크의 현재 한계를 해결하기 위한 기초 모델입니다. AudioSep는 자연어 설명을 사용하여 사운드를 분리하는 것을 목표로 합니다. AudioSep 모델은 대규모 멀티모달 데이터셋에 대해 광범위하게 훈련되어 오픈 도메인에서 LASS 모델의 일반화를 가능하게 합니다.

AudioSep : 주요 구성 요소 및 아키텍처

AudioSep 프레임워크의 아키텍처는 두 가지 주요 구성 요소로 구성됩니다. 텍스트 인코더와 분리 모델입니다.

텍스트 인코더

AudioSep 프레임워크는 CLIP 또는 대조적 언어 이미지 사전 훈련 모델의 텍스트 인코더를 사용하여 자연어 쿼리에서 텍스트 임베딩을 추출합니다. 입력 텍스트 쿼리는 “N” 토큰의 시퀀스로 구성되며, 텍스트 인코더에 의해 처리되어 입력 언어 쿼리에서 텍스트 임베딩이 추출됩니다.

CLIP 모델은 대규모 이미지-텍스트 페어 데이터에 대해 대조적 학습을 사용하여 사전 훈련되며, 이는 텍스트 인코더가 의미 공간에서 텍스트 설명을 매핑하는 것을 가능하게 합니다.

CLAP 모델은 CLIP 모델과 유사하게 작동하며, 대조적 학습 목표를 사용하여 텍스트 및 오디오 인코더를 연결합니다.

분리 모델

AudioSep 프레임워크는 주파수 도메인 ResUNet 모델을 사용하여 오디오 클립의 믹스를 분리하는 데 사용됩니다. 모델은 먼저 웨이브폼 신호에서 복소수 스펙트로그램을 추출한 다음, 분리 모델에 입력합니다.

ResUNet 모델은 6개의 잔차 블록, 6개의 디코더 블록, 4개의 병목 블록으로 구성됩니다. 각 인코더 블록은 4개의 잔차畳み込み 블록을 사용하여 피처를 다운샘플링하고, 디코더 블록은 4개의 잔사畳み込み 블록을 사용하여 피처를 업샘플링하여 분리 구성 요소를 얻습니다.

AudioSep 프레임워크는 분리 모델과 텍스트 인코더를 연결하는 FiLm 또는 피처-와이즈 선형 변조 레이어를 사용합니다.

훈련 및 손실

AudioSep 모델의 훈련期间, 개발자들은 라우드니스 오그멘테이션 방법을 사용하며, L1 손실 함수를 사용하여 모델을 엔드투엔드 방식으로 훈련합니다.

데이터셋 및 벤치마크

AudioSep는 LASS 모델의 현재 한계를 해결하기 위한 기초 모델입니다. AudioSep 모델은 대규모 멀티모달 데이터셋에 대해 광범위하게 훈련되어 오픈 도메인에서 LASS 모델의 일반화를 가능하게 합니다.

AudioSet

AudioSet은 약 2백만개의 10초 오디오 클립으로 구성된 대규모 오디오 데이터셋입니다. 각 오디오 클립은 사운드 클래스의 존재 또는 부재에 따라 분류됩니다.

VGGSound

VGGSound 데이터셋은 약 2만개의 10초 비디오 클립으로 구성된 대규모 시각-오디오 데이터셋입니다. 각 비디오 클립은 사운드 클래스에 따라 분류됩니다.

AudioCaps

AudioCaps는 약 5만개의 10초 오디오 클립으로 구성된 대규모 오디오 캡션 데이터셋입니다. 각 오디오 클립은 자연어 설명으로 주석이 달려 있습니다.

ClothoV2

ClothoV2는 약 4만개의 오디오 클립으로 구성된 대규모 오디오 캡션 데이터셋입니다. 각 오디오 클립은 자연어 설명으로 주석이 달려 있습니다.

WavCaps

WavCaps는 약 4만개의 오디오 클립으로 구성된 대규모 오디오 데이터셋입니다. 각 오디오 클립은 자연어 설명으로 주석이 달려 있습니다.

훈련 세부 정보

AudioSep 모델의 훈련期间, 개발자들은 훈련 데이터셋에서 두 개의 오디오 세그먼트를 임의로 샘플링하여 훈련 믹스를 생성합니다.

AudioSep 모델은 텍스트 인코더를 사용하여 텍스트 임베딩을 추출하며, 분리 모델은 ResUNet 레이어를 사용하여 오디오 클립의 믹스를 분리합니다.

평가 결과

학습된 데이터셋

AudioSep 모델의 성능은 학습된 데이터셋에서 평가됩니다. 결과는 AudioSep 모델이 기존의 사운드 분리 모델보다 우수한 성능을 보임을 보여줍니다.

미학습된 데이터셋

AudioSep 모델의 성능은 미학습된 데이터셋에서 평가됩니다. 결과는 AudioSep 모델이 제로샷 설정에서 강한 성능을 보임을 보여줍니다.

분리 결과 시각화

AudioSep 모델의 분리 결과는 시각화됩니다. 결과는 AudioSep 모델이 대상 사운드의 스펙트로그램을 잘 분리함을 보여줍니다.

텍스트 쿼리 비교

AudioSep 모델의 성능은 다양한 텍스트 쿼리에서 평가됩니다. 결과는 AudioSep 모델이 다양한 텍스트 쿼리에서 강한 성능을 보임을 보여줍니다.

결론

AudioSep는 오픈 도메인에서 자연어 설명을 사용하여 사운드를 분리하는 기초 모델입니다. 평가 결과는 AudioSep 모델이 강한 성능을 보임을 보여줍니다. AudioSep 모델은 기존의 사운드 분리 모델보다 우수한 성능을 보이며, 실제 응용 분야에서 유용한 도구가 될 수 있습니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.