AI 모델 및 플랫폼

SALMONN: 대규모 언어 모델의 일반적인 청각 능력에 대한 소개

mm
Unite.AI를 Google의 선호 소스에 추가

청각은 실제 환경에서 AI 에이전트에게 필수적인 요소이며, 이는 일반적인 청각 정보의 인식과 이해를 포함합니다. 이러한 청각 정보는 음악, 오디오 이벤트 및 음성의 세 가지 주요 사운드 유형으로 구성됩니다. 최근에는 텍스트 기반의 대규모 언어 모델(Large Language Model, LLM) 프레임워크가 자연어 처리(Natural Language Processing, NLP) 작업에서 인간 수준의 성능을 달성하는 등 뛰어난 능력을 보여주었습니다. 또한, 지시 튜닝(instruction tuning)이라는 훈련 방법이 인기를 얻고 있습니다. 이 방법은 대규모 언어 모델을 더 효과적으로 열린 사용자 지시에 따라 훈련하는 데 사용됩니다. 그러나 현재 연구는 대규모 언어 모델에 멀티모달 콘텐츠를 인식할 수 있는 능력을 부여하는 데 중점을 두고 있습니다.

同じ 방식으로, 이 기사에서는 SALMONN 또는 Speech Audio Language Music Open Neural Network에 대해 논의할 것입니다. SALMONN은 음성 및 오디오 인코더를 미리 훈련된 텍스트 기반 대규모 언어 모델과 결합하여 단일 오디오-텍스트 멀티모달 모델을 구축하는 최첨단 오픈 음성 오디오 언어 음악 신경망입니다. SALMONN 모델은 대규모 언어 모델이 일반적인 오디오 입력을 직접 이해하고 처리할 수 있도록 하여, 훈련에 사용된 다양한 오디오 및 음성 작업에서 경쟁력 있는 성능을 발휘합니다.

요약하면, SALMONN 프레임워크는 일반적인 오디오 입력을 이해하고 처리할 수 있는 최초의 멀티모달 대규모 언어 모델입니다. SALMONN 프레임워크는 LoRA 스케일링 요인과 추가적인 활성화 단계를 사용하여 교차 모드 에머전트 능력을 분석합니다.

SALMONN: 단일 오디오-텍스트 멀티모달 대규모 언어 모델에 대한 소개

SALMONN은 Speech Audio Language Music Open Neural Network의 약자이며, 음성, 오디오 이벤트 및 음악을 포함하는 세 가지 기본 오디오 또는 사운드 유형을 인식하고 이해할 수 있는 단일 오디오-텍스트 멀티모달 대규모 언어 모델 프레임워크입니다. SALMONN 모델은 대규모 언어 모델이 일반적인 오디오 입력을 직접 이해하고 처리할 수 있도록 하여, 다양한 오디오 및 음성 작업에서 경쟁력 있는 성능을 발휘합니다.

SALMONN 프레임워크는 음성 및 비음성 오디오 작업의 성능을 향상시키기 위해 두 개의 인코더 구조를 사용합니다. 하나는 BEATs 오디오 인코더이고, 다른 하나는 Whisper 음성 모델에서 가져온 음성 인코더입니다. 또한, SALMONN 프레임워크는 Q-Former 또는 쿼리 트랜스포머를 연결 모듈로 사용하여 변수 길이의 인코더 출력 시퀀스를 가변 수의 오디오 토큰으로 변환합니다. LoRA 또는 Low Rank Adaptation 접근 방식은 Vicuna 프레임워크의 출력 공간을 증강된 입력 공간과 일치시키기 위해 교차 모드 어댑터로 사용됩니다.

さらに, 프레임워크는 다양한 오디오 이벤트, 음악 벤치마크 및 음성 벤치마크를 사용하여其의 인지 청각 능력을 평가하며, 벤치마크를 세 가지 레벨로 나눕니다. 첫 번째 벤치마크 레벨에서는 8개의 작업을 포함하는 지시 훈련을 수행합니다. 다른 두 번째 벤치마크 레벨은 훈련되지 않은 작업으로, 두 번째 레벨의 벤치마크는 슬롯 채우기 및 미학습 언어로의 번역과 같은 5개의 음성 기반 자연어 처리 작업을 포함합니다.

요약하면, SALMONN 프레임워크는 일반적인 오디오 입력을 이해하고 처리할 수 있는 최초의 멀티모달 대규모 언어 모델입니다. SALMONN 프레임워크는 LoRA 스케일링 요인과 추가적인 활성화 단계를 사용하여 교차 모드 에머전트 능력을 분석합니다.

  1. 일반적인 오디오 입력을 최대 능력으로 이해하고 인식할 수 있는 최초의 멀티모달 대규모 언어 모델입니다.
  2. 교차 모드 에머전트 능력을 제공하는 LoRA 스케일링 요인과 추가적인 활성화 단계를 사용하여 프레임워크의 능력을 분석합니다.

SALMONN: 아키텍처 및 방법론

이 섹션에서는 SALMONN 프레임워크의 아키텍처, 훈련 방법 및 실험 설정에 대해 살펴보겠습니다.

모델 아키텍처

SALMONN 프레임워크의 핵심 아키텍처는 두 개의 청각 인코더의 출력을 동기화하고 결합합니다. 그런 다음 Q-Former를 프레임 레벨에서 연결 모듈로 구현합니다. Q-Former에서 생성된 출력 시퀀스는 텍스트 지시 프롬프트와 결합되어 LoRA 적응 접근 방식의 입력으로 제공됩니다.

청각 인코더

SALMONN 프레임워크는 두 개의 청각 인코더를 사용합니다. 하나는 비음성 BEATs 오디오 인코더이고, 다른 하나는 Whisper 음성 모델에서 가져온 음성 인코더입니다. BEATs 오디오 인코더는 자기 지도적 반복 학습 접근 방식을 사용하여 비음성 높은 수준의 오디오 의미를 추출합니다. 음성 인코더는 약한 지도 학습 데이터를 사용하여 음성 인식 및 음성 번역 작업을 수행하며, 인코더의 출력 특징은 배경 노이즈 및 음성 정보를 포함할 수 있습니다.

윈도우 레벨 Q-Former

Q-Former 구조는 이미지 인코더의 출력을 텍스트 입력 토큰으로 변환하는 데 사용됩니다. 오디오 토큰의 경우 일부 수정이 필요합니다. 구체적으로, 프레임워크는 인코더 출력을 연결된 인코더 출력 시퀀스로 간주하고, Q-Former는 텍스트 토큰으로 변환하기 위해 고정 수의 훈련 가능한 쿼리를 사용합니다.

LoRA 및 LLM

SALMONN 프레임워크는 또한 Vicuna LLM을 사용합니다. Vicuna LLM은 지시를 더 정확하게 따르도록 미세 조정된 LLaMA 대규모 언어 모델 프레임워크입니다. LoRA 프레임워크는 매개 변수 효율적인 미세 조정을 위한 일반적인 방법이며, SALMONN 프레임워크에서 자기 주의 레이어의 쿼리 및 가중치 행렬을 적응시키기 위해 사용됩니다.

훈련 방법

SALMONN 프레임워크는 세 단계의 교차 모드 훈련 접근 방식을 사용합니다. 훈련 단계는 대부분의 시각적 LLM 프레임워크에서 포함되는 사전 훈련 단계와 지시 튜닝 단계를 포함하며, 오디오 캡션 및 음성 인식 작업에서 과적합 문제를 해결하기 위해 추가적인 활성화 튜닝 단계가 구현됩니다.

사전 훈련 단계

SALMONN 프레임워크는 미리 훈련된 매개 변수와 무작위로 초기화된 매개 변수 간의 격차를 제한하기 위해 대규모 오디오 캡션 및 음성 인식 데이터를 사용하여 LoRA 및 Q-Former 구성 요소를 사전 훈련합니다. 이러한 작업은 오디오 이벤트의 주요 내용에 대한 중요한 청각 정보를 포함하며, 텍스트 및 청각 정보 간의 정렬을 학습하기 위해 복잡한 이해 또는 추론이 필요하지 않습니다.

지시 튜닝 단계

SALMONN 프레임워크에서 구현된 지시 튜닝 단계는 NLP 및 시각적 LLM 프레임워크에서와 같이 오디오 이벤트, 음악 작업 및 음성 이벤트의 목록을 사용하여 오디오-텍스트 지시를 미세 조정합니다. 작업은 다양한 테스트에 걸쳐서 중요도에 따라 우선순위가 지정되며, 전화 인식, 중첩 음성 인식 및 음악 캡션과 같은 작업이 포함됩니다. 또한, 오디오 데이터와 함께 짝 지어진 텍스트 정보는 지시 프롬프트를 생성하는 데 사용됩니다.

작업 과적합

첫 두 단계의 훈련만을 구현할 때, SALMONN 프레임워크는 지시 튜닝 작업에서 경쟁력 있는 결과를 반환합니다. 그러나 교차 모드 작업, 특히 교차 모드 공유 능력이 필요한 작업에서 성능은 표시되지 않습니다. 특히, 모델은 지시 프롬프트를 위반하여 관련이 없거나 잘못된 응답을 생성하는 경우가 있으며, 이는 SALMONN 프레임워크에서 작업 과적합이라고 합니다. 활성화 튜닝 단계는 이러한 과적합 문제를 해결하기 위해 구현됩니다.

활성화 튜닝 단계

과적합 문제를 해결하기 위한 효과적인 접근 방식은 내재된 조건부 언어 모델을 더 긴 및 다양한 응답으로 정규화하는 것입니다. 프레임워크는 이러한 작업에 대한 쌍으로 된 훈련 데이터를 생성하기 위해 텍스트와 함께 오디오 또는 음성 캡션을 짝 지어줍니다.

작업 사양

SALMONN의 제로샷 교차 모드 에머전트 능력을 평가하기 위해 개발자는 15개의 음성, 오디오 및 음악 작업을 세 가지 레벨로 나눴습니다.

레벨 1

첫 번째 레벨에서는 작업이 지시 튜닝에 사용되므로 SALMONN 프레임워크가 수행해야 하는 가장 쉬운 작업 세트입니다.

레벨 2

두 번째 레벨은 훈련되지 않은 작업으로 구성되며, 1단계 작업보다 복잡도가 더 높습니다. 2단계에서는 음성 키워드 추출, SQQA(Spoken Query-based Question Answering) 및 음성 기반 슬롯 채우기와 같은 음성 기반 자연어 처리 작업을 포함합니다.

레벨 3

세 번째 레벨의 작업은 다른 두 레벨보다 더 복잡하며, 음성 오디오 공유 및 오디오 기반 스토리텔링 작업을 포함합니다. 음성 오디오 공유 작업은 SALMONN 프레임워크가 오디오 클립에서 질문을 이해하고, 배경의 오디오 이벤트나 음악을 사용하여 지지하는 증거를 찾고, 질문에 대한 적절한 이유를 생성하도록 요구합니다. 오디오 기반 스토리텔링 작업은 모델이 일반적인 오디오 입력에서 의미 있는 이야기를 생성하도록 요구합니다.

결과

레벨 1 작업

다음 표는 레벨 1 작업의 결과를 보여줍니다. SALMONN 프레임워크는 활성화 튜닝과 함께 또는 없이 경쟁력 있는 결과를 반환합니다.

레벨 2 및 3 작업

SALMONN 프레임워크는 레벨 1 작업에서 경쟁력 있는 결과를 반환하지만, 활성화 튜닝 없이 레벨 2 및 3 작업에서 과적합으로 인해 성능이 저하됩니다. 특히, 모델은 지시를 따르지 못하며, 관련이 없거나 잘못된 응답을 생성합니다. 그러나 활성화 튜닝을 사용하면 결과가 크게 개선됩니다.

LoRA 스케일링 요인 할인

LoRA 스케일링 요인 할인은 작업에서 과적합 문제를 최소화하기 위해 LoRA 스케일링 요인을 할인하는 영향을 평가합니다. 다음 그림에서 볼 수 있듯이, LoRA 스케일링 요인을 2.0으로 할인하면 SALMONN 프레임워크의 교차 모드 추론 능력이 향상됩니다.

작업 과적합 평가

활성화 튜닝을 강조하기 위해 SALMONN 프레임워크는 세 가지 훈련 단계 동안의 퍼플렉서티의 변화를 분석합니다. 다음 그림에서 볼 수 있듯이, 퍼플렉서티의 변화는 모델의 교차 모드 정렬 학습을 나타냅니다.

활성화 튜닝

SALMONN 프레임워크는 다양한 활성화 방법을 탐구합니다. 이러한 방법에는 텍스트 기반 QA 작업에 대한 긴 답변 또는 오디오 기반 긴 글쓰기와 같은 작업이 포함됩니다. Q-Former 및 LoRA 구성 요소를 미세 조정하기 위해 이러한 세 가지 방법을 사용합니다.

최종 생각

이 기사에서는 SALMONN 또는 Speech Audio Language Music Open Neural Network에 대해 논의했습니다. SALMONN은 음성 및 오디오 인코더를 미리 훈련된 텍스트 기반 대규모 언어 모델과 결합하여 단일 오디오-텍스트 멀티모달 모델을 구축하는 최첨단 오픈 음성 오디오 언어 음악 신경망입니다. SALMONN 모델은 대규모 언어 모델이 일반적인 오디오 입력을 직접 이해하고 처리할 수 있도록 하여, 다양한 오디오 및 음성 작업에서 경쟁력 있는 성능을 발휘합니다.

SALMONN 프레임워크는 다양한 오디오 및 음성 작업에서 경쟁력 있는 성능을 발휘하며, 미학습 언어로의 번역과 같은 미훈련 이해 작업에 일반화합니다. SALMONN 프레임워크의 능력으로 인해, 이는 대규모 언어 모델의 일반적인 청각 능력을 향상시키는 다음 단계로 간주될 수 있습니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.