AI 모델 및 플랫폼

텍스트에서 음악으로 생성되는 AI: Stability Audio, Google의 MusicLM 및 기타

mm
Unite.AI를 Google의 선호 소스에 추가

음악은 인간의 영혼과 공鳴하는 예술 형식으로 우리 모두의 상수였습니다. 인공지능을 사용하여 음악을 생성하는 것은 수십 년 전부터 시작되었습니다. 초기 시도는 간단하고 직관적이었으며 기본 알고리즘이 단조로운 멜로디를 생성했습니다. 그러나 기술이 발전함에 따라 AI 음악 생성기의 복잡성과 능력도 발전하여 딥 러닝과 자연어 처리(NLP)가 이 기술에서 핵심적인 역할을 하게 되었습니다.

오늘날 Spotify와 같은 플랫폼은 사용자의 청취 경험을 세분화하기 위해 AI를 활용하고 있습니다. 이러한 딥 러닝 알고리즘은 다양한 음악 요소(템포, 분위기 등) 기반의 개인별 선호도를 분석하여 개인화된 노래 제안을 제공합니다. 또한 인터넷에서 노래 관련 토론을 분석하여 자세한 노래 프로필을 생성합니다.

음악에서 AI의 기원: 알고리즘 구성에서 생성 모델링까지의 여정

음악 세계에서 AI가 혼합되는 초기 단계(1950년대~1970년대)는 주로 알고리즘 구성에 집중되었습니다. 이는 컴퓨터가 정의된 규칙 집합을 사용하여 음악을 생성하는 방법이었습니다. 이 기간 동안 가장 주목할 만한 작품은 1957年の Illiac Suite for String Quartet입니다. 이는 몬테 카를로 알고리즘을 사용하여 음고와 리듬을 전통적인 음악 이론과 통계적 확률성의 범위 내에서 결정했습니다.

Midjourney를 사용하여 생성된 이미지

Midjourney를 사용하여 생성된 이미지

이 기간 동안 또 다른 선구자 Iannis Xenakis는 확률적 과정, 즉 랜덤 확률 분포 개념을 사용하여 음악을 생성했습니다. 그는 컴퓨터와 FORTRAN 언어를 사용하여 여러 확률 함수를 연결하여 다양한 그래픽 표현이 서로 다른 사운드 공간에 해당하는 패턴을 생성했습니다.

텍스트를 음악으로 번역하는 복잡성

음악은 멜로디, 하모니, 리듬, 템포 등 다양한 요소를 포함하는 다차원 데이터 형식으로 저장되므로 텍스트를 음악으로 번역하는 작업은 매우 복잡합니다. 표준 노래는 컴퓨터에서 거의 100만 개의 숫자로 표현되며, 이는 이미지, 텍스트 등 다른 데이터 형식보다 훨씬 높은 숫자입니다.

오디오 생성 분야는 현실적인 사운드 생성을 위해 혁신적인 접근 방식을 보이고 있습니다. 한 방법은 스펙트로그램을 생성한 다음 이를 오디오로 다시 변환하는 것입니다.

또 다른 전략은 음악의 상징적 표현, 즉 악보와 같은 것을 사용합니다. 이는 음악가를 통해 해석되고 연주될 수 있습니다. 이 방법은 Magenta의 Chamber Ensemble Generator와 같은 도구를 통해 디지털화되어 MIDI 형식의 음악을 생성합니다. 이는 컴퓨터와 음악 기기 간의 통신을 위한 프로토콜입니다.

이러한 접근 방식은 이 분야를 발전시켰지만, 각자 제한점을 가지고 있습니다. 이는 오디오 생성의 복잡성을 강조합니다.

Transformer 기반의 자율 회귀 모델과 U-Net 기반의 확산 모델은 오디오, 텍스트, 음악 등을 생성하는 데 상태 오프 더 아트(SOTA) 결과를 제공하는 기술의 최전선에 있습니다. OpenAI의 GPT 시리즈와 대부분의 다른 대규모 언어 모델(LLM)은 트랜스포머를 사용하여 인코더, 디코더 또는 둘 다의 아키텍처를 활용합니다. 이미지/아트 측면에서는 MidJourney, Stability AI, DALL-E 2가 모두 확산 프레임워크를 활용합니다. 이러한 두 가지 핵심 기술은 오디오 부문에서도 최적의 결과를 달성하는 데 핵심이 되었습니다. 이 기사에서는 Google의 MusicLM과 Stable Audio를 포함한 이러한 기술의 놀라운 능력을 살펴보겠습니다.

Google의 MusicLM

Google의 MusicLM은今年 5월에 출시되었습니다. MusicLM은 텍스트에 기술된 정서와 정확히 공鳴하는 고화질 음악을 생성할 수 있습니다. 계층적 시퀀스-시퀀스 모델링을 사용하여 MusicLM은 텍스트 설명을 음악으로 변환하는 기능을 가지며, 24 kHz에서 확장된 기간 동안 공鳴할 수 있습니다.

이 모델은 단순히 텍스트 입력에만 국한되지 않고 멜로디에도 조건을 둘 수 있습니다. 즉, 휘파람이나 흥얼거리는 멜로디를 텍스트 설명에서 기술된 스타일로 변환할 수 있습니다.

기술적 통찰

MusicLM은 2022년에 도입된 AudioLM 프레임워크의 원리를 활용합니다. AudioLM은 이산 표현 공간 내에서 오디오 생성을 언어 모델링 작업으로 합성하며, 이는 계층적 음성 이산 단위(또는 토큰)를 사용하여 높은忠実도와 장기간 동안 일관성을 보장합니다.

생성 과정을 용이하게 하기 위해 MusicLM은 AudioLM의 능력을 확장하여 텍스트 조건을 통합합니다. 이는 텍스트 설명과 음악을 가까운 임베딩 공간에 투영하여 훈련 중에 캡션의 필요성을 제거하는 MuLan, 공동 음악-텍스트 모델을 사용합니다. 이 전략을 통해 모델은 대규모 오디오 전용 코퍼스에서 훈련할 수 있습니다.

MusicLM 모델은 또한 SoundStream을 오디오 토큰화기로 사용합니다. 이는 24 kHz 음악을 6 kbps에서 인상적인忠実도로 재구성할 수 있으며, 효율적이고 고품질 오디오 압축을 위해 잔차 벡터 양자화(RVQ)를 활용합니다.

MusicLM의 독립적 인 전처리 과정에 대한 일러스트레이션

MusicLM의 전처리 과정: SoundStream, w2v-BERT, MuLan | 이미지 출처: 여기

또한 MusicLM은 멜로디 조건을 허용하여 확장합니다. 이 접근 방식은 심지어 단순한 흥얼거림이 텍스트 스타일 설명에 맞게 세부적으로 조정된 훌륭한 청취 경험의基础를 제공할 수 있습니다.

MusicLM 개발자는 또한 5.5k개의 음악-텍스트 쌍으로 구성된 데이터 세트인 MusicCaps를 오픈 소스로 제공했습니다. 각 쌍은 인간 전문가가 제작한 풍부한 텍스트 설명을 포함합니다. Hugging Face의 MusicCaps를 확인하십시오.

Google의 MusicLM을 사용하여 AI 사운드트랙을 생성하려면 어떻게 시작해야 합니까?

  1. 공식 MusicLM 웹사이트를 방문하고 “시작하기”를 클릭합니다.
  2. 대기열에 가입하기 위해 “등록하기”를 선택합니다.
  3. Google (GOOGL ) 계정으로 로그인합니다.
  4. 접근 권한이 허가되면 “시도하기”를 클릭하여 시작합니다.

아래는 제가 MusicLM과 함께 실험한 몇 가지 예시 프롬프트입니다.

“명상곡, 차분하고 편안한 플루트와 기타로 구성된 음악. 음악은 느리며 평화와宁靜의 감정을 창조하는 데 중점을 둡니다.”

“재즈, 색소폰”

이전의 최적 모델인 Riffusion 및 Mubert와의 질적 평가에서 MusicLM이 더 선호되었습니다. 참가자들은 10초 오디오 클립에 대한 텍스트 캡션의 호환성을 더 긍정적으로 평가했습니다.

MusicLM 성능 비교

MusicLM 성능 비교, 이미지 출처: 여기

안정성 오디오

Stability AI는 최근 “안정성 오디오“를 발표했습니다. 이는 텍스트 메타데이터, 오디오 파일 기간 및 시작 시간을 조건으로 하는 잠재 확산 모델 아키텍처입니다. Google의 MusicLM과 마찬가지로 이 접근 방식은 생성된 오디오의 내용과 길이를 제어할 수 있습니다. 훈련 창 크기까지 지정된 길이의 오디오 클립을 생성할 수 있습니다.

기술적 통찰

안정성 오디오는 가변형 오토인코더(VAE)와 조건부 확산 모델을 포함하는 여러 구성 요소로 구성됩니다. 이는 텍스트 인코더와 함께 작동합니다.

VAE, 텍스트 인코더 및 U-Net 기반 조건부 확산 모델의 통합을 보여주는 일러스트레이션

안정성 오디오 아키텍처, 이미지 출처: 여기

VAE는 원시 오디오 샘플을 다루지 않고도 더 빠른 생성과 훈련을 가능하게 하며, 이는 오디오를 데이터 압축, 노이즈 저항 및 가역적 손실 이산 표현으로 압축합니다.

텍스트 인코더는 CLAP 모델에서 파생된 것으로, 이는 CLAP 모델에서 가져온 것입니다. 이는 토큰화된 입력 텍스트의 세부적인 관계를 이해하는 데 핵심적인 역할을 하며, 이는 텍스트 특징을 제공합니다. 이는 텍스트 인코더의 마지막 계층에서 가져온 특징을 통해 달성되며, 이는 확산 U-Net으로 크로스 어텐션 계층을 통해 통합됩니다.

또한 타이밍 임베딩을 통합하는 것이 중요합니다. 이는 오디오 청크의 시작 시간과 원본 오디오 파일의 총 기간에 기반하여 계산됩니다. 이러한 값은 초당 이산 학습 임베딩으로 변환되어 프롬프트 토큰과 함께 U-Net의 크로스 어텐션 계층으로 공급되어 사용자가 출력 오디오의 전체 길이를 지시할 수 있도록 합니다.

안정성 오디오 모델은 AudioSparx와의 협력을 통해 80만 개 이상의 오디오 파일로 구성된 광범위한 데이터 세트를 사용하여 훈련되었습니다.

안정성 오디오 상업용

안정성 오디오 상업용

안정성 오디오는 무료 버전을 제공하며, 이는 월 20초 트랙 20개까지 생성할 수 있습니다. 또한 월 $12의 Pro 플랜을 제공하며, 이는 월 90초 트랙 500개까지 생성할 수 있습니다.

아래는 제가 안정성 오디오를 사용하여 생성한 오디오 클립입니다.

Midjourney를 사용하여 생성된 이미지

Midjourney를 사용하여 생성된 이미지

“시네마틱, 사운드트랙, 부드러운 비, 앰비언트, 평온한, 멀리서 짖는 개 소리, 차분한 잎 소리, 미묘한 바람, 40 BPM”

 

이러한 세련된 오디오 조각의 응용 분야는 무궁무진합니다. 영화 감독은 이러한 기술을 사용하여 풍부하고 몰입감 있는 사운드 스케이프를 생성할 수 있습니다. 상업 분야에서는 광고주가 이러한 맞춤형 오디오 트랙을 활용할 수 있습니다. 또한 이 도구는 개인 창작자와 예술가에게 무한한 가능성의 캔버스를 제공하여 이야기, 감정 및 분위기를 창조할 수 있습니다.

프롬프트 팁

텍스트 프롬프트를 사용하여 완벽한 오디오를 생성하는 방법:

  1. 상세히: 장르, 분위기, 악기를 지정하십시오. 예: 시네마틱, 와일드 웨스트, 퍼커션, 긴장감, 대기
  2. 분위기 설정: 음악적 및 감정적 용어를 결합하여 원하는 분위기를 전달하십시오.
  3. 악기 선택: 악기 이름에 형용사를 추가하십시오. 예: “반향되는 기타” 또는 “강력한 합창”
  4. BPM: 장르와 일치하는 템포를 설정하여 조화로운 출력을 생성하십시오. 예: 드럼과 베이스 트랙의 경우 170 BPM

종료 메모

Midjourney를 사용하여 생성된 이미지

Midjourney를 사용하여 생성된 이미지

이 기사에서는 알고리즘 구성에서부터 오늘날의 고급 생성 AI 프레임워크인 Google의 MusicLM과 Stability Audio까지 AI 생성 음악/오디오에 대해 살펴보았습니다. 이러한 기술은 딥 러닝과 최적의 압축 모델을 활용하여 음악 생성을 향상시키고 청취자 경험을 세분화합니다.

그러나 이는 끊임없이 진화하는 분야이며, 장기간의 일관성을 유지하는 것과 같은 장애물과 AI로 제작된 음악의 진정성에 대한 논쟁이 이 분야의 선구자들에게 도전을 제기합니다. 방금 전, AI로 제작된 노래가 드레이크와 위켄드의 스타일을 모방하여 온라인에서 초기에 화제가 된 후 그래미 후보에서 제외되었습니다. 이는 음악 산업에서 AI 생성 음악의 합법성에 대한 논쟁을 보여줍니다(출처). AI는 음악과 청취자 사이의 간격을 메우면서 기술과 예술이 공존하는 생태계를 촉진하며, 혁신을 촉진하고 전통을尊重합니다.

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.