AI 모델 및 플랫폼
오픈AI, 장르별 음악 생성 가능한 새로운 AI 프로그램 개발
독립 연구 기관 오픈AI는 최근 새로운 형태의 생성적 AI인 주크박스(Jukebox)를 발표했습니다. 주크박스는 음악을 생성할 수 있는 능력으로 인해 이러한 이름이 붙여졌습니다. 주크박스 AI는 악기와 가사와 같은 속성에 따라 사운드를 생성할 수 있으며, 오픈AI 연구 팀은 압축된 오디오 클립과 다양한 가사 조각을 사용하여 이 AI를 훈련시켰습니다.
테크크런치에 따르면, 오픈AI 연구진은 원시 오디오 클립을 사용하여 모델을 훈련시켜 오디오를 생성할 수 있는 능력을 부여했습니다. 이는 다른 음악 생성 애플리케이션에서 사용되는 접근 방식과는 대조적입니다. 이러한 애플리케이션은 종종 “기호적 음악”을 사용합니다. 즉, 실제 오디오가 아닌 노트와 피치에 대한 정보만을 사용합니다. 연구 팀은 오디오를 압축하고 신경망이 해석할 수 있는 형식으로 인코딩하기 위해 합성곱 신경망을 사용했습니다. 이후 트랜스포머를 사용하여 압축된 오디오를 생성하고, 데이터를 오디오 형식으로 변환하기 위해 업샘플링을 수행했습니다.
주크박스를 생성할 때, 오픈AI는 오디오의 복잡하고 밀도 높은 특성을 다루는 방법을 개발해야 했습니다. 연구자들은 오디오의 연속적인 특성을 처리하기 위해 오디오를 1/128초 길이의 더 작은 섹션으로 나누었습니다. 목표는 노래를 충분히 큰 조각으로 나누어 문제가 해결 불가능해지지 않도록 하는 동시에, 모델이 노래의 패턴을 학습하고 재구성할 수 있을 만큼 충분히 작고 정교한 섹션을 생성하는 것이었습니다.
오픈AI가 사용한 기술은 이전에 회사에서 제작한 더 오래된 음악 생성 AI인 뮤즈넷(MuseNet)과 일부 공통점을 공유합니다. 뮤즈넷은 MIDI 파일에 훈련되어 다양한 스타일의 음악을 생성할 수 있었습니다. 그러나 그것은 노래의 전체 멜로디에만 집중했고 가사를 생성할 수 없었습니다. 반면에, 주크박스는 음악을 동반하는 가사를 작성할 수 있습니다. 가사는 오픈AI 연구진에 의해 “공동 작성”되며, 모델이 특정 스타일의 가사를 생성하도록 지시합니다. 주크박스 시스템은 120만 개의 노래에 대한 가사와 메타데이터로 구성된 텍스트를 사용하여 훈련되었습니다.
모델의 가사에 대해, 연구자들은最初에 가사를 노래의 길이와 비슷한 길이로 늘리는 단순한 휴리스틱을 사용했습니다. 이 접근 방식은 일반적으로 잘 작동했지만, 가사가 특히 빠를 때에는 잘 작동하지 않았습니다. 이를 해결하기 위해, 노래에서 보컬을 추출하여 가사와 일치시키고, 가사와 보컬이 비교적 정확하게 일치하도록 단어 수준의 정렬을 얻었습니다. 이후, 가사에 대한 인코딩 레이어와 음악의 섹션을 가사에 매핑하는 키-값 쌍을 사용하는 주의 레이어를 사용했습니다.
논문의 저자들은 또한 주크박스가 몇 가지 제한을 가지고 있으며, 향후 연구에서는 이러한 제한을 개선하기 위해 노력할 것이라고 언급합니다. 저자들은 다음과 같이 작성했습니다.
“주크박스는 음악의 품질, 일관성, 오디오 샘플의 길이, 아티스트, 장르, 가사에 대한 조건 지정 능력에서 발전을 나타내지만, 이러한 생성물과 인간이 생성한 음악 사이에는まだ 상당한 간격이 있습니다. 예를 들어, 생성된 노래는 지역적인 음악적 일관성을 보여주고, 전통적인 코드 패턴을 따르며,甚至 인상적인 솔로를 특징으로 할 수 있지만, 우리는 반복되는 코러스와 같은熟悉한 더 큰 음악적 구조를 듣지 못합니다.”
현재, 모델은 특정 장르 또는 특정 아티스트의 스타일로 인식되는 노래를 생성할 수 있습니다. 예를 들어, 엘비스 프레슬리, 케이티 페리, 또는 레이지 어게인스트 더 머신의 스타일로 노래를 생성할 수 있습니다. 이러한 노래는 장르 또는 아티스트의 스타일로 인식되지만, 또한 assez 거친 소리를 내며, 종종 패러디 또는 노래의 나쁨 버전으로 들릴 수 있습니다. 그러나 기술적인 성과는 인상적입니다. 연구진은 음악 생성 프로그램을 개발하기로 결정한 이유는 이 작업이 어려웠기 때문이며, 연구진은 기술을 계속 개선하기 위해 노력할 것입니다. 주크박스가 생성한 노래를 여기서 들을 수 있습니다.












