AI 모델 및 플랫폼
연구진, 중국어와 영어로 노래할 수 있는 AI 모델 개발
마이크로소프트와 자장 대학의 연구진은 최근 여러 언어로 노래할 수 있는 AI 모델을 개발했다. VentureBeat에 따르면, 연구진이 개발한 DeepSinger AI는 다양한 음악 웹사이트의 데이터를 사용하여 훈련되었으며, 알고리즘을 통해 가수의 목소리의 음색을 포착했다.
AI 가수가 노래하는 “목소리”를 생성하는 데에는 음고와 음의 길이를 예측하고 제어할 수 있는 알고리즘이 필요하다. 사람이 노래할 때는 단순한 말하는 것보다 훨씬 더 복잡한 리듬과 패턴을 생성한다. 연구진이 극복해야 할 또 다른 문제는 말하는 목소리 훈련 데이터가 충분히 उपलब하지만 노래하는 목소리 훈련 데이터 세트는 비교적 희박하다는 것이다. 이러한 문제를 음성과 가사 분석이 필요한 노래 생성 문제와 결합하면 노래 생성은 매우 복잡한 문제가 된다.
연구진이 개발한 DeepSinger 시스템은 이러한 문제를 해결하기 위해 오디오 데이터를 채굴하고 변환하는 데이터 파이프라인을 개발했다. 다양한 음악 웹사이트에서 노래 클립을 추출하고, 노래를 오디오의 나머지 부분에서 분리하고, 문장으로 나누었다. 다음 단계는 가사 내의 각 음소의 길이를 결정하여 가사 내의 각 음소를 나타내는 일련의 샘플을 생성하는 것이었다. 데이터를 정리하여 훈련 샘플이 왜곡되지 않도록 하고, 가사와 오디오 샘플을 신뢰도 점수에 따라 정렬했다.
同じ 방법이 다양한 언어에 효과적으로 작동하는 것으로 보인다. DeepSinger는 89명의 가수가 92시간 이상 노래하는 중국어, 광동어, 영어 보컬 샘플로 훈련되었다. 연구 결과에 따르면 DeepSinger 시스템은 정확성과 자연스러움과 같은 지표에 따라 높은 품질의 “노래” 샘플을 생성할 수 있었다. 연구진은 20명에게 DeepSinger와 훈련 노래를 평가하도록 요청했으며, 생성된 샘플과 실제 오디오 사이의 점수 차이는 매우 작았다. 참가자들은 DeepSinger에 대해 평균 0.34에서 0.76 사이의 점수를 주었다.
연구진은 향후 DeepSinger의 하위 모델을 공동으로 훈련하여 생성된 목소리의 품질을 개선하려고 한다. 이는 WaveNet과 같은 전문 기술의 도움으로 가능하다. 이러한 기술은 자연스러운 소리를 생성하기 위해 오디오 波形을 사용하도록 설계되었다.
DeepSinger 시스템은 가수와 다른 음악가들이 스튜디오에 다시 들어가서 녹음을 다시 할 필요 없이 작업을 수정할 수 있도록 도와줄 수 있다. 또한 가수가 실제로 노래하지 않은 노래를 생성하여 오디오 딥페이크를 만들 수 있다. 이는 패러디 또는 풍자에 사용될 수 있지만 법적 문제가 있을 수 있다.
DeepSinger는 음악과 오디오를 상호작용하는 새로운 방법을 제공하는 일련의 새로운 AI 기반 음악 및 오디오 시스템 중 하나이다. OpenAI는 최근 특정 장르 또는 특정 아티스트의 스타일로 원본 음악 트랙을 생성할 수 있는 자체 AI 시스템인 JukeBox를 출시했다. 다른 음악 AI 도구로는 Google의 Magenta와 Amazon의 DeepComposer (AMZN ) 가 있다. Magenta는 자동 드럼 백킹부터 단순한 음악 기반 비디오 게임까지 모든 것을 생성할 수 있는 오픈 소스 오디오(및 이미지) 조작 라이브러리이다. Amazon의 DeepComposer는 사용자가 사전 훈련된 샘플 모델을 가져와 모델을 사용자에게 맞게 조정할 수 있도록 설계되었다. 사용자는 사전 훈련된 샘플 모델을 가져와 모델을 사용자에게 맞게 조정할 수 있다.
(GOOGL )DeepSinger가 생성한 일부 오디오 샘플을 이 링크에서 들어볼 수 있다.












