Mô hình và nền tảng AI

Các nhà nghiên cứu tạo ra mô hình AI có thể hát bằng cả tiếng Trung và tiếng Anh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nhóm nghiên cứu từ Microsoft và Đại học Zhajiang đã tạo ra một mô hình AI có thể hát bằng nhiều ngôn ngữ. Theo VentureBeat báo cáo, mô hình AI DeepSinger được nhóm phát triển được đào tạo trên dữ liệu từ các trang web âm nhạc, sử dụng các thuật toán để bắt kịp âm sắc của giọng hát.

Tạo ra “giọng” của một ca sĩ AI đòi hỏi các thuật toán có thể dự đoán và kiểm soát cả cao độ và thời lượng của âm thanh. Khi mọi người hát, các tiếng ồn họ tạo ra có nhịp điệu và mẫu phức tạp hơn nhiều so với lời nói đơn giản. Một vấn đề khác mà nhóm phải vượt qua là trong khi có một lượng đáng kể dữ liệu đào tạo nói / nói, các tập dữ liệu đào tạo hát khá hiếm. Kết hợp những thách thức này với thực tế rằng các bài hát cần phải phân tích cả âm thanh và lời bài hát, và vấn đề tạo ra giọng hát trở nên cực kỳ phức tạp.

Hệ thống DeepSinger do các nhà nghiên cứu tạo ra đã vượt qua những thách thức này bằng cách phát triển một đường ống dữ liệu để khai thác và biến đổi dữ liệu âm thanh. Các đoạn hát được trích xuất từ các trang web âm nhạc, và sau đó giọng hát được phân lập từ phần còn lại của âm thanh và chia thành câu. Bước tiếp theo là xác định thời lượng của mỗi âm vị trong lời bài hát, kết quả là một loạt các mẫu mỗi mẫu đại diện cho một âm vị duy nhất trong lời bài hát. Việc làm sạch dữ liệu được thực hiện để xử lý các mẫu đào tạo bị méo mó sau khi lời bài hát và các mẫu âm thanh kèm theo được sắp xếp theo điểm số tín nhiệm.

Các phương pháp chính xác giống nhau dường như hoạt động cho nhiều ngôn ngữ. DeepSinger được đào tạo trên các mẫu giọng hát tiếng Trung, tiếng Quảng Đông và tiếng Anh từ 89 ca sĩ hát trong hơn 92 giờ. Kết quả của nghiên cứu cho thấy hệ thống DeepSinger có thể tạo ra các mẫu “hát” chất lượng cao theo các chỉ số như độ chính xác của cao độ và âm thanh tự nhiên. Các nhà nghiên cứu đã có 20 người đánh giá cả bài hát được tạo ra bởi DeepSinger và các bài hát đào tạo theo các chỉ số này và khoảng cách giữa các điểm số cho các mẫu được tạo ra và âm thanh thực sự rất nhỏ. Những người tham gia đã cho DeepSinger một điểm đánh giá ý kiến trung bình bị sai số từ 0,34 đến 0,76.

Trong tương lai, các nhà nghiên cứu muốn thử và cải thiện chất lượng của các giọng hát được tạo ra bằng cách đào tạo chung các mô hình con khác nhau mà DeepSinger bao gồm, được thực hiện với sự hỗ trợ của các công nghệ chuyên dụng như WaveNet được thiết kế đặc biệt cho nhiệm vụ tạo ra âm thanh tự nhiên thông qua sóng âm.

Hệ thống DeepSinger có thể được sử dụng để giúp các ca sĩ và nghệ sĩ âm nhạc khác sửa lỗi công việc mà không cần quay lại phòng thu cho một phiên ghi âm khác. Nó cũng có thể được sử dụng để tạo ra các bản giả mạo âm thanh sâu, làm cho nó có vẻ như một nghệ sĩ đã hát một bài hát mà họ không thực sự làm. Mặc dù nó có thể được sử dụng cho mục đích nhái hoặc hài kịch, nhưng nó cũng có tính hợp pháp đáng ngờ.

DeepSinger chỉ là một trong những làn sóng mới của các hệ thống âm nhạc và âm thanh dựa trên AI có thể biến đổi cách âm nhạc và phần mềm tương tác. OpenAI gần đây đã phát hành hệ thống AI của riêng họ, được gọi là JukeBox, có khả năng tạo ra các bản nhạc gốc theo phong cách của một thể loại nhất định hoặc thậm chí là một nghệ sĩ cụ thể. Các công cụ âm nhạc AI khác bao gồm Google’s Magenta (GOOGL )Amazon’s DeepComposer (AMZN ). Magenta là một thư viện xử lý âm thanh (và hình ảnh) mã nguồn mở có thể được sử dụng để tạo ra mọi thứ từ âm thanh trống tự động đến các trò chơi video âm nhạc đơn giản. Trong khi đó, Amazon’s DeepComposer nhắm vào những người muốn đào tạo và tùy chỉnh các mô hình học sâu dựa trên âm nhạc của riêng họ, cho phép người dùng lấy các mẫu mô hình đã được đào tạo trước và điều chỉnh các mô hình theo nhu cầu của họ.

Bạn có thể nghe một số mẫu âm thanh được tạo ra bởi DeepSinger tại đây.

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.