نماذج ومنصات الذكاء الاصطناعي

tạo ra chương trình AI mới để tạo nhạc dựa trên thể loại

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

Tổ chức nghiên cứu độc lập OpenAI gần đây đã phát hành một hình thức mới của AI tạo ra được gọi là Jukebox, được đặt tên như vậy vì khả năng tạo ra âm nhạc của nó. Jukebox AI có thể tạo ra âm thanh dựa trên các thuộc tính như nhạc cụ và thậm chí là lời bài hát, và nhóm nghiên cứu OpenAI đã tạo ra AI này bằng cách đào tạo nó trên các đoạn âm thanh nén và các đoạn lời bài hát khác nhau.

Như TechCrunch đã báo cáo, các nhà nghiên cứu OpenAI đã đào tạo mô hình bằng cách sử dụng các đoạn âm thanh thô, cho mô hình khả năng sản xuất âm thanh. Điều này khác với các phương pháp được sử dụng để tạo ra các ứng dụng tạo nhạc khác, thường dựa trên “âm nhạc biểu tượng” (như âm nhạc MIDI) mà không phải là âm thanh thực sự. Nhóm các nhà nghiên cứu đã sử dụng mạng nơ-ron tích chập để đào tạo mô hình, nén âm thanh và mã hóa nó thành định dạng mà mạng nơ-ron có thể giải thích. Sau đó, một bộ chuyển đổi được sử dụng để tạo ra âm thanh nén, sau đó được lấy mẫu để chuyển đổi dữ liệu thành định dạng âm thanh.

Khi tạo ra Jukebox, OpenAI phải tạo ra một phương pháp để đối phó với bản chất phức tạp, dày đặc của âm thanh. Các nhà nghiên cứu đã đối phó với bản chất liên tục của âm thanh bằng cách chia nó thành các phần rời rạc, dễ tiêu hóa hơn, chia các bài hát thành các phần nhỏ có độ dài 1/128 giây. Mục tiêu là tạo ra một mô hình AI có khả năng chia nhỏ các bài hát thành các phần đủ lớn để vấn đề không trở nên không thể giải quyết, nhưng đủ nhỏ và chính xác để các mô hình có thể học được mẫu của một bài hát và tái tạo mẫu đó.

Phương pháp được sử dụng bởi OpenAI chia sẻ một số điểm tương đồng với một AI tạo nhạc cũ hơn mà công ty đã sản xuất, được gọi là MuseNet. MuseNet được đào tạo trên các tệp MIDI và có khả năng tạo ra âm nhạc trong nhiều phong cách khác nhau, mặc dù nó tập trung vào giai điệu tổng thể của một bài hát và không thể tạo ra lời bài hát. Ngược lại, Jukebox có thể viết lời bài hát của riêng nó để đi cùng với âm nhạc. Lời bài hát được “đồng viết” bởi các nhà nghiên cứu OpenAI, hướng dẫn mô hình tạo ra lời bài hát trong các phong cách nhất định. Hệ thống Jukebox được đào tạo trên lời bài hát được thu thập từ LyricWiki, với dữ liệu đào tạo bao gồm văn bản và siêu dữ liệu trên 1,2 triệu bài hát.

Khi nói đến lời bài hát của mô hình, các nhà nghiên cứu đầu tiên đã thử sử dụng một thuật toán đơn giản mà kéo dài lời bài hát đến khoảng thời lượng của một bài hát, phân tích văn bản tương ứng với một phần cụ thể của bài hát. Phương pháp đơn giản này hoạt động tốt nói chung, mặc dù các nhà nghiên cứu đã tìm thấy rằng khi lời bài hát đặc biệt nhanh, nó sẽ bị hỏng. Để giải quyết vấn đề này, các giọng nói đã được trích xuất từ bài hát và căn chỉnh với lời bài hát để có được sự căn chỉnh từ mức độ từ. Sau đó, một lớp mã hóa được sử dụng cho lời bài hát cùng với một lớp chú ý mà ánh xạ các phần của âm nhạc sang lời bài hát bằng cách sử dụng các cặp khóa-giá trị. Kết quả là lời bài hát và giọng nói có sự trùng khớp khá chính xác.

Các tác giả của bài báo cũng lưu ý rằng có một số hạn chế mà Jukebox có, và rằng công việc trong tương lai sẽ nhằm cải thiện khả năng của AI. Như các tác giả viết trong một bài đăng trên blog :

“Mặc dù Jukebox đại diện cho một bước tiến trong chất lượng âm nhạc, tính nhất quán, độ dài của mẫu âm thanh và khả năng điều kiện trên nghệ sĩ, thể loại và lời bài hát, nhưng vẫn còn một khoảng cách đáng kể giữa các thế hệ này và âm nhạc do con người tạo ra. Ví dụ, trong khi các bài hát được tạo ra cho thấy sự nhất quán âm nhạc cục bộ, tuân theo các mẫu hợp âm truyền thống và thậm chí có thể có các phần độc tấu ấn tượng, chúng tôi không nghe thấy các cấu trúc âm nhạc lớn hơn như các đoạn副歌 lặp lại.”

Hiện tại, mô hình có khả năng sản xuất một bài hát có thể nhận ra được trong phong cách của một thể loại cụ thể hoặc thậm chí là một nghệ sĩ cụ thể. Ví dụ, nó có thể sản xuất các bài hát theo phong cách của Elvis Presley, Katy Perry hoặc Rage Against the Machine. Mặc dù các bài hát có thể nhận ra được trong một thể loại hoặc có chủ đề xung quanh phong cách của một ca sĩ, nhưng chúng cũng khá thô, thường nghe như một bản nhái hoặc một phiên bản kém của một bài hát. Tuy nhiên, thành tựu kỹ thuật là ấn tượng. Các nhà nghiên cứu chịu trách nhiệm tạo ra hệ thống tạo ra AI đã chọn làm việc trên một chương trình có khả năng tạo ra âm nhạc cụ thể vì nhiệm vụ này khó khăn, và các nhà nghiên cứu dự định sẽ tiếp tục tinh chỉnh các kỹ thuật của họ. Bạn có thể nghe một số bài hát tại đây.

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.