Mô hình và nền tảng AI
Tổ Chức Nghiên Cứu Độc Lập OpenAI Tạo Ra Chương Trình AI Mới Để Tạo Nhạc Dựa Trên Thể Loại
Tổ chức nghiên cứu độc lập OpenAI vừa mới phát hành một hình thức mới của trí tuệ nhân tạo tạo ra được gọi là Jukebox, được đặt tên như vậy vì khả năng tạo ra nhạc của nó. Trí tuệ nhân tạo Jukebox có thể tạo ra âm thanh dựa trên các thuộc tính như nhạc cụ và thậm chí lời bài hát, và đội nghiên cứu OpenAI đã tạo ra trí tuệ nhân tạo này bằng cách đào tạo nó trên các đoạn âm thanh nén và các đoạn lời bài hát khác nhau.
Como TechCrunch đã báo cáo, các nhà nghiên cứu OpenAI đã đào tạo mô hình bằng cách sử dụng các đoạn âm thanh thô, cho mô hình khả năng sản xuất âm thanh. Điều này khác với các phương pháp được sử dụng để tạo ra các ứng dụng tạo nhạc khác, thường dựa trên “nhạc biểu tượng” (như nhạc MIDI) mà là thông tin về nốt và cao độ nhưng không phải âm thanh thực sự. Đội ngũ nhà nghiên cứu đã sử dụng mạng nơ-ron tích chập để đào tạo mô hình, nén âm thanh và mã hóa nó thành định dạng mà mạng nơ-ron có thể giải thích. Sau đó, một bộ chuyển đổi được sử dụng để tạo ra âm thanh nén, sau đó được lấy mẫu để chuyển đổi dữ liệu thành định dạng âm thanh.
Khi tạo ra Jukebox, OpenAI đã phải tạo ra một phương pháp để đối phó với bản chất phức tạp, dày đặc của âm thanh. Các nhà nghiên cứu đã giải quyết tính liên tục của âm thanh bằng cách chia nó thành các phần rời rạc, dễ tiêu hóa hơn, chia các bài hát thành các phần nhỏ có độ dài 1/128 giây. Mục tiêu là tạo ra một mô hình trí tuệ nhân tạo có thể chia nhỏ các bài hát thành các phần đủ lớn để vấn đề không trở nên không thể giải quyết, nhưng đủ nhỏ và chính xác để mô hình có thể học được mẫu của một bài hát và tái tạo mẫu đó.
Phương pháp được sử dụng bởi OpenAI có một số điểm tương đồng với một trí tuệ nhân tạo tạo nhạc cũ hơn mà công ty đã sản xuất, gọi là MuseNet. MuseNet được đào tạo trên các tệp MIDI và có thể tạo ra nhạc trong nhiều phong cách khác nhau, mặc dù nó tập trung vào giai điệu tổng thể của một bài hát và không thể tạo ra lời bài hát. Ngược lại, Jukebox có thể viết lời bài hát của riêng nó để đi kèm với nhạc. Lời bài hát được “viết chung” bởi các nhà nghiên cứu OpenAI, hướng dẫn mô hình tạo ra lời bài hát trong các phong cách nhất định. Hệ thống Jukebox được đào tạo trên lời bài hát được thu thập từ LyricWiki, với dữ liệu đào tạo bao gồm văn bản và siêu dữ liệu trên 1,2 triệu bài hát.
Khi nói đến lời bài hát của mô hình, các nhà nghiên cứu đầu tiên đã thử sử dụng một thuật toán đơn giản mà kéo dài lời bài hát đến khoảng thời lượng của một bài hát, phân tích văn bản tương ứng với một phần cụ thể của bài hát. Phương pháp đơn giản này hoạt động tốt nói chung, mặc dù các nhà nghiên cứu đã phát hiện ra rằng khi lời bài hát đặc biệt nhanh, nó bị hỏng. Để giải quyết vấn đề này, các giọng hát đã được trích xuất từ bài hát và căn chỉnh với văn bản lời bài hát để có được sự căn chỉnh cấp từ cho lời bài hát. Sau đó, một lớp mã hóa được sử dụng cho lời bài hát cùng với một lớp chú ý mà ánh xạ các phần của nhạc đến lời bài hát bằng cách sử dụng các cặp khóa-giá trị. Kết quả là lời bài hát và giọng hát có một sự trùng khớp khá chính xác.
Các tác giả của bài báo cũng lưu ý rằng có một số hạn chế mà Jukebox có, và rằng công việc trong tương lai sẽ nhằm cải thiện khả năng của trí tuệ nhân tạo. Như các tác giả viết trong một bài đăng trên blog:
“Mặc dù Jukebox đại diện cho một bước tiến trong chất lượng âm nhạc, tính nhất quán, độ dài của mẫu âm thanh và khả năng điều kiện trên nghệ sĩ, thể loại và lời bài hát, vẫn còn một khoảng cách đáng kể giữa các thế hệ này và âm nhạc do con người tạo ra. Ví dụ, trong khi các bài hát được tạo ra cho thấy sự nhất quán âm nhạc địa phương, tuân theo các mẫu hợp âm truyền thống và thậm chí có thể có các phần độc tấu ấn tượng, chúng tôi không nghe thấy các cấu trúc âm nhạc lớn hơn như các đoạn副 lời bài hát lặp lại.”
Hiện tại, mô hình có thể tạo ra một bài hát có thể nhận ra được trong phong cách của một thể loại cụ thể hoặc thậm chí một nghệ sĩ cụ thể. Ví dụ, nó có thể tạo ra các bài hát theo phong cách của Elvis Presley, Katy Perry hoặc Rage Against the Machine. Mặc dù các bài hát có thể nhận ra được trong một thể loại hoặc có chủ đề xung quanh phong cách của một ca sĩ, chúng cũng khá thô, thường nghe giống như một bản nhái hoặc một phiên bản cover kém của một bài hát. Tuy nhiên, thành tựu kỹ thuật là ấn tượng. Các nhà nghiên cứu chịu trách nhiệm tạo ra hệ thống tạo ra trí tuệ nhân tạo đã chọn làm việc trên một chương trình có khả năng tạo ra nhạc cụ thể vì nhiệm vụ này khó khăn, và các nhà nghiên cứu dự định sẽ tiếp tục tinh chỉnh các kỹ thuật của họ. Bạn có thể nghe một số bài hát tại đây.












