Mô hình và nền tảng AI

Các nhà nghiên cứu phát triển ‘Audeo’ AI có khả năng chơi piano

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nhóm các nhà nghiên cứu tại Đại học Washington đã phát triển một hệ thống trí tuệ nhân tạo (AI) gọi là Audeo có thể tạo ra âm thanh từ các buổi biểu diễn piano im lặng. Giai đoạn thử nghiệm liên quan đến các ứng dụng nhận dạng âm nhạc như SoundHound, có thể nhận dạng chính xác âm nhạc từ Audeo khoảng 86% thời gian. 

Nghiên cứu được trình bày tại hội nghị NeurlPS 2020 vào ngày 8 tháng 12.

Tác giả chính Eli Shlizerman là giáo sư trợ lý tại các bộ phận toán học ứng dụng và kỹ thuật điện và máy tính tại trường đại học.

“Để tạo ra âm nhạc nghe giống như nó có thể được chơi trong một buổi biểu diễn âm nhạc trước đây được cho là không thể,” Shlizerman nói. “Một thuật toán cần phải tìm ra các tín hiệu, hoặc ‘tính năng,’ trong các khung hình video liên quan đến việc tạo ra âm nhạc, và nó cần phải ‘tưởng tượng’ âm thanh đang xảy ra giữa các khung hình video. Nó đòi hỏi một hệ thống vừa chính xác vừa富 có trí tưởng tượng. Việc chúng tôi đạt được âm nhạc nghe khá tốt là một bất ngờ.”

Làm thế nào Audeo hoạt động

Hệ thống Audeo hoạt động bằng cách giải mã một video và dịch nó thành âm nhạc. Bước đầu tiên trong số nhiều bước là AI phát hiện các phím được nhấn trong mỗi khung hình video, và nó cuối cùng phát triển một sơ đồ. Sơ đồ sau đó được dịch để một bộ tổng hợp âm nhạc có thể nhận ra âm thanh.

Bước tiếp theo là để dữ liệu được làm sạch và thêm thông tin bổ sung. Thông tin này có thể bao gồm các thứ như áp lực đằng sau mỗi lần nhấn phím và thời gian nó kéo dài.

“Nếu chúng tôi cố gắng tổng hợp âm nhạc từ bước đầu tiên alone, chúng tôi sẽ tìm thấy chất lượng của âm nhạc là không hài lòng,” Shlizerman nói. “Bước thứ hai giống như một giáo viên xem xét âm nhạc của một nhà soạn nhạc học sinh và giúp cải thiện nó.”

Hệ thống được đào tạo và thử nghiệm với các video trên YouTube của pianist Paul Barton, và nó bao gồm khoảng 172.000 khung hình video của nhạc sĩ chơi các nhà soạn nhạc cổ điển như Mozart. Audeo được thử nghiệm với 19.000 khung hình của Barton chơi các bản nhạc khác nhau. 

Bộ tổng hợp

Sau khi được đào tạo, Audeo tạo ra một bản ghi âm nhạc, sau đó được đưa vào một bộ tổng hợp để dịch nó thành âm thanh. Âm nhạc nghe khác nhau tùy thuộc vào mỗi bộ tổng hợp, tương đương với việc thay đổi cài đặt nhạc cụ trên một bàn phím điện.

Hai bộ tổng hợp riêng biệt được sử dụng bởi nhóm.

“Fluidsynth tạo ra âm thanh piano tổng hợp mà chúng tôi quen thuộc. Những âm thanh này có phần cơ học nhưng khá chính xác,” Shlizerman nói. “Chúng tôi cũng sử dụng PerfNet, một bộ tổng hợp AI mới tạo ra âm nhạc phong phú và富 có biểu cảm hơn. Nhưng nó cũng tạo ra nhiều tiếng ồn hơn.”

“Mục tiêu của nghiên cứu này là để xem liệu trí tuệ nhân tạo có thể tạo ra âm nhạc được chơi bởi một pianist trong một bản ghi video – mặc dù chúng tôi không nhằm mục đích sao chép Paul Barton vì anh ấy là một nghệ sĩ piano tài năng,” Shlizerman tiếp tục. “Chúng tôi hy vọng rằng nghiên cứu của chúng tôi cho phép các cách tương tác mới với âm nhạc. Ví dụ, một ứng dụng tương lai là Audeo có thể được mở rộng thành một piano ảo với một máy quay ghi lại chỉ tay của một người. Ngoài ra, bằng cách đặt một máy quay trên đỉnh của một piano thực, Audeo có thể giúp đỡ trong các cách mới để dạy học sinh cách chơi.”

Kung Su và Ziulong Liu, các nghiên cứu sinh tiến sĩ về kỹ thuật điện và máy tính, là các đồng tác giả của bài báo.

Alex dẫn dắt hoạt động tin tức của Unite.AI, được hỗ trợ bởi AI, kết hợp báo chí, nghiên cứu và tự động hoá để hỗ trợ việc đưa tin về trí tuệ nhân tạo một cách kịp thời và mở rộng. Công việc của anh giúp đảm bảo các phát triển AI mới được đưa ra một cách hiệu quả đồng thời duy trì tiêu chuẩn biên tập của tờ báo.