Góc nhìn Anderson
Nghiên cứu Trí tuệ Nhân tạo Dự kiến Các Điều khiển Âm lượng Riêng biệt cho Đối thoại, Âm nhạc và Hiệu ứng Âm thanh

Một nghiên cứu hợp tác mới do Mitsubishi dẫn đầu điều tra khả năng tách ba bản nhạc âm thanh riêng biệt từ một nguồn âm thanh gốc, phân chia bản nhạc âm thanh thành lời nói, âm nhạc và hiệu ứng âm thanh (tức là tiếng ồn xung quanh).
Vì đây là một khuôn khổ xử lý hậu kỳ, nó cung cấp tiềm năng cho các thế hệ nền tảng xem đa phương tiện sau này, bao gồm thiết bị tiêu dùng, để cung cấp các điều khiển âm lượng ba điểm, cho phép người dùng tăng âm lượng của lời nói hoặc giảm âm lượng của bản nhạc.
Trong đoạn clip ngắn dưới đây từ video kèm theo nghiên cứu (xem cuối bài viết để xem video đầy đủ), chúng ta thấy các khía cạnh khác nhau của bản nhạc âm thanh được nhấn mạnh khi người dùng kéo một điều khiển trên một hình tam giác với mỗi thành phần âm thanh ở một góc:
Một đoạn clip từ video kèm theo bài viết (xem phần nhúng ở cuối bài viết). Khi người dùng kéo con trỏ tới một trong các khía cạnh được tách ra trong giao diện người dùng tam giác (ở bên phải), âm thanh sẽ nhấn mạnh phần đó của bản nhạc âm thanh ba phần. Mặc dù video dài hơn trích dẫn một số ví dụ thêm trên YouTube, nhưng chúng dường như không có sẵn hiện tại. Nguồn: https://vimeo.com/634073402
Bài viết này có tiêu đề Vấn đề Đũa Cocktail: Tách Âm thanh Ba Phần cho Bản nhạc Âm thanh Thế giới Thực, và đến từ các nhà nghiên cứu tại Phòng thí nghiệm Nghiên cứu Điện tử Mitsubishi (MERL) ở Cambridge, MA, và Bộ phận Kỹ thuật Hệ thống Thông minh tại Đại học Indiana ở Illinois.
Tách Các Khía cạnh của Bản nhạc Âm thanh
Các nhà nghiên cứu đã đặt tên cho thách thức này là ‘Vấn đề Đũa Cocktail’ vì nó liên quan đến việc cô lập các yếu tố nghiêm ngặt của bản nhạc âm thanh, tạo ra một bản đồ giống như một đũa (xem hình ảnh dưới đây). Trong thực tế, các bản nhạc âm thanh đa kênh (tức là âm thanh nổi và hơn thế) có thể có các loại nội dung khác nhau, chẳng hạn như lời nói, âm nhạc và âm thanh xung quanh, đặc biệt là vì lời nói có xu hướng chiếm ưu thế kênh trung tâm trong các bản混 âm Dolby 5.1. Hiện tại, tuy nhiên, lĩnh vực nghiên cứu âm thanh tách đang tập trung vào việc thu thập những sợi dây này từ một bản nhạc âm thanh đơn và đã được trộn.

Đũa Cocktail – tách ba bản nhạc âm thanh riêng biệt từ một bản nhạc âm thanh hợp nhất và đơn. Nguồn: https://arxiv.org/pdf/2110.09958.pdf
Nghiên cứu gần đây đã tập trung vào việc tách lời nói trong các môi trường khác nhau, thường là để mục đích làm sạch âm thanh lời nói cho các hệ thống Xử lý Ngôn ngữ Tự nhiên (NLP) sau này, nhưng cũng về sự cô lập của các giọng hát trong các bản ghi âm, hoặc để tạo ra các phiên bản tổng hợp của các ca sĩ thực (thậm chí là đã qua đời), hoặc để tạo điều kiện cho sự cô lập âm nhạc theo phong cách Karaoke.
Một Tập dữ liệu cho Mỗi Khía cạnh
Cho đến nay, ít chú ý đã được dành để sử dụng công nghệ AI này để cung cấp cho người dùng nhiều quyền kiểm soát hơn đối với hỗn hợp âm thanh. Do đó, các nhà nghiên cứu đã chính thức hóa vấn đề và tạo ra một tập dữ liệu mới như một công cụ hỗ trợ cho nghiên cứu tiếp theo về tách âm thanh đa loại, cũng như kiểm tra nó trên các khuôn khổ tách âm thanh hiện có.
Tập dữ liệu mới mà các tác giả đã phát triển được gọi là Divide and Remaster (DnR), và được lấy từ các tập dữ liệu trước đó LibriSpeech, Free Music Archive và Freesound Dataset 50k (FSD50K). Đối với những người muốn làm việc với DnR từ đầu, tập dữ liệu phải được xây dựng lại từ ba nguồn; nếu không, nó sẽ sớm được cung cấp tại Zenodo, theo tuyên bố của các tác giả. Tuy nhiên, tại thời điểm viết, liên kết GitHub cho các tiện ích trích xuất nguồn không hoạt động, vì vậy những người quan tâm có thể phải chờ một thời gian.
Các nhà nghiên cứu đã phát hiện ra rằng kiến trúc CrossNet un-mix (XUMX) được đề xuất bởi Sony vào tháng 5 hoạt động đặc biệt tốt với DnR.

Kiến trúc âm thanh CrossNet của Sony.
Các tác giả tuyên bố rằng các mô hình trích xuất học máy của họ hoạt động tốt trên các bản nhạc âm thanh từ YouTube, mặc dù các đánh giá được trình bày trong bài viết dựa trên dữ liệu tổng hợp, và video hỗ trợ chính được cung cấp (được nhúng dưới đây) hiện là video duy nhất dường như có sẵn.
Ba tập dữ liệu được sử dụng mỗi tập hợp bao gồm một bộ sưu tập các loại đầu ra cần được tách ra từ một bản nhạc âm thanh: FSD50K bao gồm các hiệu ứng âm thanh, và có 50.000 tệp âm thanh mono 44,1 kHz được gắn thẻ với 200 nhãn lớp từ ontology AudioSet của Google; Free Music Archive bao gồm 100.000 bài hát stereo thuộc 161 thể loại âm nhạc, mặc dù các tác giả đã sử dụng một tập con chứa 25.000 bài hát, để phù hợp với FSD50K; và LibriSpeech cung cấp cho DnR 100 giờ mẫu âm thanh sách nói dưới dạng tệp âm thanh mp3 44,1kHz.
Công việc Tương lai
Các tác giả dự đoán sẽ có thêm công việc trên tập dữ liệu và sự kết hợp của các mô hình riêng biệt được phát triển cho nghiên cứu thêm về khuôn khổ nhận dạng giọng nói và phân loại âm thanh, bao gồm cả việc tạo tự động phụ đề cho lời nói và âm thanh không phải lời nói. Họ cũng dự định đánh giá các phương pháp remix có thể giảm thiểu các hiện tượng nhận thức, vẫn là vấn đề trung tâm khi chia một bản nhạc âm thanh hợp nhất thành các thành phần của nó.
Loại tách này có thể trong tương lai sẽ có sẵn như một hàng hóa tiêu dùng trong các TV thông minh tích hợp các mạng nơ-ron tối ưu hóa cao, mặc dù dường như các triển khai ban đầu sẽ cần một số thời gian xử lý trước và không gian lưu trữ. Samsung đã sử dụng các mạng nơ-ron cục bộ để nâng cấp, trong khi Bộ xử lý Nhận thức XR của Sony, được sử dụng trong dòng Bravia của công ty, phân tích và tái diễn giải các bản nhạc âm thanh theo thời gian thực thông qua AI tích hợp nhẹ.
Các cuộc gọi để kiểm soát hỗn hợp âm thanh tốt hơn được lặp lại định kỳ, và hầu hết các giải pháp được đề xuất phải đối mặt với thực tế là bản nhạc âm thanh đã được trộn lại theo các tiêu chuẩn và giả định hiện tại (và giả định về những gì người xem muốn) trong các ngành công nghiệp điện ảnh và truyền hình.
Một người xem, bực tức vì sự chênh lệch âm lượng giữa các yếu tố khác nhau của bản nhạc âm thanh, đã tuyệt vọng đến mức phát triển một bộ điều chỉnh âm lượng tự động dựa trên phần cứng có khả năng bằng âm lượng cho phim và TV.
Mặc dù TV thông minh cung cấp một phương pháp đa dạng để cố gắng tăng âm lượng lời nói so với âm lượng lớn cho âm nhạc, nhưng chúng đều đang đấu tranh chống lại các quyết định được đưa ra tại thời điểm trộn, và, có thể nói, tầm nhìn của các nhà sản xuất nội dung muốn khán giả trải nghiệm bản nhạc âm thanh của họ chính xác như chúng được thiết lập.
Những người sản xuất nội dung có vẻ như sẽ phản đối việc bổ sung này vào ‘văn hóa remix’, vì một số nhân vật nổi bật trong ngành đã lên tiếng không đồng ý với các thuật toán xử lý hậu kỳ TV dựa trên chuyển động mịn.
https://vimeo.com/634073402












