Mô hình và nền tảng AI
Làm thế nào AI giải quyết vấn đề ‘Cocktail Party’ và tác động của nó đối với công nghệ âm thanh tương lai
Hãy tưởng tượng bạn đang ở một sự kiện đông đúc, xung quanh là tiếng nói và tiếng ồn nền, nhưng bạn vẫn có thể tập trung vào cuộc trò chuyện với người đứng ngay trước mặt. Khả năng phân biệt một âm thanh cụ thể trong nền ồn ào được gọi là vấn đề ‘Cocktail Party’, một thuật ngữ được nhà khoa học người Anh Colin Cherry đặt ra vào năm 1958 để mô tả khả năng đáng kinh ngạc của não bộ con người. Các chuyên gia AI đã cố gắng mô phỏng khả năng này của con người với máy móc trong nhiều thập kỷ, nhưng nó vẫn là một nhiệm vụ đầy thách thức. Tuy nhiên, những tiến bộ gần đây trong trí tuệ nhân tạo đang phá vỡ những rào cản, mang lại những giải pháp hiệu quả cho vấn đề này. Điều này đã tạo ra một bước ngoặt quan trọng trong công nghệ âm thanh. Trong bài viết này, chúng ta sẽ khám phá cách AI đang phát triển trong việc giải quyết vấn đề ‘Cocktail Party’ và tiềm năng của nó đối với công nghệ âm thanh tương lai. Trước khi tìm hiểu cách AI giải quyết vấn đề này, chúng ta cần hiểu cách con người giải quyết nó.
Cách con người giải quyết vấn đề ‘Cocktail Party’
Con người có một hệ thống thính giác độc đáo giúp chúng ta điều hướng trong môi trường ồn ào. Não bộ của chúng ta xử lý âm thanh theo cách binaural, nghĩa là chúng ta sử dụng đầu vào từ cả hai tai để phát hiện sự khác biệt nhỏ về thời gian và âm lượng, giúp chúng ta phát hiện vị trí của âm thanh. Khả năng này cho phép chúng ta định hướng đến giọng nói mà chúng ta muốn nghe, ngay cả khi các âm thanh khác cạnh tranh để thu hút sự chú ý.
Ngoài khả năng nghe, các kỹ năng nhận thức của chúng ta còn giúp tăng cường quá trình này. Sự chú ý có chọn lọc giúp chúng ta lọc ra các âm thanh không liên quan, cho phép chúng ta tập trung vào thông tin quan trọng. Trong khi đó, ngữ cảnh, ký ức và các tín hiệu trực quan như đọc môi giúp phân biệt giọng nói với tiếng ồn nền. Hệ thống cảm giác và nhận thức phức tạp này rất hiệu quả, nhưng việc sao chép nó vào trí tuệ máy móc vẫn còn là một thách thức.
Tại sao vấn đề này vẫn còn thách thức đối với AI?
Từ các trợ lý ảo nhận ra lệnh của chúng ta trong một quán cà phê đông đúc đến các thiết bị trợ thính giúp người dùng tập trung vào một cuộc trò chuyện, các nhà nghiên cứu AI đã liên tục cố gắng mô phỏng khả năng của não bộ con người để giải quyết vấn đề ‘Cocktail Party’. Việc này đã dẫn đến sự phát triển của các kỹ thuật như tách nguồn tín hiệu mù (BSS) và phân tích thành phần độc lập (ICA), được thiết kế để xác định và phân lập các nguồn âm thanh riêng biệt để xử lý riêng. Mặc dù những phương pháp này đã cho thấy hứa hẹn trong môi trường được kiểm soát – nơi các nguồn âm thanh có thể dự đoán và không chồng chéo đáng kể về tần số – chúng vẫn gặp khó khăn khi phân biệt các giọng nói chồng chéo hoặc phân lập một nguồn âm thanh duy nhất trong thời gian thực, đặc biệt là trong các môi trường động và không thể đoán trước. Điều này chủ yếu là do sự thiếu hụt độ sâu cảm giác và ngữ cảnh mà con người tự nhiên sử dụng. Không có các tín hiệu bổ sung như tín hiệu trực quan hoặc sự quen thuộc với các âm thanh cụ thể, AI gặp khó khăn trong việc quản lý hỗn hợp âm thanh phức tạp và ồn ào mà chúng ta gặp phải trong cuộc sống hàng ngày.
Cách WaveSciences sử dụng AI để giải quyết vấn đề
Vào năm 2019, WaveSciences, một công ty của Mỹ được thành lập bởi kỹ sư điện Keith McElveen vào năm 2009, đã đạt được một đột phá trong việc giải quyết vấn đề ‘Cocktail Party’. Giải pháp của họ, Spatial Release from Masking (SRM), sử dụng AI và vật lý của sự lan truyền âm thanh để phân lập giọng nói của một người từ tiếng ồn nền. Giống như hệ thống thính giác của con người xử lý âm thanh từ các hướng khác nhau, SRM sử dụng nhiều micro để thu âm sóng khi chúng di chuyển qua không gian.
Một trong những thách thức quan trọng trong quá trình này là các sóng âm liên tục bị phản xạ và trộn lẫn trong môi trường, khiến việc phân lập các giọng nói cụ thể trở nên khó khăn về mặt toán học. Tuy nhiên, bằng cách sử dụng AI, WaveSciences đã phát triển một phương pháp để xác định nguồn gốc của mỗi âm thanh và lọc ra tiếng ồn nền và giọng nói xung quanh dựa trên vị trí không gian của chúng. Khả năng thích nghi này cho phép SRM xử lý các thay đổi trong thời gian thực, chẳng hạn như một người nói di chuyển hoặc sự giới thiệu của các âm thanh mới, khiến nó trở nên hiệu quả hơn so với các phương pháp trước đó đã gặp khó khăn với bản chất không thể đoán trước của môi trường âm thanh thực tế. Sự tiến bộ này không chỉ nâng cao khả năng tập trung vào các cuộc trò chuyện trong môi trường ồn ào mà còn mở đường cho các đổi mới trong tương lai về công nghệ âm thanh.
Các tiến bộ trong kỹ thuật AI
Những tiến bộ gần đây trong trí tuệ nhân tạo, đặc biệt là trong các mạng lưới thần kinh sâu, đã cải thiện đáng kể khả năng của máy móc trong việc giải quyết vấn đề ‘Cocktail Party’. Các thuật toán học sâu, được đào tạo trên các tập dữ liệu lớn về tín hiệu âm thanh hỗn hợp, đã thể hiện khả năng xác định và phân lập các nguồn âm thanh khác nhau, thậm chí trong các tình huống giọng nói chồng chéo. Các dự án như BioCPPNet đã chứng minh thành công của các phương pháp này bằng cách phân lập các âm thanh của động vật, cho thấy khả năng áp dụng của chúng trong các ngữ cảnh sinh học khác ngoài giọng nói của con người. Các nhà nghiên cứu đã chỉ ra rằng các kỹ thuật học sâu có thể thích nghi với việc tách giọng nói được học trong môi trường âm nhạc sang các tình huống mới, tăng cường độ bền của mô hình trong các môi trường đa dạng.
Kỹ thuật tạo chùm tia thần kinh进一步 tăng cường khả năng này bằng cách sử dụng nhiều micro để tập trung vào các âm thanh từ các hướng cụ thể trong khi giảm thiểu tiếng ồn nền. Kỹ thuật này được tinh chỉnh bằng cách điều chỉnh động sự tập trung dựa trên môi trường âm thanh. Ngoài ra, các mô hình AI sử dụng mặt nạ thời gian-tần số để phân biệt các nguồn âm thanh dựa trên các đặc điểm phổ và thời gian duy nhất. Các hệ thống phân tích giọng nói tiên tiến phân lập và theo dõi các giọng nói cá nhân, tạo điều kiện cho các cuộc trò chuyện được tổ chức. AI có thể phân lập và tăng cường các giọng nói cụ thể một cách chính xác hơn bằng cách kết hợp các tín hiệu trực quan như chuyển động môi cùng với dữ liệu âm thanh.
Các ứng dụng thực tế của vấn đề ‘Cocktail Party’
Những phát triển này đã mở ra các con đường mới cho sự tiến bộ của công nghệ âm thanh. Một số ứng dụng thực tế bao gồm:
- Phân tích pháp y: Theo một báo cáo của BBC, công nghệ Nhận dạng và Điều khiển Giọng nói (SRM) đã được sử dụng trong các phòng xử án để phân tích bằng chứng âm thanh, đặc biệt là trong các trường hợp mà tiếng ồn nền làm phức tạp việc xác định người nói và cuộc trò chuyện của họ. Thường thì các bản ghi âm trong những tình huống như vậy trở nên không thể sử dụng được as bằng chứng. Tuy nhiên, SRM đã chứng minh được giá trị của nó trong các ngữ cảnh pháp y, thành công trong việc giải mã âm thanh quan trọng để trình bày trước tòa.
- Tai nghe chống ồn: Các nhà nghiên cứu đã phát triển một hệ thống AI thử nghiệm gọi là Target Speech Hearing cho tai nghe chống ồn, cho phép người dùng chọn một giọng nói cụ thể để giữ lại trong khi loại bỏ các âm thanh khác. Hệ thống này sử dụng các kỹ thuật dựa trên vấn đề ‘Cocktail Party’ để chạy hiệu quả trên tai nghe có khả năng tính toán hạn chế. Hiện tại, nó là một概念 thử nghiệm, nhưng các nhà tạo ra đang đàm phán với các thương hiệu tai nghe để có thể tích hợp công nghệ này.
- Thiết bị trợ thính: Các thiết bị trợ thính hiện đại thường gặp khó khăn trong môi trường ồn ào, không thể phân lập các giọng nói cụ thể từ tiếng ồn nền. Mặc dù những thiết bị này có thể khuếch đại âm thanh, chúng thiếu các cơ chế lọc tiên tiến cho phép tai người tập trung vào một cuộc trò chuyện duy nhất giữa các âm thanh cạnh tranh. Giới hạn này đặc biệt thách thức trong các môi trường đông đúc hoặc động, nơi các giọng nói chồng chéo và mức độ tiếng ồn thay đổi liên tục. Giải quyết vấn đề ‘Cocktail Party’ có thể cải thiện thiết bị trợ thính bằng cách phân lập các giọng nói mong muốn trong khi giảm thiểu tiếng ồn xung quanh.
- Truyền thông: Trong truyền thông, AI có thể tăng cường chất lượng cuộc gọi bằng cách lọc ra tiếng ồn nền và nhấn mạnh giọng nói của người nói. Điều này dẫn đến giao tiếp rõ ràng và đáng tin cậy hơn, đặc biệt là trong các môi trường ồn ào như đường phố đông đúc hoặc văn phòng đông người.
- Trợ lý giọng nói: Các trợ lý giọng nói được hỗ trợ bởi AI, như Alexa của Amazon và Siri của Apple , có thể trở nên hiệu quả hơn trong môi trường ồn ào và giải quyết vấn đề ‘Cocktail Party’ một cách hiệu quả hơn. Những tiến bộ này cho phép các thiết bị hiểu và phản hồi chính xác các lệnh của người dùng, ngay cả trong tiếng ồn nền.
- Quay và chỉnh sửa âm thanh: Các công nghệ được hỗ trợ bởi AI có thể hỗ trợ các kỹ sư âm thanh trong quá trình hậu sản xuất bằng cách phân lập các nguồn âm thanh riêng biệt trong các bản ghi âm. Khả năng này cho phép tạo ra các bản âm thanh sạch hơn và chỉnh sửa hiệu quả hơn.
Kết luận
Vấn đề ‘Cocktail Party’, một thách thức đáng kể trong xử lý âm thanh, đã chứng kiến những tiến bộ đáng kể thông qua công nghệ AI. Các đổi mới như Spatial Release from Masking (SRM) và các thuật toán học sâu đang tái định nghĩa cách máy móc phân lập và tách âm thanh trong môi trường ồn ào. Những đột phá này không chỉ cải thiện các trải nghiệm hàng ngày, như các cuộc trò chuyện rõ ràng hơn trong môi trường đông đúc và chức năng cải thiện cho thiết bị trợ thính và trợ lý giọng nói, mà còn có tiềm năng biến đổi đối với phân tích pháp y, truyền thông và ứng dụng sản xuất âm thanh. Khi AI tiếp tục tiến hóa, khả năng của nó trong việc mô phỏng các khả năng thính giác của con người sẽ dẫn đến những tiến bộ quan trọng hơn trong công nghệ âm thanh, cuối cùng sẽ thay đổi cách chúng ta tương tác với âm thanh trong cuộc sống hàng ngày.












