Mô hình và nền tảng AI
Tai nghe AI cho phép bạn nghe một người trong đám đông
Trong một môi trường ồn ào, đông đúc, bạn đã bao giờ ước ao có thể loại bỏ tất cả tiếng ồn và tập trung vào người bạn đang cố gắng nghe chưa? Trong khi tai nghe chống ồn đã đạt được những bước tiến lớn trong việc tạo ra một không gian âm thanh trống, chúng vẫn gặp khó khăn trong việc cho phép các âm thanh cụ thể từ môi trường xung quanh lọc qua. Nhưng nếu tai nghe của bạn có thể được đào tạo để nhận biết và khuếch đại giọng nói của một người cụ thể, ngay cả khi bạn di chuyển trong một phòng đầy những cuộc trò chuyện khác?
Target Speech Hearing (TSH), một hệ thống AI đột phá được phát triển bởi các nhà nghiên cứu tại Đại học Washington, đang đạt được tiến bộ trong lĩnh vực này.
Cách Target Speech Hearing hoạt động
Để sử dụng TSH, người dùng chỉ cần nhìn vào người họ muốn nghe trong vài giây. Thời gian “đăng ký” ngắn này cho phép hệ thống AI học hỏi và bắt kịp các mẫu giọng nói độc đáo của người nói mục tiêu.
Dưới đây là cách nó hoạt động:
- Người dùng nhấn một nút trong khi hướng đầu họ về phía người nói mong muốn trong 3-5 giây.
- Micro trên cả hai bên của tai nghe thu âm sóng âm từ giọng nói của người nói đồng thời (với sai số 16 độ).
- Tai nghe truyền tín hiệu âm thanh này đến một máy tính nhúng trên bo mạch.
- Phần mềm học máy phân tích giọng nói và tạo mô hình các đặc điểm giọng nói độc đáo của người nói.
- Hệ thống AI sử dụng mô hình này để cách ly và khuếch đại giọng nói của người nói đã đăng ký trong thời gian thực, ngay cả khi người dùng di chuyển trong một môi trường ồn ào.
Giọng nói của người nói mục tiêu càng dài, hệ thống càng nhận được nhiều dữ liệu đào tạo, cho phép nó tập trung và làm rõ giọng nói mong muốn. Cách tiếp cận đổi mới này đối với “nghe có chọn lọc” mở ra một thế giới khả năng cho việc giao tiếp và tiếp cận tốt hơn trong các môi trường âm thanh thách thức.
Shyam Gollakota là tác giả chính của bài báo và là giáo sư tại Trường Khoa học và Kỹ thuật Máy tính Paul G. Allen của Đại học Washington
“Chúng ta thường nghĩ về AI như một công cụ trò chuyện trên web trả lời các câu hỏi. Nhưng trong dự án này, chúng tôi phát triển AI để thay đổi nhận thức âm thanh của bất kỳ ai đeo tai nghe, dựa trên sở thích của họ. Với thiết bị của chúng tôi, bạn có thể nghe rõ một người nói ngay cả khi bạn ở trong một môi trường ồn ào với nhiều người khác đang nói.” – Gollakota
Kiểm tra Tai nghe AI với TSH
Để kiểm tra Target Speech Hearing, nhóm nghiên cứu đã thực hiện một nghiên cứu với 21 người tham gia. Mỗi người tham gia đeo tai nghe TSH và đăng ký một người nói mục tiêu trong một môi trường ồn ào. Kết quả rất ấn tượng – trung bình, người dùng đánh giá độ rõ của giọng nói của người nói mục tiêu gần như gấp đôi so với tín hiệu âm thanh không lọc.
Bước đột phá này xây dựng trên công việc trước đó của nhóm về “nghe có ý nghĩa”, cho phép người dùng lọc môi trường âm thanh của họ dựa trên các phân loại âm thanh được định nghĩa trước, chẳng hạn như tiếng chim hót hoặc giọng nói của con người. TSH đưa khái niệm này một bước进一步 bằng cách cho phép khuếch đại có chọn lọc giọng nói của một cá nhân cụ thể.
Các ý nghĩa là đáng kể, từ việc cải thiện các cuộc trò chuyện cá nhân trong các môi trường ồn ào đến việc cải thiện khả năng tiếp cận cho những người có vấn đề về thính giác. Khi công nghệ phát triển, nó có thể thay đổi cơ bản cách chúng ta trải nghiệm và tương tác với thế giới âm thanh của mình.
Cải thiện Tai nghe AI và vượt qua các hạn chế
Mặc dù Target Speech Hearing đại diện cho một bước nhảy vĩ đại trong AI âm thanh, hệ thống vẫn có một số hạn chế trong hình thức hiện tại:
- Đăng ký người nói đơn: Hiện tại, TSH chỉ có thể được đào tạo để tập trung vào một người nói tại một thời điểm. Đăng ký nhiều người nói đồng thời không thể thực hiện được.
- Nhiễu từ các nguồn âm thanh tương tự: Nếu một giọng nói khác lớn đến từ cùng hướng với người nói mục tiêu trong quá trình đăng ký, hệ thống có thể gặp khó khăn trong việc cách ly các mẫu giọng nói độc đáo của người nói mục tiêu.
- Đăng ký lại thủ công: Nếu người dùng không hài lòng với chất lượng âm thanh sau đào tạo ban đầu, họ phải đăng ký lại người nói mục tiêu để cải thiện độ rõ.
Mặc dù có những hạn chế này, nhóm nghiên cứu tại Đại học Washington đang tích cực làm việc để tinh chỉnh và mở rộng khả năng của TSH. Một trong những mục tiêu chính của họ là thu nhỏ công nghệ, cho phép nó được tích hợp dễ dàng vào các sản phẩm tiêu dùng như earbud và máy trợ thính.
Khi các nhà nghiên cứu tiếp tục đẩy ranh giới của những gì có thể đạt được với AI âm thanh, các ứng dụng tiềm năng là rất lớn, từ việc cải thiện năng suất trong các môi trường văn phòng phân tâm đến việc tạo điều kiện cho giao tiếp rõ ràng hơn cho các nhân viên cứu hộ và nhân viên quân sự trong các tình huống cao cấp. Tương lai của việc nghe có chọn lọc看起来 rất sáng sủa, và Target Speech Hearing đang sẵn sàng đóng vai trò quan trọng trong việc định hình nó.












