Mô hình và nền tảng AI

EchoSpeech: Cách mạng hóa Truyền thông với Công nghệ Nhận dạng Giọng nói Im lặng

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các nhà nghiên cứu tại Đại học Cornell đã phát triển EchoSpeech, một giao diện nhận dạng giọng nói im lặng sử dụng cảm biến âm thanh và trí tuệ nhân tạo để liên tục nhận dạng lên đến 31 lệnh không phát âm dựa trên chuyển động của môi và miệng. Giao diện này có thể được vận hành trên điện thoại thông minh và chỉ cần một vài phút dữ liệu đào tạo của người dùng để nhận dạng lệnh.

Ruidong Zhang, một nghiên cứu sinh tiến sĩ về khoa học thông tin, là tác giả chính của “EchoSpeech: Continuous Silent Speech Recognition on Minimally-obtrusive Eyewear Powered by Acoustic Sensing,” sẽ được trình bày tại Hội nghị Hiệp hội Máy tính về Các yếu tố Con người trong Hệ thống Máy tính (CHI) này tháng tại Hamburg, Đức.

“Đối với những người không thể phát âm, công nghệ giọng nói im lặng này có thể là một đầu vào tuyệt vời cho bộ tổng hợp giọng nói. Nó có thể giúp bệnh nhân lấy lại giọng nói của mình,” Zhang nói, nhấn mạnh tiềm năng ứng dụng của công nghệ này khi được phát triển thêm.

Ứng dụng Thực tế và Lợi thế về Quyền riêng tư

Trong hình thức hiện tại, EchoSpeech có thể được sử dụng để giao tiếp với người khác qua điện thoại thông minh trong môi trường mà việc nói chuyện là không tiện lợi hoặc không phù hợp, chẳng hạn như nhà hàng ồn ào hoặc thư viện yên tĩnh. Giao diện giọng nói im lặng cũng có thể được kết hợp với bút stylus và sử dụng với phần mềm thiết kế như CAD, giảm đáng kể nhu cầu về bàn phím và chuột.

Được trang bị microphone và loa nhỏ hơn đầu bút chì, kính EchoSpeech hoạt động như một hệ thống sonar thông minh có thể đeo được, gửi và nhận sóng âm qua khuôn mặt và phát hiện chuyển động của miệng. Một thuật toán học sâu sau đó phân tích các hồ sơ âm thanh này trong thời gian thực với độ chính xác khoảng 95%.

“Chúng tôi đang đưa sonar lên cơ thể,” Cheng Zhang, giáo sư trợ lý về khoa học thông tin và giám đốc của Phòng thí nghiệm Giao diện Máy tính Thông minh cho Tương tác trong Tương lai (SciFi) của Cornell, cho biết.

Công nghệ nhận dạng giọng nói im lặng hiện có thường dựa trên một tập hợp lệnh đã xác định trước và yêu cầu người dùng phải đối mặt hoặc đeo camera. Cheng Zhang giải thích rằng điều này không thực tế cũng như không khả thi và cũng gây ra những lo ngại đáng kể về quyền riêng tư cho cả người dùng và những người họ tương tác.

Công nghệ cảm biến âm thanh của EchoSpeech loại bỏ nhu cầu về camera video đeo được. Hơn nữa, vì dữ liệu âm thanh nhỏ hơn dữ liệu hình ảnh hoặc video, nó yêu cầu ít băng thông để xử lý và có thể được truyền đến điện thoại thông minh qua Bluetooth trong thời gian thực, theo François Guimbretière, giáo sư về khoa học thông tin.

“Và vì dữ liệu được xử lý cục bộ trên điện thoại thông minh của bạn thay vì được tải lên đám mây,” ông nói, “thông tin nhạy cảm về quyền riêng tư không bao giờ rời khỏi tầm kiểm soát của bạn.”

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.