Mô hình và nền tảng AI

Các nhà nghiên cứu phát triển mô hình nhận dạng giọng nói con người với mạng nơ-ron sâu

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nhóm các nhà nghiên cứu từ Đức đang khám phá một mô hình nhận dạng giọng nói con người mới dựa trên học máy và mạng nơ-ron sâu. Mô hình mới này có thể giúp cải thiện đáng kể khả năng nhận dạng giọng nói con người.

Các thuật toán hỗ trợ thính giác thường được sử dụng để cải thiện khả năng nhận dạng giọng nói con người và được đánh giá thông qua các thí nghiệm khác nhau để xác định tỷ lệ tín hiệu trên tiếng ồn tại đó một số từ nhất định được nhận dạng. Tuy nhiên, những thí nghiệm này thường tốn thời gian và tốn kém.

Mô hình mới này được mô tả chi tiết trong nghiên cứu được công bố trên Tạp chí của Hiệp hội Thính học Mỹ.

Dự đoán cho người nghe khiếm thính

Jana Roßbach là một trong những tác giả từ Đại học Carl Von Ossietzky.

“Điểm mới của mô hình của chúng tôi là nó cung cấp dự đoán tốt cho người nghe khiếm thính đối với các loại tiếng ồn có độ phức tạp rất khác nhau và thể hiện cả lỗi thấp và mối tương quan cao với dữ liệu đo được”, Roßbach cho biết.

Đội ngũ các nhà nghiên cứu đã tính toán số từ mà một người nghe có thể hiểu được thông qua nhận dạng giọng nói tự động (ASR). Các công cụ nhận dạng giọng nói như Alexa và Siri dựa trên ASR này, được sử dụng rộng rãi.

Nghiên cứu và Kết quả

Nghiên cứu được thực hiện bởi đội ngũ này bao gồm tám người nghe bình thường và 20 người nghe khiếm thính. Những người nghe này được tiếp xúc với nhiều loại tiếng ồn phức tạp khác nhau che giấu giọng nói và những người nghe khiếm thính được chia thành ba nhóm tùy thuộc vào mức độ mất thính giác liên quan đến tuổi.

Thông qua mô hình mới này, các nhà nghiên cứu có thể dự đoán hiệu suất nhận dạng giọng nói con người của người nghe khiếm thính với các mức độ mất thính giác khác nhau. Họ có thể thực hiện những dự đoán này cho các loại tiếng ồn che giấu khác nhau với độ phức tạp về điều chế thời gian và sự tương đồng với giọng nói thực sự. Tất cả điều này cho phép mỗi người được quan sát và phân tích riêng lẻ về khả năng mất thính giác.

“Chúng tôi ngạc nhiên nhất khi dự đoán hoạt động tốt cho tất cả các loại tiếng ồn. Chúng tôi dự kiến mô hình sẽ gặp vấn đề khi sử dụng một người nói cạnh tranh. Tuy nhiên, điều đó không xảy ra”, Roßbach cho biết.

Vì mô hình này tập trung vào thính giác một tai, đội ngũ sẽ tiếp tục tạo ra một mô hình nhị tai cho thính giác hai tai. Họ cũng cho biết mô hình mới này có thể được sử dụng để dự đoán nỗ lực nghe hoặc chất lượng giọng nói.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.