Mô hình và nền tảng AI

Speechmatics Ra Mắt Phần Mềm Nhận Dạng Giọng Nói Tự Chủ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Công ty khởi nghiệp công nghệ nhận dạng giọng nói hàng đầu Speechmatics đã ra mắt phần mềm ‘Nhận Dạng Giọng Nói Tự Chủ’ của mình, sử dụng các kỹ thuật học sâu mới nhất và các mô hình tự giám sát đột phá. Hệ thống đã chứng minh khả năng vượt trội so với Amazon (AMZN ), Google (GOOGL ) và Microsoft.

Các Bộ Dữ Liệu Của Stanford

Speechmatics dựa trên các bộ dữ liệu được tìm thấy trong nghiên cứu ‘ Sự Khác Biệt Chủng Tộc Trong Nhận Dạng Giọng Nói‘ của Stanford, và nó đã đạt được độ chính xác tổng thể là 82,8% cho giọng nói của người Mỹ gốc Phi. Để so sánh, Google chỉ đạt được tỷ lệ chính xác là 68,7%, trong khi Amazon đạt được 68,6%.

Mức độ chính xác này tương đương với việc giảm 45% lỗi nhận dạng giọng nói, tương đương với ba từ trong một câu trung bình. Không chỉ hệ thống Speechmatics mới có độ chính xác cao trong khía cạnh này, mà nó cũng đã chứng minh sự cải thiện về độ chính xác trên các giọng nói, tuổi tác, phương ngữ và các đặc điểm xã hội dân số khác.

Thường có sự hiểu lầm trong nhận dạng giọng nói do số lượng dữ liệu được dán nhãn hạn chế mà các thuật toán có thể sử dụng để tự đào tạo. Dữ liệu được dán nhãn cần được phân loại thủ công bởi con người, điều này dẫn đến ít dữ liệu hơn có sẵn cho các hệ thống này. Điều này cũng hạn chế sự đại diện của tất cả các giọng nói, tạo ra một tập hợp các vấn đề mới.

Đào Tạo Trên Dữ Liệu Không Được Dán Nhãn

Speechmatics đang làm được tiến bộ lớn trong khía cạnh này vì công nghệ của họ được đào tạo trên số lượng lớn dữ liệu không được dán nhãn lấy trực tiếp từ internet. Dữ liệu này đến từ các thứ như nội dung trên mạng xã hội và các podcast.

Học tự giám sát đã cho phép hệ thống được đào tạo trên 1,1 triệu giờ âm thanh, tăng từ 30.000 giờ trước đó. Điều này cho phép nó có phạm vi đại diện rộng hơn về các giọng nói và giúp giảm thiểu sự thiên vị và lỗi của AI trong nhận dạng giọng nói.

Khi nói đến giọng nói của trẻ em, Speechmatics cũng đã chứng minh khả năng vượt trội so với các đối thủ. Giọng nói của trẻ em rất khó để nhận dạng bằng công nghệ nhận dạng giọng nói truyền thống, nhưng Speechmatics đã ghi nhận tỷ lệ chính xác là 91,8%. Google chỉ đạt được 83,4% và Deepgram đạt 82,3%.

Katy Wigdahl là CEO của Speechmatics.

“Chúng tôi đang trên một nhiệm vụ cung cấp thế hệ tiếp theo của khả năng học máy và thông qua đó cung cấp công nghệ giọng nói bao gồm và dễ tiếp cận hơn. Thông báo này là một bước tiến khổng lồ hướng tới việc đạt được nhiệm vụ đó.”

“Sự tập trung của chúng tôi vào việc giải quyết sự thiên vị của AI đã dẫn đến bước nhảy vĩ đại này trong ngành công nghiệp nhận dạng giọng nói và hiệu ứng gợn sóng sẽ dẫn đến thay đổi trong nhiều tình huống khác nhau,” Wigdahl tiếp tục. “Hãy nghĩ về các chú thích không chính xác mà chúng ta thấy trên mạng xã hội, các phiên tòa nơi từ ngữ bị sai ghi và các nền tảng học trực tuyến đã vật lộn với giọng nói của trẻ em trong suốt đại dịch. Những lỗi mà mọi người đã phải chấp nhận cho đến nay có thể có tác động cụ thể đến cuộc sống hàng ngày của họ.”

Allison Zhu Koenecke là tác giả chính của nghiên cứu Stanford về nhận dạng giọng nói.

“Điều quan trọng là phải nghiên cứu và cải thiện sự công bằng trong các hệ thống chuyển đổi giọng nói sang văn bản,考虑 đến khả năng gây hại không đồng đều cho các cá nhân thông qua các lĩnh vực hạ nguồn từ chăm sóc sức khỏe đến tư pháp hình sự.”

Alex dẫn dắt hoạt động tin tức của Unite.AI, được hỗ trợ bởi AI, kết hợp báo chí, nghiên cứu và tự động hoá để hỗ trợ việc đưa tin về trí tuệ nhân tạo một cách kịp thời và mở rộng. Công việc của anh giúp đảm bảo các phát triển AI mới được đưa ra một cách hiệu quả đồng thời duy trì tiêu chuẩn biên tập của tờ báo.