Mô hình và nền tảng AI

Các nhà nghiên cứu tìm cách mở rộng Nhận dạng Giọng nói Tự động sang 2.000 ngôn ngữ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nhóm các nhà nghiên cứu tại Đại học Carnegie Mellon đang tìm cách mở rộng nhận dạng giọng nói tự động sang 2.000 ngôn ngữ. Hiện tại, chỉ một phần của ước tính 7.000 đến 8.000 ngôn ngữ được nói trên toàn thế giới sẽ được hưởng lợi từ các công nghệ ngôn ngữ hiện đại như chuyển đổi văn bản sang giọng nói hoặc tự động phụ đề.

Xinjian Li là một sinh viên tiến sĩ tại Viện Công nghệ Ngôn ngữ của Trường Khoa học Máy tính (LTI).

“Nhiều người trên thế giới nói các ngôn ngữ đa dạng, nhưng các công cụ công nghệ ngôn ngữ không được phát triển cho tất cả họ,” anh nói. “Phát triển công nghệ và mô hình ngôn ngữ tốt cho tất cả mọi người là một trong những mục tiêu của nghiên cứu này.”

Li thuộc về một nhóm chuyên gia tìm cách đơn giản hóa các yêu cầu dữ liệu mà các ngôn ngữ cần để phát triển một mô hình nhận dạng giọng nói.

Nhóm này cũng bao gồm các thành viên giảng viên của LTI là Shinji Watanabe, Florian Metze, David Mortensen và Alan Black.

Nghiên cứu có tiêu đề “ASR2K: Nhận dạng Giọng nói cho Khoảng 2.000 Ngôn ngữ Không có Âm thanh” đã được trình bày tại Hội thảo Interspeech 2022 ở Hàn Quốc.

Hầu hết các mô hình nhận dạng giọng nói hiện có yêu cầu dữ liệu văn bản và âm thanh. Trong khi dữ liệu văn bản tồn tại cho hàng nghìn ngôn ngữ, điều này không đúng với âm thanh. Nhóm muốn loại bỏ nhu cầu về dữ liệu âm thanh bằng cách tập trung vào các yếu tố ngôn ngữ chung giữa nhiều ngôn ngữ.

Công nghệ nhận dạng giọng nói thường tập trung vào âm vị của một ngôn ngữ, là những âm thanh riêng biệt giúp phân biệt nó với các ngôn ngữ khác. Những âm vị này là duy nhất cho mỗi ngôn ngữ. Đồng thời, các ngôn ngữ có âm thanh mô tả cách một từ nghe như thế nào về mặt vật lý, và nhiều âm thanh có thể tương ứng với một âm vị duy nhất. Mặc dù các ngôn ngữ riêng biệt có thể có các âm vị khác nhau, nhưng các âm thanh cơ bản có thể giống nhau.

Nhóm đang làm việc trên một mô hình nhận dạng giọng nói dựa ít hơn vào âm vị và nhiều hơn vào thông tin về cách các âm thanh được chia sẻ giữa các ngôn ngữ. Điều này giúp giảm thiểu nỗ lực cần thiết để xây dựng các mô hình riêng biệt cho từng ngôn ngữ riêng lẻ. Bằng cách kết hợp mô hình với một cây phát sinh chủng loại, là một sơ đồ thể hiện mối quan hệ giữa các ngôn ngữ, nó giúp với các quy tắc phát âm. Mô hình và cấu trúc cây của nhóm đã cho phép họ ước tính mô hình giọng nói cho hàng nghìn ngôn ngữ ngay cả khi không có dữ liệu âm thanh.

“Chúng tôi đang cố gắng loại bỏ yêu cầu dữ liệu âm thanh này, điều giúp chúng tôi chuyển từ 100 đến 200 ngôn ngữ sang 2.000,” Li nói. “Đây là nghiên cứu đầu tiên nhắm vào số lượng ngôn ngữ lớn như vậy, và chúng tôi là nhóm đầu tiên nhằm mục đích mở rộng các công cụ ngôn ngữ sang phạm vi này.”

Nghiên cứu, mặc dù vẫn còn trong giai đoạn đầu, đã cải thiện các công cụ ước lượng ngôn ngữ hiện có bằng 5%.

“Mỗi ngôn ngữ là một yếu tố rất quan trọng trong văn hóa của nó. Mỗi ngôn ngữ có câu chuyện riêng của nó, và nếu bạn không cố gắng bảo tồn các ngôn ngữ, những câu chuyện đó có thể bị mất,” Li nói. “Phát triển hệ thống nhận dạng giọng nói và công cụ này là một bước để cố gắng bảo tồn những ngôn ngữ đó.”

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.