Mô hình và nền tảng AI
CNTXT AI Ra Mắt Munsit: Hệ Thống Nhận Dạng Giọng Nói Tiếng Ả Rập Chính Xác Nhất Từ Trước Đến Nay
Trong một khoảnh khắc định hình cho trí tuệ nhân tạo ngôn ngữ Ả Rập, CNTXT AI đã ra mắt Munsit, một mô hình nhận dạng giọng nói Ả Rập thế hệ tiếp theo không chỉ là mô hình chính xác nhất từng được tạo ra cho tiếng Ả Rập, mà còn vượt trội so với các gã khổng lồ toàn cầu như OpenAI, Meta, Microsoft (MSFT ) và ElevenLabs trên các tiêu chuẩnbenchmark. Được phát triển tại UAE và tùy chỉnh cho tiếng Ả Rập từ đầu, Munsit đại diện cho một bước tiến mạnh mẽ trong cái mà CNTXT gọi là “trí tuệ nhân tạo chủ quyền” – công nghệ được xây dựng trong khu vực, cho khu vực, nhưng vẫn có tính cạnh tranh toàn cầu.
Các nền tảng khoa học của thành tựu này được trình bày trong bài báo mới được công bố của nhóm, “Tiến Bộ Nhận Dạng Giọng Nói Tiếng Ả Rập Thông Qua HọcWeakly Supervised Lớn“, giới thiệu một phương pháp đào tạo có thể mở rộng, hiệu quả về dữ liệu, giải quyết sự khan hiếm lâu dài của dữ liệu giọng nói tiếng Ả Rập được gắn nhãn. Phương pháp đó – học yếu – đã cho phép nhóm xây dựng một hệ thống thiết lập một tiêu chuẩn mới cho chất lượng phiên âm trên cả tiếng Ả Rập tiêu chuẩn hiện đại (MSA) và hơn 25 phương ngữ khu vực.
Vượt Qua Sự Khan Hiếm Dữ Liệu Trong Nhận Dạng Giọng Nói Tiếng Ả Rập
Tiếng Ả Rập, mặc dù là một trong những ngôn ngữ được nói rộng rãi nhất trên toàn cầu và là ngôn ngữ chính thức của Liên Hợp Quốc, đã lâu được coi là một ngôn ngữ có tài nguyên thấp trong lĩnh vực nhận dạng giọng nói. Điều này bắt nguồn từ cả phức tạp về mặt hình thái và sự thiếu hụt của các tập dữ liệu giọng nói lớn, đa dạng, được gắn nhãn. Không giống như tiếng Anh, được hưởng lợi từ hàng nghìn giờ dữ liệu âm thanh được chuyển tự thủ công, sự phong phú về phương ngữ và sự hiện diện kỹ thuật số bị phân mảnh của tiếng Ả Rập đã tạo ra những thách thức đáng kể cho việc xây dựng các hệ thống nhận dạng giọng nói tự động (ASR) mạnh mẽ.
Thay vì chờ đợi quá trình chuyển tự thủ công chậm và tốn kém để bắt kịp, CNTXT AI đã theo đuổi một con đường có thể mở rộng hơn nhiều: giám sát yếu. Phương pháp của họ bắt đầu với một corpus khổng lồ gồm hơn 30.000 giờ âm thanh tiếng Ả Rập không được gắn nhãn thu thập từ các nguồn đa dạng. Thông qua một đường ống xử lý dữ liệu tùy chỉnh, âm thanh thô này đã được làm sạch, phân đoạn và tự động gắn nhãn để tạo ra một tập dữ liệu đào tạo chất lượng cao 15.000 giờ – một trong những tập dữ liệu giọng nói tiếng Ả Rập lớn nhất và đại diện nhất từng được thu thập.
Quá trình này không dựa vào chú thích của con người. Thay vào đó, CNTXT đã phát triển một hệ thống nhiều giai đoạn để tạo, đánh giá và lọc các giả thuyết từ nhiều mô hình ASR. Những bản chuyển tự này đã được so sánh chéo bằng cách sử dụng khoảng cách Levenshtein để chọn các giả thuyết nhất quán nhất, sau đó được truyền qua một mô hình ngôn ngữ để đánh giá tính hợp lý về mặt ngữ pháp của chúng. Các đoạn không đáp ứng các ngưỡng chất lượng định nghĩa đã bị loại bỏ, đảm bảo rằng ngay cả khi không có xác nhận của con người, dữ liệu đào tạo vẫn đáng tin cậy. Đội ngũ đã tinh chỉnh đường ống này thông qua nhiều lần lặp lại, mỗi lần cải thiện độ chính xác của nhãn bằng cách đào tạo lại hệ thống ASR và đưa nó trở lại vào quá trình gắn nhãn.
Nền Tảng Cho Munsit: Kiến Trúc Conformer
Ở trung tâm của Munsit là mô hình Conformer, một kiến trúc mạng nơ-ron lai kết hợp sự nhạy cảm cục bộ của các lớp convolutional với khả năng mô hình hóa trình tự toàn cầu của các transformer. Thiết kế này làm cho Conformer đặc biệt phù hợp với việc xử lý các sắc thái của ngôn ngữ nói, nơi cả sự phụ thuộc dài hạn (như cấu trúc câu) và các chi tiết âm thanh tinh tế đều quan trọng.
CNTXT AI đã triển khai một biến thể lớn của Conformer, đào tạo nó từ đầu sử dụng 80 kênh mel-spectrograms làm đầu vào. Mô hình này bao gồm 18 lớp và có khoảng 121 triệu tham số. Việc đào tạo được thực hiện trên một cụm hiệu suất cao sử dụng tám GPU NVIDIA A100 với độ chính xác bfloat16, cho phép xử lý hiệu quả các kích thước batch lớn và không gian tính năng cao chiều. Để xử lý việc tách từ của cấu trúc hình thái phong phú của tiếng Ả Rập, nhóm đã sử dụng một tokenizer SentencePiece được đào tạo cụ thể trên corpus tùy chỉnh của họ, dẫn đến một từ vựng gồm 1.024 đơn vị con từ.
Không giống như đào tạo ASR giám sát truyền thống, thường yêu cầu mỗi đoạn âm thanh được ghép nối với một nhãn được chuyển tự cẩn thận, phương pháp của CNTXT hoạt động hoàn toàn trên các nhãn yếu. Những nhãn này, mặc dù nhiễu hơn so với các nhãn được xác nhận bởi con người, đã được tối ưu hóa thông qua một vòng lặp phản hồi ưu tiên sự đồng thuận, tính hợp lý về mặt ngữ pháp và tính hợp lý về mặt từ vựng. Mô hình đã được đào tạo sử dụng hàm mất Connectionist Temporal Classification (CTC), phù hợp cho mô hình hóa trình tự không được căn chỉnh – yếu tố quan trọng cho các nhiệm vụ nhận dạng giọng nói, nơi thời gian của các từ nói có thể thay đổi và không thể đoán trước.
Chiếm Đỉnh Các Tiêu Chuẩn
Kết quả nói lên tất cả. Munsit đã được thử nghiệm chống lại các mô hình ASR mã nguồn mở và thương mại hàng đầu trên sáu tập dữ liệu benchmark tiếng Ả Rập: SADA, Common Voice 18.0, MASC (sạch và nhiễu), MGB-2 và Casablanca. Những tập dữ liệu này tập hợp lại bao gồm hàng chục phương ngữ và giọng nói trên toàn thế giới Ả Rập, từ Ả Rập Xê Út đến Ma-rốc.
Trên tất cả các tiêu chuẩn, Munsit-1 đã đạt được tỷ lệ lỗi từ trung bình là 26,68 và tỷ lệ lỗi ký tự là 10,05. So với phiên bản tốt nhất của Whisper của OpenAI ghi nhận tỷ lệ lỗi từ trung bình là 36,86 và tỷ lệ lỗi ký tự là 17,21. Meta’s SeamlessM4T, một mô hình đa ngôn ngữ khác thuộc hàng đầu, có kết quả thậm chí còn cao hơn. Munsit đã vượt trội so với mọi hệ thống khác trên cả dữ liệu sạch và nhiễu, và thể hiện sự mạnh mẽ đặc biệt trong điều kiện nhiễu, một yếu tố quan trọng cho các ứng dụng thực tế như trung tâm cuộc gọi và dịch vụ công.
Khoảng cách cũng rõ rệt so với các hệ thống độc quyền. Munsit đã vượt trội so với các mô hình nhận dạng giọng nói tiếng Ả Rập của Microsoft Azure, ElevenLabs Scribe và thậm chí cả tính năng chuyển tự của GPT-4o của OpenAI. Những kết quả này không phải là những lợi ích nhỏ – chúng đại diện cho sự cải thiện tương đối trung bình là 23,19% về tỷ lệ lỗi từ và 24,78% về tỷ lệ lỗi ký tự so với baseline mở mạnh nhất, thiết lập Munsit là người dẫn đầu rõ ràng trong nhận dạng giọng nói tiếng Ả Rập.
Một Nền Tảng Cho Tương Lai Của Trí Tuệ Nhân Tạo Giọng Nói Tiếng Ả Rập
Trong khi Munsit-1 đã biến đổi các khả năng cho việc chuyển tự, phụ đề và hỗ trợ khách hàng trên thị trường nói tiếng Ả Rập, CNTXT AI xem việc ra mắt này chỉ là bước khởi đầu. Công ty hình dung một bộ đầy đủ các công nghệ giọng nói tiếng Ả Rập, bao gồm văn bản-sang-nói, trợ lý giọng nói và hệ thống dịch thời gian thực – tất cả đều dựa trên cơ sở hạ tầng chủ quyền và trí tuệ nhân tạo có liên quan đến khu vực.
“Munsit không chỉ là một bước đột phá trong nhận dạng giọng nói,” Mohammad Abu Sheikh, CEO của CNTXT AI cho biết. “Nó là một tuyên bố rằng tiếng Ả Rập thuộc về hàng đầu của trí tuệ nhân tạo toàn cầu. Chúng tôi đã chứng minh rằng trí tuệ nhân tạo hàng đầu không cần phải được nhập khẩu – nó có thể được xây dựng ở đây, bằng tiếng Ả Rập, cho tiếng Ả Rập.”
Với sự xuất hiện của các mô hình khu vực cụ thể như Munsit, ngành công nghiệp trí tuệ nhân tạo đang bước vào một kỷ nguyên mới – nơi tính liên quan về ngôn ngữ và văn hóa không bị hy sinh trong việc theo đuổi sự xuất sắc về mặt kỹ thuật. Trên thực tế, với Munsit, CNTXT AI đã chứng minh rằng chúng là một và giống nhau.












