Lãnh đạo tư tưởng
Trí tuệ nhân tạo sinh không phải là câu tử cho các ngôn ngữ bị đe dọa
Theo UNESCO, có tới một nửa số ngôn ngữ có thể tuyệt chủng vào năm 2100. Nhiều người cho rằng trí tuệ nhân tạo sinh đang góp phần vào quá trình này.
Sự suy giảm đa dạng ngôn ngữ không bắt đầu với AI – hoặc Internet. Nhưng AI đang ở vị trí để đẩy nhanh sự suy tàn của các ngôn ngữ bản địa và ngôn ngữ có ít tài nguyên.
Hầu hết 7.000 ngôn ngữ trên thế giới không có đủ tài nguyên để đào tạo mô hình AI – và nhiều ngôn ngữ không có hình thức viết. Điều này có nghĩa là một số ngôn ngữ chính thống sẽ chiếm ưu thế trong kho dữ liệu đào tạo AI của loài người, trong khi hầu hết sẽ bị bỏ lại phía sau trong cuộc cách mạng AI – và có thể biến mất hoàn toàn.
Lý do đơn giản là hầu hết dữ liệu đào tạo AI có sẵn là tiếng Anh. Tiếng Anh là động lực chính của các mô hình ngôn ngữ lớn (LLM), và những người nói các ngôn ngữ ít phổ biến hơn đang tìm thấy mình không được đại diện trong công nghệ AI.
Hãy xem xét các thống kê này từ Diễn đàn Kinh tế Thế giới:
- Hai phần ba tất cả các trang web đều bằng tiếng Anh.
- Phần lớn dữ liệu mà GenAI học được được thu thập từ web.
- Ít hơn 20% dân số thế giới nói tiếng Anh.
Khi AI trở nên tích hợp hơn vào cuộc sống hàng ngày của chúng ta, chúng ta đều nên suy nghĩ về sự công bằng ngôn ngữ. AI có tiềm năng chưa từng có để giải quyết vấn đề trên quy mô lớn, và lời hứa của nó không nên bị giới hạn ở thế giới nói tiếng Anh. AI đang tạo ra sự tiện lợi và công cụ giúp cải thiện cuộc sống cá nhân và chuyên nghiệp của mọi người ở các quốc gia phát triển.
Người nói các ngôn ngữ có ít tài nguyên đã quen với việc tìm thấy sự thiếu đại diện trong công nghệ – từ không tìm thấy trang web bằng ngôn ngữ của họ đến không có dialect được Siri nhận ra. Phần lớn văn bản đó có sẵn để đào tạo AI trong các ngôn ngữ có ít tài nguyên hơn là chất lượng kém (chính nó được dịch với độ chính xác đáng ngờ) và hẹp về phạm vi.
Làm thế nào xã hội có thể đảm bảo rằng các ngôn ngữ có ít tài nguyên hơn không bị bỏ lại phía sau trong phương trình AI? Làm thế nào chúng ta có thể đảm bảo rằng ngôn ngữ không phải là rào cản đối với lời hứa của AI?
Trong nỗ lực hướng tới sự hòa nhập ngôn ngữ, một số người chơi công nghệ lớn đã khởi xướng đào tạo các mô hình ngôn ngữ đa ngôn ngữ lớn (MLM). Microsoft (MSFT ) Translate, ví dụ, đã cam kết hỗ trợ “mọi ngôn ngữ, mọi nơi”. Và Meta có một lời hứa “Không ngôn ngữ nào bị bỏ lại phía sau”. Những điều này đáng khen ngợi, nhưng chúng có thực tế không?
Phấn đấu để có một mô hình xử lý mọi ngôn ngữ trên thế giới ủng hộ những người được đặc quyền vì có nhiều dữ liệu hơn từ các ngôn ngữ chính của thế giới. Khi chúng ta bắt đầu đối phó với các ngôn ngữ có ít tài nguyên hơn và ngôn ngữ có kịch bản không phải Latin, việc đào tạo mô hình AI trở nên khó khăn hơn, tốn thời gian hơn – và tốn kém hơn. Hãy nghĩ về nó như một loại thuế không chủ ý đối với các ngôn ngữ không được đại diện.
Các tiến bộ trong công nghệ giọng nói
Các mô hình AI chủ yếu được đào tạo trên văn bản, điều này tự nhiên ủng hộ các ngôn ngữ có kho văn bản sâu. Sự đa dạng ngôn ngữ sẽ được hỗ trợ tốt hơn với các hệ thống không phụ thuộc vào văn bản. Sự tương tác của con người vào một thời điểm là hoàn toàn dựa trên giọng nói, và nhiều nền văn hóa vẫn giữ được焦 điểm đó. Để phục vụ tốt hơn cho khán giả toàn cầu, ngành công nghiệp AI phải tiến bộ từ dữ liệu văn bản sang dữ liệu giọng nói.
Nghiên cứu đang đạt được những bước tiến lớn trong công nghệ giọng nói, nhưng nó vẫn còn tụt lại phía sau so với các công nghệ dựa trên văn bản. Nghiên cứu về xử lý giọng nói đang tiến bộ, nhưng công nghệ dịch giọng nói trực tiếp vẫn còn xa so với sự trưởng thành. Thực tế là ngành công nghiệp có xu hướng di chuyển một cách thận trọng, và chỉ khi một công nghệ tiến bộ đến một mức độ nhất định.
Nền tảng giải thích trực tiếp GlobalLink Live mới được phát hành của TransPerfect sử dụng các hình thức công nghệ giọng nói trưởng thành hơn – nhận dạng giọng nói tự động (ASR) và văn bản thành giọng nói (TTS) – lại, vì các hệ thống dịch giọng nói trực tiếp không đủ trưởng thành tại thời điểm này. Đó được nói, các nhóm nghiên cứu của chúng tôi đang chuẩn bị cho ngày khi các đường ống dẫn giọng nói trực tiếp sẵn sàng cho thời gian phát sóng.
Mô hình dịch giọng nói trực tiếp cung cấp lời hứa lớn trong việc bảo tồn các ngôn ngữ bằng miệng. Vào năm 2022, Meta đã công bố hệ thống dịch giọng nói tự động đầu tiên được hỗ trợ bởi AI cho tiếng Hokkien, một ngôn ngữ chủ yếu bằng miệng được nói bởi khoảng 46 triệu người trong cộng đồng người Hoa. Đó là một phần của dự án Trình dịch giọng nói phổ quát của Meta, đang phát triển các mô hình AI mới mà họ hy vọng sẽ cho phép dịch giọng nói trực tiếp thời gian thực trên nhiều ngôn ngữ. Meta đã chọn mở nguồn mô hình dịch tiếng Hokkien, tập dữ liệu đánh giá và các bài báo nghiên cứu để những người khác có thể tái tạo và xây dựng dựa trên công việc của họ.
Học tập với ít hơn
Sự thật là chúng ta với tư cách là một cộng đồng toàn cầu thiếu tài nguyên xung quanh một số ngôn ngữ không phải là câu tử cho những ngôn ngữ đó. Đây là nơi các mô hình đa ngôn ngữ có lợi thế, vì các ngôn ngữ học hỏi từ nhau. Tất cả các ngôn ngữ đều tuân theo các mẫu. Vì sự chuyển giao kiến thức giữa các ngôn ngữ, nhu cầu về dữ liệu đào tạo giảm đi.
Giả sử bạn có một mô hình đang học 90 ngôn ngữ và bạn muốn thêm Inuit (một nhóm ngôn ngữ bản địa Bắc Mỹ). Vì sự chuyển giao kiến thức, bạn sẽ cần ít dữ liệu Inuit hơn. Chúng tôi đang tìm cách học hỏi với ít hơn. Số lượng dữ liệu cần thiết để tinh chỉnh động cơ thấp hơn.
Tôi hy vọng về một tương lai với AI bao gồm nhiều hơn. Tôi không tin rằng chúng ta bị định sẵn để chứng kiến sự biến mất của hàng loạt ngôn ngữ – hay tôi không nghĩ AI sẽ vẫn là lĩnh vực của thế giới nói tiếng Anh. Hiện tại, chúng ta đang chứng kiến sự nhận thức nhiều hơn xung quanh vấn đề về sự công bằng ngôn ngữ. Từ việc thu thập dữ liệu đa dạng hơn đến xây dựng các mô hình ngôn ngữ cụ thể, chúng ta đang đạt được tiến bộ.
Hãy xem xét Fon, một ngôn ngữ được nói bởi khoảng 4 triệu người ở Bénin và các quốc gia châu Phi lân cận. Không lâu trước đây, một mô hình AI phổ biến đã mô tả Fon là một ngôn ngữ hư cấu. Một nhà khoa học máy tính tên là Bonaventure Dosseau, người mẹ nói tiếng Fon, đã quen với loại loại trừ này. Dosseau, người nói tiếng Pháp, lớn lên mà không có chương trình dịch để giúp anh giao tiếp với mẹ. Ngày nay, anh có thể giao tiếp với mẹ nhờ một trình dịch Fon-Pháp mà anh đã xây dựng một cách cẩn thận. Ngày nay, cũng có một Wikipedia Fon non trẻ.
Trong nỗ lực sử dụng công nghệ để bảo tồn ngôn ngữ, nghệ sĩ người Thổ Nhĩ Kỳ Refik Anadol đã khởi xướng việc tạo ra một công cụ AI mã nguồn mở cho người dân bản địa. Tại Hội nghị Thượng đỉnh Kinh tế Thế giới, anh đã hỏi: “Làm thế nào trên trái đất chúng ta có thể tạo ra một AI mà không biết toàn bộ nhân loại?”
Chúng ta không thể, và chúng ta sẽ không.












