Mô hình và nền tảng AI
Mô hình AI mới làm việc với nhiều ngôn ngữ của con người
Các nhà nghiên cứu tại Đại học Waterloo đã phát triển một mô hình AI cho phép máy tính xử lý nhiều ngôn ngữ của con người. Đây là một bước tiến quan trọng trong lĩnh vực này, vì nhiều ngôn ngữ thường bị bỏ lại trong quá trình lập trình. Các ngôn ngữ châu Phi thường không được các nhà khoa học máy tính tập trung vào, dẫn đến khả năng xử lý ngôn ngữ tự nhiên (NLP) bị hạn chế trên lục địa này.
Mô hình ngôn ngữ mới được phát triển bởi một nhóm các nhà nghiên cứu tại Trường Khoa học Máy tính David R. Cheriton của Đại học Waterloo.
Nghiên cứu này được trình bày tại Hội thảo Học tập Đại diện Đa ngôn ngữ tại Hội nghị 2021 về Phương pháp Thực nghiệm trong Xử lý Ngôn ngữ Tự nhiên.
Mô hình này đang đóng vai trò quan trọng trong việc giúp máy tính phân tích văn bản trong các ngôn ngữ châu Phi cho nhiều nhiệm vụ hữu ích, và nó được gọi là AfriBERTa. Nó sử dụng các kỹ thuật học sâu để đạt được kết quả ấn tượng cho các ngôn ngữ có ít tài nguyên.
Làm việc với 11 ngôn ngữ châu Phi
AfriBERTa làm việc với 11 ngôn ngữ châu Phi cụ thể hiện tại, bao gồm Amharic, Hausa và Swahili, được nói bởi hơn 400 triệu người. Mô hình này đã chứng minh chất lượng đầu ra tương đương với các mô hình hiện có tốt nhất, và nó đã làm như vậy trong khi chỉ học từ một gigabyte văn bản. Các mô hình tương tự khác thường yêu cầu nhiều dữ liệu hơn.
Kelechi Ogueji là một sinh viên thạc sĩ khoa học máy tính tại Waterloo.
“Các mô hình ngôn ngữ được đào tạo trước đã thay đổi cách máy tính xử lý và phân tích dữ liệu văn bản cho các nhiệm vụ từ dịch máy đến trả lời câu hỏi,” Ogueji nói. “Thật không may, các ngôn ngữ châu Phi đã nhận được rất ít sự chú ý từ cộng đồng nghiên cứu.”
“Một trong những thách thức là các mạng nơ-ron rất tốn kém về văn bản và máy tính để xây dựng. Và không giống như tiếng Anh, có lượng văn bản khổng lồ có sẵn, hầu hết 7.000 ngôn ngữ được nói trên toàn thế giới có thể được mô tả là có ít tài nguyên, vì thiếu dữ liệu để cung cấp cho các mạng nơ-ron đói dữ liệu.”
Kỹ thuật đào tạo trước
Hầu hết các mô hình này dựa trên kỹ thuật đào tạo trước, bao gồm việc nhà nghiên cứu trình bày mô hình với văn bản có một số từ bị ẩn hoặc bị che. Mô hình sau đó phải đoán từ bị ẩn, và nó tiếp tục lặp lại quá trình này hàng tỷ lần. Cuối cùng, nó học được các mối quan hệ thống kê giữa các từ, tương tự như kiến thức ngôn ngữ của con người.
Jimmy Lin là Chủ tịch Khoa học Máy tính Cheriton và là cố vấn của Ogueji.
“Có thể đào tạo trước các mô hình chỉ chính xác như các mô hình hiện có cho các nhiệm vụ cụ thể, nhưng sử dụng ít dữ liệu hơn rất nhiều, có nhiều lợi thế,” Lin nói. “Cần ít dữ liệu hơn để đào tạo mô hình ngôn ngữ có nghĩa là ít tính toán hơn được yêu cầu và do đó lượng khí thải carbon thấp hơn liên quan đến hoạt động của các trung tâm dữ liệu lớn. Các tập dữ liệu nhỏ hơn cũng làm cho việc kiểm duyệt dữ liệu trở nên thực tế hơn, đây là một cách tiếp cận để giảm thiểu các偏见 hiện diện trong các mô hình.”
“Công việc này là một bước nhỏ nhưng quan trọng để đưa khả năng xử lý ngôn ngữ tự nhiên đến hơn 1,3 tỷ người trên lục địa châu Phi.”
Nghiên cứu cũng liên quan đến Yuxin Zhu, người vừa hoàn thành bằng cử nhân khoa học máy tính tại trường đại học.












