Mô hình và nền tảng AI

Nghiên cứu mới nhằm cải thiện thuật toán phát hiện ngôn từ thù hận

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các công ty truyền thông xã hội, đặc biệt là Twitter, đã phải đối mặt với sự chỉ trích về cách họ đánh dấu ngôn từ và quyết định tài khoản nào nên bị cấm. Vấn đề cơ bản hầu như luôn liên quan đến các thuật toán mà họ sử dụng để theo dõi các bài đăng trực tuyến. Các hệ thống trí tuệ nhân tạo còn xa mới hoàn hảo khi thực hiện nhiệm vụ này, nhưng luôn có những nỗ lực được thực hiện để cải thiện chúng.

Bao gồm trong những nỗ lực đó là một nghiên cứu mới từ Đại học Nam California nhằm giảm thiểu một số lỗi có thể dẫn đến thiên vị chủng tộc.

Thất bại trong việc nhận ra ngữ cảnh

Một trong những vấn đề không nhận được nhiều sự chú ý liên quan đến các thuật toán được thiết kế để ngăn chặn sự lan truyền của ngôn từ thù hận nhưng thực sự khuếch đại thiên vị chủng tộc. Điều này xảy ra khi các thuật toán không nhận ra được ngữ cảnh và kết thúc bằng việc đánh dấu hoặc chặn các bài đăng từ các nhóm thiểu số.

Vấn đề lớn nhất với các thuật toán liên quan đến ngữ cảnh là chúng quá nhạy cảm với các thuật ngữ xác định nhóm như “đen”, “đồng tính” và “chuyển giới”. Các thuật toán coi những thuật ngữ này là phân loại ngôn từ thù hận, nhưng chúng thường được sử dụng bởi các thành viên của những nhóm đó và việc thiết lập là quan trọng.

Để giải quyết vấn đề về sự mù quáng ngữ cảnh này, các nhà nghiên cứu đã tạo ra một phân loại ngôn từ thù hận nhạy cảm với ngữ cảnh hơn. Thuật toán mới này ít có khả năng đánh dấu sai một bài đăng là ngôn từ thù hận.

Thuật toán

Các nhà nghiên cứu đã phát triển các thuật toán mới với hai yếu tố mới: ngữ cảnh liên quan đến các định danh nhóm và liệu có các tính năng khác của ngôn từ thù hận hiện diện trong bài đăng, chẳng hạn như ngôn từ phi nhân hóa.

Brendan Kennedy là một sinh viên tiến sĩ khoa học máy tính và đồng tác giả chính của nghiên cứu, được công bố vào ngày 6 tháng 7 tại ACL 2020.

“Chúng tôi muốn đưa việc phát hiện ngôn từ thù hận gần hơn với việc sẵn sàng cho ứng dụng thực tế,” Kennedy nói.

“Các mô hình phát hiện ngôn từ thù hận thường ‘hỏng’ hoặc tạo ra dự đoán xấu khi được giới thiệu với dữ liệu thế giới thực, chẳng hạn như truyền thông xã hội hoặc văn bản trực tuyến khác, vì chúng bị thiên vị bởi dữ liệu mà chúng được đào tạo để liên kết sự xuất hiện của các thuật ngữ xác định xã hội với ngôn từ thù hận.”

Lý do tại sao các thuật toán thường không chính xác là vì chúng được đào tạo trên các tập dữ liệu không cân bằng với tỷ lệ ngôn từ thù hận cực cao. Do đó, các thuật toán không học cách xử lý những gì truyền thông xã hội thực sự trông như thế nào trong thế giới thực.

Giáo sư Xiang là một chuyên gia về xử lý ngôn ngữ tự nhiên.

“Điều quan trọng là các mô hình không bỏ qua các định danh, mà phải phù hợp với ngữ cảnh đúng,” Ren nói.

“Nếu bạn dạy một mô hình từ một tập dữ liệu không cân bằng, mô hình bắt đầu nhận ra các mẫu kỳ lạ và chặn người dùng một cách không phù hợp.”

Để kiểm tra thuật toán, các nhà nghiên cứu đã sử dụng một mẫu ngẫu nhiên của văn bản từ hai trang web truyền thông xã hội có tỷ lệ ngôn từ thù hận cao. Văn bản đầu tiên được đánh dấu bởi con người là thiên vị hoặc phi nhân hóa. Mô hình hiện đại được đo lường so với mô hình của các nhà nghiên cứu về việc đánh dấu sai ngôn từ không phải thù hận, thông qua việc sử dụng 12.500 bài báo của New York Times không có ngôn từ thù hận. Trong khi các mô hình hiện đại có thể đạt được độ chính xác 77% trong việc xác định ngôn từ thù hận so với không phải thù hận, mô hình của nhà nghiên cứu cao hơn ở mức 90%.

“Công việc này không làm cho việc phát hiện ngôn từ thù hận trở nên hoàn hảo, đó là một dự án lớn mà nhiều người đang làm việc, nhưng nó tạo ra tiến bộ dần dần,” Kennedy nói.

“Ngoài việc ngăn chặn các bài đăng trên truyền thông xã hội của các thành viên trong các nhóm được bảo vệ khỏi việc bị kiểm duyệt một cách không phù hợp, chúng tôi hy vọng công việc của mình sẽ giúp đảm bảo rằng việc phát hiện ngôn từ thù hận không gây ra tổn hại không cần thiết bằng cách củng cố các mối liên hệ sai lầm về định kiến và phi nhân hóa với các nhóm xã hội.”

Alex dẫn dắt hoạt động tin tức của Unite.AI, được hỗ trợ bởi AI, kết hợp báo chí, nghiên cứu và tự động hoá để hỗ trợ việc đưa tin về trí tuệ nhân tạo một cách kịp thời và mở rộng. Công việc của anh giúp đảm bảo các phát triển AI mới được đưa ra một cách hiệu quả đồng thời duy trì tiêu chuẩn biên tập của tờ báo.