Mô hình và nền tảng AI
Mô hình thống kê giúp phát hiện thông tin sai lệch trên mạng xã hội
Một giáo sư toán học từ Đại học Mỹ, cùng với nhóm cộng tác viên của mình, đã phát triển một mô hình thống kê có thể phát hiện thông tin sai lệch trong các bài đăng trên mạng xã hội.
Học máy đang ngày càng được sử dụng để ngăn chặn sự lan truyền của thông tin sai lệch, nhưng vẫn còn một rào cản lớn liên quan đến vấn đề hộp đen xảy ra. Điều này đề cập đến khi các nhà nghiên cứu không hiểu làm thế nào một máy móc đưa ra quyết định giống như những người đào tạo con người.
Phát hiện thông tin sai lệch với mô hình thống kê
Zois Boukouvalas, giáo sư trợ lý tại Bộ phận Toán học và Thống kê của AU, đã sử dụng một tập dữ liệu Twitter với các tweet sai lệch về COVID-19 để chứng minh làm thế nào các mô hình thống kê có thể phát hiện thông tin sai lệch trên mạng xã hội trong các sự kiện lớn như đại dịch hoặc thảm họa.
Boukouvalas và các đồng nghiệp của mình, bao gồm sinh viên AU Caitlin Moroney và Giáo sư Khoa học Máy tính Nathalie Japkowics, đã chứng minh làm thế nào quyết định của mô hình phù hợp với con người trong nghiên cứu mới được công bố.
“Chúng tôi muốn biết một máy móc đang nghĩ gì khi nó đưa ra quyết định, và làm thế nào và tại sao nó đồng ý với con người đã đào tạo nó,” Boukouvalas nói. “Chúng tôi không muốn chặn tài khoản mạng xã hội của một người chỉ vì mô hình đưa ra quyết định thiên vị.”
Phương pháp được nhóm sử dụng là một loại học máy dựa trên thống kê. Các mô hình thống kê hiệu quả và cung cấp một cách khác để chống lại thông tin sai lệch.
Mô hình đã đạt được hiệu suất dự đoán cao và phân loại một tập hợp thử nghiệm gồm 112 tweet thực và sai lệch với độ chính xác gần 90%.
“Điều quan trọng về phát hiện này là mô hình của chúng tôi đã đạt được độ chính xác trong khi cung cấp sự minh bạch về cách nó phát hiện các tweet là thông tin sai lệch,” Boukouvalas tiếp tục. “Các phương pháp học sâu không thể đạt được độ chính xác như vậy với sự minh bạch.”
Đào tạo và chuẩn bị mô hình
Các nhà nghiên cứu đã chuẩn bị để đào tạo mô hình trước khi thử nghiệm nó trên một tập dữ liệu vì thông tin được cung cấp bởi con người có thể giới thiệu thiên vị và hộp đen.
Các tweet đã được dán nhãn bởi các nhà nghiên cứu là thông tin sai lệch hoặc thực dựa trên một tập hợp các quy tắc định nghĩa trước về ngôn ngữ được sử dụng trong thông tin sai lệch. Đội cũng xem xét các sắc thái trong ngôn ngữ con người và các tính năng ngôn ngữ liên quan đến thông tin sai lệch.
Trước khi đào tạo mô hình, giáo sư ngôn ngữ học xã hội Christine Mallinson của Đại học Maryland Baltimore County đã xác định các tweet cho các phong cách viết liên quan đến thông tin sai lệch, thiên vị và các nguồn tin không đáng tin cậy trong truyền thông.
“Khi chúng tôi thêm các đầu vào vào mô hình, nó đang cố gắng hiểu các yếu tố cơ bản dẫn đến sự tách biệt giữa thông tin tốt và xấu,” Japkowicz nói. “Nó đang học ngữ cảnh và cách các từ tương tác.”
Các nhà nghiên cứu sẽ hiện đang tìm cách cải thiện giao diện người dùng cho mô hình, cũng như khả năng của nó để phát hiện thông tin sai lệch trong các bài đăng trên mạng xã hội bao gồm hình ảnh hoặc các phương tiện truyền thông đa dạng khác. Mô hình thống kê sẽ được yêu cầu học cách các yếu tố khác nhau tương tác với nhau để tạo ra thông tin sai lệch.
Cả Boukouvalas và Japkowicz đều nói rằng trí thông minh con người và khả năng đọc hiểu tin tức là chìa khóa để ngăn chặn sự lan truyền của thông tin sai lệch.
“Thông qua công việc của chúng tôi, chúng tôi thiết kế các công cụ dựa trên học máy để cảnh báo và giáo dục công chúng nhằm loại bỏ thông tin sai lệch, nhưng chúng tôi tin mạnh mẽ rằng con người cần phải đóng một vai trò tích cực trong việc không lan truyền thông tin sai lệch từ đầu,” Boukouvalas nói.












