Góc nhìn Anderson
Đưa ra những câu trả lời lỗi thời với Máy học

Đôi khi sự thật có ngày hết hạn. Khi một tuyên bố có thời hạn (chẳng hạn như ‘khẩu trang là bắt buộc trên phương tiện công cộng’) xuất hiện trong xếp hạng công cụ tìm kiếm, giải pháp ‘chính thức’ rõ ràng của nó có thể ở lại quá lâu, thậm chí nhiều năm, vượt qua nội dung mới hơn và chính xác hơn về cùng một chủ đề.
Đây là một sản phẩm phụ của các thuật toán công cụ tìm kiếm nhằm xác định và thúc đẩy ‘giải pháp lâu dài’, và của xu hướng ưu tiên nội dung được liên kết tốt và duy trì lưu lượng truy cập theo thời gian – và của thái độ ngày càng thận trọng đối với nội dung mới trong thời đại tin tức giả đang phát triển.
Mặt khác, việc đánh giá thấp nội dung web có giá trị chỉ vì dấu thời gian liên kết với nó đã vượt qua một ‘cửa sổ hợp lệ’ tùy ý sẽ rủi ro rằng một thế hệ nội dung thực sự hữu ích sẽ bị tự động hạ cấp để ủng hộ vật liệu sau này có thể có tiêu chuẩn thấp hơn.
Để khắc phục hội chứng này, một bài báo mới từ các nhà nghiên cứu ở Ý, Bỉ và Đan Mạch đã sử dụng nhiều kỹ thuật máy học để phát triển một phương pháp luận cho xếp hạng bằng chứng nhận thức thời gian.
Vượt qua những câu trả lời lỗi thời
Bài báo này được viết bởi các nhà nghiên cứu từ Ủy ban Châu Âu tại Trung tâm Nghiên cứu Liên hợp (JRC) ở Ispra, Đại học Katholieke ở Leuven và Đại học Copenhagen.
Công việc này xem xét bốn phương pháp xếp hạng thời gian áp dụng trên ba phương pháp kiểm tra thực tế, mỗi phương pháp có cách tiếp cận khác nhau để xếp hạng bằng chứng, và đưa ra một phương pháp luận mới để xếp hạng sử dụng dấu thời gian bằng chứng như một ‘tiêu chuẩn vàng’. Nghiên cứu cho thấy rằng xếp hạng bằng chứng nhận thức thời gian cải thiện sự sắc sảo của kết quả, và cũng cải thiện dự đoán về quyền lực và tính xác thực của các sự kiện và tuyên bố nhạy cảm với thời gian.
Nghiên cứu này được đề xuất như một phần bổ sung có thể cho các hệ thống hiện có hoặc sau này, và được thiết kế để hỗ trợ nghiên cứu, và như một yếu tố bổ sung có thể cho việc phát triển các thuật toán công cụ tìm kiếm mới và tiến hóa.
Công việc này mô hình hóa các động lực thời gian của bằng chứng cho việc kiểm tra thực tế dựa trên nội dung, và vượt trội so với các phương pháp ‘tương đồng ngữ nghĩa’ được các thuật toán xếp hạng công cụ tìm kiếm thông thường áp dụng. Mô hình được đào tạo bởi các nhà nghiên cứu sử dụng một hàm học để xếp hạng được tối ưu hóa có thể dễ dàng chồng lên một kiến trúc kiểm tra thực tế hiện có. Các nhà nghiên cứu cho rằng hệ thống này là một đóng góp mới cho việc kiểm tra thực tế tự động.
Chỉnh sửa nhiều kiến trúc kiểm tra thực tế
Các nhà nghiên cứu đã áp dụng yếu tố thời gian hạn chế của họ vào ba kiến trúc kiểm tra thực tế hiện có. Đầu tiên là mô hình Bộ nhớ ngắn hạn hai chiều (BiLSTM) được đề xuất trong tập dữ liệu MultiFC được phát hành vào năm 2019.
Thứ hai là một sửa đổi của cái đầu tiên, với một mạng nơ-ron hồi quy một chiều (RNN) thay thế thành phần LSTM.
Mô hình thứ ba mà các nhà nghiên cứu sử dụng là một DistilBERT transformer từ thư viện Hugging Faces, một phiên bản tinh gọn của mô hình BERT NLP của Google.
Trên cả ba kiến trúc, các nhà nghiên cứu đã áp dụng một tổn thất ListMLE, từ nghiên cứu do Microsoft dẫn đầu, đã góp phần nhất quán vào nghiên cứu kiểm tra thực tế mới trong hai thập kỷ qua.

Hai mô hình kiểm tra thực tế chính mà nhóm nghiên cứu đã thêm một thành phần thời gian như một bộ lọc cho quyền lực và giá trị xếp hạng sau đó. Nguồn: https://arxiv.org/pdf/2009.06402.pdf
Các giá trị dấu thời gian được trích xuất từ siêu dữ liệu đào tạo, và bao gồm như các yếu tố xếp hạng trong mỗi mô hình.
Thử nghiệm
Đánh giá thử nghiệm cho hệ thống này liên quan đến việc sử dụng tập dữ liệu MultiFC, vì nó hiện là tập dữ liệu nguồn mở duy nhất có sẵn cho lợi ích nghiên cứu này. MultiFC chứa 34.924 tuyên bố thực tế thu được từ 26 miền kiểm tra thực tế khác nhau, bao gồm Snopes và Washington Post.
Dự đoán tính xác thực của mỗi tuyên bố được tăng cường bởi mười đoạn bằng chứng được cung cấp bởi API Tìm kiếm Google, và dự đoán thu được thông qua sự kết hợp của các yếu tố, bao gồm người nói, thẻ và danh mục.
Rất thường dấu thời gian liên quan không nhất thiết phải là dấu thời gian chứa trong siêu dữ liệu; một bài viết có thể đề cập đến các sự kiện từ thời gian trước, và trong trường hợp này, hệ thống của các nhà nghiên cứu phải cẩn thận trích xuất và chuyển đổi dữ liệu đó trực tiếp từ văn bản. Nếu không có quá trình này, một ‘chạy lại’ của tin tức lỗi thời sẽ có xu hướng đưa cho nó một lớp vỏ mới, đặc biệt là trong trường hợp các trang web có thẩm quyền cao, lan truyền dữ liệu lỗi thời.
Các ngày đã được trích xuất bằng một chương trình Python, và các ngày chính thức của siêu dữ liệu đã được kiểm tra tính nhất quán về định dạng (vì, ví dụ, định dạng ngày tháng của Mỹ và Vương quốc Anh khác nhau). Khi được xác minh thủ công, không có lỗi nào được tìm thấy trong siêu dữ liệu dấu thời gian.
Kết quả
So với kiểm tra thủ công của kết quả tự động, các nhà nghiên cứu đã tìm thấy rằng xếp hạng bằng chứng nhận thức thời gian cải thiện đáng kể về các giả định về sự liên quan dựa trên sự tương đồng ngữ nghĩa thuần túy hoặc xếp hạng SERPs. Họ cũng khẳng định rằng phương pháp của họ cải thiện dự đoán về tính xác thực cho các tuyên bố nhạy cảm với thời gian (tức là các tình huống mà một tình huống tin tức có thể thay đổi nhanh chóng, và nơi thông tin cập nhật phải được ưu tiên mà không chỉ ép buộc việc ưu tiên các kết quả mới nhất trên một chủ đề).
Các nhà nghiên cứu lưu ý rằng cách tiếp cận này sẽ có giá trị cao trong việc cải thiện các mô hình xếp hạng cho các chủ đề dễ thay đổi như chính trị và giải trí, nơi thông tin thay đổi nhanh chóng, và các phát triển có thứ hạng cao đòi hỏi một khuôn khổ cho việc tự động hạ cấp từ các vị trí hàng đầu trong xếp hạng mà họ có thể đã đạt được khi phát hành.












