Góc nhìn Anderson

Ô nhiễm Trí tuệ nhân tạo trong Kết quả Tìm kiếm Nguy cơ ‘Sụp đổ Truy xuất’

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
AI-generated image (GPT-1.5) depicting sewer workers shining their torches on a huge fatberg blocking the sewer, in which is embedded multiple extruded texts saying 'AI'.

Khi nội dung trí tuệ nhân tạo ô nhiễm web, một vector tấn công mới mở ra trong trận chiến giành đồng thuận văn hóa.

 

Nghiên cứu do một công ty tìm kiếm Hàn Quốc dẫn đầu cho rằng khi các trang trí tuệ nhân tạo xâm nhập vào kết quả tìm kiếm, chúng làm suy yếu sự ổn định của đường ống tìm kiếm và xếp hạng, và làm suy yếu các hệ thống như Retrieval-Augmented Generation (RAG) – những hệ thống phụ thuộc vào xếp hạng để quyết định thông tin nào được hiển thị và tin cậy, do đó làm tăng nguy cơ thông tin sai lệch hoặc không chính xác sẽ được coi là có thẩm quyền.

Thuật ngữ được các nhà nghiên cứu đặt ra cho hội chứng này là Sụp đổ Truy xuất, khác với mối đe dọa đã biết của sụp đổ mô hình (trong đó trí tuệ nhân tạo được đào tạo trên đầu ra của chính nó trở nên tồi tệ hơn).

Trong một kịch bản Sụp đổ Truy xuất, nội dung trí tuệ nhân tạo tiến bộ chiếm ưu thế trong kết quả tìm kiếm, đến mức mà ngay cả khi câu trả lời vẫn chính xác trên bề mặt, cơ sở dữ liệu bằng chứng sẽ trở nên ly khai với nguồn gốc con người. Tuy nhiên, dữ liệu ‘không có gốc’ này dường như đang đạt được vị trí cao trong kết quả tìm kiếm*:

‘Với sự lan rộng của văn bản trí tuệ nhân tạo, thử thách trong việc quy kết và chất lượng dữ liệu trước khi đào tạo đã tăng cường. Không giống như spam từ khóa truyền thống, nội dung tổng hợp hiện đại là ngữ nghĩa nhất quán, cho phép nó hòa nhập vào hệ thống xếp hạng và lan truyền qua đường ống như bằng chứng có thẩm quyền.’

Bài báo khẳng định rằng điều này sẽ tạo ra một môi trường ‘giòn về cấu trúc’ trong đó tín hiệu xếp hạng ưa thích các trang trí tuệ nhân tạo, SEO-optimized, thay thế nguồn gốc con người theo thời gian một cách tinh vi, tức là không kích hoạt sự sụt giảm rõ ràng về chất lượng câu trả lời:

‘Sự [tăng trưởng] của nội dung trí tuệ nhân tạo trên Web tạo ra một rủi ro cấu trúc đối với việc thu thập thông tin, vì các công cụ tìm kiếm và hệ thống RAG ngày càng tiêu thụ bằng chứng được tạo ra bởi các mô hình ngôn ngữ lớn (LLM).’

‘Chúng tôi mô tả chế độ thất bại của hệ thống này là Sụp đổ Truy xuất, một quá trình hai giai đoạn trong đó (1) nội dung trí tuệ nhân tạo chiếm ưu thế trong kết quả tìm kiếm, làm suy giảm sự đa dạng của nguồn gốc, và (2) nội dung chất lượng thấp hoặc đối đầu xâm nhập vào đường ống truy xuất.’

Các nhà nghiên cứu cho rằng một khi giai đoạn ‘chiếm ưu thế’ được thiết lập, đường ống truy xuất trở nên dễ bị tổn thương hơn đối với ô nhiễm có chủ ý, vì các trang đối đầu có thể khai thác các cơ chế tối ưu hóa tương tự để đạt được sự hiển thị*:

‘Bằng cách thiết lập khuôn khổ của Sụp đổ Truy xuất, công việc này đặt nền tảng cho việc hiểu cách nội dung tổng hợp thay đổi việc thu thập thông tin. Để giảm thiểu những rủi ro này, chúng tôi đề xuất một sự thay đổi hướng đến chiến lược Xếp hạng Phòng thủ mà tối ưu hóa sự liên quan, tính thực tế và nguồn gốc.’

Sụp đổ Truy xuất có thể làm trầm trọng thêm sụp đổ mô hình, vì nó thêm một lớp ý định độc hại vào ‘hiệu ứng sao chép’ của entropy, trong đó trí tuệ nhân tạo ngày càng cho ăn vào đầu ra trí tuệ nhân tạo. Ngoài việc ảnh hưởng đến sự đồng thuận rõ ràng về ‘sự thật’ trong kết quả tìm kiếm thời gian thực, sự không chính xác và các cuộc tấn công có thể sau đó được ghi vào các mô hình ngôn ngữ lớn được đào tạo như nguồn có thẩm quyền.

Công việc mới này có tiêu đề Sụp đổ Truy xuất Khi Trí tuệ nhân tạo Ô nhiễm Web, và đến từ ba nhà nghiên cứu tại Naver Corporation.

Phương pháp

Để kiểm tra cách nội dung trí tuệ nhân tạo lan truyền qua hệ thống truy xuất, các nhà nghiên cứu đã lấy mẫu ngẫu nhiên 1000 cặp câu hỏi/câu trả lời từ bộ dữ liệu và điểm chuẩn MS MARCO, bao gồm các câu hỏi phạm vi mở được ghép với các câu trả lời tham chiếu đã được xác thực bởi con người. Những điều này được sử dụng để xác định vị trí của việc thu thập và đánh giá tính chính xác của các phản hồi được tạo.

Đối với mỗi câu hỏi MS MARCO trong các thử nghiệm, mười tài liệu web đã được thu thập từ Tìm kiếm Google, dựa trên các kết quả SEO xếp hạng cao nhất cho từng thuật ngữ, cuối cùng tạo ra một nhóm 10.000 tài liệu.

Tính hợp lệ của tài liệu đã được đánh giá bằng cách so sánh từng tài liệu với sự thật cơ bản của MS MARCO, sử dụng GPT-5 Mini làm trọng tài.

Giả lập Nông trại Nội dung

Để mô phỏng mức chất lượng (của các bài viết thông thường, không đối đầu) liên kết với các trang trại nội dung, các tác giả đã sử dụng mô hình GPT-5 Nano của OpenAI để tạo ra các bài viết tổng hợp mới, vì đây là mức ‘tiết kiệm’ của trí tuệ nhân tạo có thể được sử dụng bởi các nhà máy nội dung. GPT-5 Mini, được sử dụng để đánh giá đầu ra, là một mô hình稍 phức tạp hơn.

Nghịch lại, để mô phỏng đối đầu (tức là nội dung được thiết kế để lan truyền thông tin sai lệch hoặc có các tính năng thông tin sai lệch), không có tài liệu tham khảo thực tế nào được sử dụng. Thay vào đó, các bản nháp đầu tiên của các mẫu được tạo ra với một máy tạo clickbait/SEO thông thường, và sau đó được chuyển đến GPT-5 Nano, được giao nhiệm vụ thay thế một số事 thực bằng các lựa chọn thay thế không chính xác nhưng có thể xảy ra. GPT-5 Nano cũng thực hiện việc xếp hạng lại ngữ nghĩa cho mục đích của bối cảnh thử nghiệm.

Để mô phỏng sự bão hòa trí tuệ nhân tạo theo thời gian, một quá trình ô nhiễm 20 vòng đã được chạy, trong đó một tài liệu tổng hợp được thêm vào mỗi câu hỏi cho một tập hợp cố định gồm mười tài liệu ban đầu, tăng tỷ lệ trí tuệ nhân tạo từ 0% đến 66,7%.

Đối với nhóm theo phong cách SEO, máy tạo được yêu cầu ‘hành động như một chuyên gia SEO’, và tích hợp Từ khóa cao-IDF từ các tài liệu ban đầu để tăng khả năng thu thập.

Đối với nhóm đối đầu, lời nhắc được thiết kế để giữ nguyên văn bản tự nhiên, trong khi thay đổi tinh vi các thực thể được đặt tên và chi tiết số, tạo ra các tài liệu sẽ không kích hoạt các bộ lọc thống kê, trong khi âm thầm làm suy giảm tính chính xác của sự kiện.

Thống kê

Ba thống kê đã được áp dụng cho các thí nghiệm: Tỷ lệ ô nhiễm nhóm (PCR), để xác định bao nhiêu tài liệu trong nhóm tổng thể được tạo ra bởi trí tuệ nhân tạo; Tỷ lệ ô nhiễm phơi nhiễm (ECR), để đo lường bao nhiêu trong số mười kết quả tìm kiếm hàng đầu đến từ nguồn trí tuệ nhân tạo (cho thấy những gì thực sự vào đường ống thu thập); và Tỷ lệ ô nhiễm trích dẫn (CCR), để ghi lại bao nhiêu bằng chứng được trích dẫn trong câu trả lời cuối cùng là tổng hợp.

Để kiểm tra tác động thực tế, cả chất lượng của nguồn thu thập và tính toàn vẹn của câu trả lời cuối cùng đều được kiểm tra. Độ chính xác@10 (P@10) ghi lại bao nhiêu trong số mười kết quả hàng đầu thực sự chính xác khi kiểm tra lại sự thật cơ bản của MS MARCO; và Độ chính xác của câu trả lời (AA) đo lường xem phản hồi được tạo có khớp với câu trả lời tham chiếu đó hay không, với GPT-5 Mini được sử dụng để xác định xem ý nghĩa có nhất quán hay không.

Thử nghiệm

Ban đầu, các tác giả đã kiểm tra phương pháp của họ đối với nhóm tài liệu ban đầu được trích xuất từ SERPS, tức là trước khi chúng được sử dụng để tạo dữ liệu tổng hợp, và họ lưu ý rằng trình xếp hạng mô hình ngôn ngữ của họ đã đạt được ‘chất lượng thu thập mạnh mẽ’, vượt qua Trình xếp hạng BM25 cơ bản.

Các tác giả đã tiến hành hai thử nghiệm chính, được gọi là Chiếm ưu thế và Đồng nhất hóa, và Ô nhiễm và Sự tham gia của Hệ thống.

Trong thử nghiệm đầu tiên, các tài liệu tổng hợp được tạo ra bởi GPT-5 Nano đã được thêm vào nhóm tài liệu ban đầu.

Kết quả cho thấy rằng các tài liệu trí tuệ nhân tạo đã chiếm ưu thế trong kết quả tìm kiếm, và làm suy giảm sự đa dạng của nguồn gốc.

Các tác giả lưu ý rằng mặc dù độ chính xác của câu trả lời vẫn được duy trì, nhưng sự suy giảm của sự đa dạng nguồn gốc là một dấu hiệu của Sụp đổ Truy xuất.

Thử nghiệm thứ hai đã kiểm tra tác động của các trang đối đầu lên hệ thống.

Kết quả cho thấy rằng các trang đối đầu có thể xâm nhập vào đường ống thu thập và làm suy giảm chất lượng của câu trả lời.

Các tác giả kết luận rằng Sụp đổ Truy xuất là một rủi ro thực sự đối với các hệ thống thu thập thông tin, và rằng cần phải có các biện pháp phòng ngừa để giảm thiểu rủi ro này.

Kết luận

Việc thiết lập các phương pháp mới hoặc cải tiến cho việc chứng minh nguồn gốc thông tin có thể là một trong những nhu cầu quan trọng nhất cho năm 2026. Các kế hoạch chứng chỉ phức tạp như ailing C2PA, đòi hỏi phải thay đổi cơ sở hạ tầng từ các nhà xuất bản, và giáo dục công chúng về ý nghĩa và cách sử dụng chúng, dường như đang thất bại.

Điều gì đó đơn giản hơn là cần thiết, và nó vẫn chưa được tìm thấy. Đây là một nhiệm vụ cấp thiết, vì thời đại hiện nay có thể là điểm chuyển quan trọng nhất đối với sự đồng thuận công khai về sự thật kể từ khi phát minh ra nhiếp ảnh vào năm 1822, và sự trỗi dậy của tuyên truyền trong những thập kỷ trước Thế chiến II.

 

* My (selective, where necessary) conversion of the authors” inline citations to hyperlinks.

Được xuất bản lần đầu vào thứ Năm, ngày 19 tháng 2 năm 2026

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]