Góc nhìn Anderson
AI Trích Dẫn Các Bài Báo Cùng Một Lần Lặp Lại – Giống Như Con Người

ChatGPT và các công cụ viết AI khác có thể đang lặng lẽ biến khoa học thành một cuộc thi phổ biến, liên tục hướng các nhà nghiên cứu tới cùng những bài báo trong khi bỏ qua các công trình mới và độc đáo có thể thực sự thúc đẩy lĩnh vực.
Monoculture, về tần suất và thống kê, là nơi cùng một tập hợp hạn chế các nguồn hoặc tài sản lặp đi lặp lại, làm ngập lụt các tiếng nói mới và quan điểm mới: cùng một bộ hạn chế các bài hát trong lịch phát thanh; cùng một đoạn đồng nhất các tác giả và sách trong các kệ sân bay; và cùng một lựa chọn hạn chế các loại trái cây và rau quả trong siêu thị:

Điều này cũng xuất hiện trong các trích dẫn xuất hiện trong nghiên cứu khoa học mới, nơi các nhà nghiên cứu, có thể một cách lười biếng, mặc định vào một tập hợp “đáng tin cậy” các nguồn mà dần dần chiếm ưu thế cho đến khi chúng thống trị các nhánh nghiên cứu.
Điều này được biết đến là Hiệu Ứng Matthew – một lý thuyết xã hội học cho rằng các vị trí đã có sẽ luôn được lợi; hội chứng này đã được so sánh với lời hứa trong Ma-thi-ơ 13:12, mà nói ‘Ai có sẽ được cho thêm, và họ sẽ có dư thừa. Ai không có, ngay cả những gì họ có cũng sẽ bị lấy đi’.
Những Người Trong Nhóm
Một trong những hi vọng lớn của nghiên cứu được hỗ trợ bởi AI là các phương pháp học máy mới có thể phá vỡ Hiệu Ứng Matthew – còn được gọi là thiên vị phổ biến – và bắt đầu trích dẫn các công trình ít được biết đến có thể sâu sắc hơn, hoặc phù hợp hơn với luận điểm của một bài báo.
Tuy nhiên, dựa trên cách các quy trình huấn luyện AI diễn giải bộ dữ liệu, chưa bao giờ có lý do tốt cho sự lạc quan này; và đã được chứng minh lặp đi lặp lại rằng khi AI không tự sáng tạo trích dẫn một cách thô – một vấn đề mãn tính đến nay – nó thực sự tiếp tục Hiệu Ứng Matthew, giống như con người – dù có thể không vì cùng một lý do.
Trong quá trình huấn luyện, một mô hình sẽ học cách xếp hạng cao các bài báo được trích dẫn nhiều nhất (hoặc “được lặp lại thường xuyên”) trong tập huấn luyện, vì các quy trình huấn luyện được thiết kế để khai thác các mẫu có ý nghĩa, và để loại bỏ các ngoại lệ như “nhiễu” hoặc các bất thường thống kê.
Dưới chế độ này, tương đương với thuyết tương đối của Einstein sẽ không bao giờ nhận được sự chú ý từ máy, vì một khi đã được huấn luyện, nó cảm thấy mình đã tìm thấy các nguyên tắc và tham chiếu, và chỉ có thể điều chỉnh nhẹ bằng cách tiếp cận các ấn phẩm mới thông qua RAG, hoặc các phương pháp khác mở rộng phạm vi của mô hình vượt ra ngoài ma trận đã huấn luyện.
Vấn đề là, nó sẽ không công nhận những công trình mới này theo cùng cách như những “đồ cũ yêu thích” mà nó đã biết, hoặc thậm chí không công nhận chúng, vì các thiên kiến thống kê đã ăn sâu vào mô hình.
Do đó AI không thực sự quan sát và bắt chước hành vi con người khi nó duy trì Hiệu Ứng Matthew – nó chỉ đếm số lần các nhà nghiên cứu lười biếng mặc định vào cùng những bài báo cũ, và xếp hạng cao những bài báo đó. Ở khía cạnh này, vấn đề lặp lại trích dẫn liên quan đến thách thức lựa chọn một bài báo khoa học thực sự thú vị trong cơn bão ngày càng tăng các ấn phẩm nghiên cứu AI, vì công trình mạnh nhất thường có tín hiệu yếu nhất.
Chẩn Đoán Mono
Vấn đề này được đề cập trong một bài báo mới thú vị từ Hoa Kỳ có tiêu đề When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Công trình mới – hợp tác giữa University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University và University of Notre Dame – nhằm chứng minh một cách dứt khoát sự tồn tại của “monoculture” trích dẫn trong học máy, để các biến số có thể được giải quyết trực tiếp trong tương lai, cùng với vấn đề tự nó.
Trong các thí nghiệm, các tác giả phát hiện mười một mô hình từ OpenAI, Google và Anthropic liên tục ưa thích cùng một nhóm nhỏ các bài báo – ngay cả sau khi các tín hiệu phổ biến đã bị loại bỏ.
Để kiểm tra, 120 bài báo thực tế đã được tước bỏ số lần trích dẫn và nơi xuất bản, trong khi tên tác giả được thay thế, và năm xuất bản được gán ngẫu nhiên. Các tập hợp ngẫu nhiên gồm ba mươi bài báo sau đó được đưa cho mỗi mô hình, và mỗi mô hình chỉ được phép trích dẫn không quá mười bài.
tám chuyên gia con người trong các lĩnh vực liên quan đã nhận cùng những bài báo mù, nhưng không đồng nhất với những bài ưa thích của AI, chứng tỏ thiên kiến cụ thể với các mô hình AI chứ không phải do các bài báo tự chúng.

Các bài báo vẫn được ưa chuộng ngay cả khi các mô hình chỉ được yêu cầu chọn các tài liệu tham khảo, cho thấy việc viết bản đánh giá không phải là nguyên nhân gây ra thiên kiến.
Thí nghiệm sau đó được mở rộng trong mười một vòng, với 120 bài báo do AI viết được thêm vào sau mỗi vòng, để kiểm tra điều gì xảy ra khi các sở thích chung này hoạt động trong một bể tài liệu nghiên cứu do AI tạo ra ngày càng lớn.
Khi càng nhiều bài báo do AI viết được thêm vào, các mô hình ngày càng tập trung trích dẫn vào số lượng ngày càng giảm của các bài báo do con người ban đầu.
Các tác giả tuyên bố:
‘Khi các mô hình ngôn ngữ chuyển từ việc soạn thảo văn bản sang chạy các tác nhân tìm kiếm tài liệu với các lời gọi công cụ, các tài liệu giả mạo trở nên dễ dàng phát hiện và kiểm soát hơn.
‘Lỗi nghiêm trọng hơn bắt đầu sau khi mọi đề xuất đều là thực tế: các mô hình khác nhau vẫn có thể chọn cùng một tập hợp hẹp, tạo ra monoculture trích dẫn mà không có một trích dẫn nào là sai.’
Để khắc phục vấn đề, bài báo cho rằng chỉ đơn giản trộn lẫn các mô hình từ các nhà cung cấp khác nhau hoặc cho các bài báo cùng mức độ phơi bày sẽ không đủ, vì phần lớn sở thích đã được chia sẻ giữa các mô hình. Thay vào đó, ưu tiên cơ bản đối với các bài báo cụ thể cần phải thay đổi – có thể bằng cách cố ý tăng cường độ hiển thị cho các bài báo bị bỏ qua. Tuy nhiên, các tác giả nhấn mạnh rằng cách tiếp cận này vẫn chưa được thử nghiệm.
Phương Pháp Kiểm Tra
Bộ chuẩn được xây dựng từ 120 bài báo thực tế về kiến thức được tách rời, thu thập từ arXiv và xuất bản trong giai đoạn 2015‑2022. Mỗi bài có từ 50‑500 trích dẫn tại thời điểm thu thập, một phạm vi được chọn để loại trừ cả các công trình hiếm và những công trình có ảnh hưởng quá lớn.
Thí nghiệm bắt đầu bằng cách rút ngẫu nhiên ba mươi bài báo từ bộ sưu tập có sẵn, với tên tác giả, năm xuất bản và số lần trích dẫn được ẩn. Mỗi mô hình tạo ra một bản đánh giá ngắn hoặc một đoạn vị trí, trích dẫn không quá mười bài, và các lựa chọn này được so sánh với các lựa chọn ngẫu nhiên từ cùng tài liệu:

Trong thí nghiệm mở rộng, 120 bài báo mới được tạo ra sẽ vào bộ sưu tập sau mỗi vòng, dần dần tăng tỷ lệ nghiên cứu do AI viết.
Trong các thử nghiệm sơ bộ, các mô hình có xu hướng trích dẫn hầu hết các bài báo mà chúng được đưa ra, thường chọn 22‑27 trong số 30. Do đó các nhà nghiên cứu đã đặt giới hạn tối đa mười trích dẫn cho thí nghiệm chính, buộc các mô hình phải lựa chọn một cách chọn lọc hơn.
Dưới đây là tóm tắt thiết kế thí nghiệm:

Thí nghiệm ban đầu sử dụng mười một mô hình từ ba nhà cung cấp chính: OpenAI được đại diện bởi GPT-5, GPT-5 mini, GPT-4.1 và GPT-4.1 mini; Google bởi Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro và Gemini 3.1 Flash-Lite; và Anthropic bởi Claude Opus 4.8, Claude Sonnet 4.6 và Claude Haiku 4.5.
Trong kết quả thử nghiệm được trình bày dưới đây, chúng ta thấy mức độ mỗi mô hình tập trung trích dẫn vào một nhóm nhỏ các bài báo; số lượng bài báo bị bỏ qua hoàn toàn; và mức độ nhất quán khi các thí nghiệm được lặp lại:

Những Mô Hình Thực Sự Ưa Thích Gì?
Ưu tiên được phát hiện phần lớn do nội dung của các bài báo quyết định. Ví dụ, đối với GPT-5 mini, khoảng 90% sự biến thiên trong việc ưu tiên các bài báo được giải thích bởi nội dung, chứ không phải các yếu tố như thứ tự danh sách, nhiễu sinh hoặc siêu dữ liệu giả tạo gắn vào mỗi bài. Hiệu ứng “nội dung chi phối” tương tự cũng được tái tạo với GPT-4.1 mini.
Bản đồ ưu tiên (xem bên dưới) cũng hầu như không thay đổi khi tiêu đề và tóm tắt được viết lại đáng kể trong khi vẫn giữ nguyên ý nghĩa. Trong bốn thử nghiệm diễn đạt lại thành công, các hệ số tương quan đạt 0.95‑0.99, mặc dù các mô hình từ ba nhà cung cấp khác nhau được dùng để viết lại.
Thay đổi trong bản đồ ưu tiên chỉ xuất hiện khi ý nghĩa cơ bản bị thay đổi một cách đáng kể:

Do đó các mô hình dường như phản ứng chủ yếu dựa trên nội dung ngữ nghĩa hơn là cách diễn đạt cụ thể. Tuy nhiên, nguyên nhân của sự đồng thuận mạnh mẽ này chưa thể xác định một cách chắc chắn.
Có khả năng, các tác giả cho rằng một đồng thuận trích dẫn chung đã được hấp thụ trong quá trình huấn luyện. Một khả năng thay thế là các đánh giá tương tự về những gì cấu thành một bài báo “có thể trích dẫn” có thể được đạt được một cách độc lập.
Vì vậy, sự tồn tại của sở thích chung đã được chứng minh, nhưng nguồn gốc cuối cùng của nó vẫn chưa được biết.
Các tác giả đề xuất rằng việc sử dụng AI rộng rãi trong nghiên cứu có thể thu hẹp phạm vi các công trình nhận được sự chú ý, vì các mô hình khác nhau có xu hướng ưu tiên nhiều bài báo giống nhau; và khi tài liệu do AI tạo ra tích lũy, những sở thích chung này có thể được củng cố thêm qua các trích dẫn lặp lại, khiến các nghiên cứu ít được ưu ái ngày càng khó phát hiện. Do đó, đa dạng trích dẫn và giám sát mức độ tập trung trích dẫn được đề xuất như các biện pháp bảo vệ tiềm năng.
Bộ chuẩn cho sự tập trung trích dẫn đệ quy của nghiên cứu hiện có trên GitHub.
Kết Luận
Ý Kiến Với tư cách là người đọc một số lượng lớn các bài báo nghiên cứu AI mỗi tuần, tôi đã chứng kiến “đợt sóng trích dẫn” xuất hiện và biến mất. Một “điểm tựa” lâu dài là Attention Is All You Need, bài báo gốc về Transformers, mà giờ đây dường như đã được mã hoá vào các mẫu nộp bài.
Một tác phẩm lặp lại khác, trong thời gian dài, là Generative Adversarial Networks năm 2014, mặc dù cuối cùng nó đã bị thay thế về tần suất bởi Denoising Diffusion Probabilistic Models và các nghiên cứu nền tảng dựa trên khuếch tán khác.
Trong hầu hết các trường hợp, những trích dẫn “đều đặn” này không sai theo nghĩa đen; nhưng chúng thường quá rộng để thực sự hỗ trợ cho bài báo mà chúng được trích dẫn; và theo cách này, chúng đại diện cho một hiện tượng gần giống “rửa trích dẫn” – việc chèn các nguồn “đáng tin cậy” nhưng chủ yếu mang tính trang trí, nhằm tạo ra một vẻ bề ngoài uy tín với công sức thấp.
Được xuất bản lần đầu vào Thứ Hai, ngày 24 tháng 8 năm 2026. Được sửa vào 23:07 EET để thêm số nhiều còn thiếu.












