Góc nhìn Anderson

Chống lại AI Slop trong các bài báo khoa học

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

AI thực hiện mọi việc ở quy mô lớn, từ công cụ thu thập dữ liệu mức độ tấn công DOS đến việc tạo ra, hoặc cho phép, khối lượng khổng lồ như vậy các bản nộp nghiên cứu khoa học đến mức kết quả đang trở thành cả khủng hoảng hậu cần và một khủng hoảng chất lượng, khi tỉ lệ tín hiệu‑nhiễu tiếp tục trở nên không thể điều hướng.

Tuần trước, máy chủ preprint arXiv đã công bố rằng sẽ áp dụng chính sách giới hạn tốc độ mới cho những người nộp, hiện sẽ bị giới hạn tối đa hai bản nộp mỗi tháng. Biện pháp này, theo thông báo, được thực hiện trong bối cảnh tỉ lệ nộp bài tăng vọt trong một khoảng thời gian ngắn:

Số lượng bản nộp hàng tháng vào danh mục cs.AI của arXiv từ tháng 1/2024 đến tháng 9/2026, cho thấy mức tăng hơn sáu lần trong khoảng thời gian này. Nguồn - https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Số lượng bản nộp hàng tháng vào danh mục cs.AI của arXiv từ tháng 1/2024 đến tháng 9/2026, cho thấy mức tăng hơn sáu lần trong khoảng thời gian này. Nguồn

Bài blog của Kat Boboris công bố bước đi này, trong đó đã nhận được bình luận trên Hacker News vào thứ Năm vừa qua, cho biết arXiv đã nhận được 40,363 bản nộp vào tháng 9/2026 – gần gấp đôi 20,569 bản nộp vào tháng 9/2024, và hơn bốn lần 9,869 bản nộp vào tháng 9/2016.

Các bản nộp của tháng mới nhất, Boboris quan sát, cũng đã tạo ra gần 9,000 vé hỗ trợ cho nhân viên và người điều hành arXiv:

‘Các người điều hành của chúng tôi đang nhận thấy sự gia tăng các bài báo mỏng có phạm vi hẹp, cũng như các bài báo ‘salami’, trong đó một công trình duy nhất bị chia nhỏ và nộp dưới dạng một tập hợp các bài báo nhỏ hơn.

‘Cũng có sự gia tăng đáng kể các bài báo dày đặc, do AI viết. Các công cụ AI đang làm cho các tác giả dễ dàng tràn ngập arXiv và các kho lưu trữ khác bằng những bài báo có giá trị thấp này.’

Đã vào tháng 5 năm nay, arXiv đã thực hiện biện pháp cấm một năm cho nội dung AI không được kiểm soát; và vào tháng 10 năm ngoái, đã thông báo với những người nộp các bài khảo sát và bài vị trí (cả hai đều có thể được tạo ra với ít nỗ lực hơn so với một nghiên cứu học thuật đầy đủ) rằng họ sẽ cần sự hỗ trợ từ đồng nghiệp để được công bố trên arXiv.

Hiện tại, việc giới hạn các yêu cầu http của miền arXiv thường gây cản trở không quá rõ ràng, và chỉ có thể hy vọng các nguồn cấp RSS rất hữu ích của nó sẽ tồn tại qua đợt cắt giảm đang diễn ra. Tuần trước Reddit đã công bố việc loại bỏ hoàn toàn các nguồn cấp RSS mà đã được lo ngại từ lâu, sẽ diễn ra từ giữa tháng tới. Tuy nhiên, tình trạng phi lợi nhuận của arXiv đồng nghĩa với việc có ít vốn tương tự có thể thu được bằng cách đưa độc giả đến các lượt truy cập bắt buộc, hoặc đăng nhập bắt buộc – ít nhất, vào thời điểm hiện tại.

Đối Phó Với Làn Sóng Gia Tăng

Trước những vấn đề nghiêm trọng và ngày càng tăng về tác động tiêu cực của việc sử dụng AI trong nghiên cứu khoa học – đặc biệt là nghiên cứu liên quan đến AI, vốn đã làm lu mờ tất cả các danh mục khác, và đã vươn lên từ tầm hầm hố để trở thành một dấu hiệu chính trị và kinh tế gần đây – một nhánh nghiên cứu đã xuất hiện nhằm khám phá các cách để chống lại sự suy giảm chất lượng của các bản nộp bài báo liên quan đến AI.

Giải pháp mới nhất để giải quyết vấn đề này xuất hiện dưới dạng một sự hợp tác giữa Đại học Quốc gia Seoul của Hàn Quốc và Đại học Minnesota ở Hoa Kỳ. bài báo, có tiêu đề Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, đề xuất đo lường ‘scientific slop’ thông qua các thất bại trong việc kết nối giữa các tuyên bố, bằng chứng, trích dẫn và cấu trúc của một bài báo:

Từ bài báo mới, tổng quan về cách tiếp cận 'scientific slop' của công trình, cho thấy cách các thất bại trong cấu trúc, lập luận và các tài liệu hỗ trợ có thể bộc lộ những điểm yếu mà các bộ phát hiện văn bản AI thông thường bỏ qua. Nguồn - https://arxiv.org/pdf/2610.00531

Từ bài báo mới, tổng quan về cách tiếp cận ‘scientific slop’ của công trình, cho thấy cách các thất bại trong cấu trúc, lập luận và các tài liệu hỗ trợ có thể bộc lộ những điểm yếu mà các bộ phát hiện văn bản AI thông thường bỏ qua. Nguồn

Khác với các cách tiếp cận trước đây, hệ thống mới xem xét vượt ra ngoài văn bản để đánh giá liệu các tuyên bố của bài báo có được hỗ trợ đúng cách bởi lập luận, bằng chứng và trích dẫn hay không. Các tác giả ghi chú*:

‘Mỗi phần của một bài báo có thể trông hợp lý khi xét riêng lẻ, vì vậy những sự cố này không thể phát hiện bằng các bộ phát hiện cấp token và chỉ có thể được nhận dạng hoặc sửa chữa ở mức độ toàn bộ bài báo. Để đo lường và giảm thiểu scientific slop, bài báo này đề cập đến ba thách thức.

‘Thứ nhất, các chỉ số cấp token không nắm bắt được cách lý luận khoa học liên kết qua một bài báo. Các phần, tuyên bố, trích dẫn, bằng chứng và tài liệu có thể mỗi đều trông hợp lý trong khi các mối quan hệ giữa chúng lại suy sụp. Chúng tôi liên tục quan sát những thất bại như vậy trong các bài báo được tạo ra hoàn toàn bằng AI, và các nhà đánh giá ICLR đã phạt chúng ngay cả trong các bản nộp do con người viết.

‘Thứ hai, việc phát hiện các mẫu này vẫn chưa được đo lường. Các bộ test hiện có chỉ gắn nhãn văn bản, vì vậy mức độ mà các bộ phát hiện, bao gồm cả các mô hình ngôn ngữ lớn đọc toàn bộ bài báo, xác định các mẫu này chưa bao giờ được đo lường.

‘Thứ ba, các mẫu này khó khắc phục một cách đáng tin cậy. Trong khi các tín hiệu mức token có thể được loại bỏ bằng cách diễn đạt lại, việc sửa chữa các mẫu này đòi hỏi khôi phục các mối quan hệ thiếu hụt mà không thay đổi nội dung khoa học nền tảng.’

Bộ chuẩn mới của các tác giả, được đặt tên SciSlopBench, đã được tích hợp vào SciSlopHarness, một khung được thiết kế để phát hiện và sửa chữa các lỗi trong lập luận khoa học của một bài báo, đồng thời bảo tồn bằng chứng khoa học nền tảng:

Các ví dụ so sánh đoạn văn lỗi với các sửa đổi do SciSlopHarness thực hiện. Các bổ sung không được hỗ trợ bị loại bỏ, trong khi các tuyên bố được sắp lại hoặc viết lại khi cần thiết để phản ánh tốt hơn bằng chứng có sẵn trong bài báo.

Các ví dụ so sánh đoạn văn lỗi với các sửa đổi do SciSlopHarness thực hiện. Các bổ sung không được hỗ trợ bị loại bỏ, trong khi các tuyên bố được sắp lại hoặc viết lại khi cần thiết để phản ánh tốt hơn bằng chứng có sẵn trong bài báo.

Bộ chuẩn SciSlopBench tự nó được xây dựng từ 390 bài báo do AI tạo, mỗi bài được ghép đôi với một bài báo do con người viết, giải quyết một vấn đề nghiên cứu và loại đóng góp tương tự.

Trong các thử nghiệm, SciSlopBench được sử dụng để phân biệt giữa 390 cặp bài báo, mỗi cặp gồm bài báo do AI tạo đã nêu ở trên, và một bài báo do con người viết được ghép đôi theo vấn đề nghiên cứu và loại đóng góp. Bộ chuẩn đã xác định đúng bài báo do AI tạo trong 85,9% các so sánh này, vượt trội đáng kể so với các bộ phát hiện văn bản AI thông thường.

Các tác giả cho biết:

‘Trong khi các sửa đổi tiêu chuẩn để lại dư thừa và việc nhắc nhở có nhận thức về slop kích hoạt việc hack phần thưởng, SciSlopHarness giảm khoảng cách còn lại giữa AI và con người xuống 63% so với baseline sửa đổi mạnh nhất mà không cần các mục tiêu tham chiếu của con người.’

‘Tổng thể, chúng tôi chứng minh rằng các bài báo khoa học do AI tạo để lại các dấu vết cơ bản trong lập luận toàn cục của chúng, và rằng việc giảm thiểu có trách nhiệm đòi hỏi nền tảng bằng chứng nghiêm ngặt thay vì chỉ tinh chỉnh văn bản.’

Ngoài các đóng góp do chính bài báo đưa ra, các tác giả đã vận hành các nguyên tắc của công trình mới dưới dạng một bản demo trực tiếp nơi người dùng có thể gửi các bài báo khoa học để phân tích mức độ slop AI mà chúng chứa.

Thú vị là, chính bài báo mới, được phân tích bởi bản demo, đạt một điểm slop ‘trung bình’ là 40/100†:

Bài báo mới, được phân tích bởi thuật toán của chính nó, đánh dấu các khu vực 'slop' được xác định bởi quy trình mới của các tác giả. Nguồn: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

Bài báo mới, được phân tích bởi thuật toán của chính nó, nhận được các khu vực ‘slop’ được đánh dấu bởi quy trình mới của các tác giả. Nguồn

Phương pháp và Cách tiếp cận Dữ liệu

Sự hợp tác 2025 Tại sao Slop Quan trọng mô tả ‘năng lực hời hợt’ như một đặc điểm định nghĩa của AI slop, nơi chất lượng bề ngoài che giấu sự thiếu nội dung. Công trình mới áp dụng ý tưởng này một cách cụ thể hơn cho các bài báo khoa học, định nghĩa ‘slop khoa học’ là những thất bại khiến khó theo dõi cách một nghiên cứu được tổ chức; cách các tuyên bố được hỗ trợ; và cách các phương pháp và bằng chứng có thể được kiểm tra, với các thất bại được nhóm thành cấu trúc; luận điểm; và các hiện vật:

Quy tắc đo lường cho sáu loại slop khoa học được sử dụng trong bộ chuẩn. Bảng cho thấy những gì được kiểm tra cho mỗi đo lường, cách tính điểm, và ý nghĩa của điểm tối đa 1, với điểm cao hơn cho thấy các thất bại lan rộng hơn.

Quy tắc đo lường cho sáu loại slop khoa học được sử dụng trong bộ chuẩn. Bảng cho thấy những gì được kiểm tra cho mỗi đo lường, cách tính điểm, và ý nghĩa của điểm tối đa 1, với điểm cao hơn cho thấy các thất bại lan rộng hơn.

Sáu đo lường slop khoa học được định nghĩa trong bài báo là tham chiếu chéo phần (liệu các phần có tham chiếu có ý nghĩa tới tài liệu ở nơi khác trong bài); độ dư thừa macro (liệu các phần sau có lặp lại nội dung của các phần trước); đồ thị luận điểm (liệu các tuyên bố được hỗ trợ đúng bởi lập luận trước); cô lập trích dẫn (liệu các trích dẫn được sử dụng một cách hời hợt, mà không giải thích cách các công trình được trích dẫn liên quan đến bài báo hoặc lẫn nhau); trình bày hình ảnh (liệu các hình minh họa phương pháp thực sự giải thích phương pháp); và khoảng trống bằng chứng (liệu kết quả được báo cáo có được hỗ trợ bởi các ví dụ cụ thể).

Bộ chuẩn được xây dựng bằng cách ghép cặp các bài báo do AI tạo với các bài báo do con người viết tương đương, với các bài báo AI được tuyển chọn từ FARS và cuộc thi 2025 Agents4Science.

Đối với mỗi bài báo FARS do máy tạo, các nhà nghiên cứu đã tìm kiếm trong các trích dẫn của nó một bài báo do con người viết cùng loại đã được chấp nhận tại một hội nghị hàng đầu, sau đó chọn cặp gần nhất theo chủ đề nghiên cứu, tạo ra 143 cặp. Các bài báo Agents4Science cũng được ghép cặp với các bản viết bởi con người, tạo thêm 247 cặp, đưa bộ chuẩn lên tổng cộng 390 cặp AI‑con người. Các bài báo bao phủ các lĩnh vực khoa học đời sống, xã hội và tự nhiên, mặc dù tập dữ liệu nặng về khoa học máy tính.

Đối với các chỉ số, hiệu suất được đánh giá bằng PairAcc, đo lường tần suất mà bài báo của con người được xếp hạng cao hơn bản AI tương đương; và AUROC, đo lường mức độ phân tách tổng thể giữa các bài báo của con người và AI qua các ngưỡng khác nhau. Các tác giả cũng báo cáo hiệu suất phát hiện khi tỷ lệ dương tính giả cho các bài báo của con người được cố định ở mức 5%.

Kiểm tra

Các thử nghiệm ban đầu so sánh SciSlop với các bộ phát hiện văn bản AI Binoculars; DetectGPT; và NTS††, cũng như các hệ thống đánh giá tự động AI Scientist người đánh giá và CycleReviewer.

Đối với các thử nghiệm sửa đổi sau, bốn phương pháp cơ sở đã được sử dụng: đề xuất cơ bản; Claude Code; tinh chỉnh dựa trên người đánh giá; và sửa đổi có nhận thức slop. Ba phương pháp đầu tiên chỉ nhận các hướng dẫn chung để cải thiện bài báo, trong khi sửa đổi có nhận thức slop còn được cung cấp thêm các định nghĩa và vị trí của slop được phát hiện. Tất cả đều được so sánh với SciSlopHarness dưới các điều kiện sửa đổi tương đương.

Đối với việc triển khai, các bộ phát hiện văn bản được cung cấp phần văn bản của bài báo, trong khi các phương pháp khác nhận mã nguồn của bài báo và, khi cần, quyền truy cập vào mã của nó. Binoculars đã sử dụng Falcon-7B cho các mô hình cơ bản và hướng dẫn; DetectGPT đã sử dụng T5-3B để tạo ra 100 biến đổi; AI Scientist đã sử dụng Qwen2.5-32B-Instruct; và CycleReviewer đã sử dụng checkpoint 8B đã phát hành của nó. Đối với các bài báo vượt quá giới hạn 2.048 token của Falcon, các cửa sổ không chồng lấn được tính điểm riêng biệt và trung bình.

Kết quả phát hiện ban đầu được chi tiết trong hai bảng dưới đây: SciSlop đạt 85,9% PairAcc, so với 68,7% của Binoculars và 68,5% của người đánh giá tự động mạnh nhất, giảm tỷ lệ lỗi hơn một nửa:

Kết quả phát hiện so sánh SciSlop với các bộ phát hiện văn bản AI và các người đánh giá tự động, cùng với kết quả cho sáu chỉ số slop riêng lẻ. SciSlop đạt PairAcc tổng thể cao nhất, trong khi các tham chiếu chéo phần cung cấp kết quả cá nhân mạnh nhất.

Kết quả phát hiện so sánh SciSlop với các bộ phát hiện văn bản AI và các người đánh giá tự động, cùng với kết quả cho sáu chỉ số slop riêng lẻ. SciSlop đạt PairAcc tổng thể cao nhất, trong khi các tham chiếu chéo phần cung cấp kết quả cá nhân mạnh nhất.

Các tham chiếu chéo phần thể hiện đặc biệt mạnh mẽ khi đứng độc lập, đạt 90,5% PairAcc mà không cần mô hình, và phát hiện 65% các bài báo do AI tạo ra ở mức tỷ lệ dương tính giả 5%, so với 24% của Binoculars.

Các tác giả cho rằng những kết quả này cho thấy các mối quan hệ trong toàn bộ bài báo cung cấp tín hiệu mạnh hơn về việc AI tạo ra so với phát hiện cấp độ văn bản thông thường trên tập dữ liệu này, đồng thời xác định các điểm yếu cụ thể có thể được nhắm tới để sửa đổi sau này.

Mối quan hệ giữa slop khoa học và đánh giá của con người về chất lượng bài báo được xem xét tiếp theo. Như được hiển thị trong cột đầu tiên bên dưới, slop cao hơn liên quan tới điểm ICLR thấp hơn cho đánh giá tổng thể, độ chặt chẽ, cách trình bày và đóng góp:

So sánh SciSlop với các bộ phát hiện văn bản AI và các người đánh giá tự động so với kết quả đánh giá ICLR. Bảng bên trái hiển thị mức độ giống AI so với điểm đánh giá; trung tâm so sánh các khía cạnh đánh giá riêng lẻ; bên phải cho thấy hiệu suất trong việc phân biệt các bài báo bị từ chối và được chấp nhận qua chín năm.

So sánh SciSlop với các bộ phát hiện văn bản AI và các người đánh giá tự động so với kết quả đánh giá ICLR. Bảng bên trái hiển thị mức độ giống AI so với điểm đánh giá; trung tâm so sánh các khía cạnh đánh giá riêng lẻ; bên phải cho thấy hiệu suất trong việc phân biệt các bài báo bị từ chối và được chấp nhận qua chín năm.

Các bài báo bị từ chối và được chấp nhận cũng được phân biệt vượt mức ngẫu nhiên trong suốt chín năm được xem xét, trong khi các bộ phát hiện thông thường rơi xuống dưới mức ngẫu nhiên trong hầu hết các so sánh.

Do đó, slop khoa học được phát hiện phản ánh các điểm yếu đã bị các nhà đánh giá con người phạt, chứ không chỉ là tín hiệu cho việc AI là tác giả.

Các thử nghiệm cuối cùng kiểm tra xem SciSlopHarness có thể loại bỏ slop còn lại sau quá trình sửa đổi chung hay không. Như được hiển thị bên dưới, công cụ này đạt mức gần nhất với trung bình con người trên tất cả sáu chỉ số, trong khi sửa đổi chung thường để lại slop đáng kể và sửa đổi có nhận thức slop trực tiếp đôi khi lại quá mức:

Kết quả sửa đổi so sánh SciSlopHarness với bốn phương pháp cơ sở trên sáu chỉ số slop. Các giá trị càng gần 0 càng gần trung bình của bài báo do con người viết, với SciSlopHarness nói chung tiến tới mức này trong khi sửa đổi có nhận thức slop thường vượt quá.

Kết quả sửa đổi so sánh SciSlopHarness với bốn phương pháp cơ sở trên sáu chỉ số slop. Các giá trị gần 0 hơn càng gần trung bình của các bài báo do con người viết, trong khi SciSlopHarness nói chung di chuyển về phía mức này, nhưng việc sửa đổi có nhận thức slop thường vượt quá mức đó.

Mỗi thay đổi đề xuất đều được kiểm tra so với lập luận khoa học và bằng chứng hỗ trợ của bài báo, các chỉnh sửa không được hỗ trợ bị loại bỏ. Trên sáu chỉ số, khoảng cách còn lại so với các bài báo do con người viết đã giảm 63 % so với Claude Code, cơ sở sửa đổi mạnh nhất.

Kết luận

Thật thú vị, trong quá trình viết bài này, không chỉ nhận thấy bài báo này đạt điểm kém trên trang demo riêng của nó, mà còn quan sát được ít nhất một ví dụ về trích dẫn ‘lười biếng’ hoặc ‘trang trí’ ††, điều mà gần đây đã trở thành một lời nguyền nhỏ nhưng ngày càng tăng trong các bài nghiên cứu.

Trong những trường hợp như vậy, ngoài bài báo cụ thể này, các nhà nghiên cứu dường như dựa vào kiến thức cá nhân của mình thay vì tương tác một cách có ý nghĩa với tài liệu hiện có. Tuy nhiên, do bị ràng buộc bởi quy ước ‘trình bày công việc của mình’, các trích dẫn thường được đưa ra với vẻ thiếu kiên nhẫn, thậm chí là khinh thường quy trình, và dường như dựa vào người đọc để chấp nhận một lượng lớn các tham chiếu như một ‘lớp vỏ’ đủ để chứng minh nguồn gốc, mặc dù lớp vỏ này sẽ không chịu được sự kiểm tra kỹ lưỡng.

Arxiv đang phản kháng lại quá trình công nghiệp hoá các bài nộp do AI thúc đẩy; việc sẽ có những ràng buộc tương tự đối với sự tham gia trực tiếp của AI trong nghiên cứu, nếu không có một thảm họa liên quan có quy mô đủ lớn, vẫn còn là câu hỏi chưa có câu trả lời.

 

* Những nhấn mạnh của các tác giả, không phải của tôi – nhưng tôi đã chuyển đổi khi cần thiết các trích dẫn nội dòng của tác giả thành siêu liên kết.

† Các tác giả không khẳng định không sử dụng AI trong bài của họ, và chi tiết việc sử dụng như vậy.

†† Độc giả có thể quan tâm khi biết rằng tôi đã phải tự mình tìm kiếm một liên kết chính xác cho khung NTS, vì liên kết do các tác giả cung cấp không liên quan – một trong những chỉ số mà SciSlop dựa vào!

Được xuất bản lần đầu Chủ nhật, ngày 4 tháng 10 năm 2026

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai