Anderson의 관점
과학 논문의 AI 슬롭에 맞서 싸우기

AI는 규모에 따라 모든 일을 수행합니다. DOS 공격 수준의 웹 스크래핑부터 과학 연구 제출물을 그러한 방대한 양으로 생산하거나 가능하게 하여, 그 결과 물류 위기와 품질 위기가 동시에 발생하고 있으며, 신호 대 잡음 비율이 점점 탐색하기 어려워지고 있습니다.
지난주, 프리프린트 서버 arXiv가 발표했습니다 제출자에게 새로운 속도 제한 정책을 도입하여 이제 월 2회 제출로 제한합니다. 발표에 따르면 이 조치는 짧은 기간 동안 제출률이 급격히 상승한 상황에 대응하기 위해 취해졌습니다:

2024년 1월부터 2026년 9월까지 arXiv의 cs.AI 카테고리 월별 제출 수, 해당 기간 동안 6배 이상 증가한 것을 보여줍니다. 출처
Kat Boboris의 블로그 게시물은 이번 조치를 발표했으며, 지난 목요일 Hacker News에서 댓글을 끌어냈습니다, arXiv가 2026년 9월에 40,363건의 제출을 받았으며 이는 2024년 9월의 20,569건의 거의 두 배, 2016년 9월의 9,869건보다 4배 이상 많다고 밝혔습니다.
Boboris가 관찰한 최신 월의 제출물은 arXiv 직원 및 중재자를 위한 지원 티켓을 거의 9,000건 생성했습니다:
‘우리 중재자들은 범위가 좁은 얇은 논문의 증가와, 단일 작업을 여러 작은 논문으로 나누어 제출하는 ‘살라미’ 논문의 증가를 관찰하고 있습니다.
‘밀집된 AI 작성 논문의 현저한 증가도 있습니다. AI 도구가 저품질 논문을 arXiv 및 기타 저장소에 대량으로 올리는 것을 저자들이 쉽게 만들고 있습니다.’
이미 올해 5월, arXiv는 검증되지 않은 AI 콘텐츠에 대해 1년 금지 조치를 시행했으며, 지난해 10월에는 설문 논문 및 입장 논문(둘 다 전체 학술 연구보다 적은 노력으로 생성 가능) 제출자에게 동료 검증이 필요하다고 알려, arXiv에 게재하려면 동료 검증이 필요하다고 전했습니다.
현재 arXiv 도메인의 빈번한 HTTP 요청 제한은 크게 눈에 띄지 않으며, 그 유용한 RSS 피드가 이번 축소에도 살아남기를 바랄 뿐입니다. 지난주 Reddit가 발표했습니다 오랫동안 두려워해 온 RSS 피드의 전면 삭제를, 이는 다음 달 중순부터 시행될 예정입니다. 그러나 arXiv의 비영리 지위 때문에 독자를 필수 사이트 방문이나 유사한 자본을 얻기 위해 강제 로그인(강제 로그인)을 요구하게 할 수도 없습니다 – 적어도 현재는.
증가하는 물결에 맞서
과학 연구에서 AI 사용의 부정적 영향에 대한 심각하고 증가하는 문제에 직면하여—특히 AI 관련 연구는 모든 다른 분야를 능가했으며 무명에서 벗어나 최근 정치·경제적 지표가 되었습니다—최근 AI 관련 논문 제출 품질 저하에 대응하는 방안을 탐구하는 연구 흐름이 등장했습니다.
이 문제를 해결하기 위한 최신 시도는 한국의 서울대학교와 미국 미네소타 대학교 간의 협업 형태로 나타났습니다. 논문은 Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers라는 제목으로, 논문의 주장, 증거, 인용 및 구조 간 연결의 실패를 통해 ‘과학적 슬롭’을 측정할 것을 제안합니다:

새 논문에서 ‘과학적 슬롭’에 대한 접근 방식을 개요로 제시하며, 구조, 논증 및 지원 자료의 실패가 기존 AI 텍스트 탐지기가 놓치는 약점을 어떻게 드러내는지 보여줍니다. 출처
이전 접근 방식과 달리, 새로운 시스템은 텍스트 자체를 넘어 논문의 주장이 논증, 증거 및 인용으로 적절히 뒷받침되는지를 평가합니다. 저자들은 다음과 같이 밝혔습니다*:
‘논문의 각 부분은 개별적으로는 그럴듯해 보일 수 있어, 이러한 붕괴는 토큰 수준 탐지기에는 보이지 않으며 전체 논문 수준에서만 식별하거나 수정할 수 있습니다. 과학적 슬롭을 벤치마크하고 완화하기 위해, 이 논문은 세 가지 과제에 접근합니다.’
‘첫째, 토큰 수준 메트릭은 과학적 추론이 논문 전반에 걸쳐 어떻게 연결되는지를 포착하지 못합니다. 섹션, 주장, 인용, 증거 및 자료는 각각 그럴듯해 보일 수 있지만, 이들 간의 관계가 무너집니다. 우리는 이러한 실패가 엔드투엔드 AI 생성 논문에서 반복적으로 나타나는 것을 관찰했으며, ICLR 리뷰어들은 인간이 쓴 제출물에서도 이미 이를 벌점으로 처리하고 있습니다.
‘두 번째, 이러한 패턴의 탐지는 측정되지 않은 상태입니다. 기존 테스트 세트는 텍스트만 라벨링하므로, 전체 논문을 읽는 LLM을 포함한 탐지기가 이러한 패턴을 식별하는 정도는 한 번도 측정된 적이 없습니다.
‘세 번째, 이러한 패턴은 신뢰성 있게 완화하기 어렵습니다. 토큰 수준 신호는 패러프레이징으로 제거될 수 있지만, 이러한 패턴을 복구하려면 기본 과학을 변경하지 않고 누락된 관계를 복원해야 합니다.’
저자들의 새로운 벤치마크인 SciSlopBench는 SciSlopHarness에 구현되었으며, 이는 논문의 과학적 추론에서 발생하는 실패를 탐지하고 복구하도록 설계된 프레임워크로, 기본 과학적 증거를 보존합니다:

SciSlopHarness가 만든 수정과 결함이 있는 구절을 비교한 예시. 근거가 없는 추가는 거부되며, 필요에 따라 주장은 재배열되거나 다시 작성되어 논문에 제공된 증거를 더 잘 반영합니다.
SciSlopBench 벤치마크 자체는 390개의 AI 생성 논문을 기반으로 구축되었으며, 각각은 유사한 연구 문제와 기여 유형을 다루는 인간이 작성한 논문과 짝을 이룹니다.
시험에서 SciSlopBench는 390쌍의 논문을 구별하는 데 사용되었으며, 각 쌍은 앞서 언급한 AI 생성 논문과 연구 문제 및 기여 유형이 일치하도록 매칭된 인간 작성 논문으로 구성되었습니다. 이 벤치마크는 이러한 비교 중 85.9%에서 AI 생성 논문을 정확히 식별했으며, 기존 AI 텍스트 탐지기보다 크게 우수한 성능을 보였습니다.
저자들은 다음과 같이 말합니다:
‘표준 수정이 잔여 슬롭을 남기고 슬롭 인식 프롬프트가 보상 해킹을 유발하는 반면, SciSlopHarness는 인간 참조 목표 없이도 가장 강력한 수정 기준 대비 남은 AI‑인간 격차를 63% 줄입니다.’
‘전반적으로, 우리는 AI 생성 과학 논문이 전반적인 추론에 근본적인 흔적을 남기며, 책임 있는 완화는 단순한 문장 다듬기가 아니라 엄격한 증거 기반을 요구한다는 것을 보여줍니다.’
논문 자체가 만든 기여 외에도, 저자들은 새로운 작업의 원칙을 실시간 데모 형태로 구현했으며, 사용자는 과학 논문을 제출해 포함된 AI 슬롭 양을 분석할 수 있습니다.
흥미롭게도, 데모로 분석된 새로운 논문 자체는 ‘보통’ 슬롭 점수 40/100†를 기록합니다:

새 논문은 자체 알고리즘으로 분석되어 저자들의 새로운 프로세스가 표시한 ‘슬롭’ 영역을 얻습니다. 출처
방법 및 데이터 접근법
2025년 협업 Why Slop Matters는 AI 슬롭의 정의적 특성으로 ‘피상적 역량’을 제시했으며, 겉보이는 품질이 실질적 내용의 부족을 가립니다. 새로운 연구는 이 개념을 과학 논문에 보다 구체적으로 적용하여, ‘과학적 슬롭’을 연구가 어떻게 조직되는지, 주장들이 어떻게 뒷받침되는지, 방법과 증거가 어떻게 검토되는지를 파악하기 어렵게 만드는 실패로 정의하고, 이러한 실패를 구조, 논증, 인공물으로 구분합니다:

벤치마크에 사용된 과학적 슬롭의 여섯 유형에 대한 측정 규칙. 표는 각 측정 항목에서 무엇을 검토하는지, 점수가 어떻게 계산되는지, 최대 점수 1이 의미하는 바와 점수가 높을수록 더 광범위한 실패를 나타냄을 보여줍니다.
The paper defines six scientific slop measures: 단면 참조 (섹션이 논문 내 다른 부분을 의미 있게 참조하는지); 매크로 중복 (후속 섹션이 이전 내용을 반복하는지); 주장 그래프 (주장이 앞선 논증에 의해 적절히 뒷받침되는지); 인용 고립 (인용이 피상적으로 사용되어 인용된 작업이 논문이나 서로와 어떻게 관련되는지 설명되지 않는지); 그림 설명 (방법 그림이 실제로 방법을 설명하는지); 그리고 증거 격차 (보고된 결과가 구체적인 예시로 뒷받침되는지).
벤치마크는 AI 생성 논문을 비교 가능하거나 동등한 인간 작성 논문과 짝지어 구성했으며, AI 논문은 FARS와 2025 Agents4Science 대회에서 선별되었습니다.
각 기계 생성 FARS 논문에 대해 연구자들은 해당 논문의 인용문을 조사하여 동일 유형의 인간이 작성한 논문 중 최고 수준 학술지에 채택된 논문을 찾고, 연구 주제별로 가장 근접한 매치를 선택해 143쌍을 만들었습니다. Agents4Science 논문도 동일하게 인간이 작성한 논문과 짝을 이루어 추가로 247쌍을 생성했으며, 이를 통해 전체 벤치마크는 총 390개의 AI‑인간 쌍이 되었습니다. 이 논문들은 생명 과학, 사회 과학, 자연 과학을 포괄하지만, 데이터셋은 컴퓨터 과학에 크게 편중되어 있습니다.
지표로는 인간 논문이 AI 논문보다 상위에 랭크되는 빈도를 측정하는 PairAcc와, 다양한 임계값에서 인간 논문과 AI 논문 간의 전반적인 구분 정도를 측정하는 AUROC를 사용해 성능을 평가했습니다. 저자들은 또한 인간 논문의 위양성 비율을 5%로 고정했을 때의 탐지 성능을 보고했습니다.
테스트
초기 테스트에서는 SciSlop을 AI 텍스트 탐지기 Binoculars, DetectGPT, NTS††와, 자동 리뷰 시스템 AI Scientist 리뷰어 및 CycleReviewer와 비교했습니다.
후속 수정 테스트에서는 네 가지 기준선이 사용되었습니다: 기본 프롬프트; Claude Code; 리뷰어 기반 정제; 및 슬롭 인식 수정. 처음 세 가지는 논문을 개선하기 위한 일반적인 지시만 받았으며, 슬롭 인식 수정은 추가로 탐지된 슬롭의 정의와 위치를 제공받았습니다. 모든 방법은 동등한 수정 조건 하에서 SciSlopHarness와 비교되었습니다.
구현 단계에서는 텍스트 탐지기에 논문의 본문을 제공하고, 다른 방법들에는 논문 소스와 필요에 따라 코드 접근 권한을 부여했습니다. Binoculars는 Falcon-7B 기반 및 instruct 모델을 사용했으며; DetectGPT는 T5-3B를 이용해 100개의 변형을 생성했습니다; AI Scientist은 Qwen2.5-32B-Instruct를 사용했으며; CycleReviewer는 공개된 8B 체크포인트를 사용했습니다. Falcon의 2,048 토큰 제한을 초과하는 논문에 대해서는 겹치지 않는 창을 별도로 점수화한 뒤 평균을 냈습니다.
초기 탐지 결과는 아래 두 표에 자세히 나와 있습니다: SciSlop은 85.9% PairAcc를 달성했으며, Binoculars는 68.7%, 가장 강력한 자동 리뷰어는 68.5%로, 오류율을 절반 이상 감소시켰습니다.

SciSlop과 AI 텍스트 탐지기 및 자동 리뷰어를 비교한 탐지 결과와 여섯 개 개별 슬롭 측정값에 대한 결과입니다. SciSlop은 전체 PairAcc에서 가장 높은 점수를 기록했으며, 교차 섹션 참조가 가장 강력한 개별 결과를 제공합니다.
교차 섹션 참조는 모델 없이도 자체적으로 매우 강력하게 작동하여 90.5% PairAcc에 도달했으며, 위양성 비율 5%에서 AI 생성 논문의 65%를 탐지했습니다. 이는 Binoculars의 24%와 비교됩니다.
저자들은 이러한 결과가 논문 전반에 걸친 관계가 기존 텍스트 수준 탐지보다 AI 생성 신호를 더 강하게 나타낸다는 것을 시사하며, 동시에 이후 수정 대상으로 삼을 수 있는 구체적인 약점을 식별한다고 주장합니다.
다음으로 과학적 슬롭과 인간이 평가한 논문 품질 간의 관계를 조사했습니다. 아래 첫 번째 열에서 보듯, 슬롭이 높을수록 ICLR 전체 평점, 타당성, 발표 및 기여 점수가 낮아지는 경향이 있었습니다.

SciSlop과 AI 텍스트 탐지기 및 자동 리뷰어를 ICLR 리뷰 결과와 비교한 내용입니다. 왼쪽 패널은 AI 유사도와 리뷰 점수의 관계를 보여주며; 중앙은 개별 리뷰 차원을 비교하고; 오른쪽은 9년 동안 거절된 논문과 채택된 논문을 구별하는 성능을 나타냅니다.
거절된 논문과 채택된 논문은 조사한 9년 전체에 걸쳐 우연 수준보다 높은 구별력을 보였으며, 기존 탐지기들은 대부분의 비교에서 우연 수준 이하의 성능을 보였습니다.
따라서 과학적 슬롭은 AI 저자를 나타내는 신호만이 아니라, 인간 리뷰어가 이미 감점하는 약점을 반영한다는 것이 밝혀졌습니다.
최종 테스트에서는 SciSlopHarness가 보다 일반적인 수정 이후에도 남아 있는 슬롭을 제거할 수 있는지를 조사했습니다. 아래와 같이, 이 하니스는 모든 여섯 측정값에서 인간 평균에 가장 가깝게 마무리했으며, 일반 수정은 종종 상당한 슬롭을 남기고 슬롭 인식 직접 수정은 때때로 과도하게 교정하는 경향을 보였습니다.

SciSlopHarness와 네 가지 기준 방법을 여섯 가지 슬롭 측정치에 걸쳐 비교한 수정 결과. 값이 0에 가까울수록 인간 논문 평균에 가깝고, SciSlopHarness는 일반적으로 이 수준으로 이동하는 반면, 슬롭 인식 수정은 종종 이를 초과한다.
각 제안된 변경 사항은 논문의 과학적 논리와 뒷받침 증거를 기준으로 검토되었으며, 근거가 없는 편집은 거부되었습니다. 여섯 가지 측정 항목 전체에서 인간이 작성한 논문과의 남은 격차는 Claude Code에 비해 63% 감소했으며, 이는 가장 강력한 수정 기준선입니다.
결론
이 글을 쓰는 과정에서, 이 논문이 자체 데모 사이트에서 얼마나 낮은 점수를 받았는지뿐만 아니라, 최근 연구 논문에서 소규모이지만 점점 커져가는 ‘lazy’ 또는 ‘cosmetic’ 인용††의 사례를 최소 한 가지 관찰한 것이 흥미로웠다, 이는 최근 연구 논문에서 소규모이지만 점점 커져가는 저주가 되었다.
이러한 경우에는, 이 특정 논문을 넘어 연구자들이 기존 문헌과 의미 있게 교류하기보다는 자신의 지식에 의존하는 것으로 보인다. 그러나 관례상 ‘작업을 보여줘야 한다’는 제약 때문에 인용은 종종 조급함으로 보이는 방식, 심지어 과정에 대한 경멸까지도 담아 제공되며, 독자가 방대한 참고문헌을 충분한 ‘출처의 광택’으로 받아들이도록 의존하는 경우가 많다. 이는 과도한 검증을 견디지 못할 것이다.
Arxiv는 AI 주도 제출 산업화에 맞서 싸우고 있다; 충분한 규모의 관련 재난이 없을 경우 연구에서 AI의 직접적인 참여에 대한 유사한 제약이 있을지는 아직 미지수이다.
* 저자들의 강조점이며, 제 것이 아니다 – 그러나 필요에 따라 저자들의 인라인 인용을 하이퍼링크로 변환한 것이다.
† 저자들은 자신의 논문에서 AI 사용이 전혀 없다고 주장하지 않으며, 그러한 사용을 상세히 기술한다.
†† 독자에게 흥미로울 수 있는 점은, 저자가 제공한 링크가 관련성이 없었기 때문에 제가 직접 NTS 프레임워크에 대한 올바른 링크를 찾아야 했다는 것이다 – 이는 SciSlop이 핵심으로 삼는 바로 그 지표 중 하나다!
2026년 10월 4일 일요일 최초 게시












