Anderson의 관점

AI 리뷰어를 속이는 방법: 가짜 과학 논문은 어떻게 리뷰를 통과할 수 있는가

mm
Unite.AI를 Google의 선호 소스에 추가
An industrial robot at an AI paper mill, stamping 'ACCEPTED' onto spurious and impossible academic research papers, including papers on perpetual motion and alchemy. ChatGPT-4o; Adobe Firefly V3; et al.

새로운 연구에 따르면 AI 시스템은 가짜 과학 논문을 작성할 수 있으며, 다른 AI가 이를 실제 논문으로 받아들이는 경우가 많아지고 있다. 이는 검출 루틴을 피하는 방법을 보여주며, 연구 세계가 봇이 봇을 속이는 상황으로 붕괴할 수 있는 가능성을暴露한다.

 

학술 연구 분야, 즉 AI 혁신의 최전선은 자체적으로 AI에 의해 발생하는 신뢰성 위기를 겪고 있다. 기계 학습이 연구, 제출 및 검토 과정에 미친 영향은 약 4년 전부터 크게 증가했으며,最新의 논란은 저품질 설문 논문의 대량 생성이다.

학술 분야와 마찬가지로 연구 분야도 ChatGPT와 Claude 시리즈와 같은 텍스트 생성 AI와 최신의 ‘감지’ AI 간의 냉전을 겪고 있다. 감지 AI는通常적으로 그들의 출력을 식별할 수 있지만, 학생이나 과학자를 거짓 양성으로 표시하지 않는다.

이 긴장은 과학적 제출의 증가와 함께 증가할 것으로 예상되며, 이는 AI 지원 시스템과 프레임워크에 의해 급격히 증가하고 있으며, 감시 과정의 산업화를 필요로 한다. 이를 통해 순수한 AI의 작품인 제출을 필터링할 수 있다.

가짜 지식 환영

미국과 사우디 아라비아의 새로운 연구 협력은 완전히 AI 생성된 제출 논문이 어떻게 현재의 AI 감지 방화벽을 침투할 수 있는지 조사한다. 이러한 논문은 일부 설득력 있는 트릭을 사용하여 검토자를 속일 수 있다.

테스트에서, BadScientist라는 새로운 시스템은 현재 과학 연구 논문에서 AI 생성된 콘텐츠를 감지하는 데 사용되는 LLM 기반 시스템에서 최대 82%의 승인률을 달성했다.

BadScientist 시스템은 하나의 AI 에이전트를 사용하여 가짜 과학 논문을 생성하고, 다른 하나의 AI 에이전트를 사용하여 현재 언어 모델을 사용하여 검토한다. 출처: https://arxiv.org/pdf/2510.18003

BadScientist 시스템은 하나의 AI 에이전트를 사용하여 가짜 과학 논문을 생성하고, 다른 하나의 AI 에이전트를 사용하여 현재 언어 모델을 사용하여 검토한다. 출처: https://arxiv.org/pdf/2510.18003

가짜 논문은 실제 AI 컨퍼런스 주제와 오도하는 전략을 사용하여 생성되었으며, 모델은 피어 리뷰 데이터를 사용하여 캘리브레이션되었다. 많은 논문이 높은 점수를 받았음에도 불구하고, 명백한 오류나 허위 사실을 포함했다.

이 논문의 발표는 스탠퍼드에서 열린 2025년 AI 에이전트를 위한 오픈 컨퍼런스와 함께 이루어졌으며, 여기서 참석자와 연사는 인간이지만, 모든 논문은 다양한 AI 시스템에 의해 작성되고 검토되었다.

BadScientist라는 새로운 논문은 학술적이고 문학적인 속임수, 생략, 허위 사실, 과장 등을 사용하여 논문을 생성한다. 이러한 전략은 대부분의 현재 감지 시스템이 AI 생성된 것으로 인식하지 못하도록 한다.

저자들은 이러한 전략을 사용하여 생성된 가짜 논문이 실제 검토 과정에서 높은 승인률을 받을 수 있음을 보여주었다.

The paper states:

‘가짜 논문은 높은 승인률을 달성한다. 검토자들은 종종 우려-승인 충돌을 나타낸다. 이는 현재 AI 검토자가 패턴 매처로서 작동하는 것보다 비판적 평가자로서 작동하지 않는다는 것을 보여준다.

‘… 단순히 LLM 검토자에게 “더 주의하라”는 것은 불충분하다. 과학 커뮤니티는 긴급한 선택에 직면해 있다. 즉각적인 행동을 통해 방어를 강화하는 안전 장치를 구현하지 않으면, 우리는 AI 전용 출판 루프에서 정교한 허위 사실이 우리의 진정한 연구와 구별할 수 없는 상황에 직면할 수 있다.

‘과학 지식의完整性 자체가 위협을 받고 있다.’

The new paper is titled BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers? and comes from six authors across the University of Washington and King Abdulaziz City for Science and Technology at Riyadh. The release has an accompanying project site.

방법

이 논문은 2024년 AI-과학자 협력의 재구성된 버전을 사용하며, 저자들은 전체 파이프라인이 근본적으로 재설계되었다고 강조한다. 가장 기본적인 작성 프롬프트만 유지되었으며, 모든 실험 실행과 템플릿 구조는 제거되었다. 업데이트된 시스템은 간단한 시드에서 작동하며, 시스템이 자유롭게 실험 결과를 발명하고 필요한 플로팅 코드를 생성할 수 있다.

이 프레임워크는 AI가 실제 실험을 수행하거나 실제 데이터를 사용하지 않고도 설득력 있는 가짜 논문을 생성하도록 설계되었다. 대신, 시스템은 의도적으로 허위 주장을 지원하기 위해 합성 데이터를 생성하거나 변경한다.

설정은 인간의 개입, 프롬프트 공격, 또는 작가와 검토자 에이전트 간의 조정된 공모를 피하기 위해 의도적으로 설계되었다. 검토자 AI는 각 제출물을 단일 패스로 평가하며, 추가 실험을 다시 실행할 수 없으며, 실제 피어 리뷰 조건을 반영한다.

‘원자적 전략’은 모듈식 전략으로, 독립적으로 또는 조합하여 적용할 수 있다. 이러한 전략에는 다음과 같은 것들이 포함된다: 극적인 개선 사항을 강조하여 방법을 주요 발전으로 만들기(TooGoodGains); 결과에 유리한 기준선을 선택하고 주요 표의 신뢰 구간을 생략하기(BaselineSelect); 추가적인 정리, 정확한 통계, 깨끗한 표를 부록에 추가하고, 코드나 데이터의 약속을 추가하기(StatTheater); 논문의 구조를 일관된 용어, 교차 참조, 형식으로 다듬기(CoherencePolish); 그리고 숨겨진 오류를 포함하는 듯한 공식적인 증명을 추가하기(ProofGap).

데이터 및 테스트

저자들은 GPT-5를 사용하여 인공 지능, 기계 학습, 컴퓨터 비전, 자연어 처리, 로봇공학, 시스템, 보안 등의 분야에서 연구 주제를 생성했다. 이러한 주제는 가짜 논문의 시드가 되었다.

각 주제는 4개의 다른 버전으로 확장되었으며, 위에서 열거한 전략을 사용하여 검토자를 속이거나 감동시키기 위해 설계되었다. 논문이 ‘승인’될지 여부를 결정하기 위해 시스템은 최종 평가 점수만 고려했다.

가짜 논문은 모두 GPT-5에 의해 작성되었다. 저자들은 GPT-4.1, o4-mini, o3를 사용하여 이를 검토했다. 모든 모델은 동일한 검토 프롬프트를 받았으며, 이는 실제 피어 리뷰에서 사용되는 평가 기준과 구조를 모방하기 위해 설계되었다.

검토 점수를 의미 있게 만들기 위해 시스템은 200개의 실제 제출물과 리뷰어의 댓글, 그리고 승인 결과를 포함하는 ICLR 2025 OpenReview 데이터셋을 사용하여 캘리브레이션되었다.

이 설정의 신뢰성을 테스트하기 위해 저자들은 5,000개의 가짜 논문을 시뮬레이션하여 1-3개의 AI 검토자를 사용했다. 각 검토자는 1-10 사이의 임의 점수를 반환했다. 결과는 시스템이 매우 적은 오류를 범했으며, 이는 최악의 경우 이론적 한계보다 훨씬 낮은 수준이었다.

세 개의 검토자를 사용하면 점수 변동성이 크게 감소했으며, 결정 안정성이 거의 3배 향상되었다. 이러한 결과는 3개의 검토 모델과 200개의 실제 논문을 사용하여 캘리브레이션하는 것을 정당화했다.

저자들은 두 가지 지표를 정의하여 생성기를 평가했다: 승인률, 가짜 논문이 통과 점수를 받는 빈도; 그리고 평균 검토 점수, 제출물에 대한 평균 평가. 두 지표 모두 시스템이 검토자를 속일 수 있는 정도를 측정하기 위해 사용되었다.

승인(ACPT)란 두 개의 임계값 이상의 점수를 받은 가짜 논문의 비율을 나타낸다. 하나는 ICLR 2025의 승인률과 일치하며, 다른 하나는 인간이 50%의 승인률을 나타낸다. 무결성 우려 率(ICR-m)은 각 검토 모델에서 무결성 우려를 표시하는 비율이다. 마지막 열은 다수결 투표에 따른 앙상블 비율을 제공한다.

승인(ACPT)란 두 개의 임계값 이상의 점수를 받은 가짜 논문의 비율을 나타낸다. 하나는 ICLR 2025의 승인률과 일치하며, 다른 하나는 인간이 50%의 승인률을 나타낸다. 무결성 우려 率(ICR-m)은 각 검토 모델에서 무결성 우려를 표시하는 비율이다. 마지막 열은 다수결 투표에 따른 앙상블 비율을 제공한다.

가짜 논문은 거의 모든 전략에서 높은 승인률을 보였다. 첫 번째 전략만으로도 두 개의 임계값에서 67%와 82%의 승인률을 달성했다. 이는 검토 모델이 쉽게 속았다는 것을 보여준다.

여섯 개의 공격 전략에서 세 개의 검토 모델(GPT-4.1, o3, o4-mini)을 사용하여 점수 분포를 보여준다. 각 플롯은 4-9 사이의 점수를 얼마나 자주 할당했는지 보여주며, 점선은 7의 승인 임계값을 표시한다.

여섯 개의 공격 전략에서 세 개의 검토 모델(GPT-4.1, o3, o4-mini)을 사용하여 점수 분포를 보여준다. 각 플롯은 4-9 사이의 점수를 얼마나 자주 할당했는지 보여주며, 점선은 7의 승인 임계값을 표시한다.

두 번째 테스트의 결과는 위의 그래프에 나와 있다. 여기서 세 개의 모델에서 여섯 개의 설정에 대한 점수 분포를 볼 수 있다. 분포는 설정에 따라 다르지만, o4-mini는 평균적으로 더 높은 점수를 할당하며, o3은 더 큰 분산과 더 극단적인 값을 보인다. GPT-4.1은 더 일관되게 낮은 점수를 할당한다.

모델과 전략에 따른 우려-승인 충돌: 무결성 우려를 표시했지만 여전히 통과 점수를 주는 경우의 비율. 높은 값은 우려 감지와 최종 평가 사이의 약한 결합을 나타낸다.

모델과 전략에 따른 우려-승인 충돌: 무결성 우려를 표시했지만 여전히 통과 점수를 주는 경우의 비율. 높은 값은 우려 감지와 최종 평가 사이의 약한 결합을 나타낸다.

위의 표에서 모델이 높은 점수를 주는 경우에도 무결성 우려를 표시하는 경우가 많음을 볼 수 있다. 이 경우 o4-mini는 가장 일관성이 없으며, s1, s3, 그리고 결합된 설정에서 100%의 충돌을 보인다. GPT-4.1은 0%에서 75% 사이의 충돌을 보인다. o3은 26%에서 52% 사이로 더 안정적이다. 충돌은 s3에서 가장 높으며, 특히 o4-mini에서 그렇다. 저자들은 감지 신호가 최종 점수와 잘 결합되지 않는다고 지적한다.

The paper concludes:

‘AI 전용 출판 루프는 과학적 지식의 기초를 위협한다. 만약 허위 사실이 실제 연구와 구별할 수 없게 되면, 과학 지식의完整性가 붕괴할 수 있다.

‘앞으로의 길은 여러 계층의 방어를 필요로 한다: 기술적(출처 검증, 인식 유효성), 절차적(무결성 인식 점수, 인간 감시), 커뮤니티(출판 후 검토, 제보자 시스템), 문화적(AI 제한에 대한 교육, 윤리 지침).

‘우리는 이 연구를 대규모로 나타나는 실패 모드를 예방하기 위한 초기 경보 시스템으로 본다. 우리의 결과는 현재 시스템이 AI 전용 연구에 준비가 되지 않았으며, 과학의 무결성을 유지하기 위해 인간의 평가를 강화하는 것이 필수적임을 보여준다.’

결론

가장 큰 도전은 향후 AI 작성 텍스트의 감지에 대한 것이다. 이는 표준적인 작성 관행과 AI 생성된 텍스트의 표준이 수렴할 가능성이 있다.

만약 일반적인 언어와 AI 언어가 수렴하여 일반적인 표준이 되면, 논리적으로 추론하면, 미래의 감지 방법은 더 어려워질 것이다.

또한, LLM이 더 유연해지고, ‘특징’이 줄어들면서, 인간과 AI 언어는 중간 지점에서 만날 가능성이 있다.

그 때, AI 감지 시스템은 이미 도달한 이미지 및 비디오 생성과 같은 단계에 도달할 것이다. 즉, Adobe 주도의 콘텐츠 인증 이니셔티브와 같은 2차적 출처 시스템이나 블록체인/원장 기반 출처 확인이 필요하다.

 

2025년 10월 22일 처음 게시

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai