Anderson의 관점

AI 생성 언어가 과학 문헌을 오염시키고 있다

mm
Unite.AI를 Google의 선호 소스에 추가

프랑스와 러시아의 연구자들은 GPT-3와 같은 AI 기반 확률적 텍스트 생성기를 사용하여 ‘고문된 언어’, 존재하지 않는 문헌의 인용, 및 무단 이미지 재사용이 과학 문헌의 출판 채널에 침투하고 있음을 나타내는 연구를 발표했다.

가장 우려되는 것은 연구된 논문이 과학적으로 부정확하거나 재현할 수 없는 내용을 객관적이고 체계적인 연구의 결과로 제시하고 있다는 것이다. 이는 생성 언어 모델이 논문의 저자들의 영어 실력을 보완하는 데만 사용되지 않고 실제로 연구를 수행하고 있음을 시사한다.

연구 보고서 Tortured phrases: A dubious writing style emerging in science는 툴루즈 대학교 컴퓨터 과학부와 야andex 연구원 Alexander Magazinov가 Tel Aviv 대학교에서 수행했다.

연구는 특히 Elsevier 저널 Microprocessors and Microsystems에서 생성된 과학 논문의 증가에 초점을 맞추고 있다.

다른 이름으로

GPT-3와 같은 자율 회귀 언어 모델은大量의 데이터를 훈련하고, 데이터를 요약, 정리, 해석하여 자연스러운 언어와 글쓰기 패턴을 재현할 수 있는 생성 언어 모델을 생성한다.

이러한 프레임워크는 모델 훈련 단계에서 원본 데이터의 직접적인 재생산을罰則하기 때문에, 결국 동의어를 찾으려고 한다.

연구자들은 다음과 같은 예를 들어 생성된 과학 논문에서 발견된 잘못된 시도와 동의어를 제시했다:

깊은 신경망: ‘깊은 신경 조직’
인공 신경망: ‘인공 신경 조직’
모바일 네트워크: ‘다양한 조직’
네트워크 공격: ‘조직 공격’
네트워크 연결: ‘조직 연관’
빅데이터: ‘대량 정보’
데이터 웨어하우스: ‘정보 저장소’
인공 지능 (AI): ‘인공 의식’
고성능 컴퓨팅: ‘고급 연산’
포그/미스트/클라우드 컴퓨팅: ‘안개 연산’
그래픽 처리 장치 (GPU): ‘디자인 준비 장치’
중앙 처리 장치 (CPU): ‘중심 준비 장치’
워크플로우 엔진: ‘작업 프로세스 모터’
얼굴 인식: ‘얼굴 인지’
음성 인식: ‘음성 인지’
평균 제곱 오차: ‘평균 제곱 실수’
평균 절대 오차: ‘평균 절대 실수’
신호 대 노이즈: ‘신호 대 소음’
전역 매개변수: ‘전세계 매개변수’
임의 접근: ‘임의 접근’
임의 포레스트: ‘임의 삼림’
임의 값: ‘임의 가치’
개미 군체: ‘지하 곤충 집단’
개미 군체: ‘지하 기생 곤충 집단’
남은 에너지: ‘남은活力’
운동 에너지: ‘운동 活力’
순수 베이즈: ‘순수 베이즈’
개인 디지털 어시스턴트 (PDA): ‘개인 컴퓨터화된 협력자’

2021년 5월, 연구자들은 Dimensions 학술 검색 엔진을 사용하여 이러한 종류의 망가진 자동 생성 언어를 검색했다.

현재, 아직 일부 과학 논문이 검색 가능하며, ‘깊은 신경 조직’과 같은 의미없는 문구를 포함하고 있다.

Dimensions에서 '깊은 신경 조직'을 검색한 결과

Dimensions에서 ‘깊은 신경 조직’을 검색한 결과 출처: https://app.dimensions.ai/

무의미 언어의 증가

연구자들은 2018년 2월부터 2021년 6월까지의 기간을 연구했으며, 지난 2년 동안, 특히 지난 6-8개월 동안 제출된 논문의 수가 급증했다는 것을 발견했다.

Microprocessors and Microsystems 저널에 제출된 논문의 수 증가

Microprocessors and Microsystems 저널에 제출된 논문의 수 증가 출처: https://arxiv.org/pdf/2107.06751.pdf

중국 과학 논문의 감소하는 편집 감독

연구자들은 2021년부터 제출된 논문에 대한 편집 평가 시간이 급격히 줄어든 것을 관찰했으며, 이는 40일 미만으로 줄어든 것으로 나타났다.

가장 많은 논문은 중국에 소속된 저자들로부터 제출되었다. 30일 미만으로 편집된 논문 중 97.5%는 중국과 관련이 있었다.

연구자들은 이러한 현象이 편집 과정의 부족과 자원 부족으로 인한 결과라고 주장한다.

연구자들은 GPT 스타일의 생성 모델이 이러한 논문의 많은 부분을 생성했을 가능성이 있다고 주장한다. 그러나 이러한 모델이 원본을 추상화하는 방식으로 인해 이를 입증하기는 어렵다.

의미가 없는 언어

연구자들은 이러한 논문이 과학적으로 부정확하거나 재현할 수 없는 내용을 포함하고 있음을 강조한다. 이는 생성 언어 모델이 단순히 언어 실력을 보완하는 데만 사용되지 않고 실제로 연구를 수행하고 있음을 시사한다.

연구자들은 또한 이러한 모델이 과학적으로 부정확한 내용을 생성할 수 있으며, 이는 연구의 압박과 출판 압박으로 인해 발생할 수 있다고 주장한다.

의미가 없는 내용이 포함된 논문

의미가 없는 내용이 포함된 논문 출처: https://www.edn.com/water-leak-detector-uses-9v-batteries/

인용 실패

연구자들은 이러한 논문에서 인용된 문헌이 실제로 존재하지 않거나 관련이 없음을 발견했다.

주의力의 산란

연구자들은 생성 언어 모델이 장기간의 논의에서 주의력을 잃을 수 있음을 발견했다. 이는 이러한 모델이 주제를 초기에 언급했지만 이후에 다시 언급하지 않는 경우가 많음을 시사한다.

원인과 이유

연구자들은 이러한 현象의 원인이 무엇인지에 대해 여러 가지 가능성을 제시한다. 이러한 가능성에는 논문의 내용이 실제로 생성 언어 모델에 의해 생성되었을 수 있으며, 이러한 모델이 과학적으로 부정확한 내용을 생성할 수 있음을 포함한다.

연구자들은 이러한 문제를 해결하기 위해更加 엄격한 편집 및 심사 절차를 도입할 것을 촉구한다.

연구자들은 또한 이러한 문제가 과학 문헌의完整性를 위협할 수 있음을 강조한다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai