Anderson의 관점

AI 기반 생성 글쓰기 모델은 종종 ‘복사 및 붙여넣기’를 합니다

mm
Unite.AI를 Google의 선호 소스에 추가

미국의 극작가이자 기업가인 윌슨 미즈너(Wilson Mizner)는 종종 다음과 같이 인용됩니다. “한 명의 작가로부터 훔치면 표절이지만, 많은 작가로부터 훔치면 연구입니다.”

마찬가지로, 새로운 세대의 AI 기반 창조적 글쓰기 시스템에 대한 가정은 그들에게 훈련 단계에서 제공된大量의 데이터가 높은 수준의 개념과 아이디어의真正한 추상화를 가져왔으며, 이러한 시스템은 수천 명의 기여 작가들의 집약된 지혜를 가지고 있으며, AI는 혁신적이고 원创的な 글쓰기를 위해 이러한 지혜를 사용할 수 있으며, 이러한 시스템을 사용하는 사람들은 고의적으로 표절을 하지 않는다는 것입니다.

그러나 페이스북과 마이크로소프트의 AI 연구 부서를 포함한 연구 컨소시엄의 새로운 논문은 GPT 시리즈와 같은 기계 학습 생성 언어 모델이 ‘가끔 매우 긴 구절을 복사’하여 원본 출력에 속임없이 포함시킨다는 것을 발견했습니다.

일부 경우에, GPT-2는 훈련 세트에서 1,000 단어가 넘는 텍스트를 복사합니다.

논문은 RAVEN(RAtingVErbalNovelty)라는 새로운 접근 방식을 사용하며, 이 접근 방식은 에드거 앨런 포의 고전 시인 ‘The Raven’을 반영합니다.

‘이 약자는 “The Raven”을 나타내며, 여기서 화자는神秘한 까마귀를 만나며, 까마귀는 “Nevermore!”라고 외칩니다. 화자는 까마귀가 단순히 인간이 말한 것을 반복하는지, 아니면 자신의 발언을 구성하는지(아마도 never와 more를 결합하여) 알 수 없습니다. — 우리의 논문에서 다루는 같은 기본적인 모호성.’

이 발견은 ‘심플’ 편집 작업을 대체하고 전체 콘텐츠를 작성하도록 설계된 AI 콘텐츠 작성 시스템의 주요 성장의 맥락에서 나왔습니다. 이러한 시스템 중 하나는 이번 주에 2,100만 달러의 시리즈 A 자금을 받았습니다.

연구자들은 ‘GPT-2는 때때로 1,000 단어가 넘는 훈련 구절을 복사합니다.’라고 말하며, 생성 언어 시스템은 소스 데이터의 언어 오류를 전파합니다.

RAVEN으로 연구된 언어 모델은 GPT 시리즈의 릴리스(GPT-3은 당시 연구자에게 접근할 수 없었음), Transformer, Transformer-XL, 및 LSTM입니다.

신선함

이 논문은 GPT-2가 Bush 2 스타일의 변형과 유도된 단어를 만드는 것을 보여주며, 이러한 새로운 단어는 훈련 데이터에 나타나지 않습니다.

결과는 또한 ‘Transformer-XL이 생성한 74%의 문장이 훈련 문장과 구문 구조가 다르다’는 것을 보여주며, 연구자들은 ‘신경망 언어 모델은 단순히 기억하지 않고, 익숙한 부분을 새로운 방식으로 결합하여 생산적인 프로세스를 사용한다’고 말합니다.

따라서 일반화와 추상화는 혁신적이고 새로운 텍스트를 생성해야 합니다.

데이터 중복이 문제일 수 있습니다

이 논문은 NLG 시스템에서 생성된 긴 인용구가 원본 텍스트가 여러 번 반복되는 데이터 세트에 포함되어 있기 때문에 AI 모델에 의해 완전히 포함될 수 있다고 주장합니다.

다른 연구 프로젝트는 완전한 텍스트 중복이 데이터 세트에서 원본 텍스트가 한 번만 나타나더라도 발생할 수 있다고 발견했습니다.

연구자들은 또한 언어 생성 시스템의 디코딩 구성 요소를 변경하면 신선함을 증가시킬 수 있지만, 이는 출력 품질의 손실로 이어진다고 발견했습니다.

데이터 세트가 커짐에 따라 콘텐츠 생성 알고리즘을 구동하는 문제가 더 커집니다. 데이터 전처리, 품질 보증, 중복 제거의 비용과 실현 가능성 문제 외에도 많은 기본 오류가 소스 데이터에 남아 있으며, 이는 AI가 생성한 콘텐츠에 전파됩니다.

연구자들은*:

‘최근 훈련 세트 크기의 증가로 인해 신선함을 확인하는 것이 특히 중요합니다. 이러한 훈련 세트의 크기는 우리의 직관을 깨뜨릴 수 있습니다. 예를 들어, 언어習得에 대한 일부 주목할만한 연구는 불규칙 동사의 정식 과거 형태(예: becomed, teached)가 학습자의 경험에 나타나지 않는다는 가정에 기반합니다. 따라서 학습자가 이러한 단어를 생성하면 그것은 학습자에게 새로운 것입니다.

‘그러나, 영어의 92개의 기본 불규칙 동사 중 모든 것에 대해, 잘못된 정식 형태가 GPT-2의 훈련 세트에 나타납니다.’

더 많은 데이터 큐레이션이 필요합니다

이 논문은 생성 언어 시스템의 구성에서 신선함에 더 많은 주의가 필요하다고 주장하며, 특히 테스트에 사용되는 데이터 세트(최종 알고리즘이 주된 훈련 데이터를 평가하는 데 사용되는 데이터 세트)의 적절성을 강조합니다.

‘기계 학습에서 모델을 테스트하기 위해 보류된 테스트 세트를 사용하는 것이 중요합니다. 텍스트 생성의 개방형 특성으로 인해 모델이 생성한 텍스트가 훈련 세트에서 복사될 수 있으며, 이는 테스트 세트에 포함되지 않습니다. 따라서 이러한 데이터를 사용하여 모델을 평가하는 것은(예: 일관성 또는 문법성에 대해) 유효하지 않습니다.’

연구자들은 또한 언어 모델의 생성에 더 많은 주의가 필요하다고 주장하며, 이는 1966년에 확인된 Eliza 효과 때문입니다. 이 효과는 “컴퓨터가 생성한 기호 문자열, 특히 단어에 대한 사람들의 이해를 읽는 것의 취약성”을 나타냅니다.
 

* 내부 인용을 하이퍼링크로 변환

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai