AI 모델 및 플랫폼
저작권 문제: 생성적 AI 모델이 저작권된 콘텐츠를 재생산하는 방법
생성적 AI의 급격한 발전은 기술의 창의적 잠재력을 둘러싼 흥분을 불러일으켰습니다. 그러나 이러한 강력한 모델은 또한 저작권된 콘텐츠를 적절한 출처 없이 재생산하는 것과 관련된 위험을 가지고 있습니다.
신경망이 훈련 데이터를 흡수하는 방법
최신 AI 시스템은 GPT-3와 같은 전이 학습을 통해 훈련됩니다.它们는 공공 소스에서 수집된 거대한 데이터셋을 섭취합니다. 예를 들어, GPT-3의 훈련 데이터는 570GB의 텍스트를 포함합니다. 훈련 과정에서, AI는 이 거대한 데이터 풀에서 패턴과 통계적 관계를 찾습니다. 그것은 단어, 문장, 문단, 언어 구조 및 기타 특징 간의 상관관계를 학습합니다.
이로 인해 AI는 주어진 입력 또는 프롬프트에 따라 새로운 일관된 텍스트 또는 이미지를 생성할 수 있습니다. 그러나 이것은 또한 이러한 모델이 저작권, 출처, 혹은 표절 위험에 대한 고려 없이 콘텐츠를 흡수한다는 것을 의미합니다. 결과적으로, 생성적 AI는 의도하지 않게 훈련 데이터에서 저작권된 텍스트를 그대로 재생산하거나 요약할 수 있습니다.
AI 표절의 주요 예
AI 표절에 대한 우려는 2020년 GPT의 출시 이후 두드러지게 나타났습니다.
최근 연구에 따르면, GPT-3와 같은 대규모 언어 모델(LLM)은 훈련 데이터에서 출처를 밝히지 않은大量의 텍스트를 재생산할 수 있습니다(Nasr et al., 2023; Carlini et al., 2022). 예를 들어, 뉴욕タイム즈의 소송에서 오픈AI 소프트웨어가 뉴욕タイム즈의 기사를 거의 그대로 생성하는 것이 밝혀졌습니다(뉴욕タイム즈, 2023).
이러한 발견은 일부 생성적 AI 시스템이 저작권 침해 위험을 겪을 수 있는 표절적인 출력을 생성할 수 있음을 시사합니다. 그러나 이러한 현상의 普遍性는 LLM의 ‘블랙박스’ 특성으로 인해 불확실합니다. 뉴욕タイム즈의 소송은 이러한 출력이 침해를 구성한다고 주장하며, 이는 생성적 AI 개발에重大한 영향을 미칠 수 있습니다. 전반적으로, 증거는 표절이 대규모 신경망 모델에서 내재된 문제이며, 주의와 안전장치가 필요하다는 것을 나타냅니다.
이러한 사례는 AI 표절 위험에 영향을 미치는 두 가지 주요 요인을 나타냅니다:
- 모델 크기 – GPT-3.5와 같은 더 큰 모델은 더 작은 모델보다 텍스트를 재생산할 가능성이 더 높습니다. 더 큰 훈련 데이터셋은 저작권된 소스 자료에 대한 노출을 증가시킵니다.
- 훈련 데이터 – 인터넷 데이터나 저작권된 작품(라이선스를 받은 경우에도)으로 훈련된 모델은 더 тщательно 구축된 데이터셋으로 훈련된 모델보다 표절할 가능성이 더 높습니다.
그러나 표절적인 출력의 普遍性를 직접 측정하는 것은 어렵습니다. 신경망의 ‘블랙박스’ 특성으로 인해 훈련 데이터와 모델 출력 간의 링크를 완전히 추적하는 것이 어렵습니다. 이러한 비율은 모델 아키텍처, 데이터셋 품질, 프롬프트 형식에 크게 의존합니다. 그러나 이러한 사례는 이러한 AI 표절이 명백히 발생한다는 것을 확인하며, 이는重大한 법적 및 윤리적 의미를 가지고 있습니다.
표절 탐지 시스템의 등장
이에 대응하여, 연구자들은 텍스트와 이미지를 생성한 모델을 자동으로 감지하는 AI 시스템을 개발하기 시작했습니다. 예를 들어, Mila의 연구자들은 AI가 작성한 텍스트를 분석하는 GenFace를 제안했습니다. 또한 Anthropic은 내부적으로 표절 탐지 기능을 개발했습니다.
그러나 이러한 도구는 제한이 있습니다. GPT-3와 같은 모델의 거대한 훈련 데이터로 인해 표절된 텍스트의 원래 출처를 찾는 것이 어렵습니다. 더 강력한 기술이 필요합니다. 그때까지 수동 검토는 잠재적으로 표절된 출력을 필터링하는 데 필수적입니다.
생성적 AI 표절을 완화하기 위한 모범 사례
생성적 AI 개발자와 사용자 모두가 표절 위험을 최소화하기 위한 모범 사례는 다음과 같습니다:
개발자에게:
- 라이선스를 받지 않은 저작권된 자료를 포함하지 않도록 훈련 데이터 소스를慎重하게 검토합니다.
- 데이터 문서화와 출처 추적 절차를 개발합니다. 메타데이터를 기록합니다.
- 표절 탐지 도구를 구현하여 높은 위험을 가진 콘텐츠를 출력 전에 플래그합니다.
- 투명한 보고서를 제공하여 훈련 데이터 소스, 라이선스, 및 AI 출력의 출처를 자세히 설명합니다.
- 콘텐츠 제작자가 훈련 데이터셋에서 쉽게 제외될 수 있도록 허용합니다. 제거 또는 제외 요청에 신속하게 응합니다.
사용자에게:
- 출력물을 배포하기 전에 잠재적으로 표절된 또는 출처가 없는 구절이 있는지 철저히 검토합니다.
- AI를 완전히 자율적인 창의 시스템으로 취급하지 않습니다. 최종 콘텐츠를 검토하는 인간 검토자를 둡니다.
- 완전히 새로운 콘텐츠를 생성하는 대신 AI를 보조 도구로 사용합니다. 모델을 재구성 또는 아이디어 생성에 사용합니다.
- AI 제공업체의 서비스 약관, 콘텐츠 정책, 및 표절 방지 대책을 검토합니다. 불투명한 모델을 피합니다.
- 저작권된 자료가 출력물에 나타날 경우 출처를 명확히 밝힙니다. AI 작업을 완전히 원천적인 것으로 표시하지 않습니다.
- 표절 위험을 추가로 평가하고 해결할 수 있을 때까지 출력물을 개인적으로 또는 기밀로 공유합니다.
생성적 모델이 계속 확산됨에 따라, 더 엄격한 훈련 데이터 규제가 필요할 수 있습니다. 이것은 콘텐츠 제작자의 동의를 얻지 않고 훈련 데이터셋에 추가하는 것을 금지할 수 있습니다. 그러나 개발자와 사용자 모두가 콘텐츠 제작자의 권리를 존중하는 윤리적인 AI 관행을 사용해야 합니다.
Midjourney의 V6 Alpha에서 표절
한정된 프롬프트 후에, 일부 연구자들은 Midjourney의 V6 모델을 사용하여 저작권된 영화, TV 프로그램, 및 비디오 게임 스크린샷과 거의 동일한 이미지를 생성할 수 있었습니다.
이러한 실험은 시각적 AI 시스템이 훈련 데이터의 출처를 확인하지 않으면 보호된 콘텐츠를 무의식적으로 표절할 수 있음을 다시 한번 확인합니다. 이것은 상업적으로 생성적 모델을 배포할 때 침해 위험을 제한하기 위해 주의와 안전장치가 필요하다는 것을 강조합니다.
AI 기업의 저작권된 콘텐츠에 대한 반응
인간과 AI의 창의성 사이의 경계가模糊해지면서, 복잡한 저작권 문제가 발생합니다. 인간과 AI의 입력이 혼합된 작품은 인간이 실행한 부분만 저작권이 될 수 있습니다.
미국 저작권 사무소는 최근에 AI-인간 그래픽 소설의 대부분에 대한 저작권을 거부했습니다. AI 아트를 비인간적이라고 판단했습니다. 또한 AI 시스템을 ‘저자’에서 제외하는 지침을 발급했습니다. 연방 법원은 AI 아트 저작권 사건에서 이 입장을 확인했습니다.
한편, 소송은 생성적 AI가 침해한다고 주장합니다. 예를 들어, Getty v. Stability AI와 예술가들 v. Midjourney/Stability AI입니다. 그러나 AI ‘저자’가 없기 때문에, 일부에서는 침해 주장이 적용되는지疑問을 제기합니다.
대응하여, 주요 AI 기업들인 Meta, Google (GOOGL ), Microsoft (MSFT ), 및 Apple은 저작권된 데이터로 AI 모델을 훈련시키기 위해 라이선스나 로열티를 지불할 필요가 없다고 주장했습니다.
여기에는 주요 AI 기업들의 잠재적인 새로운 미국 저작권 규칙에 대한 반응에 대한 요약이 포함되어 있습니다.
Meta는 라이선스를 부과하면 혼란을 초래하고 저작권 소유자에게 거의益을 주지 않을 것이라고 주장합니다(Meta, 2023).
Google은 AI 훈련이 책을 읽는 것과 같은 비침해 행위에 해당한다고 주장합니다(Google, 2022).
Microsoft는 저작권법을 변경하면 소규모 AI 개발자가 불리해질 수 있다고 경고합니다(Microsoft, 2023).
Apple (AAPL ) 은 인간 개발자가 제어하는 AI 생성 코드에 저작권을 부여하고 싶어합니다(Apple, 2023).
전반적으로, 대부분의 기업은 새로운 라이선스義務를 반대하며, AI 시스템이 저작권된 작품을 출처 없이 재생산하는 것에 대한 우려를軽視합니다. 그러나 이러한 입장은 최근의 AI 저작권 소송과 논쟁을 고려할 때 논쟁의 여지가 있습니다.
책임 있는 생성적 AI 혁신을 위한 경로
이러한 강력한 생성적 모델이 계속 발전함에 따라, 표절 위험을 막는 것이중요합니다. 다각적인 접근이 필요합니다:
- 훈련 데이터 투명성, 라이선스, 및 제작자 동의를 둘러싼 정책 개혁.
- 개발자가 내부적으로 강화한 표절 탐지 기술 및 거버넌스.
- 사용자가 위험을 인식하고 윤리적인 AI 원칙을 지키는 것.
- AI 저작권 문제를 둘러싼 명확한 법적 선례와 판례.
적절한 안전장치가 있는 경우, AI 보조 창의성이 윤리적으로繁荣할 수 있습니다. 그러나 무시된 표절 위험은 대중의 신뢰를 크게 훼손할 수 있습니다. 이 문제를 직접 해결하는 것이 생성적 AI의巨大 창의적 잠재력을 실현하는 데 중요합니다. 인간의 창의성을 강화하려는 목표를 가진 이러한 강력한 모델이 인간의 지성을 훼손하지 않도록 하는 데 필요한 균형을 찾는 것이 중요합니다.













