Anderson의 관점

현재 AI 실천은 새로운 저작권 트롤을 가능하게 할 수 있습니다

mm
Unite.AI를 Google의 선호 소스에 추가

화웨이와 학계 간의 새로운 연구 협력에 따르면 현재 인공 지능과 기계 학습에서 가장 중요한 연구 중 많은 부분이 상업적으로 두드러질 때 소송의 대상이 될 수 있다고 합니다. 이는 이러한 연구를 가능하게 하는 데이터셋이 원래 데이터가 얻어진 공공 도메인의 조건을 존중하지 않는 잘못된 라이선스로 배포되고 있기 때문입니다.

이는 두 가지 거의 불가피한 결과를 초래합니다. 즉, 이러한 데이터셋을 사용하여 개발된 상업적인 AI 알고리즘이 저작권을 존중하지 않은 데이터를 사용하여 개발되었기 때문에 기회주의적인 저작권 트롤의 대상이 될 수 있으며, 이러한 법적 취약성을 이용하여 기계 학습 기술의 배포나 확산을 반대하는 조직이나 개인이 이를 저지할 수 있습니다.

연구 논문공개적으로 사용 가능한 데이터셋을 사용하여 상업용 AI 소프트웨어를 개발할 수 있습니까? 대부분 그렇지 않습니다라는 제목으로, 화웨이 캐나다와 화웨이 중국, 영국의 요크 대학교, 캐나다의 빅토리아 대학교 간의 협력입니다.

6개 중 5개의 인기 오픈 소스 데이터셋은 법적으로 사용할 수 없습니다

연구를 위해 저자들은 화웨이의 부서에 가장 바람직한 오픈 소스 데이터셋을 선택하도록 요청했으며, 6개의 가장 요청된 데이터셋을 선택했습니다: CIFAR-10(8천만 개의 작은 이미지 데이터셋의 하위 집합, 철회된 ‘모욕적인 용어’와 ‘공격적인 이미지’로 인해, 하지만 그 파생물은 여전히 존재합니다); ImageNet; Cityscapes(독점적으로 원래 자료만 포함); FFHQ; VGGFace2, 그리고 MSCOCO.

선택된 데이터셋이 상업 프로젝트에서 법적으로 사용할 수 있는지 분석하기 위해 저자들은 각 데이터셋의 라이선스 체인을 가능한 한 되돌아가서 추적하는 새로운 파이프라인을 개발했습니다. 그러나 종종 라이선스를 찾기 위해 만료된 도메인의 웹 아카이브 캡처에 의존해야 했으며, 경우에 따라서는 가장 가까운 정보에서 라이선스 상태를 ‘추측’해야 했습니다.

저자들이 개발한 출처 추적 시스템의 아키텍처

저자들이 개발한 출처 추적 시스템의 아키텍처 출처: https://arxiv.org/pdf/2111.02374.pdf

저자들은 6개의 데이터셋 중 5개의 라이선스가 ‘상업적 사용 상황에서 최소한 하나의 위험을 포함’한다는 것을 발견했습니다:

‘우리는 MS COCO를 제외하고, 연구된 라이선스 중 어느 것도 데이터에 대한 상업적 사용을 허용하지 않는다는 것을 관찰합니다. 이는 또한 데이터셋에 대한 사전 훈련된 모델을 사용하는 것을 방지합니다. 공개적으로 사용 가능한 데이터셋과 그 위에 사전 훈련된 AI 모델은 광범위하게 상업적으로 사용되고 있습니다.’*

저자들은 또한 6개의 데이터셋 중 3개가 상업 제품에서 데이터셋을 수정할 경우 라이선스 위반으로 이어질 수 있다고 주장합니다. 이는 오직 MS-COCO만이 수정을 허용하기 때문입니다. 그러나 데이터 증강과 하위 집합 및 상위 집합은 영향력 있는 데이터셋의 일반적인 관행입니다.

CIFAR-10의 경우, 원래 컴파일러는 데이터셋을 사용하는 프로젝트가 원래 데이터셋을 발표한 논문에 대한 인용을 포함하도록 요구하는 전통적인 라이선스 형식을 만들지 않았습니다. 이는 데이터의 법적 지위를 확립하는 데 추가적인 장애물입니다.

さらに, CityScapes 데이터셋만이 원래 데이터의 독점적 소유물이며, CIFAR-10과 ImageNet은 네트워크 소스에서 수집된 데이터를 사용합니다. 이는 각 소스에 대한 라이선스 메커니즘 또는 의미 있는 免責 조항을 조사하고 추적해야 함을 의미합니다.

출구는 없습니다

상업적인 AI 회사들은 저작권 침해로 인한 소송에서 자신을 보호하기 위해 세 가지 요소에 의존하는 것으로 보입니다. 그러나 이러한 요소는 신뢰할 수 있는 장기적인 보호를 제공하지 않습니다.

1: 무규제 국가 법률
세계各地의 정부는 데이터 스크레이핑에 대한 규제를 완화하여 경쟁에서 뒤처지지 않도록 노력하고 있습니다. 그러나 미국만이 공정 사용 교리하에 완전한 면책을 제공합니다. 이는 2015년에 Authors Guild v. Google, Inc. 사건의 판결로 확정되었습니다. 이 판결은 구글이 저작권 침해로 기소되지 않고 구글 북스 프로젝트를 위해 저작권된 자료를 자유롭게 사용할 수 있음을 확인했습니다.

공정 사용 교리의 정책이 변경되면(예: 강력한 조직이나 기업이 참여하는 또 다른 랜드마크 사건에 대한 반응으로), 이는 기존의 저작권 침해 데이터베이스를 이용하여 개발된 시스템의 이전 사용을 보호할 수 있지만, 계속되는 사용과 개발을 보호하지는 않을 것입니다.

이로 인해 공정 사용 교리의 현재 보호는 매우 임시적인 기반에 있습니다. 따라서 저작권된 자료로 개발된 상업적인 기계 학습 알고리즘이 저작권 침해로 인한 소송의 대상이 될 수 있습니다. 이는 모델의 가중치가 현재 허가된 콘텐츠만을 다루더라도, 허가되지 않은 콘텐츠로 훈련된 경우에 해당합니다.

미국 외의 국가에서는 정책이 일반적으로 더 엄격합니다. 영국과 캐나다는 비상업적 목적으로만 저작권된 데이터의 사용을 면책합니다. EU의 텍스트 및 데이터 마이닝 법은 또한 원래 데이터의 저작권 요구 사항에 따라 상업적 이용을 제외합니다.

이러한安排은 조직이 다른 사람의 데이터를 사용하여伟大한 성과를 달성할 수 있지만, 이를 상업적으로 이용할 수는 없습니다. 이러한 제품은 법적으로 노출되거나, 수백만 명의 저작권자와 계약을 체결해야 하는 상황에 직면할 수 있습니다. 이는 불가능한 일입니다.

2: 구매자 유의
저작권 침해로 인한 책임을 미루는 경우, 새로운 논문은 또한 가장 인기 있는 오픈 소스 데이터셋의 라이선스가 자체적으로 저작권 남용에 대한 모든 주장을 면책한다는 점을 관찰합니다:

‘예를 들어, ImageNet의 라이선스는 사용자가 데이터셋을 사용하여 발생하는 모든 주장에 대해 ImageNet 팀을 면책하도록 요구합니다. FFHQ, VGGFace2, MS COCO 데이터셋은 데이터셋이 배포되거나 수정된 경우 동일한 라이선스하에 제공되어야 합니다.’

이는 데이터셋을 사용하는 사람們이 저작권 침해로 인한 책임을 흡수하도록 강요합니다. 그러나 이는 원래 컴파일러를 보호하지는 않습니다.

3: 미명으로 인한 면책
기계 학습 커뮤니티의 협력적인 성質으로 인해 저작권 침해로 개발된 알고리즘의 존재를 숨기기 어렵습니다. 장기적인 상업 프로젝트는 종종 공개적으로 접근 가능한 포럼이나 사전 인쇄 또는 동료 검토된 논문에서 프로젝트의 기원이 발표된 오픈 소스 환경에서 시작됩니다.

即使 그렇지 않더라도, 모델 반전점점 더 능숙해져서 데이터셋의 일반적인 특징이나甚至 원본 자료를 출력할 수 있습니다. 이는 법적 증거를 제공하거나, 알고리즘 개발의 기록과 사용된 데이터셋에 대한 세부 정보에 대한 법원 명령에 대한 의심을 제공할 수 있습니다.

결론

이 논문은 허가 없이 얻은 저작권된 자료의 혼란스럽고 임시적인 사용과, 원래 데이터의 라이선스 체인을 추적하는 것을 방해하는 라이선스 체인을描写합니다.

저자들은 다음과 같이 결론지었습니다:

‘공개적으로 사용 가능한 데이터셋은 상업용 AI 소프트웨어를 개발하는 데广泛하게 사용되고 있습니다. 공개적으로 사용 가능한 데이터셋의 라이선스가 상업적 사용을 허용하는 경우에만 이를 사용할 수 있습니다. 그러나 이러한 라이선스의 권리와 의무를 확인하는 것은 쉽지 않습니다. 때때로 라이선스가 불분명하거나 잠재적으로 무효일 수 있습니다.’

새로운 연구인 법적 데이터셋 구축은 11월 2日に 싱가포르 경영 대학의 계산 법률 센터에서 발표되었습니다. 이 연구는 데이터 과학자들이 무법 지대의 데이터 수집 시대가 끝나고, 더 엄격한 관행과 방법론을 채택하여 데이터셋 사용이 법적 결과를 초래하지 않도록 해야 한다고 강조합니다. 저자는 다음과 같이 말합니다*:

‘[법적] 데이터셋에 영향을 미치는 입법의 모음은 성장할 것으로 예상되며, 현재의 법률이 불충분한 보호를 제공한다는 우려가 있습니다. EU 인공 지능법 초안은 통과되면 인공 지능과 데이터 거버넌스의 풍경을 크게 변경할 것입니다. 다른 관할권도 자신의 법을 제정할 수 있습니다. ‘

 

* 인라인 인용을 하이퍼링크로 변환

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai