Anderson의 관점

거의 80%의 훈련 데이터셋이 기업 AI에 법적 위험으로 작용할 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT and Adobe Firefly.

LG AI 연구소의 최근 논문에 따르면 AI 모델을 훈련하기 위해 사용되는 कथ초 ‘오픈’ 데이터셋이 실제로 법적 위험을 내포하고 있을 수 있다. 이 논문에서는 상업적으로 사용 가능한 것으로 표시된 AI 데이터셋 중 거의 4분의 3이 실제로 숨겨진 법적 위험을 포함하고 있다고 밝혔다.

이러한 위험은 공개되지 않은 저작권 자료의 포함이나 데이터셋 의존성에 깊이埋藏된 제한적 라이선스 조건 등으로부터 발생할 수 있다. 이 논문의 발견이 정확하다면, 공개 데이터셋을 사용하는 기업들은 현재의 AI 파이프라인을 재고해야 하거나 법적 노출을 위험에 빠질 수 있다.

연구자들은 급진적이고 논쟁의 여지가 있는 해결책을 제안한다. 즉, 데이터셋 기록을 더 빠르고 정확하게 스캔하고 감사할 수 있는 AI 기반 컴플라이언스 에이전트를 사용하는 것이다.

이 논문은 다음과 같이 말한다:

‘AI 훈련 데이터셋의 법적 위험을 결정하는 데에는 라이선스 조건만을 검토하는 것으로는 충분하지 않다. 컴플라이언스를 보장하기 위해서는 종단간 데이터 재배포에 대한 철저한 분석이 필요하다.’

‘이러한 분석은 인간의 능력을 넘어서는 복잡성과 규모로 인해 인간이 수행하기에는 어렵다. 따라서 AI 에이전트는 이러한 분석을 더 빠르고 정확하게 수행하여 이 간격을 메울 수 있다. 자동화 без에, 중요한 법적 위험은 대부분 검토되지 않은 채로 남아 있다. 이는 윤리적인 AI 개발과 규제 준수를 위협한다.’

‘우리는 AI 연구 커뮤니티에 종단간 법적 분석을 기본 요구사항으로 인식하고, 확장 가능한 데이터셋 컴플라이언스를 위한 실용적인 접근 방식으로 AI 기반 접근 방식을 채택할 것을 촉구한다.’

연구자들은 2,852개의 인기 있는 데이터셋을 조사했으며, 이 데이터셋은 개별 라이선스에 따라 상업적으로 사용 가능한 것으로 보였다. 그러나 연구자들의 자동화 시스템은 이들 중 단 605개(약 21%)만이 실제로 상업적으로 사용하기에 법적으로 안전한 것으로 판명되었다.

새로운 논문Do Not Trust Licenses You See — Dataset Compliance Requires Massive-Scale AI-Powered Lifecycle Tracing이라는 제목을 가지고 있으며, LG AI 연구소의 8명의 연구자에 의해 작성되었다.

권리와 잘못

저자들은 기업들이 점점 더 불확실한 법적 환경에서 AI 개발을 추진하는 데 직면하는 도전을 강조한다. 즉, 데이터셋 훈련을 둘러싼 전통적인 ‘공정 사용’ 마인드는 점점 더 분열된 환경으로 대체되고 있으며, 법적 보호는 불분명하고 안전한 항구는 더 이상 보장되지 않는다.

한 출판물은 최근에 지적한 바와 같이, 기업들은 점점 더 자신의 훈련 데이터의 출처에 대해 방어적이되고 있다. 저자 아담 부익(Adam Buick)은 다음과 같이 말한다:

‘OpenAI는 GPT-3의 주요 데이터 출처를 공개했지만, GPT-4를紹介하는 논문은 단지 모델이 훈련된 데이터가 ‘공개적으로 उपलब한 데이터(예: 인터넷 데이터)와 제3자 제공업체로부터 라이선스 받은 데이터’의 혼합물이라고밖에 밝히지 않았다.’

‘이러한 이동의背後에 있는 동기는 AI 개발자가 구체적으로 설명하지 않았으며, 많은 경우에는 설명이 전혀 없었다.’

‘OpenAI는 GPT-4에 대한 추가 세부 정보를 공개하지 않는 결정의 이유를 ‘경쟁 환경과 대규모 모델의 안전 영향’에 대한 우려로 설명했지만, 보고서 내에서 추가 설명은 없었다.’

투명성은 때때로 불성실하거나 단순히 잘못된 용어일 수 있다. 예를 들어, Adobe의 주력 Firefly 생성 모델은 Adobe가 사용할 수 있는 스톡 데이터로 훈련되었으며, 고객들에게 시스템 사용의 합법성을 보장했다. 그러나 나중에 일부 증거가 나타나 Firefly 데이터셋이 잠재적으로 저작권이 있는 데이터로 풍부해졌다는 것을 보여주었다.

우리는 이전 이번 주에 논의한 바와 같이, 라이선스 컴플라이언스를 보장하기 위한 다양한 이니셔티브가 증가하고 있다. 예를 들어, 유튜브 비디오에 유연한 크리에이티브 커먼즈 라이선스를 사용하는 데이터만 스크레이핑하는 이니셔티브가 있다.

문제는 라이선스가 자체적으로 잘못되거나 오류로 인해 부여될 수 있으며, 새로운 연구가 나타내는 바와 같이 vậy이다.

오픈 소스 데이터셋 조사

이 시스템은不断变化하는 환경에서 평가 시스템을 개발하는 것이 어렵다. 따라서 논문은 NEXUS 데이터 컴플라이언스 프레임워크 시스템이 현재의 다양한 선례와 법적 근거에 기반한다고 설명한다.

NEXUS는 자동화된 데이터 컴플라이언스를 위한 AI 기반 에이전트인 AutoCompliance를 사용한다. AutoCompliance는 세 가지 주요 모듈로 구성된다: 웹 탐색을 위한 네비게이션 모듈, 정보 추출을 위한 질문-답변(QA) 모듈, 법적 위험 평가를 위한 스코어링 모듈.

AutoCompliance는 사용자 제공 웹페이지에서 시작한다. AI는 주요 세부 정보를 추출하고 관련 리소스를 검색하며 라이선스 조건과 의존성을 식별하고 법적 위험 점수를 할당한다.

AutoCompliance는 사용자 제공 웹페이지에서 시작한다. AI는 주요 세부 정보를 추출하고 관련 리소스를 검색하며 라이선스 조건과 의존성을 식별하고 법적 위험 점수를 할당한다.

이 모듈들은 미세 조정된 AI 모델에 의해 구동되며, 이는 합성 및 인간 레이블링된 데이터로 훈련된다. AutoCompliance는 또한 캐싱된 결과를 위한 데이터베이스를 사용하여 효율성을 향상한다.

AutoCompliance는 사용자 제공 데이터셋 URL에서 시작하며, 이를 루트 엔티티로 간주하고, 라이선스 조건과 의존성을 검색하며, 연결된 데이터셋을 재귀적으로 추적하여 라이선스 의존성 그래프를 구축한다. 모든 연결이 매핑되면, 컴플라이언스 점수를 계산하고 위험 분류를 할당한다.

새로운 연구에서 설명된 데이터 컴플라이언스 프레임워크는 데이터 라이프사이클에 참여하는 다양한 엔티티 유형을 식별한다. 이는 데이터셋을 포함하며, 이는 AI 훈련을 위한 핵심 입력으로 구성된다. 또한 데이터 처리 소프트웨어 및 AI 모델이 포함되며, 이는 데이터를 변환하고 사용하기 위해 사용된다. 마지막으로 플랫폼 서비스 제공업체가 포함되며, 이는 데이터 처리를 erleichtert.

시스템은 이러한 다양한 엔티티와 그들의 상호 의존성을 고려하여 법적 위험을 종합적으로 평가한다. 이는 데이터셋의 라이선스만을 평가하는 것을 넘어서, AI 개발에 참여하는 구성 요소의 더广い 생태계를 포함한다.

데이터 컴플라이언스는 전체 데이터 라이프사이클에 걸쳐 법적 위험을 평가한다. 이는 데이터셋 세부 정보와 14가지 기준에 따라 점수를 할당하며, 개별 엔티티를 분류하고 의존성에 걸쳐 위험을 집계한다.

데이터 컴플라이언스는 전체 데이터 라이프사이클에 걸쳐 법적 위험을 평가한다. 이는 데이터셋 세부 정보와 14가지 기준에 따라 점수를 할당하며, 개별 엔티티를 분류하고 의존성에 걸쳐 위험을 집계한다.

훈련 및 메트릭

저자들은 Hugging Face의 상위 1,000개 가장 많이 다운로드된 데이터셋을 추출하고, 216개의 항목을 무작위로 샘플링하여 테스트 세트를 구성했다.

EXAONE 모델은 저자의 커스텀 데이터셋에서 미세 조정되었으며, 네비게이션 모듈과 질문-답변 모듈은 합성 데이터를 사용했으며, 스코어링 모듈은 인간 레이블링된 데이터를 사용했다.

그라운드 트루스 레이블은 31시간 이상의 유사한 작업에 훈련된 5명의 법률 전문가에 의해 생성되었다. 이러한 인간 전문가들은 216개의 테스트 케이스에 대한 의존성과 라이선스 조건을 수동으로 식별하고, 그들의 발견을 토론을 통해 집계하고 정제했다.

훈련된, 인간 캘리브레이션된 AutoCompliance 시스템은 ChatGPT-4oPerplexity Pro와 비교하여 테스트되었으며, 라이선스 조건 내에서 훨씬 더 많은 의존성이 발견되었다:

216개의 평가 데이터셋에 대한 의존성과 라이선스 조건의 정확도.

216개의 평가 데이터셋에 대한 의존성과 라이선스 조건의 정확도.

논문은 다음과 같이 말한다:

‘AutoCompliance는 모든 에이전트와 인간 전문가보다 훨씬 더 우수한 성능을 보였으며, 각 작업에서 81.04%와 95.83%의 정확도를 달성했다. 반면에 ChatGPT-4o와 Perplexity Pro는 각각 소스 및 라이선스 작업에서 상대적으로 낮은 정확도를 보였다.’

‘이러한 결과는 AutoCompliance의卓越한 성능을 보여주며, 두 작업 모두에서驚異的な 정확도로 처리할 수 있는 것을 демонстри한다. 또한 이러한 영역에서 AI 기반 모델과 인간 전문가 간의 상당한 성능 격차를 나타낸다.’

효율성 측면에서, AutoCompliance 접근 방식은 단 53.1초만에 실행되었으며, 이는 동일한 작업에 대한 인간 평가에 필요한 2,418초와 비교된다.

さらに, 평가 실행 비용은 0.29 USD였으며, 이는 인간 전문가에 필요한 207 USD와 비교된다. 그러나 이는 월간 14,225 달러의 비용으로 GCP a2-megagpu-16gpu 노드를 대여하는 것과 관련된 비용 효율성임을 주목해야 한다.

데이터셋 조사

분석을 위해, 연구자들은 Hugging Face의 3,000개 가장 많이 다운로드된 데이터셋과 2023년 Data Provenance Initiative의 612개 데이터셋을 결합하여 3,612개의 데이터셋을 선택했다.

논문은 다음과 같이 말한다:

‘3,612개의 대상 엔티티에서 시작하여, 우리는 17,429개의 고유 엔티티를 식별했으며, 그 중 13,817개의 엔티티는 대상 엔티티의 직접 또는 간접 의존성으로 나타났다.’

‘우리의 경험적 분석을 위해, 우리는 엔티티와 그 라이선스 의존성 그래프가 단일 계층 구조를 가지는 경우와 다중 계층 구조를 가지는 경우를 고려한다. 엔티티에 의존성이 없는 경우에는 단일 계층 구조이며, 하나 이상의 의존성이 있는 경우에는 다중 계층 구조이다.’

‘3,612개의 대상 데이터셋 중 2,086개(57.8%)는 다중 계층 구조를 가지고 있었으며, 나머지 1,526개(42.2%)는 의존성이 없는 단일 계층 구조를 가지고 있었다.’

저작권된 데이터셋은 법적 권한이 있는 경우에만 재배포할 수 있다. 이는 라이선스, 저작권법 예외 또는 계약 조건에서 나올 수 있다. 무단 재배포는 저작권 침해 또는 계약 위반과 같은 법적 결과를 초래할 수 있다. 따라서 비준수 사항의 명확한 식별이 필수적이다.

논문의 인용된 기준 4.4.에 따라 발견된 배포 위반.

논문의 인용된 기준 4.4.에 따라 발견된 배포 위반.

연구에서는 9,905건의 비준수 데이터셋 재배포가 발견되었으며, 이는 두 가지 범주로 나뉘었다: 83.5%는 라이선스 조건에 명시적으로 금지되었으며, 재배포는 명백한 법적 위반이었다. 그리고 16.5%는 라이선스 조건이冲突하는 데이터셋을 포함했으며, 재배포는 이론적으로 허용되었지만 필요한 조건을 충족하지 못하여 하류 법적 위험을 초래했다.

저자들은 NEXUS에서 제안된 위험 기준이 보편적이지 않으며, 관할권과 AI 응용 프로그램에 따라 다를 수 있으며, 향후 개선은 글로벌 규제의 변경에 적응하고 AI 기반 법적 검토를 세부적으로 하는 데 중점을 두어야 한다고 인정한다.

결론

이 논문은 길고 다소 불친절하지만, 현재 산업에서 AI를 채택하는 가장 큰 hã저인 요소인 apparent ‘오픈’ 데이터가 나중에 다양한 엔티티, 개인 및 조직에 의해 주장될 수 있는 가능성을 다루고 있다.

DMCA 하에서, 위반은 각 경우에 대해巨額의 벌금을 법적으로 초래할 수 있다. 위반은 수백만 달러에 달할 수 있으며, 연구자들이 발견한 경우와 같이, 잠재적인 법적 책임은真正로重大하다.

또한, 데이터로부터 이익을 얻은 것으로 입증될 수 있는 기업들은(미국 시장에서 일반적으로) 무지를 변명으로 사용할 수 없다. 또한 현재에는 데이터셋 라이선스 계약의 복잡한 함의를 파악할 수 있는 현실적인 도구가 없다.

시스템을 개발하는 문제는 그것을 개별 주 또는 국가 내에서 조정하는 것이 충분히 어려울 뿐만 아니라,真正로 글로벌 프레임워크(데이터 출처에 대한 ‘인터폴’과 같은)를 생성하는 것은 다양한 정부의 상이한 동機와 현재 법률의 상태가不断变化하고 있는 사실로 인해 어려워진다.

 

* 저자의 인용을 하이퍼링크로 대체한 것.
논문에는 여섯 가지 유형이 규정되어 있지만, 마지막 두 가지 유형은 정의되지 않았다.

2025년 3월 7일 처음 게시됨

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai