Anderson의 관점
AI의 지적재산권 세척 방법

AI 학습에 지식재산권을 사용한 책임을 법적으로 묻게 된다면, 그 사용 흔적을 흐리는 방법도 이미 여러 가지 존재한다.
의견 현재 빠르게 전개되는 생성형 AI 혁명은 19세기 이후 어떤 변혁적 기술보다 법적으로 불안정한 환경에서 진행되고 있다.
3~4년 전까지 머신러닝 연구계는 새 시스템 개발 과정에서 지식재산권으로 보호된 자료를 이용하는 것을 암묵적으로, 때로는 명시적으로 허용받았다. 시스템이 성숙하지도 상업적으로 유효하지도 않았기 때문에 결과는 모든 의미에서 학술 연구로 취급됐다.
그러나 ChatGPT와 Claude 같은 확산 기반 LLM, Sora 같은 VLM이 갑자기 성공하면서 과거의 추상적이고 ‘무해한’ 연구가 상업성을 얻었고, 타인의 지식재산을 이용해도 된다는 자유 통행권도 끝났다.
권리자는 자신의 저작권 자료로 전부 또는 일부 학습한 AI가 만든 가치에서 몫을 요구하기 시작했고, 관련 소송은 따라가기 어려울 만큼 빠르게 늘고 있다.

미국 사건만 보아도 새 소송이 매우 빠른 속도로 등장하며, 같은 흐름은 미국 밖에서도 이어진다. 출처
‘공짜 점심’을 제도화하려는 움직임
AI 인프라에 투입되는 막대한 자금이 저작권 위험을 지닌 AI를 경제와 사회 깊숙이 심어 ‘망하게 둘 수 없는’ 수준뿐 아니라 ‘소송하기 어려운’ 수준으로 만들려는 것이라는 시각이 있다.
미국 대통령도 “성공적인 AI 프로그램을 만들려면 읽거나 공부한 모든 기사와 책에 비용을 지불하라고 요구할 수 없다”는 견해를 정책에 반영하려 한다.
서구 산업 시대에 이와 직접 비교할 만한 전례는 거의 없다. 20년 후 의약 특허가 만료되는 제도나 공공장소에서 기대할 수 있는 개인정보 보호의 한계가 가까운 예일 뿐이다.
다만 시대와 정책은 바뀐다. 지식재산 보호에 대한 사실상의 강제 수용이 흔들리거나 나중에 뒤집힐 가능성에 대비해, AI 개발자들은 논쟁적인 학습 데이터를 다루는 여러 보조적 방법을 표준 관행으로 만들고 있다.
프록시 데이터셋
첫 방법은 토렌트 목록 사이트가 문제 자료를 직접 호스팅하지 않는다고 방어하는 논리와 비슷하다. 이미지나 영상을 저장·전송할 필요를 줄이고, 권리자의 요청에 따른 삭제와 버전 관리도 빠르게 할 수 있다.
토렌트가 파일 위치를 가리키는 표지판이듯 영향력 있는 일부 데이터셋도 실제 콘텐츠가 아니라 위치 목록만 제공한다. 관리자는 데이터셋을 직접 배포하지 않고, 최종 사용자가 URL을 이용해 자료를 내려받는 책임을 진다는 구조다.
Google Research의 Conceptual 12M은 이미지 캡션을 제공하지만 이미지 자체는 당시 웹에 있던 위치를 가리킨다.

Google Research Conceptual 12M 큐레이션의 예시 두 건. 출처
또 다른 대표 사례는 2022년 Stable Diffusion의 등장을 가능하게 한 LAION이다. 독점 서비스가 생성 이미지 시장을 폐쇄적으로 장악할 듯한 시기에 강력한 오픈소스 생성 시스템을 대중에게 제공했다.

현대 저작권 미술작품을 포함한 LAION 프로젝트 변형의 예. 출처
일부 포인터 컬렉션의 다운로드 파일이 큰 이유는 이미지 자체보다 방대한 텍스트나 학습 과정에서 원본으로부터 추출한 임베딩·특징이 포함되기 때문이다.
영상이 요구하는 프록시 방식
의미 있는 규모의 영상을 직접 묶어 배포하려면 저장공간이 지나치게 많이 필요하므로 영상 데이터셋은 포인터 방식의 명분이 더 강하다. 하지만 URL 목록을 받았다고 바로 학습할 수 있는 것은 아니다. 이미지와 영상은 GPU 메모리에 맞게 크기와 구도를 조정해야 하고, 영상은 보통 3~5초의 짧은 구간으로 잘라야 한다.
온라인 영상 위치를 참조하는 대표 컬렉션으로 Google의 Kinetics Human Action Video Dataset과 YouTube-8M이 있다. YouTube-8M은 다운로드 뒤 영상 구간을 어떻게 처리할지 주석을 제공하지만 영상 확보는 사용자에게 맡긴다.
닫힌 생성기에서 나온 ‘열린’ 데이터
비공개 플랫폼으로 VFX 데이터를 생성한 뒤 결과 데이터셋만 공개하는 경우도 있다. 원천 모델의 지식재산 문제를 지우려는 것인지, 외부에서 ‘세척된’ 결과만 요청한 것인지 의문이 생긴다.
이런 세대 간 세척의 사례로 볼 수 있는 Omni-VFX는 Pika와 PixVerse 같은 폐쇄·반폐쇄 플랫폼을 참조한 Open-VFX의 많은 데이터를 포함한다.

오픈소스 Omni-VFX 데이터셋에 등장한 익숙한 얼굴. 출처
상류 모델에서 이어지는 책임
두 번째 큰 방식은 저작권 자료와 최종 학습 사이에 하나 이상의 단계를 두는 것이다. 그중 하나가 과거 어느 시점에 저작권 자료로 학습한 모델이 만든 합성 데이터다. 합성물이 매우 사실적인 결과를 만들 수 있다면, 일반 세계 모델이 합리적으로 추측할 수 없는 변환을 원저작물이 제공했을 가능성이 있다.
특히 생성 영상에서 현실에 없는 사건이나 시각효과(VFX)를 만들 때 이 문제가 뚜렷하다. 레이저가 신체의 예상 밖 부분에서 나오는 장면처럼 다양한 효과를 추상화하려는 최근 연구들은 값비싼 영화 VFX 대신 주문 제작 또는 ‘오픈소스’ VFX 클립으로 학습했다고 설명한다.
EffectMaker의 예시에서 왼쪽 원본 영상의 ‘동작’을 가운데 원본 이미지에 적용한다. EffectMaker는 한 영상의 VFX 역학을 추출해 새 영상으로 옮기려는 올해 첫 연구도 아니며, 이 과제는 AI VFX 연구의 독립된 하위 분야가 되고 있다.
Marvel 같은 대형 미디어 기업이 지식재산 소송에서 이길 가능성이 높다는 점을 의식해 VFX 기업과 스타트업은 다른 회사의 IP를 쓰지 않았음을 증명하려 애쓴다. Meta는 2026년 겨울 VFX 아티스트에게 할리우드 수준 효과를 생성하는 AI 학습 작업을 높은 보수로 제안한 것으로 알려졌다.
돈의 흐름과 기본 모델의 문제
그러나 블록버스터 한 편의 VFX 샷이 평균 약 4만2천 달러이고 더 비싼 경우도 많은 상황에서, 어떤 기업이 충분히 다양하고 풍부한 주문 제작 샷에 얼마까지 지불할지는 의문이다.
새 AI 모델은 결국 인기 영화의 표준 효과를 요구받을 가능성이 높다. 기존 영화에서 작업한 VFX 전문가가 비슷한 샷을 다시 만드는 상황이라면 ‘맞춤형’ 데이터 역시 모방적일 수 있다. 더구나 새 표본이 완전히 새로운 아키텍처에서 처음부터 학습된다는 보장도 없다.
재현 샷을 기본 모델에 의존하는 LoRA 같은 보조 모듈로 학습한다면 방어 가능성은 기본 모델이 얼마나 IP 측면에서 깨끗한지에 달린다. 미세조정이나 기존 컬렉션의 사전지식·임베딩을 이용하는 혼합 방법도 원천의 무결성이 불분명하면 새 작업의 독창성은 외형적일 뿐이다.
불가능한 장면이라는 단서
VFX는 현실에 존재하지 않아 오픈소스 대체 자료도 없는 장면을 보여 주기 때문에 AI 데이터의 IP 세척을 살펴보는 흥미로운 사례다. 건물 철거는 공개 자료나 저렴한 스톡 영상에서 배울 수 있지만 사람에게서 레이저가 나오는 장면은 도난하거나 주문 제작한 VFX 없이는 배울 수 없다.
극적인 홍수 같은 자연재해도 실제 현장에서는 사람들이 재난 한가운데를 생중계하지 않으므로 영화적 시점의 자료가 드물다. 그런 장면을 잘 생성하는 모델은 필요한 정보를 다른 곳에서 얻었을 가능성이 높다. 다만 대부분 AI 작업은 이렇게 출처를 추론하기 쉬운 특수성을 갖지 않아 IP 자료의 이점을 흐리는 일이 더 쉬울 수 있다.
결론: 얽힌 그물
생성형 AI를 오래 써 본 사람은 학습 데이터에 비슷한 사례가 없을 때 여러 개념을 결합하기 어려워한다는 사실을 체감한다. 이를 ‘얽힘’이라 하며, 학습된 개념의 요소가 레고 블록처럼 분리되지 않고 관련 요소와 함께 뭉치는 현상이다.
현재 주요 생성형 AI를 특징짓는 확산 방식에서 이 구조적 중력장을 벗어나기는 거의 불가능하다. 앞으로 학습 개념을 더 잘 분리해 새 조합으로 붙일 수 있고 출처의 흔적도 덜 드러내는 접근이 나타날 가능성은 있다.
EffectMaker를 비난하는 것이 아니라 AI 영상 연구에서 등장하는 일반적 관행을 논평한 것이다. 2026년 3월 16일 최초 게재.












