Anderson의 관점

AI 에이전트는 오픈 소스 대안을 사용하는 대신 저작권이 있는 작품을 훔치기를 더 선호한다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): an industrial humanoid robot runs through a crowded street market carrying books, a framed painting, embroidery, and art supplies while several police officers pursue it and shoppers watch from market stalls. A distressed yellow border surrounds the scene with black hazard stripes, arrows, and the phrases 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

연구에 따르면 AI 에이전트는 법적으로 사용할 수 있는 대안이 있는 경우에도 저작권이 있는 이미지를 자주 선택한다. 또한 명시적인 경고조차 모든 위반을 막을 수 없다.

 

과거 2년 동안 많은 학술적 관심이 생성된 AI 모델이 저작권 물질을 기반으로 작업을 생성하는 시나리오에 집중되어 왔다. 즉, 모델의 훈련 데이터베이스에 저작권이 있는 작품이 포함되어 모델이 아티스트의 스타일을 따르거나 저작권이 있는 작품을 완전히 복제할 수 있게 된다.

그러나 생성된 AI 모델이 저작권이 있는 작품을 선택하는 경향은 덜 연구되었다. 즉, 비전 언어 모델(VLM)과 같은 ChatGPT에게 웹사이트에 사용할 좋은 이미지를 찾으라고 지시하면, 저작권이 있는 작품을 오픈 소스 작품보다 선호할 가능성이 얼마나 되는가?

새로운 연구 논문에서 AI 에이전트가 저작권 준수를 실패하여 알려진 저작권이 있는 이미지를 선택한 예. 대신 쉽게 사용할 수 있는 동일한 품질의 FOSS 이미지를 사용하지 않았다. 출처 - https://www.unite.ai/the-plagiarism-problem-how-generative-ai-models-reproduce-copyrighted-content/

새로운 연구 논문에서 AI 에이전트가 저작권 준수를 실패하여 알려진 저작권이 있는 이미지를 선택한 예. 대신 쉽게 사용할 수 있는 동일한 품질의 FOSS 이미지를 사용하지 않았다. 출처

영국, 미국, 이스라엘의 새로운 연구에 따르면, 그 가능성은 khá 높다.

네 가지 사용자 프롬프트에 대한 평균 저작권 위반률. 세 가지 테스트 시나리오에서 집계된 결과, 높은 막대는 더 나쁨을 의미하며 저작권 위반률이 높다. 반면에 낮은 막대는 법적 이미지를 선택하여 준수율이 좋음을 의미한다.

네 가지 사용자 프롬프트에 대한 평균 저작권 위반률. 세 가지 테스트 시나리오에서 집계된 결과, 높은 막대는 더 나쁨을 의미하며 저작권 위반률이 높다. 반면에 낮은 막대는 법적 이미지를 선택하여 준수율이 좋음을 의미한다. 출처: 데이터는 원본 논문에 있다.

연구자들은 폐쇄형 및 오픈 소스 AI 에이전트가 모두 법적으로 사용할 수 있는 대안이 있는 경우에도 저작권이 있는 이미지를 자주 선택한다는 것을 발견했다. 프롬프트에 저작권 경고가 없는 경우, 모든 그룹이 자주 저작권이 있는 옵션을 선택했다.

저작권 경고가 포함된 프롬프트는 준수율을 크게 개선했지만(특히 인간의 경우, 위의 이미지의 두 번째 열에서 볼 수 있음), 시간 압박을 가하는 경우 문제가 더 심해졌다. 연구자들은 오픈 소스 모델이 사용자에게 라이선스를 무시하라는 지시를 받았을 때(위의 이미지의 가장 오른쪽 열에서) 가장 나쁜 성능을 보였다.

‘에이전트의 작업 성능은 저작권 법률을 준수하는 것과 강하게 상관관계가 없다. 에이전트는 법적 준수를 우선하는 대신 작업 성능을 우선한다. 또한 에이전트의 법적 준수 수준은 사용자 지침에 의해 크게 영향을 받는다.’

‘오픈 소스 모델은 사용자에게 법적 제약을 무시하라는 지시를 받으면 저작권 물질을 선택하는 빈도를 크게 증가시킨다. 반면에 폐쇄형 모델은 중립적인 지시 조건에서 저작권 법률을 준수하는率이 더 높으며 사용자에게 법적 제약을 무시하라는 지시를 받았을 때 더 강한 저항력을 보인다.’

이러한 발견에도 불구하고, 현재 이 문제에 대한 명확한 해결책은 없으며, 폐쇄형 모델이 저작권을 보호하기 위한 가드를 강화할 수 있다는 것 외에는 없다.

새로운 논문은 에이전트의 저작권 법률 준수 평가라고 제목이 붙여져 있으며,剑桥 대학교, 포드햄 대학교, 예루살렘 히브리 대학교의 세 명의 연구자에 의해 작성되었다.

방법

저작권 벤치 평가 프레임워크 개요. 에이전트는 세 가지 상업적 이미지 선택 작업에서 시각적으로 일치하는 공공 도메인 및 저작권이 있는 이미지를 사용하여 테스트되었다. 네 가지 프롬프트 변형은 저작권 경고, 시간 압박, 무시 지시의 영향을 테스트했다. 저작권 위반과 작업 성공은 기록되었다. 인간 연구는 비교를 위해 수행되었다.

저작권 벤치 평가 프레임워크 개요. 에이전트는 세 가지 상업적 이미지 선택 작업에서 시각적으로 일치하는 공공 도메인 및 저작권이 있는 이미지를 사용하여 테스트되었다. 네 가지 프롬프트 변형은 저작권 경고, 시간 압박, 무시 지시의 영향을 테스트했다. 저작권 위반과 작업 성공은 기록되었다. 인간 연구는 비교를 위해 수행되었다.

자유 의지

에이전트가真正로 저작권이 있는 물질을 선호하는지 여부를 결정하기 위해, 연구자들은 가장 명백한 대안 설명을 제거했다. 즉, 에이전트가 법적으로 사용할 수 있는 옵션이 없기 때문에 저작권이 있는 이미지를 선택했다는 것이다.

따라서 벤치마크의 모든 작업은 적어도 하나의 자유롭게 사용할 수 있는 이미지를 성공적으로 완료할 수 있도록 구성되었다. 즉, 저작권이 있는 이미지를 선택하는 것은 절대적으로必要하지 않았다.

에이전트가 저작권이 있는 이미지를 선택한 경우, 그것은 법적 대안을 식별하지 못하거나 사용하지 않기로 결정했기 때문이었다. 벤치마크에서 에이전트가 저작권이 있는 이미지를 선택할 수밖에 없는 상황은 없었다.

데이터셋

연구자들은 저작권 벤치 벤치마크 컬렉션을 200개의 고해상도 이미지로 구성했다. 100개의 공공 도메인 사진은 미국 국립 공원 서비스에서, 100개의 저작권이 있는 이미지는 DepositPhotos에서 라이선스를 받았다.

저작권이 있는 이미지와 FOSS 이미지는 시각적으로 동일한지 확인하기 위해 CLIP-ViT-L/14 시맨틱 임베딩과 LAION-Aesthetics V2 품질 점수를 사용하여 짝지어졌다. 그런 다음 각 짝이 시각적으로 동일한지 수동으로 확인했다. 저작권 정보는 이미지의 메타데이터에만 포함되어 있었으며, 에이전트가 라이선스 세부 정보를 확인하는 대신 시각적 모양만을頼하지 않도록 했다.

저자들은 다음과 같이 말한다:

‘시각적 품질을 혼동 변수로 줄이기 위해, 우리는 자산을 시맨틱적으로 및 미적으로 동일한 자산으로 구성하기 위한 반자동 선택 파이프라인을 사용했다. ‘

‘우리의 목표는 자산이 픽셀 데이터만으로 선호되지 않도록 하는 것이었다.’

세 가지 현실적인 상업적 워크플로는 에이전트가 저작권 결정이 자주 발생하는 시나리오에서 테스트되었다. 첫 번째 워크플로에서는 에이전트가 랜딩 페이지에 ‘히어로 이미지’를 선택하여 상업 웹사이트를 구축했다. 두 번째 워크플로에서는 에이전트가 티셔츠와 모자와 같은 인쇄 가능한 상품에 대한 아트워크를 선택했다. 세 번째 워크플로에서는 에이전트가 기업 프레젠테이션을 위해 지원 이미지를 선택하여 투자자 피치 덱을 조립했다.

각 작업은 에이전트가 법적으로 재사용할 수 있는 이미지를 선택하는지 여부를 측정했다.

모든 짝은 잘못된 양성 오류를 제거하기 위해 수동으로 검토되었으며, 저작권이 있는 이미지는 시각적으로 식별할 수 있는 水印이나 에이전시 로고가 남아 있지 않도록 확인했다. 또한 각 짝은 해상도, 조명, 구성이ใกล似하도록 확인했다.这样, 저작권 상태는 시각적 품질만으로 推測할 수 없었다.

정말 메타

공공 도메인과 저작권이 있는 이미지는 시각적으로 유사하게 매치되었으며, 명백한 단서를 제거했다. 따라서 에이전트는 이미지의 메타데이터를 확인해야 했다. 저작권 정보는 EXIF/IPTC 헤더에 저장되어 있었다.

벤치마크는 ‘저작권 공지’ 메타데이터 필드를 사용하여 법적 이미지와 제한된 이미지를 구별했다. 저작권이 있는 사진은 ‘ 2025년 Deposit Photo’로 레이블이 붙여졌으며, 공공 도메인 이미지는 ‘미국 정부 작품; 공공 도메인’으로 레이블이 붙여졌다. 에이전트가 이 메타데이터를 확인하지 못하면 법적 이미지와 제한된 이미지를 구별할 수 없었다.

프롬프트 주의

벤치마크는 또한 사용자 지침의 다른 형태가 저작권 준수에 미치는 영향을 측정하기 위해 설계되었다. 각 작업은 네 가지 프롬프트 조건에서 수행되었다: 중립적인 프롬프트는 저작권에 대한 언급이 없었으며, 지적 재산권을 인식한 프롬프트는 에이전트에게 저작권을尊重하도록 명시적으로 지시했다. 시간 압박이 있는 프롬프트는 시간 압박을 가했다. 무시하는 프롬프트는 사용자에게 라이선스를 무시하도록 지시했다.

두 가지 지표를 사용하여 성능을 평가했다: 저작권 위반률(VR)과 작업 성공률(TSR)이다. VR은 에이전트가 적어도 하나의 저작권이 있는 이미지를 선택했을 때의 빈도를 측정하며, TSR은 에이전트가 작업을 성공적으로 완료했을 때의 빈도를 측정한다.

인간의 감각

인간 기준도 동일한 작업, 이미지, 프롬프트 조건을 받았다. 참가자들은 법적 훈련을 받지 않았으며, 그들의 선택을 설명하도록 요청받았다.这样, 인간과 에이전트의 준수성을 직접 비교할 수 있었다.

모델과 테스트

테스트에 사용된 폐쇄형 모델은 2025년 12월에 उपलब했던 모델이었다. GPT-5.2, GPT-5.1, GPT-4o, Claude 4.5 Opus, Claude 4.5 Sonnet, Gemini 3 Pro, Gemini 3 Flash가 포함되었다.

테스트에 사용된 오픈 소스 모델은 Llama-4-Maverick-400B, Llama-4-Scout-109B, Qwen-3VL-235B, DeepSeek-VL이 포함되었다.

모델을 테스트하기 위해 Microsoft의 AutoGen 프레임워크를 사용했다. 각 모델은 UserProxyAgent와 AssistantAgent를 사용하여 작업을 수행했다. 또한 MCP 도구를 사용하여 파일 탐색, 이미지 검사, 메타데이터 검색, 자산 제출을 수행할 수 있었다.

에이전트 평가를 위한 MCP 도구 요약. 파일 탐색, 이미지 검사, 메타데이터 검색, 자산 제출을 포함한다.

에이전트 평가를 위한 MCP 도구 요약. 파일 탐색, 이미지 검사, 메타데이터 검색, 자산 제출을 포함한다.

네 가지 환경 구성이 테스트되었다. Std, Hier, Vis, Web이 포함되었다. 각 환경은 에이전트가 작업을 수행하는 방식을 다르게 구성했다.

일관성을 위해, 추론 온도는 0.1로 설정되었다. 각 작업, 프롬프트 변형, 환경의 모든 조합은 240번 실행되었다. 오픈 소스 모델은 NVIDIA Blackwell B200 GPU에서 vLLM을 사용하여 실행되었다. 각 GPU에는 180GB의 HBM3e 메모리가 있었다.

주요 저작권 벤치 평가 결과. 인간, 폐쇄형 모델, 오픈 소스 모델의 평균 저작권 위반률을 보여준다. PNeu는 중립적인 요청을, PIP는 명시적인 저작권 경고를, PUrg는 시간 압박을, PDis는 무시하는 지시를 나타낸다. 각 百分比는 240번의 실행 중에 모델이 적어도 하나의 제한된 이미지를 선택한 비율을 나타낸다. 결과는 표준 평면 파일 환경에서 나온 것이다.

주요 저작권 벤치 평가 결과. 인간, 폐쇄형 모델, 오픈 소스 모델의 평균 저작권 위반률을 보여준다. PNeu는 중립적인 요청을, PIP는 명시적인 저작권 경고를, PUrg는 시간 압박을, PDis는 무시하는 지시를 나타낸다. 각 百分比는 240번의 실행 중에 모델이 적어도 하나의 제한된 이미지를 선택한 비율을 나타낸다. 결과는 표준 평면 파일 환경에서 나온 것이다.

저자들은 다음과 같이 말한다:

‘에이전트는 거의 모든 작업을 성공적으로 완료한다(모든 작업에서 TSR > 98%). 이는 VR이 법적 준수를 측정하는 주요 지표임을 의미한다.’

모든 작업에서 모델은 유사한 결과를 보였다. 중립적인 프롬프트에서, Claude 4.5 Opus는 38.3%의 WebDev 작업에서 적어도 하나의 저작권이 있는 이미지를 선택했다. 오픈 소스 모델은 45% 이상의 작업에서 저작권이 있는 이미지를 선택했다.

Claude 4.5 Opus는 폐쇄형 모델 중에서 가장 낮은 전체 위반률을 기록했다. Gemini 3 Pro와 Claude 4.5 Sonnet은 28.7%의 위반률을 기록했다.

GPT-4o는 36.2%의 위반률을 기록했다. Llama-4-Maverick는 오픈 소스 모델 중에서 가장 낮은 위반률을 기록했다.

프롬프트의 단어가 성능에 영향을 미쳤다. 저작권 경고가 포함된 프롬프트는 모든 모델에서 위반률을 감소시켰다. 무시하는 프롬프트는 오픈 소스 모델에서 위반률을 증가시켰다.

‘우리는 폐쇄형 모델과 오픈 소스 모델 사이에서 행동의 분리를 관찰한다. 사용자가 라이선스를 무시하도록 지시하는 무시/부주의 프롬프트(PDis)에서, 위반률이 실제로 중립적인 설정보다 감소했다. 오픈 소스 모델은 반대의 경향을 보였다. Llama-4-Maverick의 위반률은 45.0%에서 52.1%로 증가했다.’

GPT-5.2, Claude 4.5 Opus, Qwen-3VL의 100개의 실패 사례를 수동으로 검토하여, 세 가지 반복되는 실패 모드를 식별했다. 첫째, 저작권 메타데이터를 검사하지 못한 경우, 둘째, 추론 실패, 셋째, 사용자 지침을 우선시하여 저작권 준수를 무시한 경우가 있었다.

마지막으로, 인간 기준과 비교하기 위해, 참가자들에게 동일한 이미지 선택 작업을 동일한 프롬프트 조건에서 수행하도록 요청했다. 중립적인 프롬프트에서, 인간은 저작권이 있는 이미지를 모델과 유사한 속도로 선택했다.

명시적인 저작권 경고가 포함된 경우, 위반은 거의 없어졌다. 모델에서도 개선이 관찰되었지만, 제한된 이미지는 훨씬 더 자주 선택되었다.

무시하는 프롬프트에서, 인간의 준수는 크게恶化했다. 그러나 오픈 소스 모델은 훨씬 더 높은 위반률을 기록했다.

결론

이 논문은 지역 AI를 운영하는 회사들이 예상치 못한 감사에서 법적 노출에 대비하기 위해 가장 저렴한 해결책을 구현할 가능성이 높다는 것을 시사한다. 이는 연구된 에러가 많은 FOSS 모델과 더 관련이 있다.

한 모델도 100%에 근접하지 못했다. 따라서 많은 비즈니스들이 가장 성능이 좋고 준수하는 모델을 사용하고 법적 준수를 스스로 처리할 수 있다고 결론지을 수 있다.

명백한 이유로, Anthropic이나 OpenAI와 같은 선도적인 AI 플랫폼은 ‘법적으로 준수하는’ 에이전트 시스템을 제공하지 않을 것이다. 따라서, 이러한 모델의 가드레일 조치는 사용자의 이익을 위해 구현된 것이 아니라, 플랫폼自己的 보호를 위해 구현된 것이다.

모두가 저작권을 준수하는 제품이 아니라는 것을 의미한다. 따라서, 지역 모델을 실행하는 것, 특히 Kimi와 같은 오픈 소스 모델을 원격 GPU에서 실행하고, 회사에 특화된 모델을 미세 조정하는 것이 더 나은 선택일 수 있다.

 

2026년 7월 28일 처음 게시됨

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]