Anderson의 관점
합성 데이터셋에서 실제 身分을 회복할 수 있다

2022년은 생성적 인공지능의 파괴적 잠재력이 처음으로 널리 공유된 관심을 끌었던 순간이었다면, 2024년은 기업들이 그 힘을 활용하기를 원하는 가운데 생성적 인공지능의 기반이 되는 데이터의 합법성에 대한 질문들이 중심무대에 올랐다.
미국의 공정 사용 도クト린과 함께 학술적 라이선스가 오랫동안 학문적 및 상업적 연구 분야에서 생성적 인공지능을 탐구할 수 있도록 허용해 왔지만, 표절 증거가 나타남에 따라 점점 더 유지하기 어려워졌다. 그 결과 미국은 현재 AI 생성 콘텐츠의 저작권 등록을 금지했다.
이 문제는 아직 해결되지 않았으며, 곧 해결될 것 같지도 않다. 2023년에 생성적 인공지능의 법적 지위에 대한 미디어 및 공공의 우려가 증가한 결과로, 미국 저작권 사무소는 이 문제를 조사하기 시작했으며, 2024년 7월에 첫 번째 보고서를 발간했다.
이러한 상황에서 기업의 이해관계는 법적 결과를 피하기 위해 비싼 모델을 개발하는 데 관심이 있다.
비싼 단기 해결책은 기업이 사용할 수 있는 데이터를 훈련시키는 것이다. Adobe의 텍스트-이미지 및 텍스트-비디오 아키텍처인 Firefly는 주로 2014년에 구입한 Fotolia 스톡 이미지 데이터셋에 의해 구동되며, 공개 도메인 데이터를 사용하여 보충된다.同時에 기존 스톡 사진 공급업체인 Getty 및 Shutterstock는 새로운 가치의 라이선스된 데이터를 자본화했으며, 라이선스된 콘텐츠 또는 자체 IP 규정 준수 GenAI 시스템을 개발하기 위한 거래가 증가하고 있다.
합성 솔루션
AI 모델의 잠재 공간에서 저작권 데이터를 제거하는 것은 어려운 문제이며, 이러한 문제는 회사에 매우 비용이 많이 들 수 있다.
대안은 합성 데이터를 사용하는 것으로, 컴퓨터 비전 시스템 및 대규모 언어 모델(Large Language Model, LLM)에서 더 저렴한 솔루션이다. 합성 데이터는 대상 도메인의 무작위로 생성된 예제로 구성된다.
이러한 사이트는 실제로 존재하지 않는 사람들의 사진을 합성할 수 있다는 아이디어를 이미popular화했다. 이러한 사진은 실제로 존재하는 사람들과 아무런 관련이 없다.
따라서 이러한 추상적이고 비실제적인 예제로 얼굴 인식 시스템 또는 생성 시스템을 훈련시키면, 법적으로 사용할 수 있는 데이터가 필요하지 않은 상태에서 AI 모델의 생산성을 얻을 수 있다.
균형의 작용
문제는 합성 데이터를 생성하는 시스템이 실제 데이터로 훈련된다는 것이다. 이러한 실제 데이터가 합성 데이터에 유출되면, 제한된 또는 비인가된 자료가 금전적 이익을 위해 사용되었다는 증거를 제공할 수 있다.
이를 피하기 위해, 이러한 모델은真正로 ‘랜덤’한 이미지르 생성해야 한다. 이러한 모델은 잘 일반화되어야 한다. 일반화는 훈련된 AI 모델이 높은 수준의 개념을 이해하는 능력을 측정한다.
불행히도, 이러한 시스템이 세부적인 세부 사항을 생성하거나 인식하기 위해 광범위한 데이터셋을 훈련해야 하는 경우가 많다. 이는 시스템이 실제 훈련 데이터를 일부 재현하는 경향이 있는 ‘기억’에 노출될 수 있다.
이것은 학습 속도를 낮추거나, 코어 개념이 아직 특정 데이터 포인트와 관련되지 않은 단계에서 훈련을 종료함으로써 완화될 수 있다.
그러나 이러한 해결책은 모델이 세부적인 세부 사항을 갖지 못하도록 할 수 있다.
얼굴 공개
스위스에서 발표된 새로운 논문은 합성 데이터셋에서 실제 이미지의 원본 이미지를 회복할 수 있다고 주장한다.
이 연구는 6개의 최신 합성 데이터셋을 조사했으며, 모든 경우에 원본(潜在적으로 저작권이 있는) 데이터를 회복할 수 있었다.
연구자들은 다음과 같이 말한다.
‘우리의 실험은 합성 얼굴 인식 데이터셋이 실제 훈련 데이터의 샘플과 매우 유사한 샘플을 포함한다는 것을 보여준다. 어떤 경우에는 합성 샘플이 원본 이미지와 매우 유사하며, 다른 경우에는 합성 샘플이 원본 이미지와 다소 다른 변형을 갖는다.’
방법, 데이터 및 결과
이 연구는 멤버십 추론 공격을 사용하여 합성 데이터셋에서 원본 이미지를 회복했다.
이 연구는 6개의 합성 데이터셋을 조사했으며, 실제 데이터셋의 원본 이미지를 회복할 수 있었다.
연구자들은 다음과 같이 말한다.
‘합성 데이터셋은 실제 훈련 데이터의 샘플과 매우 유사한 샘플을 포함한다. 이는 개인 정보 보호와 관련된 문제를 제기한다.’
결론
최근에 미디어는 AI 모델을 AI 생성 데이터로 훈련시키는 것이 점점 더 낮은 성과를 가져온다는 것을 강조했다.
그러나 스위스의 새로운 연구는 기업들이 생성적 인공지능을 利用하고자 하는 경우, 더 중요한 문제를 제기한다. 즉, 합성 데이터셋에서 실제 이미지의 원본 이미지를 회복할 수 있다는 것이다.
이 연구는 합성 데이터셋이 실제 데이터셋의 원본 이미지를 포함할 수 있으며, 이는 개인 정보 보호와 관련된 문제를 제기한다는 것을 보여준다.
따라서 기업들은 생성적 인공지능을 利用하고자 하는 경우, 합성 데이터셋의 안전성을 보장해야 한다.












