Anderson의 관점

하이퍼스케일 AI 데이터셋의 문제: 인터넷 자체보다 더 나쁨일까?

mm
Unite.AI를 Google의 선호 소스에 추가

아일랜드, 영국, 미국의 연구자들은 하이퍼스케일 AI 훈련 데이터셋의 성장이 인터넷의 최악의 측면을 전파할 수 있다고 경고하며, 최근에 발표된 학술 데이터셋에는 ‘강간, 포르노그래피, 악의적인 스테레오タイプ, 인종차별적이고 민족적인 욕설, 그리고 다른 극단적으로 문제가 있는 콘텐츠’가 포함되어 있다고 주장한다.

연구자들은 새로운 대규모의 미검증 또는 잘못 필터링된 다중 모달(예: 이미지와 텍스트) 데이터셋이 부정적인 콘텐츠의 영향을 강화하는 능력에서 더 해롭다고 주장한다. 이러한 데이터셋은 사용자 불만, 지역 모더레이션, 또는 알고리즘을 통해 온라인 플랫폼에서 삭제된 이미지와 콘텐츠를 보존하기 때문이다.

그들은 또한 이러한 문제가 해결되기까지 수년이 걸릴 수 있으며, ImageNet 데이터셋의 경우 10년이 걸렸다고 관찰한다. 또한 이러한 후속 수정은 새로운 데이터셋에서 반영되지 않을 수 있다.

연구 논문다중 모달 데이터셋: 여성혐오, 포르노그래피, 그리고 악의적인 스테레오タイプ라는 제목으로, University College Dublin & Lero, 에딘버러 대학교, 및 UnifyID 인증 플랫폼의 Chief Scientist가 참여하였다.

연구는 최근에 발표된 CLIP 필터링된 LAION-400M 데이터셋에 초점을 맞추고 있지만, 연구자들은 하이퍼스케일 데이터셋의 일반적인 경향에 대해 논의하며, 더 나은 추론(그리고 심지어 인공 일반 지능 [AGI])을 위한 결과 중심의 추진력이 손상된 데이터 소스를 사용하고, 잠재적으로 해를 끼치고, 불법 데이터를 보존하며, 이러한 데이터의 도덕적 모델을 다운스트림 AI 구현에 통합할 수 있다고 주장한다.

LAION-400M

지난 달, LAION-400M 데이터셋이 발표되어 다중 모달 언어 데이터셋의 수가 증가하였다. 이 데이터셋은 400만 개의 텍스트-이미지 쌍을 포함한다.

LAION-400M은 Google AI의 폐쇄적인 WIT(웹 이미지 텍스트) 데이터셋의 개방형 버전으로, 2021년 3월에 발표되었다. 이 데이터셋은 텍스트-이미지 쌍을 포함하며, 데이터베이스의 이미지와 함께 사용되는 텍스트(예: 웹 갤러리의 이미지의 alt 텍스트)를 연관시킨다. 이는 사용자가 텍스트 기반 이미지 검색을 수행할 수 있도록 하며, 기본 AI가 이러한 도메인에 대해 형성한 연관성을 보여준다.

이미지와 텍스트의 관계, 그리고 쿼리 결과에 편향을 삽입할 수 있는 코사인 유사성은 논문의 개선된 방법론에 대한 요구와 관련이 있다. 매우 간단한 LAION-400M 데이터베이스 쿼리도 편향을 보여줄 수 있다.

예를 들어, scitkit-image 라이브러리의 개척적인 여성 우주 비행사 Eileen Collins의 이미지는 LAION-400M에서 두 개의 연관된 캡션을 검색한다: ‘이것은 미국 국기와 함께 있는 우주 비행사의 초상이다’‘이것은 미국 국기와 함께 있는 미소 짓는 주부의 사진이다’.

미국 우주 비행사 Eileen Collins는 LAION-400M에서 두 가지 다른 설명을 받는다. 출처: https://arxiv.org/pdf/2110.01963.pdf

미국 우주 비행사 Eileen Collins는 LAION-400M에서 두 가지 다른 설명을 받는다. 출처: https://arxiv.org/pdf/2110.01963.pdf

이러한 캡션이 적용될 가능성이 높은 것으로 나타나는 코사인 유사성은 매우 가까우며, 연구자들은 이러한 근접성으로 인해 LAION-400M을 사용하는 AI 시스템이 어느 쪽 캡션도 적절한 캡션으로 제시할 가능성이 상대적으로 높을 것이라고 주장한다.

포르노그래피가 다시頂上에 오르다

LAION-400M에는 검색 가능한 인터페이스가 있으며, ‘안전 검색’ 버튼을 해제하면 레이블과 클래스에 대한 포르노그래픽 이미지와 텍스트 연관성이 지배적임을 보여준다. 예를 들어, 데이터베이스에서 ‘수녀’를 검색하면(안전 모드를 비활성화한 경우), 결과는 주로 공포, 코스프레, 의상과 관련이 있으며, 실제 수녀는 거의 없다.

同じ 검색에서 안전 모드를 끄면, ‘수녀’라는 용어와 관련된 포르노그래픽 이미지가 나타나며, 비포르노 이미지는 검색 결과 페이지 하단으로 밀려난다. 이것은 LAION-400M이 온라인 소스에서 ‘수녀’라는 용어에 대한 포르노 이미지를 더 크게 가중치 부여한다는 것을 보여준다.

온라인 검색 인터페이스에서 기본적으로 안전 모드를 활성화하는 것은 사용자에게 혼란을 줄 수 있다. 이는 UI 특성상 필터이며, 필터는 파생된 AI 시스템에서 활성화되지 않을 수 있으며, 알고리즘 사용 측면에서 상대적으로 필터링이나 구분이 어려운 ‘수녀’ 도메인에 일반화된 방식으로 활성화된다.

연구 논문에는 다양한 검색 용어에 대한 모호한 예시가 부록에 포함되어 있으며, 연구자들은 이러한 이미지를 조사하고 모호하게 하는 과정에서 경험한 불쾌감, 구역질, 두통 등을 언급하며, 대규모 데이터베이스의 인간 감시를 위한 큐레이션의 어려움을 인정한다.

금지된 콘텐츠를 보존하고 저작권 보호를 제거하는 것

연구자들은 이러한 데이터셋이 소수자 개인의剝削를 영속화할 가능성이 높으며, 이러한 데이터를 사용하는 오픈 소스 데이터 프로젝트가 사용자에게 책임을 전가하는 것이 합법적이거나 도덕적으로 정당한지에 대해 질문한다.

개인들은 데이터를 웹사이트에서 삭제하고 영원히 사라졌다고 생각할 수 있지만, 데이터는 여전히 연구자와 조직의 서버에 남아 있을 수 있다. 데이터를 데이터셋에서 삭제할 책임은 누구에게 있는가? LAION-400M의 경우, 데이터셋 사용자에게 이 작업을 위임하였다. 이러한 프로세스가 의도적으로 복잡하게 만들어지고 평균 사용자가 데이터를 삭제하는 데 필요한 기술 지식을 갖고 있지 않기 때문에, 이는 합리적인 접근 방식인가?

그들은 또한 LAION-400M이 채택한 크리에이티브 커먼즈 CC-BY 4.0 라이선스 모델하에서 출시되어서는 안 된다고 주장한다. 이는 대규모 데이터셋의 민주화에 대한 잠재적인 이점에도 불구하고 vậy이다.

LAION-400M 도메인은 데이터셋 이미지들이 '자체 저작권'하에 있다고 주장한다. 이는 최근 몇 년간의 법원 판결과 정부 지침에 의해 대폭 승인된 웹 스크래핑을 위한 '패스스루' 메커니즘을 통해 가능하다. 출처: https://rom1504.github.io/clip-retrieval/

LAION-400M 도메인은 데이터셋 이미지들이 ‘자체 저작권’하에 있다고 주장한다. 출처: https://rom1504.github.io/clip-retrieval/

연구자들은 데이터셋 문제를 해결하기 위해 자원봉사자들이 기여할 수 있으며, 연구자들이 개선된 필터링 기술을 개발할 수 있다고 제안한다.

하이퍼스케일 데이터의 민주화 문제

연구자들은 LAION-400M과 같은 대규모 비디오-언어 데이터셋이 이전에는 빅 테크 회사와 자원을 갖춘 연구 기관에서만 사용할 수 있었다고 주장한다. 그들은 새로운 출시의 정신을 칭찬하지만, 그 실행에 대해 비판한다.

연구자들은 ‘민주화’의 일반적으로 받아들여지는 정의가, 취약한 개인과 커뮤니티의 권리, 복지, 및利益을 고려하지 않는다고 주장한다. 이러한 데이터셋과 그 위에 훈련된 모델의 하류 영향으로 인해 가장 많이 고통을 받을 가능성이 있는 사람들이다.

연구자들은 GPT-3 규모의 오픈 소스 모델이 궁극적으로 수백만 명의 사용자에게 배포될 예정이며, 연구 프로젝트가 수정되거나 제거되기 전에 데이터셋을 채택할 수 있기 때문에, 미검증된 데이터셋의 무책임한 출시가 오픈 소스 기계 학습의 일반적인 특징이 되어서는 안 된다고 주장한다.

지니를 다시 병에 넣다

일부 데이터셋은 내용이 이미 다운스트림 AI 프로젝트에 영구적으로 통합된 후에야 삭제되거나 수정되었다. 이러한 예로는 Duke MTMC(다중 대상, 다중 카메라) 데이터셋이 있으며, 이는 중국의 억압적 권위에 의한 사용에 대한 반복적인 우려로 인해 최终적으로 撤回되었다. 또 다른 예로는 Microsoft Celeb(MS-Celeb-1M) 데이터셋이 있으며, 이는 1,000만 개의 ‘유명인’ 얼굴 이미지를 포함했으며, 저널리스트, 활동가, 정책 입안자, 작가 등의 생체 데이터 노출로 인해 심하게 비판을 받았다. Tiny Images 데이터셋도 2020년에 삭제되었으며, 이는 ‘편향, 공격적이고 유해한 이미지, 그리고 비방적 용어’를 포함하고 있었다.

수정된 데이터셋의 예로는 ImageNet 데이터셋이 있으며, 이는 10년(2009-2019) 동안 개인 정보와 비이미지 가능한 클래스에 대한 반복적인 비판에 대한 조치를 취했다.

연구자들은 LAION-400M이 이러한 개선을 무시함으로써 실제로 이러한 개선을 뒤로 물러뜨리고 있다고 주장한다. 또한 이러한 경향이 더 큰 데이터셋의 출현에서 나타난다고 주장한다.

연구자들은 이러한 데이터셋을 철저하게 정화하기 위한 노력의 규모가 천문학적일 것이라고 강조한다.

* 연구자들의 인라인 인용을 하이퍼링크로 변환한 내 작업이다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai