Anderson의 관점

소수자 목소리 ‘필터링’된 구글 자연어 처리 모델

mm
Unite.AI를 Google의 선호 소스에 추가

새로운 연구에 따르면 가장 큰 자연어 처리(NLP) 데이터셋 중 하나가 검열되어 흑인과 히스패닉 작가, 게이와 레즈비언 정체성 관련 자료, 그리고 다른 소수자 정체성 관련 자료가 제거되었다.

이 데이터셋은 구글의 스위치 트랜스포머T5 모델을 훈련하는 데 사용되었으며, 구글 AI 자체에서 큐레이션되었다.

연구 보고서는 Colossal Clean Crawled Corpus(C4) 데이터셋이 365만 개 이상의 인터넷 도메인에서 스크레이핑한 156억 개의 토큰을 포함하며, 거대한 Common Crawl 스크레이핑 데이터베이스의 하위 집합임을 밝혔다. 또한 C4를 정제하는 필터가 소수자 그룹의 콘텐츠와 토론을 효과적으로 대상으로 삼아 제거했다고 밝혔다.

보고서는 다음과 같이 말한다:

‘제외된 데이터를 조사한 결과, 흑인과 히스패닉 작가와 관련된 문서와 성적 취향을 언급하는 문서가 C4의 블록리스트 필터링에 의해 제외될 가능성이 훨씬 더 높으며, 많은 제외된 문서에는 공격적이거나 성적인 내용이 아닌 내용이 포함되어 있다(예: 동성 결혼에 대한 입법 논의, 과학 및 의학 콘텐츠).’

이 연구는 기존의 언어 기반 인종 불평등을 더욱 심화시키고 LGBTQ+ 정체성을 낙인찍는다는 점을 지적한다. 또한 다음과 같이 말한다:

‘언어 모델에 텍스트를 적용할 때 소수자 정체성을 가진 사람들에 대한 텍스트를 제거하는 것은 효과적으로 그들을 기술의 혜택에서 제외하는 것이다. 예를 들어 기계 번역이나 검색과 같은 기술의 혜택에서 제외된다.’

공통 크롤링 데이터의 큐레이션

연구 보고서 Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus는 Allen Institute for Artificial Intelligence, 워싱턴 대학교 Paul G. Allen School of Computer Science & Engineering, Hugging Face, 및 Queer in AI의 연구자들 간의 협력이다.

보고서에서 제공한 C4의 블록리스트 필터링에 의해 제외된 문서의 가능성 지수. 그래프는 정체성에 대한 Pointwise Mutual Information(PMI) 지수를 나타내며, 게이와 레즈비언 정체성이 가장 높은 제외 가능성을 가지고 있다.

보고서에서 제공한 C4의 블록리스트 필터링에 의해 제외된 문서의 가능성 지수. 그래프는 정체성에 대한 Pointwise Mutual Information(PMI) 지수를 나타내며, 게이와 레즈비언 정체성이 가장 높은 제외 가능성을 가지고 있다.

C4 모델은 NLP 연구를 위한 기초 자원으로 사용되는 Common Crawl 웹 코퍼스의 큐레이션된 버전이다. Common Crawl은 인터넷에서 텍스트 데이터를 더 임의적으로 스크레이핑하며, NLP 연구에서 증오 언어와 다른 사회학적/심리학적 연구를 위한 중립적인 데이터 저장소로 사용된다.

제대로 기록되지 않은 필터링

C4의 ‘유해’ 콘텐츠 제거 결정에는 포르노그래픽 콘텐츠가 포함되므로, ‘레즈비언’ 정체성이 가장 많이 제외된 정제된 데이터셋(위 이미지 참조)이 아마도 놀라운 일이 아니다.

연구 보고서의 저자들은 C4의 문서와 메타데이터에 대한 부족한 문서화와 기록을 비판하며, 필터가 제거하는 데이터에 대해 더 많은 기록과 배경 정보를 남겨야 한다고 주장한다. 이러한 기록은 C4(및 C4에서 개발된 언어 모델)의 경우에는 학술 연구를 통해서만 추적할 수 있다.

그들은 다음과 같이 말한다:

‘일부 필터는 상대적으로 간단하다. 예를 들어 Lorem ipsum 플레이스홀더 텍스트를 제거하는 필터이다. 그러나 우리는 다른 필터가 금지된 단어 목록의 토큰을 포함하는 문서를 제거하며, 이는 소수자 정체성과 관련된 영어 방언(예: 아프리카계 미국인 영어, LGBTQ+ 정체성에 대한 토론)에 대한 문서를 불균형적으로 제거한다는 것을 발견했다.’

연구자들은 C4의 필터링 정도를 더 설명하기 위해, C4의 블록리스트에 의해 제외된 Common Crawl의 10만 개의 문서를 무작위로 샘플링하여 K-Means 클러스터링을 사용했다. 그들은 제외된 문서 중 16개의 클러스터가 주로 성적인 성격을 가지고 있으며, 이는 제외된 데이터의 약 31%를 차지한다고 발견했다. 나머지 제외된 데이터에서, 연구자들은 과학, 의학, 건강, 법률, 정치 문서와 관련된 클러스터를 발견했다.

C4에서 표현된 각 정체성에 대한 긍정적 감정의 비율. UnifiedQA에 따르면, '유대인'과 '아랍인'은 가장 극단적인 정체성으로, '유대인'에 대한 긍정적 편향과 '아랍인'에 대한 부정적 편향이 있다.

C4에서 표현된 각 정체성에 대한 긍정적 감정의 비율. UnifiedQA에 따르면, ‘유대인’과 ‘아랍인’은 가장 극단적인 정체성으로, ‘유대인’에 대한 긍정적 편향과 ‘아랍인’에 대한 부정적 편향이 있다.

제외된 문서의 기준

연구자들은 C4의 필터링 스키마의 공격성을 이해하기 위해, C4의 블록리스트에 의해 제외된 Common Crawl의 10만 개의 문서를 무작위로 샘플링하여 K-Means 클러스터링을 사용했다. 그들은 제외된 문서 중 16개의 클러스터가 주로 성적인 성격을 가지고 있으며, 이는 제외된 데이터의 약 31%를 차지한다고 발견했다. 나머지 제외된 데이터에서, 연구자들은 과학, 의학, 건강, 법률, 정치 문서와 관련된 클러스터를 발견했다.

5,000개의 결과를 표시하기 위해, C4의 블록리스트 필터링에 의해 제외된 10만 개의 문서에 대한 일반적인 K-Means 클러스터링. 일러스트레이션은 상위 5개의 키워드를 보여준다.

5,000개의 결과를 표시하기 위해, C4의 블록리스트 필터링에 의해 제외된 10만 개의 문서에 대한 일반적인 K-Means 클러스터링. 일러스트레이션은 상위 5개의 키워드를 보여준다.

게이와 레즈비언 정체성 관련 자료의 차단에 대해, 연구자들은 성적 정체성에 대한 언급(예: 레즈비언, 게이, 동성애자, 양성애자)이 C4에서 가장 높은 제외 가능성을 가지고 있으며, 비공격적이고 비성적인 문서가 제외된 자료의 22%와 36%를 차지한다고 발견했다.

방언 제외와 오래된 데이터

추가로, 연구자들은 방언 인식 주제 모델을 사용하여 C4에서 제외된 민족성 특정 언어의 정도를 추정했다. 그들은 아프리카계 미국인 영어와 히스패닉 영어가 블록리스트 필터링에 의해 불균형적으로 영향을 받는다는 것을 발견했다.

또한, 보고서는 C4 파생 코퍼스의 상당한 비율이 10년 이상 된 자료에서 얻어졌으며, 일부는 수십 년 된 자료이며, 대부분이 뉴스, 특허, 위키백과 웹사이트에서 유래했다고 언급한다. 연구자들은 인터넷 아카이브에서 첫 번째 저장을 식별하여 정확한 연대를 추정하는 것이 정확한 방법은 아니라고 인정하지만, 합리적인 대안이 없는 경우에 이 접근 방식을 사용했다.

결론

보고서는 인터넷에서 스크레이핑한 데이터셋을 사용하여 NLP 연구에 기여하는 경우, 더 엄격한 문서화 시스템을 주장한다. 보고서는 다음과 같이 말한다:

‘인터넷에서 스크레이핑한 데이터셋을 구축할 때, 텍스트가 스크레이핑된 도메인을 보고하는 것은 데이터셋을 이해하는 데 중요하다. 데이터 수집 프로세스는 예상과는 상당히 다른 인터넷 도메인의 분포로 이어질 수 있다.’

그들은 또한 벤치마크 오염이 이미 GPT-3 개발에서 문제가 되었으며, 기계 데이터가 인간 데이터와 함께 포함되는 경우를 지적한다(위 참조). 이는 이미 개발에서 문제가 되었으며, 결국 벤치마크 데이터의 영향을 정량화하고 제외하는 것이 GPT-3를 다시 훈련하는 것보다 더 저렴한 것으로 판명되었다. 출처 논문은 ‘미미한 성능 영향’을 입증한다.

보고서는 다음과 같이 결론을 내린다:

‘우리의 분석은 유해하거나 음란한 콘텐츠가 있는 문서를 결정하는 것이 단순히 나쁜 단어를 감지하는 것을 넘어서는 더 복잡한 작업임을 확인한다. 증오와 음란한 콘텐츠는 부정적인 키워드 없이 표현될 수 있다(예: 미세 공격, 은어).

중요하게는, 명백히 나쁜 단어의 의미는 사회적 맥락에 크게 의존한다(예: 불친절함은 친사회적 기능을 수행할 수 있으며, 누가 어떤 단어를 말하는지에 따라 그 공격성은 달라진다. 예를 들어, 재취득된 욕설 “n*gga”는 흑인 화자가 말할 때보다 백인 화자가 말할 때보다 덜 공격적으로 여겨진다.

‘우리는 웹 크롤링 데이터에서 데이터셋을 구축할 때 블록리스트 필터링을 사용하는 것을 권장하지 않는다.’

* 인라인 인용을 하이퍼링크로 변환

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai