Anderson의 관점
이미지 검색 결과에서 성별과 인종 변경하기: 기계 학습을 활용한 혁신적인 솔루션

UC 샌디에고와 Adobe (ADBE ) Research 간의 연구 협력에서 전통적으로 백인 중심의 직업에서 나타나는 이미지 검색 결과의 인종과 성별 다양성 부족에 대한 혁신적인 솔루션을 제안했습니다. 생성적 적대적 네트워크(GAN)를 사용하여 성별과/또는 인종이 변경된 ‘편향된’ 직업의 비실제 이미지 생성을 제안했습니다.

새로운 논문에서 연구자들이 원하는 사진의 특성을 입력한 예시입니다. 이러한 사진은 일반적인 이미지 자료에서 나타나지 않거나 부적절한 방식으로 나타납니다. 출처
새로운 논문에서 저자들은 재정렬을 통해 편향된 이미지/특징 클래스를 수정하는 데 한계가 있으며, 합성 데이터를 사용하여 인종과 성별 다양성을 증가시키는 것이 앞으로의 도전을 해결하는 방법일 수 있다고 제안했습니다.
‘모든 직업에서 다양한 인종과 성별의 특성을 제공하는 기회를 사용자에게 제공하는 것이 중요합니다. 그러나 일부 직업과 인종 및 성별의 조합에서는 이미지 자료가 부족한 경우가 있습니다. ‘
‘또한 일부 경우에는 특정 인종과 성별의 조합이 부적절한 방식으로 표현될 수 있습니다. 예를 들어, ‘아시아인 여성 플럼버’ 또는 ‘흑인 여성 경비원’과 같은 검색어에서 이러한 문제가 발생할 수 있습니다.’
저자들은 이전 연구에서 2014년에 96개의 직업에 대한 상위 400개의 이미지 검색 결과를 수집하여 여성은 결과의 37%만 차지하며, 반대 성별의 이미지는 22%만 차지하는 것으로 나타났습니다. 2019년 연구에서는 5년 후에 이러한 비율이 45%와 30%로 증가한 것으로 나타났습니다.
또한 2014년 연구에서는 특정 직업에서 성별화된 개인의 분류를 섹시한 목수 문제로 정의했으며, 이러한 부적절한 분류가 직업 인식 결과를 왜곡할 수 있습니다.
적절하게 또는 부적절하게 표현되지 않은 것
연구자들은 구글 이미지 검색에서 ‘플럼버’를 검색한 결과를 예로 들어 설명했습니다. 결과는 젊은 백인 남성으로 домини되었습니다.

2021년 1월에 수행된 검색 결과입니다.
저자들은 다른 직업에서도 유사한 편향이 발생한다는 것을 관찰했습니다. 예를 들어, ‘관리자’, ‘청소원’, ‘기계 작동자’와 같은 직업에서 연령, 성별, 인종에 대한 편향이 나타납니다.
‘예상대로, 이러한 사회적 편향으로 인해 일부 인종과 성별의 조합에서는 이미지 자료가 거의 또는 전혀 없습니다. 예를 들어, ‘흑인 여성 기계 작동자’ 또는 ‘아시아인 남성 행정 보조원’과 같은 검색어에서 이러한 문제가 발생할 수 있습니다.’
‘또한 일부 경우에는 특정 성별과 인종의 조합이 부적절한 방식으로 표현될 수 있습니다. 예를 들어, ‘아시아인 여성 플럼버’ 또는 ‘흑인 여성 경비원’과 같은 검색어에서 이러한 문제가 발생할 수 있습니다.’
이 논문은 2014년의 다른 연구를 인용하며, 96개의 직업에 대한 상위 400개의 이미지 검색 결과를 수집하여 여성은 결과의 37%만 차지하며, 반대 성별의 이미지는 22%만 차지하는 것으로 나타났습니다. 2019년 연구에서는 5년 후에 이러한 비율이 45%와 30%로 증가한 것으로 나타났습니다.
또한 2014년 연구에서는 특정 직업에서 성별화된 개인의 분류를 섹시한 목수 문제로 정의했으며, 이러한 부적절한 분류가 직업 인식 결과를 왜곡할 수 있습니다.
전체적인 그림
저자들의 주요 도전은 1024×1024 해상도의 이미지 합성 시스템을 개발하는 것이었습니다. 현재의 GAN 및 인코더-디코더 기반 이미지 합성 시스템의 상태에서 512×512는 이미 고해상도입니다. 더 높은 해상도는 업스케일링을 통해 얻을 수 있지만, 시간과 처리 리소스가 많이 소요되며, 생성된 이미지의 진실성이 손상될 수 있습니다.
저자들은 낮은 해상도는 이미지 검색에서 인정을 받지 못할 것이라고 주장하며, 다양한 GAN 프레임워크를 실험하여 높은 해상도의 이미지를 생성할 수 있는 시스템을 개발했습니다.
StyleGan2를 채택한 후, 저자들은 생성된 이미지의 하위 특징(예: 인종, 직업, 성별)에 대한 더 큰 제어가 필요하다고 판단했습니다. 따라서 저자들은 다중 클래스 조건부를 사용하여 생성 과정을 강화했습니다.

지정된 이미지 생성기의 아키텍처입니다. 저자들은 이 아키텍처가 StyleGAN2에 특정되지 않으며, 다양한 생성기 프레임워크에 적용될 수 있다고 주장합니다.
인종, 성별, 직업을 제어하기 위해, 아키텍처는 이러한 특징의(concatenated) 일회용 인코딩을 y 벡터에 주입합니다. 이후, 피드포워드 네트워크는 이러한 특징을 임베딩하여 생성 시 忽略되지 않도록 합니다.
저자들은 StyleGAN2를 이러한 방식으로 조작하는 데 한계가 있으며, 더 세부적인 조작 시도가 이미지 품질이 저하되고, 심지어 모드 붕괴가 발생할 수 있다고 주장합니다.
이러한 문제를 해결하기 위해, 저자들은 StyleGAN2-ADA를 사용하여, 적응적 판별자 강화(Adaptive Discriminator Augmentation, ADA)를 사용하여 판별자가 과적합되는 것을 방지했습니다.
데이터 생성 및 평가
이 프로젝트의 목적은 새로운 합성 데이터를 생성하는 것이므로, 연구자들은 2014년 프로젝트의 방법론을 채택하여, 높은 인종과 성별 편향을 나타내는 여러 직업을 선택했습니다. 선택된 직업은 ‘경영자’, ‘관리자’, ‘간호사’, ‘농부’, ‘군인’, ‘경비원’, ‘트럭 운전사’, ‘청소원’, ‘목수’, ‘플럼버’, ‘기계 작동자’, ‘기술 지원자’, ‘소프트웨어 엔지니어’, ‘작가’ 등이 있습니다.
저자들은 이러한 직업을 선택한 이유는 이미지 검색 결과에서 편향이 나타나는 정도와, 이러한 직업이 시각적 구성 요소를 포함하는 정도입니다.
데이터셋은 Adobe Stock 라이브러리에서 10,000개의 이미지를 사용하여 구축되었습니다. 이러한 이미지들은 일반적으로 95% 이상의 점수를 얻을 수 있었으며, 직업을 분류하는 데 사용되었습니다.
그러나 많은 이미지들이 목표 작업에 도움이 되지 않았으므로, 수동 필터링이 필요했습니다. 이후, ResNet32 기반 분류기를 사용하여 이미지를 성별과 인종으로 레이블링했습니다. 평균 정확도는 성별에 대해 95.7%, 인종에 대해 81.5%였습니다.
이미지 레이블은 성별: 남성, 여성, 인종: 백인, 흑인, 아시아인, 기타와 같은 형식으로 얻었습니다.
모델은 TensorFlow에서 StyleGAN2와 StyleGAN2-ADA를 사용하여 구축되었습니다. 사전 훈련은 StyleGAN2의 사전 훈련된 가중치를 사용하여 수행되었습니다. 또한 34,000개의 직업 관련 이미지를 수집하여 Uncurated Stock-Occupation HQ(U-SOHQ) 데이터셋을 구축했습니다.

아마존 메카니컬 터크를 사용한 인간 평가 예시입니다.
이미지는 네 가지 구성에서 생성되었습니다. Uniform+ 구성이 자동 평가와 인간 평가에서 최고의 점수를 얻었습니다. 이후, 저자들은 분류 정확도와 함께 Attribute Matching Score를 사용하여 이미지의 품질을 평가했습니다.

인간 평가 결과입니다. Uniform+ 방법이 가장 설득력 있는 결과를 나타냅니다.












