헬스케어

성별 편향된 데이터로 학습된 AI 모델은 질병 진단에서 성과가 낮다

mm
Unite.AI를 Google의 선호 소스에 추가

최근 아르헨티나의 연구자들이 수행한 연구가 PNAS 저널에 발표되었으며, 성별 편향된 훈련 데이터가 질병 및 의료 문제 진단에서 모델 성능을 저하할 수 있음을 시사한다. Statnews에 따르면, 연구자들은 여성 환자가 현저히 부족하거나 전혀 포함되지 않은 모델을 훈련시키고, 알고리즘이 여성 환자를 진단할 때 성과가 현저히 낮아진다는 것을 발견했다. 남성 환자가 제외되거나 부족한 경우에도 동일한 현상이 나타났다.

과거 5년 동안 AI 모델과 기계 학습이更加 普及되면서, 편향된 데이터셋과 그로 인한 편향된 기계 학습 모델에 대한 문제에 대한 관심이 증가했다. 기계 학습에서 데이터 편향은 어색하고, 사회적으로 유해하며, 배제적인 AI 애플리케이션을 초래할 수 있다. 그러나 의료 분야에서는 생명이 걸린 문제가 될 수 있다.尽管 편향된 데이터셋의 문제가 알려져 있지만, 몇몇 연구만이 편향된 데이터셋이 얼마나 유해할 수 있는지 정량화하려고 시도했다. 연구 팀은 데이터 편향이 이전에 전문가들이 예상한 것보다 더 극적인 영향을 미칠 수 있음을 발견했다.

최근 몇 년 동안 의료 분야에서 AI의 가장 인기 있는 사용법 중 하나는 의료 이미지에 기반한 환자 진단이다. 연구 팀은 폐렴, 심장 비대, 또는ヘル니아와 같은 다양한 의료 조건을 감지하기 위한 X선 사진을 사용한 모델을 분석했다. 연구 팀은 Inception-v3, ResNet, 및 DenseNet-121과 같은 세 가지 오픈 소스 모델 아키텍처를 연구했다. 모델은 스탠퍼드 대학교와 미국 국립 보건원에서 가져온 두 개의 오픈 소스 데이터셋에서 추출한 가슴 X선 사진에 훈련되었다. 데이터셋 자체는 성별 표현면에서 비교적 균형이良지만, 연구자들은 성별 불균형이 있는 하위 집합으로 데이터를 나누어 편향시켰다.

연구 팀은 다섯 가지 다른 훈련 데이터셋을 생성했으며, 각 데이터셋은 남성/여성 환자 스캔의 다른 비율로 구성되었다. 다섯 가지 훈련 세트는 다음과 같이 나누어졌다:

  • 모든 이미지는 남성 환자였다
  • 모든 이미지는 여성 환자였다
  • 남성 환자 25%, 여성 환자 75%
  • 여성 환자 75%, 남성 환자 25%
  • 남성 환자 50%, 여성 환자 50%

모델이 하나의 하위 집합에 훈련된 후, 남성과 여성 환자 모두의 스캔을 포함하는 컬렉션에서 테스트되었다. 다양한 의료 조건에서 모델의 정확도가 성별 편향된 훈련 데이터에서 훨씬 낮아지는 현저한 경향이 있었다. 흥미로운 점은 하나의 성별이 훈련 데이터에서 과도하게 표현된 경우, 해당 성별이 과도한 표현에서 이익을 얻지 않는다는 것이다. 모델이 하나의 성별에 편향된 데이터 또는 다른 성별에 편향된 데이터에 훈련되었는지에 관계없이, 포괄적인 데이터셋에서 훈련된 경우보다 해당 성별에서 성과가 더 좋지 않았다.

연구의 선임 저자 인 Enzo Ferrante는 Statnews와의 인터뷰에서 연구가 모델을 테스트할 모든 인구에 대해 대표적이고 다양한 훈련 데이터의 중요성을 강조한다고 말했다.

하나의 성별로 훈련된 모델이 다른 성별에서 성과가 낮은 이유는 완전히 명확하지 않다. 일부 불일치는 생리적 차이로 인해 발생할 수 있지만, 사회적 및 문화적 요인도 일부 차이를 설명할 수 있다. 예를 들어, 여성은 남성보다 질병 진행의 다른 단계에서 X선 사진을 찍을 수 있다. 이것이 사실이라면, 훈련 이미지에서 발견되는 특징(및 모델에서 학습된 패턴)이 영향을 받을 수 있다. 이것이 사실이라면, 연구자들이 데이터셋에서 편향을 제거하기가 훨씬 더 어려워질 수 있다. 왜냐하면 편향이 데이터 수집 메커니즘을 통해 데이터셋에 구축되기 때문이다.

데이터 다양성에 주의를 기울이는 연구자들조차도 편향된 또는 불균형한 데이터와 함께 작업할 수밖에 없는 상황에 직면할 수 있다. 의료 조건을 진단하는 방식에 불균형이 있는 경우, 데이터가 불균형해질 수 있다. 예를 들어, 유방암 환자에 대한 데이터는 거의 여성으로부터 수집된다. 마찬가지로, 자폐증은 남성과 여성에서 다르게 나타나며, 결과적으로 남성보다 여성에서 더 높은 비율로 진단된다.

연구자들이 편향된 데이터와 데이터 편향을 가능한 모든 방법으로 제어하는 것이非常 중요하다. 이를 위해 향후 연구가 편향된 데이터의 영향을 정량화하는 데 도움이 될 것이다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.