헬스케어

乳房암 진단을 개선하기 위한 크라우드소싱 AI 챌린지 종료

mm
Unite.AI를 Google의 선호 소스에 추가

유방암의 초기 징후를 발견하기 위해 유방촬영은 여성의 건강을 위해 매우 중요합니다. 그러나 유방촬영은 인간 전문가가 해석해야 하며, 심지어 고도로 훈련된 전문가도 실수를 할 수 있습니다. 미국에서 유방촬영의 거짓 양성률은 약 10%로 추정됩니다. 더 정확한 유방촬영 판독 시스템을 개발하기 위해 디지털 유방촬영(DM) 드림 챌린지는 최근 새로운 유방촬영 판독 알고리즘을 개발하기 위한 크라우드소싱 프로젝트를 시작했습니다.

PhysicsWorld에 따르면, 컴퓨터 비전 기술과 딥 러닝 알고리즘이 최근 몇 년 동안 더 발전했기 때문에 연구자와 엔지니어들은 유방촬영을 해석하기 위해 AI를 사용하려고 합니다. 디지털 유방촬영(DM) 드림 챌린지는 유방암의 가능한 징후를 인식하기 위한 AI 알고리즘의 사용을 조사하기 위한 경쟁을 시작했습니다.

DM 드림 챌린지는 지금까지 유방촬영 해석에 관한 딥 러닝 알고리즘의 가장 큰 연구입니다. DREAM 챌린지의 사장인 저스틴 구니는 이 챌린지의 이유는 수십 개의 딥 러닝 모델을 두 개의 다른 데이터베이스에서 구조적으로 평가할 수 있었기 때문이라고 설명했습니다. 챌린지에 참여한 사람들은 유방촬영 데이터에서 훈련할 수 있는 알고리즘을 설계해야 했으며, 환자가 1년 내에 유방암으로 진단될 가능성에 대한 확률 점수를 출력해야 했습니다. 또한 두 번째 챌린지 조건도 있었습니다. 두 번째 작업에서는 알고리즘이 인구통계학적 위험 데이터, 임상 데이터 및 이전 스크리닝 검사에서 수집된 이미지와 같은 추가 정보에서 훈련될 수 있었습니다.

모델을 훈련하기 위해 두 개의 데이터셋을 사용했습니다. 첫 번째 데이터셋은 미국 연구자들이 수집한 카이저 퍼머넌트 워싱턴(KPW) 데이터셋이었습니다. 한편, 두 번째 데이터셋은 스웨덴의 카롤린스카 연구소(KI) 연구자들이 수집했습니다.

이 챌린지에 1100명 이상의 참가자가 참여했으며, 126개의 다른 팀으로 나뉘어졌으며, 전 세계의 사람들이 참여했습니다. 첫 번째 챌린지에서 모델은 KPW 데이터셋을 사용하여 훈련되었으며, 이는 14만 개 이상의 스크리닝 검사 이미지로 구성되었습니다. 두 번째 챌린지의 결과와 비교했을 때, 임상 데이터와 같은 추가 특징에 대한 접근이 알고리즘의 차별화 능력을 의미 있게 개선하지 못하는 것으로 나타났습니다. 그러나 DM 드림 팀은 향후 알고리즘 개발에서 이전 이미지의 분석을 포함해야 한다고 제안했으며, 참가자들이 데이터를 충분히 활용하지 못했을 수 있다고 지적했습니다.

Health IT Analytics에 따르면, DR 드림 팀은 최상위 8개의 팀이 협력하여 앙상블 분류 모델을 설계하려고 합니다. 이 모델이 개별 모델을 능가할 수 있는지 확인하기 위해 챌린지 조정자는 다양한 알고리즘의 예측을 가중 평균하여 챌린지 앙상블 모델(CEM)을 만들었습니다. CEM 모델의 확률적 예측은 특이도에 따라 평가된 방사선과의 해석과 비교되었습니다. 방사선은 90.5%의 특이도를 달성했으며, CEM 모델은 76.1%의 특이도만 달성했습니다. 결과는 실망스러워 보이지만, CEM 모델과 방사선 해석의 추정이 다른 모델(CEM+R)에 집계되면 특이도가 92%로 개선됩니다.

KI 테스트 데이터셋을 사용하여 유사한 결과가 얻어졌으며, 이는 모델을 검증하기 위해 독점적으로 사용된 데이터셋으로, 16만 개 이상의 검사 이미지로 구성되었습니다. CEM 모델은 방사선보다稍微劣등했으며(92.5%의 특이도 대 96.7%의 특이도), 그러나 CEM+R은 더 나은 결과를 달성했습니다(98.5%의 특이도).

개별 모델은 인간 전문가의 성능을 능가하지 못했지만, CEM+R 모델은 방사선 해석만을 사용하는 것보다 약간의优势을 보였습니다. 인간의 직관과 AI 보조를 결합하면 정확도를 개선할 수 있을 것입니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.