Здравоохранение
Модели ИИ, обученные на данных с половым предвзятостью, хуже диагностируют заболевания

Недавно в журнале PNAS была опубликована статья, проведенная исследователями из Аргентины, которая подразумевает, что наличие половозависимых данных для обучения приводит к худшей производительности модели при диагностике заболеваний и других медицинских проблем. Как сообщает Statnews, команда исследователей экспериментировала с обучением моделей, где женщины-пациенты были заметно недопредставлены или полностью исключены, и обнаружила, что алгоритм работал значительно хуже при диагностике их. То же самое было верно и для случаев, когда мужчины-пациенты были исключены или недопредставлены.
За последние пять лет, когда модели ИИ и машинное обучение стали более повсеместными, больше внимания было уделено проблемам предвзятых наборов данных и предвзятых моделей машинного обучения, которые из них получаются. Предвзятость в данных машинного обучения может привести к неловким, социально вредным и исключительным приложениям ИИ, но когда речь идет о медицинских приложениях, на кону могут быть жизни. Однако, несмотря на знание проблемы, немногие исследования пытались количественно оценить, насколько вредна предвзятость в наборах данных. Проведенное исследование показало, что предвзятость в данных может иметь более экстремальные последствия, чем многие эксперты ранее предполагали.
Одним из наиболее популярных применений ИИ в медицинских контекстах в последние годы было использование моделей ИИ для диагностики пациентов на основе медицинских изображений. Исследовательская команда проанализировала модели, используемые для обнаружения наличия различных медицинских условий, таких как пневмония, кардиомегалия или грыжа, на рентгеновских снимках. Исследователи изучили три открытые архитектуры моделей: Inception-v3, ResNet и DenseNet-121. Модели были обучены на рентгеновских снимках грудной клетки из двух открытых наборов данных, полученных из Стэнфордского университета и Национальных институтов здравоохранения. Хотя сами наборы данных относительно сбалансированы по половому представительству, исследователи искусственно исказили данные, разбив их на подмножества с половым дисбалансом.
Исследовательская команда создала пять различных наборов данных для обучения, каждый из которых состоял из разных соотношений сканов пациентов-мужчин и женщин. Пять наборов для обучения были следующими:
- Все изображения были пациентов-мужчин
- Все изображения были пациенток-женщин
- 25% мужчин-пациентов и 75% женщин-пациентов
- 75% женщин-пациентов и 25% мужчин-пациентов
- Половина мужчин-пациентов и половина женщин-пациентов
После того, как модель была обучена на одном из подмножеств, ее проверили на коллекции сканов как мужчин-, так и женщин-пациентов. Был заметен определенный тренд, присутствующий во всех медицинских условиях, точность моделей была намного хуже, когда данные для обучения были значительно искажены по половому признаку. Интересно отметить, что если один пол был переоценен в данных для обучения, это не принесло ему никакой пользы. Независимо от того, была ли модель обучена на данных, искаженных для одного пола или другого, она не работала лучше на этом поле по сравнению с обучением на инклюзивном наборе данных.
Старший автор исследования, Энцо Ферранте, цитируется Statnews как объясняющий, что это исследование подчеркивает важность разнообразия и представительства в данных для обучения для всех популяций, которые вы планируете протестировать.
Не совсем ясно, почему модели, обученные на одном поле, работают хуже, когда применяются к другому. Некоторые из расхождений могут быть вызваны физиологическими различиями, но также могут быть обусловлены социальными и культурными факторами. Например, женщины могут получать рентгеновские снимки на другой стадии прогрессии заболевания по сравнению с мужчинами. Если это так, это может повлиять на особенности (и, следовательно, закономерности, выученные моделью) в тренировочных изображениях. Если это так, это делает гораздо более сложным для исследователей де-байасировать свои наборы данных, поскольку предвзятость будет встроена в набор данных через механизмы сбора данных.
Даже исследователи, которые внимательно следят за разнообразием данных, иногда не имеют выбора, кроме как работать с данными, которые искажены или предвзяты. Ситуации, когда существует диспропорция в том, как диагностируются медицинские условия, часто приводят к несбалансированным данным. Например, данные о пациентах с раком молочной железы почти исключительно собираются у женщин. Аналогично, аутизм проявляется по-разному у мужчин и женщин, и в результате это состояние диагностируется в гораздо большей степени у мальчиков, чем у девочек.
Тем не менее, крайне важно, чтобы исследователи контролировали искаженные данные и предвзятость в данных любым возможным способом. В этом направлении будущие исследования помогут исследователям количественно оценить влияние предвзятых данных.












