Погляд Anderson

Популярний набір даних COVIDx критикується дослідниками з Великої Британії

mm
Додайте Unite.AI до бажаних джерел у Google

Консорціум дослідників з Великої Британії висловив критику щодо рівня наукової довіри, яку вкладають у відкриті набори даних, що використовуються для аналізу рентгенограм грудної клітки пацієнтів з COVID-19, зосереджуючись на популярному відкритому наборі даних COVIDx.

Дослідники, які протестували COVIDx у різних моделях навчання штучного інтелекту, стверджують, що він “не репрезентативний для реальної клінічної проблеми”, що результати, отримані за допомогою нього, “надмірно завищені”, і що моделі “не узагальнюються добре” до реальних даних.

Автори також відзначають неконсистентність внесених даних, які складають COVIDx, де оригінальні зображення надходять у різній роздільності, які автоматично переформатовуються глибоким навчанням у відповідні розміри для навчання, і спостерігають, що цей процес може вводити оманливі артефакти, пов’язані з алгоритмом зміни розміру зображення, а не з клінічним аспектом даних.

Стаття називається Пастки використання відкритих даних для розробки рішень штучного інтелекту для виявлення COVID-19 на рентгенограмах грудної клітки і є спільною роботою Центру комп’ютерного зображення та симуляції в біомедицині (CISTIB) університету Лідса разом з дослідниками з п’яти інших організацій того ж міста, включаючи Лікарню Лідса.

Дослідження деталізує, серед іншого, негативну практику “невідповідного використання міток” у наборі даних COVIDx, а також “високий ризик упередженості та супутньої патології”. Експерименти дослідників з проходженням набору даних через три життєздатні моделі штучного інтелекту спонукали їх зробити висновок, що “виключна продуктивність, широко повідомлена в цій області, надмірно завищена, результати продуктивності моделей неправильно представлені, і моделі не узагальнюються добре до клінічно-реалістичних даних”.

П’ять контрастних наборів даних в одному

Звіт відзначає, що більшість поточних методологій, заснованих на штучному інтелекті, в цій галузі залежать від “гетерогенної” колекції даних з різних відкритих репозиторіїв, спостерігаючи, що п’ять наборів даних з помітно різними характеристиками були об’єднані в набір даних COVIDx, попри, на думку дослідників, недостатню рівність якості та типу даних.

Набір даних COVIDx був опублікований у травні 2020 року як спільна робота під керівництвом кафедри системного дизайну університету Ватерлоо в Канаді, з даними, розміщеними на GitHub у рамках ініціативи COVID-Net Open Source.

П’ять колекцій, які становлять COVIDx, включають: колекцію зображень COVID-19 (відкритий набір даних від дослідників з Монреалю); ініціативу набору даних рентгенограм грудної клітки COVID-19; набір даних Actualmed COVID-19; базу даних радіографії COVID-19; і набір даних змагання з виявлення пневмонії RSNA, один з багатьох до-COVID наборів, які були використані під час пандемії.

(RICORD – див. нижче – був пізніше доданий до COVIDx, але оскільки він був включений після моделей, що цікавили дослідження, його виключили з тестових даних, і в будь-якому випадку він ще більше різноманітнить COVIDx, що є центральною скаргою авторів дослідження.)

Дослідники стверджують, що COVIDx є “найбільшим і найбільш використовуваним” набором даних такого типу в науковому співтоваристві, пов’язаному з дослідженнями COVID, і що дані, імпортовані до COVIDx з зовнішніх наборів даних, не достатньо відповідають тричастинній схемі набору даних COVIDx (тобто “нормальному”, “пневмонії” та “COVID-19”).

Досить близько..?

При вивченні походження та придатності внесених наборів даних для COVIDx на момент дослідження дослідники виявили “невідповідне використання” даних RSNA, де дані одного типу були, на думку дослідників, неправильно віднесені до іншої категорії:

‘Репозиторій RSNA, який використовує публічно доступні рентгенограми грудної клітки від NIH Chestx-ray8 [**], був розроблений для завдання сегментації та містить три класи зображень, ‘Легенева не прозорість’, ‘Немає легеневої не прозорості/Не нормально’, і ‘Нормально’, з доступними обмежувальними рамками для випадків ‘Легеневої не прозорості’.

‘При складанні в COVIDx всі рентгенограми грудної клітки з класу ‘Легенева не прозорість’ включаються до класу пневмонії.’

По суті, стверджує стаття, методологія COVIDx розширює визначення “пневмонії” до включення “всіх пневмонії-подібних легеневих не прозоростей”. Наслідком цього є те, що порівнювані типи даних (мабуть) втрачаються. Дослідники заявляють:

‘ […] клас пневмонії в наборі даних COVIDx містить рентгенограми грудної клітки з різноманітними іншими патологіями, включаючи плевральний випот, інфільтрацію, консолідацію, емфізему та маси. Консолідація є радіологічною ознакою можливої пневмонії, а не клінічним діагнозом. Використання консолідації як заміни пневмонії без документації цього є потенційно оманливим.’

Альтернативні патології (крім COVID-19), пов'язані з COVIDx.

Альтернативні патології (крім COVID-19), пов’язані з COVIDx. Джерело: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Звіт виявляє, що лише 6,13% з 4 305 випадків пневмонії, отриманих з RSNA, були точно позначені, що становить лише 265 справжніх випадків пневмонії.

Крім того, багато випадків, які не були пневмонією, включені до COVIDx, представляли собою супутню патологію – ускладнення інших захворювань або інші вторинні медичні проблеми, які не обов’язково пов’язані з пневмонією.

Не ‘Нормально’

Звіт далі припускає, що вплив набору даних змагання RSNA на COVIDx викривив емпіричну стабільність даних. Дослідники спостерігають, що COVIDx надає перевагу класу “нормальному” даних RSNA, фактично виключаючи всі класи “немає легеневої не прозорості/не нормально” у ширшому наборі даних. Стаття стверджує:

‘Хоча це відповідає очікуваному в межах мітки ‘нормально’, розширення класу пневмонії та використання лише ‘нормальних’ рентгенограм грудної клітки, а не випадків без пневмонії, суттєво спрощує завдання класифікації.

‘Результатом цього є набір даних, який відображає завдання, яке віддалене від справжньої клінічної проблеми.’

Потенційні упередження з несовместимими стандартами даних

Стаття виявляє кілька інших типів упередженості в COVIDx, відзначаючи, що деякі внесені дані змішують педіатричні рентгенограми грудної клітки з рентгенограмами дорослих пацієнтів, і далі спостерігають, що ці дані є єдиним “значимим” джерелом педіатричних зображень у COVIDx.

Крім того, зображення з набору даних RSNA мають роздільність 1024×1024, тоді як інший внесений набір даних надає зображення лише роздільності 299×299. Оскільки моделі машинного навчання будуть змінювати розмір зображень, щоб відповідати доступному тренувальному простору (латентному простору), це означає, що зображення 299×299 будуть збільшені у тренувальному робочому процесі (потенційно призводячи до артефактів, пов’язаних з алгоритмом масштабування, а не з патологією), а більші зображення будуть зменшені. Знову ж таки, це суперечить однорідним стандартам даних, необхідним для аналізу комп’ютерного зору на основі штучного інтелекту.

Крім того, дані ActMed, включені до COVIDx, містять “дископодібні маркери” у рентгенограмах грудної клітки COVID-19, повторювану особливість, яка є несумісною з ширшим набором даних, і яку потрібно обробляти як “повторюваний аутлієр”.

Це саме той вид питань, який зазвичай вирішується шляхом очищення або видалення даних, оскільки повторення маркерів достатнє для реєстрації як “ознаки” під час навчання, але не достатньо часте, щоб корисно узагальнити у ширшій схемі набору даних. Без механізму для зниження впливу штучних маркерів вони потенційно можуть бути розглянуті методологією системи машинного навчання як патологічні явища.

Навчання та тестування

Дослідники протестували COVIDx проти двох порівняльних наборів даних за трьома моделями. Два додаткових набори даних були RICORD, який містить 1096 рентгенограм грудної клітки COVID-19 у 361 пацієнта з чотирьох країн; і CheXpert, публічний набір даних

Три моделі, які були використані, були COVID-Net, CoroNet і DarkCovidNet. Всі три моделі використовують卷олюційні нейронні мережі (CNN), хоча CoroNet складається з двоступеневого процесу класифікації зображень, з автокодувальниками, які передаються до класифікатора CNN.

Тестування показало “стрімке падіння” продуктивності всіх моделей на не-COVIDx наборах даних порівняно з 86% точністю, отриманою при використанні даних COVIDx. Однак, якщо дані неправильно позначені або згруповані, ці результати є фактично хибними. Дослідники відзначили значно знижені показники точності на порівняльних зовнішніх наборах даних, які, на їхню думку, є більш реалістичними та правильно класифікованими даними.

Крім того, стаття відзначає:

‘Клінічний огляд 500 карт салєнсі генерованих прогнозуванням на тестових даних COVIDx показав тенденцію до клінічно нерелевантних ознак. Це часто включало фокусування на кісткових структурах та м’яких тканинах замість дифузної двосторонньої не прозорості легень, характерної для інфекції COVID-19.’

Це рентгенограма підтвердженого випадку COVID-19, якому була призначена передбачувана ймовірність лише 0,938 від DarkCovidNet, навченого на COVIDx. Джерело: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Це рентгенограма підтвердженого випадку COVID-19, якому була призначена передбачувана ймовірність лише 0,938 від DarkCovidNet, навченого на COVIDx.

Висновки

Дослідники критикують відсутність демографічних або клінічних даних, пов’язаних з рентгенограмами грудної клітки в COVIDx, стверджуючи, що без цих даних неможливо врахувати “конфундовані фактори” таких як вік.

Вони також відзначають, що проблеми, виявлені в наборі даних COVIDx, можуть бути застосовані до інших наборів даних, які були подібним чином джерелені (тобто шляхом змішування до-COVID баз радіологічних зображень з недавніми даними рентгенограм грудної клітки без адекватної архітектури даних, компенсації варіанту та чіткого визначення обмежень цього підходу).

Під час підсумовування недоліків COVIDx дослідники підкреслюють нерівномірне включення “чистих” педіатричних рентгенограм, а також їхнє сприйняття неправильного використання міток і високого ризику упередженості та супутньої патології в COVIDx, стверджуючи, що ‘виключна продуктивність [COVIDx] повідомлена широко в цій області є надмірно завищеною, результати продуктивності моделей неправильно представлені, і моделі не узагальнюються добре до клінічно-реалістичних даних.’

Звіт завершується:

‘Недостатність доступних лікарняних даних разом з недостатньою оцінкою моделей у всьому проблемному домені дозволила використання відкритих даних обманути дослідницьке співтовариство. Продовження публікації завищених показників продуктивності моделей ризикує пошкодити довіру до досліджень штучного інтелекту в медичних діагностичних засобах, особливо коли захворювання є предметом великого громадського інтересу. Якість досліджень в цій галузі повинна покращитися, щоб запобігти цьому, і це повинно починатися з даних.’

 

 

*Хоча дослідники дослідження стверджують, що зробили дані, файли та код для нової статті доступними онлайн, доступ вимагає входу, і на момент написання цієї статті загальний публічний доступ до файлів недоступний.
** ChestX-ray8: Бази даних рентгенограм грудної клітки в масштабі лікарні та бенчмарки слабко-керованих класифікації та локалізації загальних захворювань грудної клітки –
https://arxiv.org/pdf/1705.02315.pdf

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai