Взгляд Anderson

Популярная база данных COVIDx подвергнута критике исследователями из Великобритании

mm
Добавьте Unite.AI в избранные источники в Google

Исследовательский консорциум из Великобритании выразил обеспокоенность по поводу степени научной уверенности, возложенной на открытые базы данных, используемые для анализа рентгеновских снимков легких пациентов с COVID-19, сосредоточив внимание на популярной открытом базе данных COVIDx.

Исследователи, протестировавшие COVIDx в различных моделях обучения ИИ, утверждают, что он “не представляет реальной клинической проблемы”, что результаты, полученные с его помощью, “завышены”, и что модели “не обобщаются хорошо” на реальные данные.

Авторы также отмечают несоответствие внесенных данных, составляющих COVIDx, где исходные изображения имеют разные разрешения, которые автоматически переформатируются глубоким обучением в согласованные размеры, необходимые для обучения, и наблюдают, что этот процесс может ввести обманчивые артефакты, связанные с алгоритмом изменения размера изображения, а не с клиническим аспектом данных.

Статья под названием Ловушки использования открытых данных для разработки решений глубокого обучения для обнаружения COVID-19 на рентгеновских снимках легких является сотрудничеством между Центром вычислительной визуализации и симуляции в биомедицине (CISTIB) в Университете Лидса и исследователями из пяти других организаций в том же городе, включая Учреждение здравоохранения Лидса.

Исследования подробно описывают, среди прочего, “неправильное использование меток” в базе данных COVIDx, а также “высокий риск предвзятости и конфузии”. Собственные эксперименты исследователей по проверке базы данных на трех жизнеспособных моделях глубокого обучения привели их к выводу, что “исключительная производительность, широко сообщаемая в области, завышена, что результаты производительности моделей неправильно представлены, и что модели не обобщаются хорошо на клинически реалистичные данные”.

Пять контрастных наборов данных в одном

Отчет* отмечает, что большинство текущих методов, основанных на ИИ, в этой области полагаются на “гетерогенную” смесь данных из различных открытых репозиториев, наблюдая, что пять наборов данных с заметно разными характеристиками были объединены в базу данных COVIDx, несмотря на (по мнению исследователей) недостаточное соответствие качества и типа данных.

База данных COVIDx была опубликована в мае 2020 года в качестве консорциума, возглавляемого Департаментом системного проектирования Университета Ватерлоо в Канаде, с данными, доступными в рамках инициативы COVID-Net Open Source.

Пять коллекций, составляющих COVIDx, являются: коллекция изображений COVID-19 (открытый набор данных из Монреаля); инициатива набора данных рентгеновских снимков легких COVID-19; набор данных рентгеновских снимков легких Actualmed COVID-19; база данных радиографии COVID-19; и набор данных соревнования RSNA по обнаружению пневмонии, один из многих до-COVID наборов, которые были привлечены для решения кризиса пандемии.

(RICORD – см. ниже – был добавлен в COVIDx позже, но поскольку он был включен после моделей, представляющих интерес в исследовании, он был исключен из тестовых данных, и в любом случае он еще больше варьировал бы COVIDx, что является основной жалобой авторов исследования.)

Исследователи утверждают, что COVIDx является “крупнейшим и наиболее широко используемым” набором данных своего рода в научном сообществе, связанном с исследованиями COVID, и что данные, импортированные в COVIDx из внешних наборов данных, не соответствуют трипартитной схеме базы данных COVIDx (т.е. “нормальному”, “пневмонии” и “COVID-19”).

Достаточно близко..?

При проверке происхождения и пригодности вносимых наборов данных для COVIDx в момент исследования исследователи обнаружили “неправильное использование” данных RSNA, где данные одного типа, по утверждению исследователей, были сведены в другую категорию:

‘Репозиторий RSNA, который использует общедоступные рентгеновские снимки легких из NIH Chestx-ray8 [**], был разработан для задачи сегментации и содержит три класса изображений: ‘Легочная непрозрачность’, ‘Нет легочной непрозрачности/Не нормально’ и ‘Нормально’, с доступными ограничивающими рамками для случаев ‘Легочной непрозрачности’.

‘При его компиляции в COVIDx все рентгеновские снимки из класса ‘Легочной непрозрачности’ включены в класс пневмонии.’

По сути, статья утверждает, что методология COVIDx расширяет определение “пневмонии”, чтобы включить “все пневмонии-подобные легочные непрозрачности”. Следовательно, как полагают исследователи, сравнимость сравнимых типов данных ставится под угрозу. Исследователи заявляют:

‘[…] класс пневмонии в базе данных COVIDx содержит рентгеновские снимки с разнообразием многих других патологий, включая плевральный выпот, инфильтрацию, консолидацию, эмфизему и опухоли. Консолидация является радиологической особенностью возможной пневмонии, а не клиническим диагнозом. Использование консолидации в качестве замены пневмонии без документирования этого может быть вводящим в заблуждение.’

Альтернативные патологии (помимо COVID-19) в COVIDx.

Альтернативные патологии (помимо COVID-19) в COVIDx. Источник: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Отчет обнаруживает, что только 6,13% из 4305 случаев пневмонии, полученных из RSNA, были точно помечены, представляя всего 265 подлинных случаев пневмонии.

Кроме того, многие из не-пневмонических случаев, включенных в COVIDx, представляли собой коморбидности – осложнения других заболеваний или вторичные медицинские проблемы в состояниях, которые не обязательно связаны с пневмонией.

Не ‘нормально’

Отчет进一步 предполагает, что влияние набора данных соревнования RSNA на COVIDx искажает эмпирическую стабильность данных. Исследователи наблюдают, что COVIDx отдает приоритет классу “нормального” данных RSNA, эффективно исключая все классы “нет легочной непрозрачности/не нормально” в более широком наборе данных. Статья гласит:

‘Хотя это соответствует тому, что ожидается в рамках метки ‘нормально’, расширение класса пневмонии и использование только ‘нормальных’ рентгеновских снимков, а не пневмонии-отрицательных случаев, значительно упрощает задачу классификации.

‘В результате получается набор данных, который отражает задачу, удаленную от реальной клинической проблемы.’

Потенциальные предвзятости из-за несовместимых стандартов данных

Статья выявляет несколько других типов предвзятости в COVIDx, отмечая, что некоторые вносимые данные смешивают педиатрические рентгеновские снимки с снимками взрослых пациентов, и далее наблюдает, что эти данные являются единственным “значительным” источником педиатрических изображений в COVIDx.

Кроме того, изображения из набора данных RSNA имеют разрешение 1024×1024, в то время как другой вносимый набор данных предоставляет изображения только с разрешением 299×299. Поскольку модели машинного обучения неизбежно изменят размер изображений, чтобы приспособиться к доступному пространству обучения (латентному пространству), это означает, что изображения 299×299 будут масштабированы в процессе обучения (потенциально приводя к артефактам, связанным с алгоритмом масштабирования, а не с патологией), и более крупные изображения будут уменьшены. Снова, это уменьшает однородные стандарты данных, необходимые для анализа компьютерного зрения на основе ИИ.

Далее, данные ActMed, включенные в COVIDx, содержат “дискообразные маркеры” в рентгеновских снимках легких COVID-19, повторяющуюся особенность, несовместимую с более широким набором данных, и которую необходимо обработать как “повторяющийся аутлиер”.

Это тот тип проблемы, который обычно решается либо очисткой, либо исключением данных, поскольку повторение маркеров достаточно, чтобы зарегистрироваться как “особенность” в обучении, но не достаточно часто, чтобы обобщить полезно в более широкой схеме набора данных. Без механизма для учета влияния искусственных маркеров они потенциально могут быть рассмотрены методологией системы машинного обучения как патологические явления.

Обучение и тестирование

Исследователи протестировали COVIDx на двух сравнительных наборах данных по трем моделям. Два дополнительных набора данных были RICORD, содержащим 1096 рентгеновских снимков легких COVID-19 по 361 пациенту из четырех стран; и CheXpert, публичный набор данных.

Три модели, использованные для тестирования, были COVID-Net, CoroNet и DarkCovidNet. Все три модели используют свёрточные нейронные сети (CNN), хотя CoroNet состоит из двухэтапного процесса классификации изображений, с автоэнкодерами, передающими вывод на классификатор CNN.

Тестирование показало “крутой спад” во всех показателях производительности моделей на не-COVIDx наборах данных по сравнению с 86% точности, полученной при использовании данных COVIDx. Однако, если данные помечены неправильно или сгруппированы, это эффективно ложные результаты. Исследователи отметили значительно сниженные показатели точности на сравнимых внешних наборах данных, которые, по мнению статьи, являются более реалистичными и правильно классифицированными данными.

Статья также наблюдает:

‘Клинический обзор 500 карт салIENCE, сгенерированных прогнозом на тестовых данных COVIDx, показал тенденцию значимости в клинически нерелевантных особенностях. Это часто включало фокус на костных структурах и мягких тканях вместо диффузной билатеральной непрозрачности легких, типичной для инфекции COVID-19.’

Это рентгеновский снимок подтвержденного случая COVID-19, присвоенный вероятность прогноза 0,938 от COVIDx, обученного на DarkCovidNet. Источник: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Это рентгеновский снимок подтвержденного случая COVID-19, присвоенный вероятность прогноза 0,938 от COVIDx, обученного на DarkCovidNet.

Выводы

Исследователи критикуют отсутствие демографических или клинических данных, связанных с рентгеновскими снимками в COVIDx, утверждая, что без них невозможно учесть “конфузные факторы”, такие как возраст.

Они также наблюдают, что проблемы, найденные в наборе данных COVIDx, могут быть применимы к другим наборам данных, которые были подобным образом получены (т.е. путем смешивания до-COVID баз данных радиологических изображений с недавними данными рентгеновских снимков COVID без адекватной архитектуры данных, компенсации дисперсии и четкого определения ограничений этого подхода).

В сводке недостатков COVIDx исследователи подчеркивают одностороннее включение “ясных” педиатрических рентгеновских снимков, а также их восприятие неправильного использования меток и высокого риска предвзятости и конфузии в COVIDx, утверждая, что ‘исключительная производительность [COVIDx] широко сообщаемая в области является завышенной, что результаты производительности моделей неправильно представлены, и что модели не обобщаются хорошо на клинически реалистичные данные.’

Отчет заключает:

‘Отсутствие доступных больничных данных, в сочетании с недостаточной оценкой моделей по всей области, позволило использовать открытые данные для введения исследовательского сообщества в заблуждение. Продолжение публикации завышенных метрик производительности моделей рискует нанести ущерб достоверности исследований ИИ в медицинской диагностике, особенно когда речь идет о заболеваниях, представляющих большой общественный интерес. Качество исследований в этой области должно улучшиться, чтобы предотвратить это, и это должно начаться с данных.’

 

 

*Хотя исследователи утверждают, что сделали данные, файлы и код для новой статьи доступными онлайн, доступ требует входа, и на момент написания нет общедоступного доступа к файлам.
** ChestX-ray8: База данных рентгеновских снимков легких в масштабе больницы и эталоны слабо-наблюдаемой классификации и локализации распространенных заболеваний легких – https://arxiv.org/pdf/1705.02315.pdf

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai