Anderson’un Açısı

Popüler COVIDx Veri Setinin UK Araştırmacıları Tarafından Eleştirilmesi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

UK’dan bir araştırma konsorsiyumu, COVID-19 hastalarının göğüs röntgenlerinin bilgisayar görüşü tabanlı analizinde kullanılan açık kaynaklı veri setlerine duyulan bilimsel güvenin kapsamını eleştirdi, özellikle de popüler açık kaynaklı veri seti COVIDx’i hedef aldı.

Araştırmacılar, COVIDx’i çeşitli AI eğitim modellerinde test etti ve bunun “gerçek klinik problemin temsilcisi olmadığı”, elde edilen sonuçların “aşırı şişirilmiş” olduğu ve modellerin “gerçek dünya verilerine iyi genellemeye sahip olmadığı” iddiasında bulundu.

Yazarlar ayrıca, COVIDx’i oluşturan katkıda bulunan verilerin tutarlılığının eksikliğini not etti, burada orijinal görüntüler çeşitli çözünürlüklerde geldi ve derin öğrenme iş akışı tarafından eğitim için gerekli olan tutarlı boyutlara otomatik olarak yeniden boyutlandırıldı ve bu işlemin görüntü yeniden boyutlandırma algoritmasıyla ilgili aldatıcı sanat eserleri tanıtabileceğini, klinik veri yönünden değil, gözlemlediler.

Makale COVID-19 teşhisinde göğüs röntgenlerinde derin öğrenme çözümlerinin geliştirilmesinde açık verilerin kullanılmasıyla ilgili tuzaklar olarak adlandırıldı ve Leeds Üniversitesi’ndeki Center for Computational Imaging & Simulation in Biomedicine (CISTIB) ile aynı şehirdeki beş diğer kuruluştan araştırmacılar arasındaki bir işbirliği olarak gerçekleştirildi, bunlar arasında Leeds Teaching Hospitals NHS Trust de yer aldı.

Araştırmada, COVIDx veri setindeki ‘etiketlerin yanlış kullanımı’ ve ‘yüksek yanılma ve yanılma riski’ gibi olumsuz uygulamalar detaylandırıldı. Araştırmacıların kendi deneyleri, veri setini üç geçerli derin öğrenme modeli aracılığıyla test etti ve onları ‘rapor edilen istisnai performansı şişirmiş, model performansı sonuçlarını yanlış temsil etmiş ve modellerin klinik olarak gerçekçi verilere iyi genellemeye sahip olmadığı’ sonucuna varmaya yöneltti.

Beş Çelişen Veri Seti Bir Arada

Rapor, mevcut AI tabanlı yöntemlerin çoğunun bu alanda ‘heterojen’ bir veri koleksiyonuna bağlı olduğunu gözlemledi ve beş veri setinin, veri kalitesi ve türü açısından yeterli eşitliğe sahip olmadan COVIDx veri setine birleştirildiğini kaydetti.

COVIDx veri seti Mayıs 2020’de Kanada’daki Waterloo Üniversitesi’ndeki Sistemler Tasarım Mühendisliği Bölümü’nün önderliğinde bir konsorsiyum çalışması olarak yayımlandı, veri COVID-Net Açık Kaynak Girişimi kapsamında sunuldu.

COVIDx’i oluşturan beş koleksiyon şunlardır: COVID-19 Görüntü Veri Toplama (Montreal araştırmacılarından açık kaynaklı bir set); COVID-19 Göğüs Röntgeni Veri Seti girişimi; Actualmed COVID-19 Göğüs Röntgeni veri seti; COVID-19 Radyografi Veritabanı; ve RSNA Pnömoni Tespit Challenge veri seti, COVID-19 salgını için hizmete sunulan önceden var olan birçok veri setinden biri.

(RICORD – aşağıda bahsedilen – daha sonra COVIDx’e eklendi, ancak çalışmadaki ilgi modellerine dahil edilmeden önce eklendiği için test verisinden çıkarıldı ve her durumda COVIDx’i daha da çeşitlendirecekti, bu da yazarların merkezi şikayeti.

Araştırmacılar, COVIDx’in COVID araştırmaları ile ilgili bilimsel topluluk içinde kendi türünün ‘en büyük ve en yaygın kullanılan’ veri seti olduğunu ve COVIDx’e dış veri setlerinden aktarılan verilerin COVIDx veri setinin üçlü şemasına (yani ‘normal’, ‘pnömoni’ ve ‘COVID-19’) yeterli şekilde uymadığını iddia etti.

Yeterince Yakın..?

Araştırmacılar, COVIDx’e katkıda bulunan veri setlerinin kökenini ve çalışmanın yapıldığı sırada uygunluğunu incelediler ve RSNA verisinin ‘yanlış kullanımını’ buldular, burada bir türün verisi başka bir kategoriye yönlendirilmişti:

‘RSNA deposu, NIH Chestx-ray8’den halka açık göğüs röntgeni verilerini kullandı ve bir segmentasyon görevi için tasarlandığından üç görüntü sınıfı içerir: ‘Akciğer Opasitesi’, ‘Lung Opasitesi Yok/Normal Değil’ ve ‘Normal’, ‘Lung Opasitesi’ vakaları için sınırlayıcı kutular mevcuttur.’

‘COVIDx’e derlenmesinde tüm ‘Akciğer Opasitesi’ sınıfından göğüs röntgenleri pnömoni sınıfına dahil edildi.’

Esasen, makale, COVIDx metodolojisinin ‘pnömoni’ tanımını ‘tüm pnömoni benzeri akciğer opasitelerine’ genişlettiğini iddia ediyor. Buna göre, karşılaştırılabilir veri türlerinin gibi-for-like değeri tehdit altına girmektedir. Araştırmacılar şöyle diyor:

‘ […] COVIDx veri setindeki pnömoni sınıfı, plevral efüzyon, infiltrasyon, konsolidasyon, emfizem ve kitleler dahil olmak üzere birçok başka patolojilerin göğüs röntgenlerini içerir. Konsolidasyon, muhtemel pnömoninin bir radyolojik özelliğidir, klinik bir tanı değildir. Bunu pnömoni yerine kullanmak zonder bunu belgelemek potansiyel olarak yanıltıcı olabilir.’

COVIDx ile ilişkili alternatif patolojiler (COVID-19 dışındaki).

COVIDx ile ilişkili alternatif patolojiler (COVID-19 dışındaki). Kaynak: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Raporda, RSNA’dan alınan 4.305 pnömoni vakasının yalnızca %6,13’ünün (265 gerçek pnömoni vakası) doğru şekilde etiketlendiği bulundu.

Ayrıca, COVIDx’e dahil edilen birçok non-pnömoni vakası, komorbiditeler olarak ortaya çıktı – diğer hastalıkların komplikasyonları veya pnömoni ile ilişkili olmayan ikincil tıbbi sorunlar.

Normal Değil

Rapor, RSNA challenge veri setinin COVIDx üzerindeki etkisinin veri setinin empirik stabilitesini bozduğunu öne sürüyor. Araştırmacılar, COVIDx’in RSNA verisinin ‘normal’ sınıfını önceliklendirdiğini, efektif olarak daha geniş veri setindeki ‘akciğer opasitesi yok/normal değil’ sınıflarını dışladığını gözlemlediler. Makale şöyle diyor:

‘Bu, ‘normal’ etiketinin beklendiği ile tutarlıdır, ancak pnömoni sınıfını genişletmek ve sadece ‘normal’ göğüs röntgenlerini kullanmak, sınıflandırma görevini büyük ölçüde basitleştirir.’

‘Sonuç, gerçek klinik problemden uzaklaşmış bir görevi yansıtan bir veri setidir.’

Uyumsuz Veri Standartlarından Kaynaklanan Potansiyel Yanlılıklar

Makale, COVIDx’de çeşitli yanlılık türlerini tespit etti, bazı katkıda bulunan verilerin pediatrik göğüs röntgeni görüntülerini yetişkin hasta röntgenleriyle birleştirdiğini ve bu verilerin COVIDx’deki tek ‘önemli’ pediatrik görüntü kaynağı olduğunu gözlemledi.

Ayrıca, RSNA veri setindeki görüntülerin 1024×1024 çözünürlüğe sahipken, başka bir katkıda bulunan veri seti yalnızca 299×299 çözünürlükte görüntüler sunuyor. Makine öğrenimi modelleri, eğitim için mevcut alanı (latent alanı) doldurmak için görüntüleri yeniden boyutlandıracağından, 299×299 görüntüler eğitim akışında ölçeklendirilecek (bu, patoloji yerine ölçeklendirme algoritması ile ilgili sanat eserlerine yol açabilir) ve daha büyük görüntüler küçültülecektir. Yine, bu, AI tabanlı bilgisayar görüşü analizine gerekli olan homojen veri standartlarına karşı çalışır.

ActMed verisinin COVIDx’e aktarılan kısmı, COVID-19 göğüs röntgenlerinde ‘disk şekilli işaretler’ içerir, bu bir tekrarlanan özelliktir ve daha geniş veri setiyle tutarlı değildir ve bu, ‘tekrarlayan bir aykırı değer’ olarak ele alınması gereken bir özelliktir.

Bu, genellikle veri temizleme veya veri çıkarma ile ele alınan bir sorundur, çünkü işaretlerin tekrarı, eğitimde bir ‘özellik’ olarak kaydedilmesi için yeterlidir, ancak daha geniş veri setinde faydalı bir şekilde genelleştirmek için yeterli değildir. Yapay zeka sisteminin metodolojisinin bu yapay işaretleri patolojik fenomenler olarak değerlendirebileceği endişesi olmadan, bu işaretlerin etkisini azaltan bir mekanizma olmadan, bunlar potansiyel olarak ‘özellikler’ olarak değerlendirilebilir.

Eğitim ve Test

Araştırmacılar, COVIDx’i iki karşılaştırma veri seti boyunca üç model aracılığıyla test etti. Ek iki veri seti, 1096 COVID-19 göğüs röntgeninden oluşan 361 hastadan oluşan RICORD ve CheXpert idi.

Üç model olarak COVID-Net, CoroNet ve DarkCovidNet kullanıldı. Tüm üç model, Evrişimli Sinir Ağları (CNN) kullanıyor, ancak CoroNet, otomatik kodlayıcıların bir CNN sınıflandırıcısına çıktı passing ettiği iki aşamalı bir görüntü sınıflandırma sürecini içeriyor.

Test, tüm model performansında COVIDx dışı veri setlerinde ‘keskin bir düşüş’ gösterdi, ancak COVIDx verisi kullanıldığında %86’lık bir doğruluk elde edildi. Ancak, veriler yanlış etiketlenmiş veya yanlış gruplandırılmışsa, bunlar esasen yanlış sonuçlardır. Araştırmacılar, karşılaştırılabilir dış veri setlerinde büyük ölçüde azaltılmış doğruluk sonuçları gözlemledi ve makale, bu verilerin daha gerçekçi ve doğru şekilde etiketlenmiş veri olarak önerildi.

Araştırmada ayrıca şöyle denildi:

‘COVIDx test verisi üzerine yapılan 500 grad-CAM saliency haritasının klinik bir incelemesi, klinik olarak alakasız özelliklerde bir anlamlılık eğilimini gösterdi. Bu genellikle kemik yapılar ve yumuşak dokular yerine akciğer alanlarının difüz bilateral opasifikasyonuna odaklanmayı içerir, bu da COVID-19 enfeksiyonunun tipik bir özelliğidir.’

Bu, DarkCovidNet ile eğitilen COVIDx'den bir onaylanmış COVID-19 vakasına ait bir röntgen ve 0.938 tahmin olasılığı.

DarkCovidNet ile eğitilen COVIDx’den bir onaylanmış COVID-19 vakasına ait bir röntgen ve 0.938 tahmin olasılığı.

SONUÇLAR

Araştırmacılar, COVIDx’deki göğüs röntgeni görüntülerine ilişkin demografik veya klinik verilerin eksikliğini eleştiriyor ve bunların olmadan ‘yanılma faktörlerini’ hesaba katmanın imkansız olduğunu savunuyor.

Araştırmacılar, COVIDx’de bulunan sorunların, benzer şekilde kaynaklandığı (yani, önceden var olan radyolojik görüntü veritabanlarını COVID X-ray görüntü verisiyle birleştirmek zonder yeterli veri mimarisi, varyans telafisi ve bu yaklaşımın sınırlarının net bir tanımlaması) diğer veri setlerine de uygulanabileceğini gözlemlediler.

COVIDx’in eksikliklerini özetlerken, araştırmacılar, ‘pediatrik X-ray’lerin ‘açık’ şekilde dahil edilmesini, etiketlerin yanlış kullanımını ve COVIDx’de yüksek yanılma ve yanılma riskini vurguladılar, iddialarını şöyle özetlediler: ‘istisnai performans [COVIDx’in] problem alanındaki yaygın olarak bildirilen, model performans sonuçlarının yanlış temsil edildiği ve modellerin klinik olarak gerçekçi verilere iyi genellemeye sahip olmadığı’.

Rapor şöyle sona erdi:

‘Mevcut hastane verilerinin eksikliği ve problem alanındaki yetersiz model değerlendirmesi, açık kaynaklı verilerin araştırma topluluğunu yanıltmasına izin verdi. Aşırı şişirilmiş model performans metriklerinin yayınlanması, özellikle hastalığın büyük kamuoyu ilgisine sahip olduğu tıbbi teşhislerde yapay zeka araştırmalarının güvenilirliğini tehlikeye atma riski taşıyor. Bu alanda araştırmaların kalitesi, bu durumun yaşanmasını önlemek için verbessirilmelidir, bu da veriyle başlamalıdır.’

 

 

*Araştırmacılar, çalışmadaki ilgi modellerine dahil edilmeden önce eklendiği için test verisinden çıkarılan RICORD’u da dahil olmak üzere, yeni makale için veri, dosyalar ve kodu çevrimiçi olarak kullanılabilir hale getirdiklerini iddia ediyorlar, ancak erişim için oturum açma gerekiyor ve yazıldığı sırada dosyaların genel halka açık erişimine izin verilmiyor.
** ChestX-ray8: Hastane Ölçeğinde Göğüs Röntgeni Veri Tabanı ve Zayıf Denetimli Sınıflandırma ve Yaygın Toraks Hastalıklarının Lokalizasyonu için Benchmarks – https://arxiv.org/pdf/1705.02315.pdf

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai