Anderson’un Açısı

Sentetik Yara Veri Setlerini Oluşturmak İçin Çatışmalı Sinir Ağları Kullanma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

İlk kez, bir Çatışmalı Sinir Ağı sentetik yara görüntüsü veri setlerini oluşturmak için kullanılmaktadır. Bu, sağlık makineleri öğrenimi uygulamalarında bu tür içeriğin çeşitlilikten ve erişilebilirlikten yoksun olduğu kritik bir eksikliği gidermek amacıyla yapılmaktadır.

Sistem, WG2AN olarak adlandırılmaktadır. Bu, Batten Mühendislik ve Teknoloji Koleji ile sağlık şirketleri eKare arasında bir işbirliğidir. eKare, makine öğrenimi metodolojilerini yara ölçümü ve tanımlamasına uygulamaya chuyênlaşmıştır.

Çatışmalı Sinir Ağı, eKare tarafından sağlanan 100-4000 etiketli stereoskopik kronik yara görüntüleri üzerinde eğitilmiştir. Bu görüntüler, basıncın, cerrahi operasyonların, lenfovasküler olayların, diyabetin ve yanıkların neden olduğu yaralar gibi çeşitli yara türlerini içermektedir. Görüntüler 1224×1224 ile 2160×2160 arasında değişen boyutlarda olup, hekimler tarafından mevcut ışık altında çekilmiştir.

Model eğitim mimarisindeki mevcut gizli uzayı dikkate almak için, görüntüler 512×512 boyutuna küçültülmüştür ve arka planlarından çıkarılmıştır. Veri seti boyutunun etkisini incelemek için, 100, 250, 500, 1000, 2000 ve 4000 görüntüden oluşan partiler üzerinde testler yapılmıştır.

Kaynak: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Kaynak: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Üstteki resim, eğitim setinin büyüklüğüne ve her geçişte yürütülen epoch sayısına göre artan ayrıntı ve granülasyonu göstermektedir.

WG2GAN mimarisi

WG2GAN mimarisi Kaynak: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

WG2GAN, PyTorch üzerinde, 8GB VRAM ve GTX 1080 GPU ile donatılmış nispeten zayıf bir tüketici tarzı kurulumda çalışmaktadır. Eğitim, 100-4000 görüntü arasındaki veri seti boyutları ve epoch sayıları üzerinde 4-58 saat arasında sürmüştür. İlk yarı eğitim için Adam Optimizer kullanılmış ve öğrenme oranı 0.0002 olarak belirlenmiştir. Eğitim, sıfır kayıp elde edilene kadar lineer olarak azalan bir öğrenme oranı ile sona ermiştir.

Üstte solda, yara alanına uygulanan segmentasyon; üstte orta, gerçek yara görüntüsü; üstte sağda, orijinal kaynaktan türetilen ve veri setinde genelleştirilebilecek sentetik yara türü. Altta, orijinal yara ve sağda, WG2GAN tarafından üretilen sentetik yara.

Üstte solda, yara alanına uygulanan segmentasyon; üstte orta, gerçek yara görüntüsü; üstte sağda, orijinal kaynaktan türetilen ve veri setinde genelleştirilebilecek sentetik yara türü. Altta, orijinal yara ve sağda, WG2GAN tarafından üretilen sentetik yara.

Tıbbi veri setlerinde, etiketleme kaçınılmaz bir bottleneck teşkil etmektedir. Bu durumda, araştırmacılar, daha önce eKare tarafından yapılan bir araştırmanın sonuçlarını kullanarak, yarı otomatik bir etiketleme sistemi geliştirmişlerdir. Bu sistem, Play-Doh’dan yapılan ve anlamsal bağlam için yaklaşık renklendirilen gerçekçi yara modellerini kullanmaktadır.

eKare Yara Modelleri

eKare Yara Modelleri

Araştırmacılar, eğitim sürecinin başlangıcında, veri seti oldukça çeşitli ve ağırlıklar rastgele olduğunda ortaya çıkan bir sorunu gözlemlediler – modelin ‘yerleşmesi’ uzun zaman alıyordu (75 epoch):

Veri çeşitli olduğunda, hem Çatışmalı Sinir Ağı hem de kodlayıcı/çözücü modeller, ilk aşamalarda genellemeyi elde etmekte zorlanmaktadır. Yukarıdaki WG2GAN eğitimi grafiğinde görüldüğü gibi, bu durum modelin sıfır kayba ulaşana kadar eğitim zamanını takip etmektedir.

Eğitim sürecinde, modelin herhangi bir iterasyon veya epochun özelliklerine veya özelliklerine takılmamasına dikkat edilmelidir. Model, kaynak materyali aşırı soyutlamadan kaçınarak, kullanılabilir bir ortalama kayba genellemeye devam etmelidir. WG2GAN durumunda, bu, gerçekçi olmayan, tamamen ‘kurgusal’ yaralar oluşturmak yerine, belirli bir yara türünün gerçekçi varyasyonlarını üretme riskini taşır.

Makine Öğrenimi Veri Setinde Kapsamın Kontrol Edilmesi

Daha hafif eğitim setlerine sahip modeller daha hızlı genellemeye ulaşır. Makaledeki araştırmacılar, en gerçekçi görüntülerin maksimum ayarların altında elde edilebileceğini iddia etmektedirler: 1000 görüntü veri seti 200 epoch üzerinde eğitilmiştir.

Daha küçük veri setleri, daha kısa sürede daha gerçekçi görüntüler elde edebilir, ancak üretilen görüntü ve yara türlerinin çeşitliliği de sınırlı olacaktır. Çatışmalı Sinir Ağı ve kodlayıcı/çözücü eğitim rejimlerinde, girdi verisi hacmi, üretilen görüntülerin gerçekliği ve gerçekliği arasında bir dengenin korunması gerekmektedir – bu, tıbbi görüntü sentezinin ötesinde, genel olarak makine öğrenimi için geçerli olan kapsam ve ağırlıklandırma konularıdır.

Tıbbi Veri Setlerinde Sınıflandırma Dengeesizlikleri

Genel olarak, sağlık makineleri öğrenimi, veri setlerinin eksikliği ve sınıflandırma dengesizliklerinin birleşimi ile karşı karşıyadır. Bir hastalıkla ilgili temel veri, ana veri setinin çok küçük bir kısmını oluşturduğundan, bu durum ya dışlanmış veri olarak görülmesine ya da eğitim sırasında genellemeye dahil olmasına neden olabilir.

Bu soruna çözüm olarak, alt-örnekleme veya üst-örnekleme gibi yöntemler önerilmiştir. Ancak, bu problem genellikle, tek bir tıbbi soruna bağlı, hastalığa özgü veri setleri geliştirerek çözülmektedir. Bu yaklaşım, her bir vakada etkili olsa da, tıbbi makine öğrenimi araştırmalarının Balkanlaşma kültürüne katkıda bulunmakta ve sektördeki genel ilerlemeyi yavaşlatabilmektedir.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai