Unghiul lui Anderson

Crearea de seturi de date sintetice de răni cu rețele antagoniste generative

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Pentru prima dată, o Rețea Antagonistă Generativă este utilizată pentru a crea seturi de date sintetice de imagini de răni, în scopul de a remedia o lipsă critică de conținut divers și accesibil de acest tip în aplicațiile de învățare automată în sănătate.

Sistemul, numit WG2AN, este o colaborare între Colegiul de Inginerie și Tehnologie Batten și compania de sănătate AI eKare, care se specializează în aplicarea metodologiilor de învățare automată pentru măsurarea și identificarea rănilor.

Rețeaua Antagonistă Generativă este antrenată pe 100-4000 de imagini stereoscopice de răni cronice etichetate furnizate de eKare, incluzând fotografii anonime de tipuri de leziuni cauzate de presiune, intervenții chirurgicale, incidente limfovasculare, diabet și arsuri. Materialul sursă a variat în dimensiune între 1224×1224 și 2160×2160, toate fiind luate sub lumina disponibilă de către medici.

Pentru a se adapta la spațiul latent disponibil în arhitectura de antrenare a modelului, imaginile au fost redimensionate la 512×512 și extrase din fundal. Pentru a studia efectul dimensiunii setului de date, au fost implementate teste pe loturi de 100, 250, 500, 1000, 2000 și 4000 de imagini.

Sursă: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Sursă: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Imaginea de mai sus arată o creștere a detaliilor și granulației în funcție de dimensiunea setului de antrenare și numărul de epoci rulate pe fiecare trecere.

Arhitectura WG. Sursă: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Arhitectura WG2GAN. Sursă: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

WG2GAN rulează pe PyTorch pe un setup relativ slab de consum, cu 8GB de VRAM pe o placă grafică GTX 1080. Antrenarea a durat între 4-58 de ore pe o gamă de dimensiuni de set de date de la 100 la 4000 de imagini și pe o gamă de epoci, pe un lot de 64 ca o compromis între precizie și performanță. Optimizatorul Adam este utilizat pentru prima jumătate a antrenării la o rată de învățare de 0,0002 și se încheie cu o rată de învățare liniar descrescătoare până la o pierdere de zero.

Sus-stânga, segmentarea aplicată zonei rănite. Sus-centru, imaginea reală a rănilor; sus-dreapta, o rană sintetică de un tip care poate fi generalizat într-un set de date, pe baza sursei originale. Jos, rana originală și, dreapta, o sinteză a rănilor generate de WG2GAN.

Sus-stânga, segmentarea aplicată zonei rănite. Sus-centru, imaginea reală a rănilor; sus-dreapta, o rană sintetică de un tip care poate fi generalizat într-un set de date, pe baza sursei originale. Jos, rana originală și, dreapta, o sinteză a rănilor generate de WG2GAN.

În seturile de date medicale, la fel ca și în multe alte sectoare ale învățării automate, etichetarea este un bottleneck inevitabil. În acest caz, cercetătorii au utilizat un sistem de etichetare semi-automatizat care se bazează pe cercetări anterioare de la eKare, care au utilizat modele reale de răni create din plastilină și vopsite pentru context semantic.

Modele de răni eKare

Modele de răni eKare

Cercetătorii au remarcat o problemă care apare frecvent în stadiile inițiale de antrenare, atunci când un set de date este foarte divers și greutățile sunt randomizate – modelul necesită mult timp (75 de epoci) pentru a “se stabiliza”:

Atunci când datele sunt variate, atât modelele GAN, cât și cele encoder/decoder au dificultăți în a obține generalizarea în stadiile inițiale, așa cum se poate vedea în graficul de antrenare a WG2GAN, care urmărește cronologia antrenării de la început până la pierdere zero.

Trebuie să se acorde atenție pentru a se asigura că procesul de antrenare nu se fixează pe caracteristicile sau trăsăturile unei singure iterații sau epoci, ci continuă să generalizeze la o medie utilă fără a produce rezultate care abstractizează excesiv materialul sursă. În cazul WG2GAN, aceasta ar risca să creeze răni “ficționale”, complet nelegate de tipurile de răni reale, în loc să producă o gamă realistă de variații în cadrul unui anumit tip de rană.

Controlul domeniului de aplicare într-un set de date de învățare automată

Modelele cu seturi de antrenare mai ușoare generalizează mai repede, iar cercetătorii articolului susțin că imaginile cele mai realiste ar putea fi obținute la mai puțin de setările maxime: un set de date de 1000 de imagini antrenat pe 200 de epoci.

Deși seturile de date mai mici ar putea obține imagini realiste în timp mai scurt, gama de imagini și tipurile de răni generate vor fi, de asemenea, mai limitate. Există un echilibru delicat în regimurile de antrenare GAN și encoder/decoder între volumul și varietatea datelor de intrare, fidelitatea imaginilor produse și realismul imaginilor produse — probleme de domeniu și greutate care nu sunt deloc limitate la sinteza de imagini medicale.

Dezechilibrele de clasă în seturile de date medicale

În general, învățarea automată în sănătate este afectată nu numai de o lipsă de seturi de date, ci și de dezechilibre de clasă, în care datele esențiale despre o boală anumită constituie un procent atât de mic din setul de date gazdă încât riscă să fie respinse ca date outlier sau să fie asimilate în procesul de generalizare pe parcursul antrenării.

O serie de metode au fost propuse pentru a aborda această problemă, cum ar fi sub-împăturirea sau supra-împăturirea. Cu toate acestea, problema este adesea ocolită prin dezvoltarea de seturi de date specifice bolilor care sunt legate în întregime de o singură problemă medicală. Deși această abordare este eficientă în fiecare caz, contribuie la cultura de balkanizare în sfera cercetării de învățare automată medicală și, probabil, încetinește progresul general în sector.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai