Andersons vinkel

Skapande av syntetiska sårdataset med generativa adversariala nätverk

mm
Lägg till Unite.AI bland dina föredragna källor på Google

För första gången används ett generativt adversarialt nätverk för att skapa syntetiska dataset av sårbilder, i syfte att åtgärda en kritisk brist på varierade och tillgängliga innehåll av denna typ i hälso- och sjukvårdsapplikationer för maskinlärning.

Systemet, som kallas WG2AN, är ett samarbete mellan Batten College of Engineering & Technology och AI-hälsoföretaget eKare, som specialiserar sig på att tillämpa maskinlärningsmetoder för att mäta och identifiera sår.

GAN tränas på 100-4000 märkta stereoskopiska kroniska sårbilder som tillhandahålls av eKare, inklusive anonymiserade bilder av skadetyper orsakade av tryck, kirurgi, lymfovaskulära incidenter, diabetes och brännskador. Källmaterialet varierade i storlek mellan 1224×1224 till 2160×2160, alla tagna under tillgängligt ljus av läkare.

För att anpassa den tillgängliga latenta utrymmet i modellträningsarkitekturen skalades bilderna om till 512×512 och extraherades från sina bakgrunder. För att studera effekten av dataset-storlek genomfördes testkörningar på batchar om 100, 250, 500, 1000, 2000 och 4000 bilder.

Källa: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Källa: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Bilden ovan visar ökande detalj och granularitet enligt storleken på det bidragande träningsuppsättningen och antalet epoker som körs på varje pass.

Arkitekturen för WG. Källa: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Arkitekturen för WG2GAN. Källa: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

WG2GAN körs på PyTorch på en relativt smal konsumentstyrd konfiguration, med 8 GB VRAM på en GTX 1080 GPU. Träning tog mellan 4-58 timmar över ett intervall av dataset-storlekar från 100-4000 bilder och över ett intervall av epoker, med en batchstorlek på 64 som en avvägning mellan noggrannhet och prestanda. Adam-optimisatorn används för den första halvan av träningen med en inlärningshastighet på 0,0002, och avslutas med en linjärt avtagande inlärningshastighet tills en förlust på noll uppnås.

Överst till vänster, segmentering tillämpad på sårområdet. Överst i mitten, bild av det faktiska såret; överst till höger, ett syntetiskt sår av en typ som kan generaliseras i ett dataset, baserat på den ursprungliga källan. Nedan, det ursprungliga såret, och till höger, en syntes av såret genererad av WG2GAN.

Överst till vänster, segmentering tillämpad på sårområdet. Överst i mitten, bild av det faktiska såret; överst till höger, ett syntetiskt sår av en typ som kan generaliseras i ett dataset, baserat på den ursprungliga källan. Nedan, det ursprungliga såret, och till höger, en syntes av såret genererad av WG2GAN.

I medicinska dataset, liksom i många andra områden av maskinlärning, är märkning en oundviklig flaskhals. I detta fall använde forskarna ett semiautomatiskt märkningssystem som utnyttjar tidigare forskning från eKare, som använde verkliga modeller av sår, skapade i Play-Doh och grovt färgade för semantisk kontext.

eKare sårmodeller

eKare sårmodeller

Forskarna noterade ett problem som ofta förekommer i de tidiga stadierna av träning, när ett dataset är ganska varierat och vikter är slumpmässiga – modellen tar lång tid (75 epoker) att “sätta sig”:

Där data är varierad, har både GAN och encoder/decoder-modeller svårt att uppnå generalisering i de tidiga stadierna, som vi kan se belagt i grafen ovan som visar träningen av WG2GAN, som spårar träningsförloppet från början till nollförlust.

För att säkerställa att träningsprocessen inte fokuserar på funktionerna eller egenskaperna hos någon enskild iteration eller epoch, utan fortsätter att generalisera till en användbar medelförlust utan att producera resultat som alltför mycket abstraherar källmaterialet. I fallet med WG2GAN skulle det riskera att skapa obegränsade, helt “fiktiva” sår, sammanfogade bland alltför många olika sårtyper, snarare än att producera en korrekt variation inom en viss sårtyp.

Att kontrollera omfattning i ett maskinlärningsdataset

Modeller med lättare träningsuppsättningar generaliserar snabbare, och forskarna i artikeln hävdar att de mest realistiska bilderna kunde erhållas vid mindre än maximala inställningar: ett dataset med 1000 bilder tränat under 200 epoker.

Även om mindre dataset kanske kan uppnå högrealistiska bilder på kortare tid, kommer utbudet av bilder och sårtyper som genereras att vara mer begränsat. Det finns en känslig balans i GAN- och encoder/decoder-träningsregimer mellan volymen och variationen av indata, troheten hos de producerade bilderna och realismen hos de producerade bilderna — frågor om omfattning och viktning som inte är begränsade till medicinsk bildsyntes.

Klassobalanser i medicinska dataset

I allmänhet är hälso- och sjukvårdsmaskinlärning inte bara begränsad av en brist på dataset, utan också av klassobalanser, där viktig data om en specifik sjukdom utgör så liten andel av sitt värddataset att den riskerar att antingen förkastas som utvikningsdata eller att bli assimilerad under träningsprocessen.

Flera metoder har föreslagits för att hantera det senare problemet, såsom undersampling eller översampling. Men problemet undviks ofta genom att utveckla sjukdomsspecifika dataset som är helt bundna till ett enda medicinskt problem. Även om denna metod är effektiv i varje enskilt fall, bidrar den till kulturen av balkanisering inom området för medicinsk maskinlärningsforskning och bromsar förmodligen den allmänna utvecklingen inom sektorn.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai