Kąt Andersona

Tworzenie syntetycznych zbiorów danych ran z użyciem sieci generatywno-dyskryminacyjnych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Po raz pierwszy, sieć generatywno-dyskryminacyjna jest używana do tworzenia syntetycznych zbiorów danych obrazów ran, w celu zaradzenia krytycznemu brakowi różnorodnych i dostępnych treści tego typu w aplikacjach machine learning w ochronie zdrowia.

System, nazwany WG2AN, jest współpracą między Batten College of Engineering & Technology a firmą AI eKare, specjalizującą się w stosowaniu metodologii machine learning do pomiaru i identyfikacji ran.

Sieć generatywno-dyskryminacyjna jest szkolona na 100-4000 obrazach ran przewlekłych, poddanych stereoskopii, dostarczonych przez eKare, w tym anonimowych zdjęć różnych typów urazów, takich jak urazy ciśnieniowe, chirurgiczne, limfowaskularne, cukrzycowe i oparzeniowe. Materiał źródłowy różnił się rozmiarem od 1224×1224 do 2160×2160, wszystkie wykonane w dostępnym świetle przez lekarzy.

Aby dostosować się do dostępnego latent space w architekturze szkolenia modelu, obrazy zostały przeskalowane do 512×512 i wyodrębnione z ich tła. Aby zbadać wpływ rozmiaru zbioru danych, przeprowadzono testy na partiach 100, 250, 500, 1000, 2000 i 4000 obrazów.

Źródło: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Źródło: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Powyższy obraz pokazuje wzrastającą szczegółowość i granulację w zależności od rozmiaru zbioru danych i liczby epok wykonanych na każdym przebiegu.

Architektura WG. Źródło: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

Architektura WG2GAN. Źródło: https://ietresearch.onlinelibrary.wiley.com/doi/pdfdirect/10.1049/tje2.12033

WG2GAN działa na PyTorch na względnie lekkim konsumenckim zestawie, z 8GB VRAM na karcie graficznej GTX 1080. Szkolenie trwało od 4 do 58 godzin w zależności od rozmiaru zbioru danych i liczby epok, na partii 64 jako kompromis między dokładnością a wydajnością. Użyto optymalizatora Adam dla pierwszej połowy szkolenia przy szybkości uczenia 0,0002, a następnie zastosowano liniowo malejącą szybkość uczenia aż do osiągnięcia straty zero.

Powyżej po lewej, segmentacja zastosowana do obszaru rany. Powyżej środku, obraz rzeczywistej rany; powyżej po prawej, syntetyczna rana danego typu, jaki może być uogólniony w zbiorze danych, na podstawie oryginalnego źródła. Poniżej, oryginalna rana, a po prawej, syntetyczna rana wygenerowana przez WG2GAN.

Powyżej po lewej, segmentacja zastosowana do obszaru rany. Powyżej środku, obraz rzeczywistej rany; powyżej po prawej, syntetyczna rana danego typu, jaki może być uogólniony w zbiorze danych, na podstawie oryginalnego źródła. Poniżej, oryginalna rana, a po prawej, syntetyczna rana wygenerowana przez WG2GAN.

W zbiorach danych medycznych, tak jak w wielu innych dziedzinach machine learning, etykietowanie jest nieuniknioną butelką szyjkową. W tym przypadku badacze użyli półautomatycznego systemu etykietowania, który wykorzystuje wcześniejsze badania eKare, które zastosowały modele ran zrobione z plasteliny i pomalowane dla kontekstu semantycznego.

Modele ran eKare

Modele ran eKare

Badacze zauważyli problem, który często występuje we wstępnych etapach szkolenia, gdy zbiór danych jest bardzo zróżnicowany, a wagi są losowe – model potrzebuje długiego czasu (75 epok), aby “usiąść”:

Gdzie dane są zróżnicowane, zarówno modele GAN, jak i encoder/decoder mają trudności z uzyskaniem uogólnienia we wczesnych etapach, jak można zobaczyć w powyższym wykresie szkolenia WG2GAN, który śledzi przebieg szkolenia od początku do straty zero.

Należy zachować ostrożność, aby proces szkolenia nie skupił się na cechach lub charakterystyce jednej iteracji lub epoki, ale raczej kontynuował uogólnianie do użytecznego średniego błędu bez wytwarzania wyników, które w nadmiarze abstrahują materiał źródłowy. W przypadku WG2GAN, to ryzyko stworzenia nieograniczonych, całkowicie “fikcyjnych” ran, połączonych między zbyt szerokim zakresem niepowiązanych typów ran, zamiast wytwarzania dokładnego zakresu wariacji w ramach danego typu rany.

Kontrolowanie zakresu w zbiorze danych machine learning

Modele z lżejszymi zbiorami danych uogólniają szybciej, a autorzy pracy twierdzą, że najbardziej realistyczne obrazy mogą być uzyskane przy ustawieniach mniejszych niż maksymalne: zbiór 1000 obrazów szkolonych przez 200 epok.

Chociaż mniejsze zbiory danych mogą osiągnąć bardzo realistyczne obrazy w krótszym czasie, zakres obrazów i typów ran wygenerowanych będzie koniecznie bardziej ograniczony. Istnieje delikatna równowaga w szkoleniu modeli GAN i encoder/decoder między objętością i różnorodnością danych wejściowych, wiernością wytwarzanych obrazów i realistycznością wytwarzanych obrazów — kwestie zakresu i wag, które nie są ograniczone do syntezy obrazów medycznych.

Nierównowaga klas w zbiorach danych medycznych

Ogólnie, machine learning w ochronie zdrowia jest dotknięty nie tylko brakiem zbiorów danych, ale także nierównowagą klas, gdzie istotne dane na temat konkretnego schorzenia stanowią tak mały procent jego zbioru danych, że ryzykują być odrzucone jako dane outlier lub zostać wchłonięte w procesie uogólnienia podczas szkolenia.

Istnieje wiele metod, które zostały zaproponowane w celu rozwiązania tego problemu, takich jak niedouszczanie lub naduszczanie. Jednak problem jest często omijany przez rozwijanie zbiorów danych specyficznych dla chorób, które są całkowicie związane z jednym problemem medycznym. Chociaż ten podejście jest skuteczne w przypadku poszczególnych przypadków, przyczynia się do kultury Balkanizacji w dziedzinie badań machine learning w ochronie zdrowia i prawdopodobnie spowalnia postęp ogólny w sektorze.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai