Modele i platformy AI

Wysokiej precyzji edycja semantyczna obrazów z EditGAN

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Sieci generatywne przeciwstawne lub GAN-y mają nowe zastosowania w branży edycji obrazów. Od kilku miesięcy EditGAN zyskuje popularność w branży AI/ML, ponieważ jest nowatorską metodą wysokiej precyzji i jakości edycji semantycznej obrazów.

Będziemy omawiać model EditGAN szczegółowo i wyjaśniać, dlaczego może okazać się kamieniem milowym w branży edycji semantycznej obrazów.

Zacznijmy. Ale zanim dowiemy się, co to jest EditGAN, ważne jest, aby zrozumieć, jakie jest znaczenie EditGAN i dlaczego jest to znaczący krok naprzód.

Dlaczego EditGAN?

Chociaż tradycyjne architektury GAN pomogły branży edycji obrazów opartej na AI znacznie się rozwinąć, istnieją pewne znaczące wyzwania związane z budową architektury GAN od podstaw.

  1. Podczas fazy szkolenia, architektura GAN wymaga dużej ilości danych oznaczonych z adnotacjami segmentacji semantycznej.
  2. Mogą one zapewnić tylko kontrolę na wysokim poziomie.
  3. I często po prostu interpolują między obrazami.

Można zaobserwować, że chociaż tradycyjne architektury GAN wykonują pracę, nie są one skuteczne dla szerokiej dystrybucji. Niskiej wydajności tradycyjnych architektur GAN jest powodem, dla którego EditGAN został wprowadzony przez NVIDIA (NVDA ) w 2022 roku.

EditGAN jest proponowany jako skuteczna metoda wysokiej precyzji i jakości edycji semantycznej obrazów, z możliwością umożliwienia użytkownikom edycji obrazów poprzez modyfikację ich szczegółowych masek segmentacji.

Model EditGAN jest zbudowany na ramie GAN, która modeluje obrazy i ich segmentacje semantyczne wspólnie, i wymaga tylko niewielkiej ilości danych oznaczonych lub adnotowanych.

Architektura ramy EditGAN pozwala modelowi nauczyć się dowolnej liczby wektorów edycji, które mogą być następnie zastosowane bezpośrednio do innych obrazów z wysoką szybkością i wydajnością.

Aby podsumować, dlaczego potrzebujemy EditGAN, jest to pierwsza ramka edycji obrazów oparta na GAN, która oferuje

  1. Bardzo wysoką precyzję edycji.
  2. Może działać z niewielką ilością danych oznaczonych.
  3. Może być wdrożony skutecznie w scenariuszach czasu rzeczywistego.
  4. Pozwala na kompozycję dla wielu edycji jednocześnie.
  5. Działa na obrazach wygenerowanych przez GAN, rzeczywistych i nawet poza domeną.

Wysokiej precyzji edycja semantyczna obrazów z EditGAN

StyleGAN2, najnowocześniejsza ramka GAN dla syntezy obrazów, jest podstawowym składnikiem generacji obrazów EditGAN.

StyleGAN2 jest głębokim modelem generatywnym, który został przeszkolony do syntezy obrazów o najwyższej możliwej jakości wraz z uzyskaniem zrozumienia semantycznego modelowanych obrazów.

Trening i inferencja segmentacji

Model EditGAN osadza obraz w przestrzeni latentnej GAN za pomocą optymalizacji i encodera do wykonania segmentacji na nowym obrazie i szkolenia gałęzi segmentacji.

W wyniku model osadza obrazów z adnotacjami semantycznymi z zestawu danych w przestrzeni latentnej i używa straty krzyżowej do szkolenia gałęzi segmentacji generatora.

Używanie edycji segmentacji do znalezienia semantyki w przestrzeni latentnej

Głównym celem EditGAN jest wykorzystanie wspólnej dystrybucji segmentacji semantycznej i obrazów do wysokiej precyzji edycji obrazów.

Różne sposoby edycji podczas inferencji

Wektory edycji uzyskane za pomocą optymalizacji mogą być opisane jako semantycznie znaczące i często są rozłączne z różnymi atrybutami.

Implementacja

Ramka EditGAN jest oceniana na obrazach z czterech różnych kategorii: Samochody, Ptaki, Koty i Twarze.

Wyniki

Wyniki jakościowe

Wyniki wewnątrz domeny

Powyższy obraz demonstruje wydajność ramki EditGAN podczas stosowania wcześniej nauczonych wektorów edycji na nowe obrazy i ulepszania ich za pomocą 30 kroków optymalizacji.

Wyniki ilościowe

Aby zmierzyć możliwości edycji obrazów EditGAN, model używa punktu odniesienia edycji uśmiechu, który został wprowadzony przez MaskGAN.

Ograniczenia

Ponieważ EditGAN opiera się na ramie GAN, ma te same ograniczenia, co każdy inny model GAN: może działać tylko z obrazami, które mogą być modelowane przez GAN.

Podsumowanie

Jednym z głównych powodów, dla których GAN nie jest standardem branżowym w polu edycji obrazów, jest ograniczona praktyczność.

EditGAN ma na celu rozwiązanie problemów przedstawionych przez konwencjonalne ramy GAN i próbuje być skuteczną metodą wysokiej jakości i precyzji edycji semantycznej obrazów.

"Inżynier z zawodu, pisarz z serca". Kunal jest technicznym pisarzem z głęboką miłością i zrozumieniem AI i ML, poświęconym uproszczeniu złożonych pojęć w tych dziedzinach poprzez swoje angażujące i informacyjne dokumentacje.