Kąt Andersona

Ulepszanie generacji ekranu zielonego dla stabilnej dyfuzji

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

Pomimo entuzjazmu społeczności i inwestorów wokół generatywnej sztucznej inteligencji wizualnej, wyjście z takich systemów nie zawsze jest gotowe do użycia w świecie rzeczywistym; jednym z przykładów jest to, że systemy AI generują całe obrazy (lub serię obrazów w przypadku wideo), zamiast pojedynczych, izolowanych elementów, które są zwykle wymagane do różnorodnych aplikacji w multimediach i dla praktyków efektów wizualnych.

Prosty przykład to clip-art zaprojektowany, aby “unosić się” nad wybranym przez użytkownika tłem:

The light-grey checkered background, perhaps most familiar to Photoshop users, has come to represent the alpha channel, or transparency channel, even in simple consumer items such as stock images.

The light-grey checkered background, perhaps most familiar to Photoshop users, has come to represent the alpha channel, or transparency channel, even in simple consumer items such as stock images.

Przezroczystość tego rodzaju była powszechnie dostępna od ponad trzydziestu lat; od rewolucji cyfrowej w początkach lat 90., użytkownicy mogli wyodrębnić elementy z wideo i obrazów za pomocą coraz bardziej zaawansowanych zestawów narzędzi i technik.

Na przykład, wyzwanie “wypuszczania” tła niebieskiego i zielonego w nagraniach wideo, które wcześniej było domeną drogich procesów chemicznych i optycznych drukarek (oraz ręcznie wykonanych mat), stało się pracą kilku minut w systemach takich jak Adobe’s After Effects i aplikacje Photoshop (wśród wielu innych bezpłatnych i własnościowych programów i systemów).

Gdy element został wyodrębniony, kanał alfa (efektywnie maska, która zasłania nieistotną zawartość) pozwala na łatwe nałożenie dowolnego elementu wideo na nowe tło lub składanie go z innymi wyodrębnionymi elementami.

Examples of alpha channels, with their effects depicted in the lower row. Source: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Examples of alpha channels, with their effects depicted in the lower row. Source: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Wypuszczanie

W komputerowym widzeniu, tworzenie kanałów alfa należy do zakresu segmentacji semantycznej, z projektami open source, takimi jak Meta’s Segment Anything, które zapewniają metodę wyodrębniania/ekstrakcji obiektów docelowych za pomocą rozpoznawania obiektów wzbogaconego semantycznie.

Ramka Segment Anything została wykorzystana w szerokim zakresie przepływów pracy ekstrakcji i izolacji efektów wizualnych, takich jak projekt Alpha-CLIP.

Example extractions using Segment Anything, in the Alpha-CLIP framework: Source: https://arxiv.org/pdf/2312.03818

Example extractions using Segment Anything, in the Alpha-CLIP framework: Source: https://arxiv.org/pdf/2312.03818

Istnieją wiele alternatywnych metod segmentacji semantycznej, które mogą być dostosowane do zadania przypisywania kanałów alfa.

Jednak segmentacja semantyczna opiera się na danych szkoleniowych, które mogą nie zawierać wszystkich kategorii obiektów, które są wymagane do wyodrębnienia. Chociaż modele szkolone na bardzo dużych ilościach danych mogą umożliwić rozpoznanie szerszego zakresu obiektów (efektywnie stając się modelami podstawowymi lub modelami świata), są one jednak ograniczone przez klasy, które są najskuteczniej szkolone.

Semantic segmentation systems such as Segment Anything can struggle to identify certain objects, or parts of objects, as exemplified here in output from ambiguous prompts. Source: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Semantic segmentation systems such as Segment Anything can struggle to identify certain objects, or parts of objects, as exemplified here in output from ambiguous prompts. Source: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

W każdym razie, segmentacja semantyczna jest tak samo post facto procesem, jak procedura zielonego ekranu, i musi izolować elementy bez zalety pojedynczej, rozpoznawalnej barwy tła, która może być skutecznie usunięta.

Dlatego czasami zdarzało się, że społeczność użytkowników miała pomysł, aby generować obrazy i wideo, które zawierają tło zielonego ekranu, które mogą być natychmiast usunięte za pomocą konwencjonalnych metod.

Niestety, popularne modele dyfuzji latentnej, takie jak Stable Diffusion, często mają trudności z renderowaniem naprawdę żywego zielonego ekranu. Jest to spowodowane tym, że dane szkoleniowe tych modeli nie zawierają wielu przykładów tego dość specjalistycznego scenariusza. Nawet gdy system się powiedzie, idea “zielonego” tendencji do rozprzestrzeniania się w niepożądany sposób na pierwszoplanowy przedmiot, ze względu na splątanie pojęć:

Above, we see that Stable Diffusion has prioritized authenticity of image over the need to create a single intensity of green, effectively replicating real-world problems that occur in traditional green screen scenarios. Below, we see that the 'green' concept has polluted the foreground image. The more the prompt focuses on the 'green' concept, the worse this problem is likely to get. Source: https://stablediffusionweb.com/

Above, we see that Stable Diffusion has prioritized authenticity of image over the need to create a single intensity of green, effectively replicating real-world problems that occur in traditional green screen scenarios. Below, we see that the ‘green’ concept has polluted the foreground image. The more the prompt focuses on the ‘green’ concept, the worse this problem is likely to get. Source: https://stablediffusionweb.com/

Pomimo zaawansowanych metod, zarówno suknia kobiety, jak i krawat mężczyzny (na dolnych obrazach widocznych powyżej) tendencji do “wypuszczania” wraz z tłem zielonym – problem, który sięga do czasów usunięcia barwników fotochemicznych w latach 70. i 80.

Jak zawsze, niedociągnięcia modelu można pokonać, rzucając konkretnych danych na problem i poświęcając znaczne zasoby szkoleniowe. Systemy takie jak Stanford’s 2024 oferta LayerDiffuse tworzą dostosowany model, który jest w stanie generować obrazy z kanałami alfa:

The Stanford LayerDiffuse project was trained on a million apposite images capable of imbuing the model with transparency capabilities. Source: https://arxiv.org/pdf/2402.17113

The Stanford LayerDiffuse project was trained on a million apposite images capable of imbuing the model with transparency capabilities. Source: https://arxiv.org/pdf/2402.17113

Niestety, oprócz znacznych zasobów kuracji i szkolenia wymaganych do tego podejścia, zestaw danych użyty do LayerDiffuse nie jest dostępny publicznie, ograniczając użycie modeli szkolonych na nim. Nawet gdyby to ograniczenie nie istniało, to podejście to jest trudne do dostosowania lub rozwoju dla konkretnych przypadków użycia.

Nieco później w 2024 roku, Adobe Research współpracował z Uniwersytetem Stonybrook, aby wyprodukować MAGICK, podejście AI do ekstrakcji, szkolone na obrazach dyfuzji wygenerowanych na zamówienie.

From the 2024 paper, an example of fine-grained alpha channel extraction in MAGICK. Source: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

From the 2024 paper, an example of fine-grained alpha channel extraction in MAGICK. Source: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

150 000 wyodrębnionych, AI-wygenerowanych obiektów zostało użytych do szkolenia MAGICK, aby system mógł rozwinąć intuicyjne zrozumienie ekstrakcji:

Samples from the MAGICK training dataset.

Samples from the MAGICK training dataset.

Ten zestaw danych, jak stwierdza artykuł źródłowy, był bardzo trudny do wygenerowania z powodu wspomnianego wcześniej powodu – że metody dyfuzji mają trudności z tworzeniem solidnych, kluczowych obszarów koloru. Dlatego konieczne było ręczne wybieranie wygenerowanych mat.

Ten logistyczny wąski gardziełek prowadzi ponownie do systemu, który nie może być łatwo rozwijany lub dostosowywany, ale musi być używany w ramach jego początkowo wytrenowanego zakresu możliwości.

TKG-DM – ‘Rodzima’ Ekstrakcja Chroma dla Modelu Dyfuzji Latentnej

Nowa współpraca między niemieckimi i japońskimi badaczami zaproponowała alternatywę dla takich wytrenowanych metod, zdolną – jak stwierdza artykuł – do uzyskania lepszych wyników niż wymienione powyżej metody, bez potrzeby szkolenia na specjalnie przygotowanych zestawach danych.

TKG-DM alters the random noise that seeds a generative image so that it is better-capable of producing a solid, keyable background – in any color. Source: https://arxiv.org/pdf/2411.15580

TKG-DM alters the random noise that seeds a generative image so that it is better-capable of producing a solid, keyable background – in any color. Source: https://arxiv.org/pdf/2411.15580

Nowe podejście podejmuje problem na poziomie generacji, optymalizując losowy szum z którego generowany jest obraz w modelu dyfuzji latentnej (LDM) takim jak Stable Diffusion.

Podejście to opiera się na poprzednim badaniu schematu kolorów w rozkładzie Stable Diffusion i jest w stanie produkować tło dowolnego koloru, z mniejszym (lub żadnym) splątaniem koloru tła z treścią pierwszoplanową w porównaniu z innymi metodami.

Initial noise is conditioned by a channel mean shift that is able to influence aspects of the denoising process, without entangling the color signal into the foreground content.

Initial noise is conditioned by a channel mean shift that is able to influence aspects of the denoising process, without entangling the color signal into the foreground content.

Artykuł stwierdza:

‘Nasze obszerne eksperymenty dowodzą, że TKG-DM poprawia wyniki FID i mask-FID o 33,7% i 35,9%, odpowiednio.

‘Thus, our training-free model rivals fine-tuned models, offering an efficient and versatile solution for various visual content creation tasks that require precise foreground and background control. ‘

Nowy artykuł nosi tytuł TKG-DM: Training-free Chroma Key Content Generation Diffusion Model i pochodzi od siedmiu badaczy z Uniwersytetu Hosei w Tokio i RPTU Kaiserslautern-Landau & DFKI GmbH, w Kaiserslautern.

Metoda

Nowe podejście rozszerza architekturę Stable Diffusion, warunkując początkowy szum Gaussa za pomocą przesunięcia średniego kanału (CMS), które produkuje wzorce szumu zaprojektowane do zachęcania pożądanej separacji tła i pierwszoplanu w wygenerowanym wyniku.

Schema for the workflow of the proposed system.

Schema for the the proposed system.

CMS dostosowuje średnią każdego kanału koloru, utrzymując ogólny rozwój procesu denoisingu.

Autorzy wyjaśniają:

‘To generate the foreground object on the chroma key background, we apply an init noise selection strategy that selectively combines the initial [noise] and the init color [noise] using a 2D Gaussian [mask].

‘This mask creates a gradual transition by preserving the original noise in the foreground region and applying the color-shifted noise to the background region.’

The color channel desired for the background chroma color is instantiated with a null text prompt, while the actual foreground content is created semantically, from the user's text instruction.

The color channel desired for the background chroma color is instantiated with a null text prompt, while the actual foreground content is created semantically, from the user’s text instruction.

Self-attention i cross-attention są używane do separacji dwóch aspektów obrazu (tła chroma i treści pierwszoplanowej). Self-attention pomaga w spójności wewnętrznej obiektu pierwszoplanowego, podczas gdy cross-attention utrzymuje wierność w stosunku do podpowiedzi tekstowej. Artykuł zauważa, że ponieważ tło jest zwykle mniej szczegółowe i podkreślane w generowanych obrazach, jego słabszy wpływ jest względnie łatwy do pokonania i zastąpienia płaskim kolorem.

A visualization of the influence of self-attention and cross-attention in the chroma-style generation process.

A visualization of the influence of self-attention and cross-attention in the chroma-style generation process.

Dane i testy

TKG-DM został przetestowany przy użyciu Stable Diffusion V1.5 i Stable Diffusion SDXL. Obrazy zostały wygenerowane w rozdzielczości 512x512px i 1024x1024px, odpowiednio.

Obrazy zostały utworzone przy użyciu planisty DDIM rodzimego dla Stable Diffusion, przy skali wskazówki 7,5, z 50 krokami denoisingu. Celowe tło było zielone, obecnie dominująca metoda wypuszczania.

Nowe podejście zostało porównane do DeepFloyd, w ustawieniach używanych dla MAGICK; do dostosowanego modelu dyfuzji o niskim ranku GreenBack LoRA; oraz do wspomnianego wcześniej LayerDiffuse.

Dla danych, 3000 obrazów z zestawu danych MAGICK zostało użytych.

Examples from the MAGICK dataset, from which 3000 images were curated in tests for the new system. Source: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Examples from the MAGICK dataset, from which 3000 images were curated in tests for the new system. Source: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Dla metryk, autorzy użyli Fréchet Inception Distance (FID), aby ocenić jakość pierwszoplanu. Opracowali również metrykę specyficzną dla projektu, m-FID, która używa systemu BiRefNet, aby ocenić jakość wynikowej maski.

Visual comparisons of the BiRefNet system against prior methods. Source: https://arxiv.org/pdf/2401.03407

Visual comparisons of the BiRefNet system against prior methods. Source: https://arxiv.org/pdf/2401.03407

Aby przetestować semantyczną zgodność z podpowiedziami wejściowymi, użyto metod CLIP-Sentence (CLIP-S) i CLIP-Image (CLIP-I). CLIP-S ocenia wierność podpowiedzi, a CLIP-I podobieństwo wizualne do prawdy.

First set of qualitative results for the new method, this time for Stable Diffusion V1.5. Please refer to source PDF for better resolution.

First set of qualitative results for the new method, this time for Stable Diffusion V1.5. Please refer to source PDF for better resolution.

Autorzy twierdzą, że wyniki (wizualizowane powyżej i poniżej, SD1.5 i SDXL, odpowiednio) dowodzą, że TKG-DM osiąga lepsze wyniki bez inżynierii podpowiedzi lub konieczności szkolenia lub dostosowywania modelu.

SDXL qualitative results. Please refer to source PDF for better resolution.

SDXL qualitative results. Please refer to source PDF for better resolution.

Uwzględniają, że przy podpowiedzi, aby wywołać zielone tło w wygenerowanych wynikach, Stable Diffusion 1.5 ma trudności z generowaniem czystego tła, podczas gdy SDXL (chociaż wykonuje nieco lepiej) produkuje niestabilne, zielone odcienie, które mogą zakłócać separację w procesie chroma.

Stwierdzają ponadto, że chociaż LayerDiffuse generuje dobrze oddzielone tła, czasami traci szczegóły, takie jak precyzyjne numery lub litery, i autorzy przypisują to ograniczeniom w zestawie danych. Dodają, że generowanie masek czasami zawodzi, prowadząc do “nieobciętych” obrazów.

Dla testów ilościowych, chociaż LayerDiffuse wydaje się mieć przewagę w SDXL dla FID, autorzy podkreślają, że jest to wynik specjalnego zestawu danych, który skutecznie stanowi “upieczony” i nieelastyczny produkt. Jak wcześniej wspomniano, jakikolwiek obiekt lub klasa nieobjęta tym zestawem danych, lub nieodpowiednio objęta, może nie działać tak dobrze, a dalsze dostosowanie do nowych klas nakłada na użytkownika ciężar kuracji i szkolenia.

Quantitative results for the comparisons. LayerDiffuse's apparent advantage, the paper implies, comes at the expense of flexibility, and the burden of data curation and training.

Quantitative results for the comparisons. LayerDiffuse’s apparent advantage, the paper implies, comes at the expense of flexibility, and the burden of data curation and training.

Artykuł stwierdza:

‘DeepFloyd’s high FID, m-FID, and CLIP-I scores reflect its similarity to the ground truth based on DeepFloyd’s outputs. However, this alignment gives it an inherent advantage, making it unsuitable as a fair benchmark for image quality. Its lower CLIP-S score further indicates weaker text alignment compared to other models.

Overall, these results underscore our model’s ability to generate high-quality, text-aligned foregrounds without fine-tuning, offering an efficient chroma key content generation solution.’

Wreszcie, badacze przeprowadzili badanie użytkowników, aby ocenić przestrzeganie podpowiedzi w różnych metodach. Sto uczestników zostało poproszonych o ocenę 30 par obrazów z każdej metody, z obiektami wyodrębnionymi za pomocą BiRefNet i ręcznymi poprawkami we wszystkich przykładach. Podejście treningowe autorów zostało preferowane w tym badaniu.

Results from the user study.

Results from the user study.

TKG-DM jest kompatybilny z popularnym ControlNet systemem trzeciej strony dla Stable Diffusion, a autorzy twierdzą, że produkuje lepsze wyniki niż rodzima zdolność ControlNet do osiągnięcia tego rodzaju separacji.

Wnioski

Być może najbardziej godny uwagi wniosek z tego nowego artykułu jest stopień, w jakim modele dyfuzji latentnej są splątane, w przeciwieństwie do powszechnego spostrzeżenia, że mogą one łatwo separować aspekty obrazów i wideo podczas generowania nowej zawartości.

Badanie to podkreśla również stopień, w jakim społeczność badawcza i hobbystyczna zwróciła się ku dostosowaniu jako post facto rozwiązaniu niedociągnięć modeli – rozwiązaniu, które zawsze będzie działać dobrze na ograniczonej liczbie klas, lub tolerancyjnie dobrze na znacznie większej liczbie możliwych klas i obiektów, zgodnie z większymi ilościami danych w zestawach szkoleniowych.

Dlatego jest odświeżające zobaczyć przynajmniej jedno rozwiązanie, które nie polega na takich mozolnych i niekiedy nieszczerych rozwiązaniach.

 

* Zdjęcia do filmu Superman z 1978 roku, aktor Christopher Reeve musiał nosić turkusowy kostium Supermana do zdjęć z niebieskim ekranem, aby uniknąć kasowania ikonicznego niebieskiego kostiumu. Kolor niebieski kostiumu został później przywrócony za pomocą korekcji koloru.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]