Anderson’un Açısı

Yeşil Ekran Jenerasyonu için Stable Diffusion’un İyileştirilmesi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

Topluluğun ve yatırımcıların görsel generatif AI’ye yönelik coşkusu rağmen, bu sistemlerin çıktısı her zaman gerçek dünya kullanımına hazır değildir; bir örnek, gen AI sistemlerinin genellikle bireysel, izole edilmiş öğeler yerine (video için ise bir dizi görüntü) tüm görüntüleri çıkardığıdır ve bu, çoklu ortamlarda ve görsel efekt uygulamalarında genellikle gerekli olan türden değildir.

Bunun basit bir örneği, kullanıcı tarafından seçilen hedef arka planın üzerine “yüzmek” üzere tasarlanmış kliptir:

Hafif gri checkered arka plan, muhtemelen Photoshop kullanıcıları için en çok tanınan, alpha kanalı veya şeffaflık kanalı olarak temsil eder, hatta basit tüketici ürünlerinde olduğu gibi stok görüntülerde bile.

Hafif gri checkered arka plan, muhtemelen Photoshop kullanıcıları için en çok tanınan, alpha kanalı veya şeffaflık kanalı olarak temsil eder, hatta basit tüketici ürünlerinde olduğu gibi stok görüntülerde bile.

Bu tür şeffaflık, dijital devrimin başlangıcından bu yana, yani 1990’ların başından bu yana yaklaşık otuz yıldır mevcuttur; kullanıcılar, video ve görüntülerden öğeleri giderek daha gelişmiş bir dizi araç seti ve teknik kullanarak çıkarabilmiştir.

Örneğin, video görüntülerindeki mavi ekran ve yeşil ekran arka planlarını “düşürme” challenge’ı, bir zamanlar pahalı kimyasal süreçler ve optik yazıcılar (ve el yapımı matlar) tarafından gerçekleştirilen bir iş, Adobe’ nin After Effects ve Photoshop uygulamaları (ve birçok diğer ücretsiz ve özel program ve sistem) gibi sistemlerde dakikalar içinde gerçekleştirilebilecek bir iş haline gelmiştir.

Bir öğe izole edildikten sonra, alpha kanalı (aslında, ilgili olmayan içeriği gizleyen bir maske) videodaki herhangi bir öğeyi yeni arka planlar üzerine kolayca süperpoze etmeyi veya diğer izole edilmiş öğelerle birlikte oluşturmayı sağlar.

Alpha kanallarının örnekleri, alt satırda efektleri ile birlikte gösterilmiştir. Kaynak: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Alpha kanallarının örnekleri, alt satırda efektleri ile birlikte gösterilmiştir. Kaynak: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Düşürme

Bilgisayarlı görme alanında, alpha kanallarının oluşturulması, anlamsal segmentasyon kapsamında yer alır ve Meta’nın Segment Anything gibi açık kaynaklı projeler, metin ile uyumlu nesne tanıma yoluyla hedef nesneleri izole etmek ve çıkarmak için bir yöntem sağlar.

Segment Anything çerçevesi, Alpha-CLIP projesi gibi çeşitli görsel efekt çıkarma ve izolasyon iş akışlarında kullanılmıştır.

Segment Anything kullanarak Alpha-CLIP çerçevesinde yapılan çıkarımların örnekleri: Kaynak: https://arxiv.org/pdf/2312.03818

Segment Anything kullanarak Alpha-CLIP çerçevesinde yapılan çıkarımların örnekleri: Kaynak: https://arxiv.org/pdf/2312.03818

Anlamsal segmentasyon, eğitilmiş verilerden faydalanır, ancak bu veriler her zaman gerekli olan tüm nesne kategorilerini içermeyebilir. Yüksek hacimli verilerle eğitilmiş modeller, daha geniş bir nesne yelpazesini tanıyabilse de, yine de en iyi şekilde eğitildikleri sınıflarla sınırlıdırlar.

Anlamsal segmentasyon sistemleri, belirli nesneleri veya nesne parçalarını tanımlamakta zorlanabilir, burada gösterildiği gibi belirsiz promt'lerin çıktıları. Kaynak: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Anlamsal segmentasyon sistemleri, belirli nesneleri veya nesne parçalarını tanımlamakta zorlanabilir, burada gösterildiği gibi belirsiz promt’lerin çıktıları. Kaynak: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Her durumda, anlamsal segmentasyon, yeşil ekran prosedürü gibi, bir sonraki süreçtir ve tek bir arka plan renk swatchesını tanıyıp kaldırma avantajı olmadan öğeleri izole etmelidir.

Bu nedenle, kullanıcı topluluğuna, görüntülerin ve videoların yeşil ekran arka planları ile oluşturulabileceği ve geleneksel yöntemlerle kolayca kaldırılabileceği düşüncesi gelmiştir.

Maalesef, popüler latent difüzyon modelleri gibi Stable Diffusion, genellikle gerçekten canlı bir yeşil ekran oluşturmada zorluk çekebilir. Bu, modellerin eğitim verilerinin bu özel senaryoya çok fazla örnek içermemesinden kaynaklanmaktadır. Sistem başarılı olduğunda, “yeşil” kavramı, kavram bağlantısı nedeniyle ön plan konusuna yayılma eğilimindedir:

Üstte, Stable Diffusion'un görüntüde otantiklikten, tek bir yeşil yoğunluğunu oluşturma ihtiyacına öncelik verdiğini görüyoruz, böylece geleneksel yeşil ekran senaryolarında ortaya çıkan gerçek dünya sorunlarını etkili bir şekilde yeniden üretiyor. Altta, 'yeşil' kavramının ön plan görüntüsünü bozduğunu görüyoruz. 'Yeşil' kavramına odaklanma arttıkça, bu sorun daha da kötüleşecektir. Kaynak: https://stablediffusionweb.com/

Üstte, Stable Diffusion’un görüntüde otantiklikten, tek bir yeşil yoğunluğunu oluşturma ihtiyacına öncelik verdiğini görüyoruz, böylece geleneksel yeşil ekran senaryolarında ortaya çıkan gerçek dünya sorunlarını etkili bir şekilde yeniden üretiyor. Altta, ‘yeşil’ kavramının ön plan görüntüsünü bozduğunu görüyoruz. Kaynak: https://stablediffusionweb.com/

İleri yöntemlere rağmen, her iki kadın ve erkek görüntüsündeki (alttaki görüntülerde) elbise ve kravat, yeşil arka planla birlikte “düşer” – 1970’ler ve 1980’lerde foto-kimyasal emülsiyon boyası kaldırma günlerinden kalma bir sorun.

Sistemlerin eksiklikleri, belirli verileri bir soruna yönlendirmek ve önemli eğitim kaynakları ayırmak suretiyle aşılabiliyor. Stanford’un 2024’te sunduğu LayerDiffuse gibi sistemler, alpha kanalları ile görüntüler oluşturabilen ince ayarlanmış bir model oluşturur:

Stanford LayerDiffuse projesi, modeli şeffaflık yetenekleri ile donatmak için bir milyonluk uygun görüntülerle eğitildi. Kaynak: https://arxiv.org/pdf/2402.17113

Stanford LayerDiffuse projesi, modeli şeffaflık yetenekleri ile donatmak için bir milyonluk uygun görüntülerle eğitildi. Kaynak: https://arxiv.org/pdf/2402.17113

Maalesef, bu yaklaşımın yanı sıra, LayerDiffuse için kullanılan veri kümesi kamuyla paylaşılmamaktadır, bu da modelin kullanımını kısıtlamaktadır. Ayrıca, bu yaklaşım, özel durumlar için özelleştirilmekte veya geliştirilmekte zorluklarla karşılaşmaktadır.

2024’ün稍後 döneminde, Adobe Research, Stonybrook Üniversitesi ile işbirliği yaparak, özel difüzyon görüntülerinden oluşan bir AI çıkarma yaklaşımı olan MAGICK üretti.

2024 makalesinden, MAGICK'te ince alpha kanal çıkarma örneği. Kaynak: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

2024 makalesinden, MAGICK’te ince alpha kanal çıkarma örneği. Kaynak: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

MAGICK, 150.000 çıkarılan, AI tarafından oluşturulan nesnelerle eğitildi, böylece sistem çıkarmayı anlar:

MAGICK eğitim veri kümesinden örnekler.

MAGICK eğitim veri kümesinden örnekler.

Bu veri kümesi, kaynak makalede belirtildiği gibi, difüzyon yöntemlerinin katı renk yamaları oluşturma zorluğu nedeniyle çok zor oluşturulmuştur. Bu nedenle, oluşturulan maskelerin manuel seçimi gerekliydi.

Bu lojistik tıkanıklık, yine de geliştirilemeyen veya özelleştirilemeyen, ancak ilk olarak eğitildiği yetenek kapsamında kullanılan bir sistemle sonuçlanır.

TKG-DM – ‘Yerel’ Kroma Çıkarma için Latent Difüzyon Modeli

Alman ve Japon araştırmacıların yeni bir işbirliği, yukarıda bahsedilen yöntemlerden daha iyi sonuçlar elde edebilen, ancak özel olarak hazırlanmış veri kümeleri üzerinde eğitim gerektirmeyen bir alternatif önerdi.

TKG-DM, bir generatif görüntüyü başlatan rastgele gürültüyü değiştirir, böylece herhangi bir renkte katı, anahtarlama için uygun bir arka plan üretme yeteneğini artırır. Kaynak: https://arxiv.org/pdf/2411.15580

TKG-DM, bir generatif görüntüyü başlatan rastgele gürültüyü değiştirir, böylece herhangi bir renkte katı, anahtarlama için uygun bir arka plan üretme yeteneğini artırır. Kaynak: https://arxiv.org/pdf/2411.15580

Yeni yöntem, problemi rastgele gürültüyi optimize ederek, bir latent difüzyon modeli (LDM) gibi Stable Diffusion düzeyinde ele alır.

Yaklaşım, önceki bir araştırmaya dayanır ve herhangi bir arka plan rengi oluşturabilir, diğer yöntemlere kıyasla daha az (veya hiç) anahtar arka plan renginin ön plan içeriğine karışmasıyla.

İlk gürültü, kanalların ortalama kaymasını koşullandırır, böylece gürültü giderme sürecini etkileyebilir, ancak renk sinyalini ön plan içeriğine karıştırmaz.

İlk gürültü, kanalların ortalama kaymasını koşullandırır, böylece gürültü giderme sürecini etkileyebilir, ancak renk sinyalini ön plan içeriğine karıştırmaz.

Makale şöyle diyor:

‘Geniş kapsamlı deneylerimiz, TKG-DM’in FID ve mask-FID puanlarını sırasıyla %33,7 ve %35,9 oranında iyileştirdiğini gösteriyor.

‘Bu nedenle, eğitim gerektirmeyen modelimiz, ince ayarlanmış modellerle rekabet ediyor ve çeşitli görsel içerik oluşturma görevleri için precisa ön plan ve arka plan kontrolü sunuyor.’

Yeni makale, TKG-DM: Eğitim Gerektirmeyen Kroma Anahtarlama İçeriği Oluşturma Difüzyon Modeli olarak adlandırılmış ve Tokyo’daki Hosei Üniversitesi ve Kaiserslautern’deki RPTU Kaiserslautern-Landau & DFKI GmbH’dan yedi araştırmacı tarafından sunulmuştur.

Yöntem

Yeni yaklaşım, Stable Diffusion mimarisini, kanal ortalama kayması (CMS) ile ilk Gaussian gürültüsünü koşullandırarak genişletir, bu da üretilen görüntüde arzu edilen arka plan ve ön plan ayrımını teşvik eden gürültü desenleri üretir.

Önerilen sistemin iş akışı şeması.

Önerilen sistemin iş akışı şeması.

CMS, her renk kanalının ortalamasını ayarlar, ancak gürültü giderme sürecinin genel gelişimini korur.

Yazarlar şöyle diyor:

‘Kroma anahtarlama arka planında ön plan nesnesini üretmek için, ilk gürültü seçimi stratejisi uyguluyoruz, bu da 2D Gaussian kullanarak ilk [gürültü] ve init renk [gürültü]sini birleştirir.

‘Bu maske, orijinal gürültüyü ön plan bölgesinde korurken, renk kaydırılmış gürültüyü arka plan bölgesine uygulayarak bir geçiş oluşturur.’

Arka plan kroma rengi için istenen renk kanalı, boş bir metin promtu ile oluşturulurken, gerçek ön plan içeriği kullanıcıların metin talimatından semantik olarak oluşturulur.

Arka plan kroma rengi için istenen renk kanalı, boş bir metin promtu ile oluşturulurken, gerçek ön plan içeriği kullanıcıların metin talimatından semantik olarak oluşturulur.

Kendine dikkat ve çapraz dikkat kullanılarak, görüntünün iki yönü (kroma arka planı ve ön plan içeriği) ayrılır. Kendine dikkat, ön plan nesnesinin iç tutarlılığını sağlar, mentre çapraz dikkat, metin promtuna bağlılığı korur. Makale, arka plan görüntüsünün genellikle daha az ayrıntılı ve vurgulanmadığına dikkat çeker, bu nedenle etkisinin daha zayıf olması ve saf bir renk yamasıyla değiştirilmesi daha kolaydır.

Kroma-stil oluşturma sürecinde kendine dikkat ve çapraz dikkat etkisinin görselleştirilmesi.

Kroma-stil oluşturma sürecinde kendine dikkat ve çapraz dikkat etkisinin görselleştirilmesi.

Veri ve Testler

TKG-DM, Stable Diffusion V1.5 ve Stable Diffusion SDXL ile test edilmiştir. Görüntüler 512x512px ve 1024x1024px olarak oluşturulmuştur.

Görüntüler, Stable Diffusion’un yerli DDIM zamanlayıcı kullanılarak, 7,5’lik bir yönlendirme ölçeği ile ve 50 gürültü giderme adımı ile oluşturulmuştur. Hedef arka plan rengi yeşildi, şimdi baskın düşme yöntemi.

Yeni yaklaşım, DeepFloyd ile MAGICK için kullanılan ayarlarla karşılaştırıldı; düşük dereceli difüzyon modeli GreenBack LoRA ile; ve ayrıca LayerDiffuse ile.

Veri için, MAGICK veri kümesinden 3000 görüntü kullanıldı.

MAGICK veri kümesinden örnekler, yeni sistemin testlerinde kullanılmıştır. Kaynak: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

MAGICK veri kümesinden örnekler, yeni sistemin testlerinde kullanılmıştır. Kaynak: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Metrikler için, yazarlar Fréchet Inception Distance (FID) kullanmıştır. Ayrıca, BiRefNet sistemini kullanarak projeye özel bir metrik geliştirdiler, bu da oluşturulan maske kalitesini değerlendirir.

Önceki yöntemlerle BiRefNet sisteminin görsel karşılaştırmaları. Kaynak: https://arxiv.org/pdf/2401.03407

Önceki yöntemlerle BiRefNet sisteminin görsel karşılaştırmaları. Kaynak: https://arxiv.org/pdf/2401.03407

Giriş promtlarıyla semantik hizalamayı test etmek için, CLIP-Sentence (CLIP-S) ve CLIP-Image (CLIP-I) yöntemleri kullanıldı. CLIP-S, promt sadakatini değerlendirir, CLIP-I ise görsel benzerliği değerlendirir.

Yeni yöntemin ilk nitel sonuçları, bu kez Stable Diffusion V1.5 için. Daha iyi bir çözünürlük için lütfen kaynak PDF'ye bakın.

Yeni yöntemin ilk nitel sonuçları, bu kez Stable Diffusion V1.5 için. Daha iyi bir çözünürlük için lütfen kaynak PDF’ye bakın.

Yazarlar, sonuçların (yukarıda ve aşağıda gösterilen, SD1.5 ve SDXL için) TKG-DM’in, promt mühendisliği veya model eğitimi gerektirmeden üstün sonuçlar elde ettiğini gösterdiğini iddia ediyorlar.

SDXL nitel sonuçları. Daha iyi bir çözünürlük için lütfen kaynak PDF'ye bakın.

SDXL nitel sonuçları. Daha iyi bir çözünürlük için lütfen kaynak PDF’ye bakın.

Onlar, Stable Diffusion 1.5’in, yeşil arka plan oluşturma konusunda zorluk çektiğini, SDXL’in (biraz daha iyi performans gösterse de) istikrarsız açık yeşil tonları ürettiğini ve kroma işlemesinde ayırma ile interferansa neden olabileceğini gözlemlediler.

Ayrıca, LayerDiffuse’un iyi ayrılmış arka planlar ürettiğini, ancak bazen detayları (örneğin, precisa sayılar veya harfler) kaybettiğini ve yazarların bunu veri kümesindeki sınırlamalara bağladığını not ettiler. Ayrıca, maske oluşturmanın bazen başarısız olabileceğini ve “kesilmemiş” görüntülere neden olabileceğini eklediler.

Niteliksel testlerde, LayerDiffuse’un SDXL için FID’de bir avantajı olsa da, yazarlar bu avantajın, efektif bir şekilde “hazır” ve esnek olmayan bir ürün oluşturan özel bir veri kümesinden kaynaklandığını vurguladılar. Veri kümesinde temsil edilmeyen veya yetersiz temsil edilen herhangi bir nesne veya sınıf, aynı düzeyde performans göstermeyebilir ve bu sınıfları kapsamak için daha fazla fine-tuning, kullanıcıya bir kürasyon ve eğitim yükü getirir.

Karşılaştırmaların nicel sonuçları. Makale, LayerDiffuse'un görünür avantajının, esneklikten ve veri kürasyonu ve eğitim yükünden kaynaklandığını ima ediyor.

Karşılaştırmaların nicel sonuçları. Makale, LayerDiffuse’un görünür avantajının, esneklikten ve veri kürasyonu ve eğitim yükünden kaynaklandığını ima ediyor.

Makale şöyle diyor:

‘DeepFloyd’un yüksek FID, m-FID ve CLIP-I puanları, DeepFloyd’un çıktılarının gerçek değerlere benzerliğini yansıtır. Ancak bu, onu adil bir benchmark olarak kullanmasını engelleyen bir avantaja sahiptir. Daha düşük CLIP-S puanı, metin hizalamasında diğer modellere kıyasla daha zayıf performans gösterdiğini gösterir.’

‘Genel olarak, bu sonuçlar, modelimizin yüksek kaliteli, metinle uyumlu ön planlar oluşturma yeteneğini vurgular ve fine-tuning gerektirmeden etkili bir kroma anahtarlama içeriği oluşturma çözümü sunar.’

Son olarak, araştırmacılar, çeşitli yöntemlerin promt uyumu konusunda kullanıcıların tercihlerini değerlendirmek için bir kullanıcı çalışması gerçekleştirdiler. Yüz katılımcı, her yöntemden 30 görüntü çiftini değerlendirdi, konular BiRefNet ve tüm örneklerde manuel düzeltmeler kullanılarak çıkarıldı. Yazarların eğitim gerektirmeyen yaklaşımı bu çalışmada tercih edildi.

Kullanıcı çalışması sonuçları.

Kullanıcı çalışması sonuçları.

TKG-DM, Stable Diffusion için popüler üçüncü taraf sistemi ControlNet ile uyumludur ve yazarlar, bu tür bir ayırma için ControlNet’in yerel yeteneklerinden daha iyi sonuçlar ürettiğini iddia ediyorlar.

Sonuç

Bu yeni makaleden belki de en önemli çıkarım, latent difüzyon modellerinin, popüler kamu algısına rağmen, görüntülerin ve videoların çeşitli yönlerini ayırma konusunda ne kadar iç içe geçtiğidür.

Çalışma, ayrıca, araştırmacı ve hobi topluluğunun, modellerin eksikliklerini gidermek için fine-tuning’e yönelme derecesini vurgulamaktadır – bu, her zaman belirli sınıflar ve nesne türleri için bir çözüm olacaktır. Bu durumda, fine-tune edilmiş bir model, sınırlı bir sınıf veya nesne türleri için çok iyi çalışabilir veya daha fazla veri ile eğitilmişse, daha geniş bir sınıf ve nesne yelpazesi için makul bir şekilde çalışabilir.

Bu nedenle, en azından bir çözümün, böyle zahmetli ve tartışmalı çözümlere başvurmadan, bu sorunları ele alması memnun edici.

 

* 1978 yapımı Superman filminin çekimleri sırasında, aktör Christopher Reeve, mavi kostümün silinmesini önlemek için mavi ekran çekimlerinde turkuaz Superman kostümü giymek zorunda kaldı. Kostümün mavi rengi daha sonra renk düzeltme yoluyla geri yüklenmiştir.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'nin Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]