Anderson’un Açısı

İnsan Görüntülerini AI ile Geri Yüklemek ve Düzenlemek

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

California Üniversitesi Merced ve Adobe arasındaki yeni bir işbirliği, insan görüntü tamamlama alanında – yani görüntülerdeki gizli veya eksik kısımların ortaya çıkarılması görevi – devlet-sanatını ilerletiyor. Bu, sanal deneme, animasyon ve fotoğraf düzenleme gibi amaçlar için kullanılan bir görevdir.

Hasarlı görüntüleri onarma veya kullanıcıların isteğine göre değiştirme yanı sıra, CompleteMe gibi insan görüntü tamamlama sistemleri, mevcut görüntülere yeni giysiler ekleyebilir (ortadaki sütundaki bu iki örnekte olduğu gibi, ek referans görüntüsü aracılığıyla). Bu örnekler, yeni makalenin kapsamlı ek PDF'sinden alınmıştır. Kaynak: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Hasarlı görüntüleri onarma veya kullanıcıların isteğine göre değiştirme yanı sıra, CompleteMe gibi insan görüntü tamamlama sistemleri, mevcut görüntülere yeni giysiler ekleyebilir (ortadaki sütundaki bu iki örnekte olduğu gibi, ek referans görüntüsü aracılığıyla). Bu örnekler, yeni makalenin kapsamlı ek PDF’sinden alınmıştır. Kaynak: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Yeni yaklaşım, CompleteMe: Referans Tabanlı İnsan Görüntüsü Tamamlama olarak adlandırılmaktadır ve gizli veya eksik bölümü değiştirmek için sistem tarafından hangi içeriğin kullanılacağına dair ipuçları sağlamak için ek girdi görüntülerini kullanır (moda tabanlı deneme çerçevelerine uygulanabilirliği nedeniyle).

CompleteMe sistemi, referans içeriğini insan görüntüsünün gizli veya gizlenmiş kısmına uyarlayabilir.

CompleteMe sistemi, referans içeriğini insan görüntüsünün gizli veya gizlenmiş kısmına uyarlayabilir.

Yeni sistem, çift U-Net mimarisi ve Bölge Odaklı Dikkat (RFA) bloğu kullanır ve görüntü geri yükleme örneğinin ilgili alanına kaynakları yönlendirir.

Araştırmacılar ayrıca, referans tabanlı tamamlama görevlerini değerlendirmek için tasarlanmış yeni ve zorlu bir benchmark sistemi sunuyorlar (CompleteMe, bilgisayar vizyonunda devam eden bir araştırma dalının bir parçasıdır, ancak şimdiye kadar böyle bir benchmark şeması yoktur).

Testlerde ve iyi ölçeklenmiş bir kullanıcı çalışmasında, yeni yöntem çoğu metrikte öne çıktı ve genel olarak öne çıktı. Bazı durumlarda, rakip yöntemler referans tabanlı yaklaşım tarafından tamamen yanıltıldı.

Ek materyalden: AnyDoor yöntemi, referans görüntüsünü yorumlama konusunda özel zorluklar yaşamaktadır.

Ek materyalden: AnyDoor yöntemi, referans görüntüsünü yorumlama konusunda özel zorluklar yaşamaktadır.

Makalede şunlar belirtilmektedir:

‘Geniş deneylerimiz, CompleteMe’nin hem referans tabanlı hem de referans tabanlı olmayan güncel yöntemleri, nicel metrikler, nitel sonuçlar ve kullanıcı çalışmaları açısından aşmaktadır.

‘Özellikle karmaşık pozlar, karmaşık giysi desenleri ve ayırt edici aksesuarlar içeren zorlu senaryolarda, modelimiz her zaman üstün görsel doğruluk ve anlamsal tutarlılık elde etmektedir.’

Maalesef, projenin GitHub varlığı, kod içermez ve bu girişim, aynı zamanda mütevazi bir proje sayfasına sahiptir ve özel bir mimari olarak sunulmaktadır.

Yeni sistemin önceki yöntemlere göre subjektif performansının başka bir örneği. Makalede daha fazla ayrıntı bulunacaktır.

Yeni sistemin önceki yöntemlere göre subjektif performansının başka bir örneği. Makalede daha fazla ayrıntı bulunacaktır.

Yöntem

CompleteMe çerçevesi, réféns U-Net tarafından desteklenmektedir ve bu, yardımcı materyalin işleme sürecine entegrasyonunu işler ve birleşik bir U-Net, daha geniş bir süreç yelpazesini nihai sonuca ulaşmak için barındırır, aşağıdaki kavramsal şemada gösterildiği gibi.

CompleteMe'nin kavramsal şeması. Kaynak: https://arxiv.org/pdf/2504.20042

CompleteMe’nin kavramsal şeması. Kaynak: https://arxiv.org/pdf/2504.20042

Sistem, önce maskeleme girdi görüntüsünü gizli bir temsile kodlar. Aynı zamanda, Referans U-Net, farklı vücut bölgelerini gösteren birden fazla referans görüntüsünü işler ve ayrıntılı uzaysal özellikler çıkarır.

Bu özellikler, ‘tamamlayıcı’ U-Net’te bulunan Bölge Odaklı Dikkat bloğuna geçirilir ve burada, ilgili alanlara dikkat çekmek için kaynaklar yönlendirilir.

Özellikler, daha sonra global özellikler ile birleştirilir ve bu, modelin eksik içeriği hem ince detaylarla hem de anlamsal tutarlılıkla yeniden oluşturmasına olanak tanır.

Geri yüklemenin gerçekçiliğini ve dayanıklılığını artırmak için, girdi maskeleme işlemi, eşit olasılıkla uygulanacak rastgele ızgara tabanlı gizlemelerle birlikte insan vücut şekli maskelerini birleştirir, bu da modelin tamamlaması gereken eksik bölgenin karmaşıklığını artırır.

Referans İçin

İnsan görüntü tamamlama için önceki referans tabanlı yöntemler genellikle anlamsal düzeyde kodlayıcılara dayanıyordu. Bu tür projeler arasında CLIP itself ve DINOv2 bulunur ve bu projeler referans görüntülerden global özellikler çıkarır, ancak genellikle doğru kimlik korunması için gerekli olan ince uzaysal ayrıntıları kaybederler.

Eski DINOV2 yaklaşımının yayınlandığı makaleden: Renkli üst çubuklar, her sütundaki görüntü parçalarına uygulanan İlk Üç İlkel Bileşen Analizinin (PCA) ilk üç ilkel bileşenini gösterir ve bu, modelin farklı görüntülerdeki benzer nesne parçalarını nasıl birleştirdiğini vurgular. Farklı pozlar, stiller veya işlemlerdesin, karşılık gelen bölgeler (kanatlar, uzuvlar veya tekerlekler gibi) tutarlı bir şekilde eşleştirilir ve modelin denetimsiz olarak parça tabanlı yapıyı öğrenme yeteneğini gösterir. Kaynak: https://arxiv.org/pdf/2304.07193

Eski DINOV2 yaklaşımının yayınlandığı makaleden: Renkli üst çubuklar, her sütundaki görüntü parçalarına uygulanan İlk Üç İlkel Bileşen Analizinin (PCA) ilk üç ilkel bileşenini gösterir ve bu, modelin farklı görüntülerdeki benzer nesne parçalarını nasıl birleştirdiğini vurgular. Farklı pozlar, stiller veya işlemlerdesin, karşılık gelen bölgeler (kanatlar, uzuvlar veya tekerlekler gibi) tutarlı bir şekilde eşleştirilir ve modelin denetimsiz olarak parça tabanlı yapıyı öğrenme yeteneğini gösterir. Kaynak: https://arxiv.org/pdf/2304.07193

CompleteMe, bu sorunu, Stable Diffusion 1.5 tarafından başlatılan ancak difüzyon gürültü adımını içermeyen özel bir Referans U-Net ile ele alır.

Her referans görüntüsü, farklı vücut bölgelerini gösteren, ayrıntılı uzaysal özelliklere dönüştürülür. Global anlamsal özellikler ayrıca CLIP kullanılarak çıkarılır ve her iki özellik kümesi de dikkat temelli entegrasyon sırasında verimli kullanım için önbelleğe alınır. Böylece, sistem esnek bir şekilde birden fazla referans girdisini işleyebilir ve aynı zamanda ince görsel görünümü korur.

Orkestrasyon

Birleşik U-Net, tamamlama sürecinin son aşamalarını yönetir. Stable Diffusion 1.5’in boyama varyantından uyarlanan bu, gizli kaynak görüntüsünün latentsel formunu, referans görüntülerinden alınan ayrıntılı uzaysal özelliklerle birlikte ve CLIP tarafından çıkarılan global anlamsal özelliklerle birlikte alır.

Bu çeşitli girdiler, modelin dikkatini referans materyalinin en ilgili alanlarına yönlendirmek için kritik bir rol oynayan RFA bloğu aracılığıyla birleştirilir.

Dikkat mekanizmasına girmeden önce, referans özellikleri, ilgili olmayan bölgeleri kaldırmak için açıkça maskelenir ve sonra kaynak görüntüsünün latentsel temsiliyle birleştirilir, böylece dikkat mümkün olduğunca kesin bir şekilde yönlendirilir.

Bu entegrasyonu güçlendirmek için CompleteMe, IP-Adapter çerçevesinden uyarlanan bir ayrılmış çapraz dikkat mekanizması içerir.

CompleteMe'ye dahil edilen IP-Adapter, son üç yılın en başarılı ve en çok kullanılan projelerinden biridir. Kaynak: https://ip-adapter.github.io/

CompleteMe’ye dahil edilen IP-Adapter, son üç yılın en başarılı ve en çok kullanılan projelerinden biridir. Kaynak: https://ip-adapter.github.io/

Bu, modelin, ayrı dikkat akışları aracılığıyla, hem uzaysal olarak ayrıntılı görsel özellikler hem de daha geniş anlamsal bağlamı işleyerek, daha sonra birleştirilen ve tutarlı bir yeniden yapılandırmaya yol açan bir şekilde işlemesine olanak tanır.

Benchmarking

Referans tabanlı insan tamamlama için uygun bir veri kümesinin olmaması nedeniyle, araştırmacılar kendi benchmark’lerini önerdiler. Bu benchmark, Adobe Research’in 2023 UniHuman projesi için oluşturulan WPose veri kümesinden seçilen görüntü çiftlerini içerir.

Adobe Research 2023 UniHuman projesinden poz örnekleri. Kaynak: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Adobe Research 2023 UniHuman projesinden poz örnekleri. Kaynak: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Araştırmacılar, kaynak maskelerini çizerek, 417 üçlü görüntü grubu elde ettiler – bir kaynak görüntü, bir maske ve bir referans görüntüsünden oluşur.

Referans WPose veri kümesinden türetilen ve araştırmacılar tarafından kapsamlı bir şekilde düzenlenen iki grup örneği.

Referans WPose veri kümesinden türetilen ve araştırmacılar tarafından kapsamlı bir şekilde düzenlenen iki grup örneği.

Yazarlar, LLaVA Büyük Dil Modelini (LLM) kullanarak, kaynak görüntülerini tanımlayan metin ipuçlarını ürettiler.

Kullanılan metrikler alışılmışın ötesindeydi; genellikle kullanılan Peak Signal-to-Noise Ratio (PSNR), Yapısal Benzerlik Endeksi (SSIM) ve Öğrenilen Algısal Görüntü Parçası Benzerliği (LPIPS, bu durumda maskeleme bölgelerinin değerlendirilmesi için) yanı sıra, yazarlar DINO için benzerlik puanlarını, DreamSim için üretim sonucu değerlendirmesini ve CLIP’i kullandılar.

Veri ve Testler

Çalışmayı test etmek için yazarlar, varsayılan Stable Diffusion V1.5 modelini ve 1.5 boyama modelini kullandılar. Sistemlerin görüntü kodlayıcısı, CLIP Görme modelini ve modelin dahili özellik boyutlarına uymak için bunları yeniden şekillendiren veya hizalayan projeksiyon katmanlarını kullandı.

Eğitim, 30.000 iterasyon için sekiz NVIDIA A100 GPU’sunda, Ortalama Kare Hatası (MSE) kaybı tarafından denetlenerek, 64’lük bir toplu boyutunda ve 2×10-5 öğrenme hızında gerçekleştirildi. Eğitim boyunca çeşitli öğeler rastgele atıldı, böylece sistem verilere aşırı uyumlu hale gelmesini önledi.

Veri kümesi, Parts to Whole veri kümesinden türetilmiştir ve bu da DeepFashion-MultiModal veri kümesine dayanmaktadır.

Parts to Whole veri kümesinden örnekler, CompleteMe için oluşturulan veri için kullanılmıştır. Kaynak: https://huanngzh.github.io/Parts2Whole/

Parts to Whole veri kümesinden örnekler, CompleteMe için oluşturulan veri için kullanılmıştır. Kaynak: https://huanngzh.github.io/Parts2Whole/

Yazarlar şunları belirtiyorlar:

‘Gereksinimlerimize uymak için, occluded görüntülerle birlikte, insan görünümünün çeşitli yönlerini yakalayan ve kısa metinsel etiketlerle birlikte, eğitim çiftlerini yeniden inşa ettik.

‘Her eğitim örneğimiz, üst vücut giysileri, alt vücut giysileri, tüm vücut giysileri, saç veya başlık, yüz ve ayakkabı gibi altı görünüm türünü içerir. Maskeleme stratejisi için, 1 ila 30 kez arasında %50 rastgele ızgara tabanlı maskeleme uyguluyoruz ve diğer %50 için insan vücut şekli maskesini kullanıyoruz, böylece maskeleme karmaşıklığını artırıyoruz.

‘İnşaat pipeline’inden sonra, 40.000 görüntü çifti elde ettik.’

Karşılaştırılmış önceki referans içermeyen yöntemler arasında Büyük Occluded İnsan Görüntüsü Tamamlama (LOHC) ve BrushNet bulunur; referans tabanlı modeller arasında Paint-by-Example, AnyDoor, LeftRefill ve MimicBrush bulunur.

Yazarlar, önce belirtilen metrikler üzerinde nicel bir karşılaştırma ile başladılar.

İlk nicel karşılaştırma sonuçları.

İlk nicel karşılaştırma sonuçları.

Nicel değerlendirmeyle ilgili olarak yazarlar, CompleteMe’nin, anlamsal hizalamayı ve referans görüntüsüyle çıktı arasındaki görünüm tutarlılığını yakalamak amacıyla tasarlanan CLIP-I, DINO, DreamSim ve LPIPS gibi çoğu algısal metrikte en yüksek puanları elde ettiğini belirtiyorlar.

Ancak, model tüm benchmark’lerde tüm karşılaştırma noktalarını aşmaz. Özellikle, BrushNet CLIP-T’de en yüksek puanı alır, LeftRefill SSIM ve PSNR’de liderlik eder ve MimicBrush CLIP-I’de slightly daha iyi performans gösterir.

CompleteMe genel olarak tutarlı güçlü sonuçlar gösterir, ancak bazı durumlarda performans farklılıkları mütevazıdır ve belirli metrikler hala önceki yöntemler tarafından liderlik etmektedir. Yazarlar, bu sonuçları CompleteMe’nin hem yapısal hem de algısal boyutlarda dengeli bir güç gösterisi olarak yorumlar.

Çalışmada yapılan nitel testlerin illüstrasyonları burada yeniden üretmek için çok fazla, bu nedenle okuyucuyu hem kaynak makaleye hem de makalede daha önce bahsedilen kapsamlı ek PDF dosyasına yönlendirmekteyiz.

Öncelikle makaledeki ana nitel örnekleri vurguluyoruz ve ayrıca bu makalede daha önce tanıtılan ek görüntü havuzundan bazı ek durumları sunuyoruz.

Ana makaledeki ilk nitel sonuçlar. Daha iyi çözünürlük için lütfen kaynak makaleye başvurun.

Ana makaledeki ilk nitel sonuçlar. Daha iyi çözünürlük için lütfen kaynak makaleye başvurun.


Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai