Yapay zeka modelleri ve platformları
BrushNet: Resimli Doldurma için Çift Dalga Dağılımı ile Oynat ve Çalıştır
Görüntü doldurma, bilgisayar görüşünde klasik bir sorun olup, görüntünün masked bölgelerini doğal ve inandırıcı içerikle restore etmeyi amaçlar. Mevcut çalışmalar, geleneksel görüntü doldurma teknikleri gibi Generative Adversarial Networks veya GAN’lar ve Variational Auto-Encoders veya VAE’leri kullanır, ancak genellikle yardımcı el ile oluşturulmuş özellikler gerektirir ve aynı zamanda tatmin edici sonuçlar vermez. Son birkaç yıl içinde, difüzyon tabanlı yöntemler, bilgisayar görüşü topluluğu içinde yüksek kaliteli görüntü oluşturma yetenekleri, çıktı çeşitliliği ve ince ayar kontrolleri nedeniyle popülerlik kazanmıştır. Difüzyon modellerini metin yönlendirmeli görüntü doldurma için kullanma girişimleri, standart gürültü azaltma stratejisini, masked bölgeleri önceden eğitilmiş bir difüzyon modelinden örnekleyerek ve masked olmayan alanları verilen görüntüden kopyalayarak değiştirdi. Bu yöntemler, basit görüntü doldurma görevlerinde tatmin edici performans sağlasa da, karmaşık maske şekilleri, metin ipuçları ve görüntü içerikleri ile sonuçlanan genel bir tutarlılık eksikliği ile mücadele etti.
Gelişmelere, araştırmalara ve son birkaç yıl içinde bu modellerin geliştirilmesine rağmen, görüntü doldurma hala bilgisayar görüşü geliştiricileri için önemli bir engel teşkil etmektedir. Mevcut difüzyon modellerinin görüntü doldurma görevleri için uyarlamaları, örnek alma stratejisinin değiştirilmesini veya görüntü doldurma için özel olarak tasarlanmış difüzyon modellerinin geliştirilmesini içerir, ancak bunlar genellikle azaltılmış görüntü kalitesi ve tutarlı olmayan anlamlara sahiptir. Bu zorlukları aşmak ve görüntü doldurma modelleri için yol göstermek için, bu makalede, önceden eğitilmiş herhangi bir difüzyon modeline piksel düzeyinde masked görüntü özelliklerini gömerek, tutarlılık ve gelişmiş sonuç garantisi veren yeni bir oynat ve çalıştır çerçevesi olan BrushNet hakkında konuşacağız. BrushNet çerçevesi, görüntü özelliklerini ve gürültülü latensi ayrı dallara ayırarak yeni bir paradigma sunar. Görüntü özelliklerinin ve gürültülü latenslerin ayırılması, modelin öğrenme yükünü önemli ölçüde azaltır ve hiyerarşik bir şekilde temel masked görüntü bilgisinin nüanslı bir şekilde dahil edilmesini sağlar. BrushNet çerçevesinin yanı sıra, segmentasyon tabanlı performans değerlendirmesi ve görüntü doldurma eğitimi için BrushBench ve BrushData hakkında da konuşacağız.

Bu makale, BrushNet çerçevesini derinlemesine kapsamak amacıyla yazılmıştır ve mekanizmayı, metodolojiyi, mimariyi ve diğer çerçevelerle karşılaştırmayı keşfedeceğiz. Şimdi başlayalım.
BrushNet: Çift Dalga Dağılımı ile Resimli Doldurma
Görüntü doldurma, bir görüntünün eksik bölgelerini restore etmeye çalışan bir yöntemdir ve genel tutarlılığı korumayı amaçlar. Görüntü doldurma, görüntü düzenleme ve sanal deneme gibi çeşitli bilgisayar görüşü görevlerinde uygulanır. Son zamanlarda, difüzyon modelleri gibi Stable Diffusion ve Stable Diffusion 1.5, yüksek kaliteli görüntü oluşturma yetenekleri sergiledi ve kullanıcıların semantik ve yapısal kontrolleri kontrol etmelerine olanak tanıdı. Difüzyon modellerinin dikkat çekici potansiyeli, araştırmacıları metin yönlendirmeli yüksek kaliteli görüntü doldurma görevleri için difüzyon modellerine başvurmaya yöneltti.
Geleneksel difüzyon tabanlı metin yönlendirmeli doldurma çerçevelerinin kullandığı yöntemler, iki kategoriye ayrılmaktadır: Örnek Alma Stratejisi Değişikliği ve Özel Doldurma Modelleri. Örnek alma stratejisini değiştirme yöntemi, standart gürültü azaltma işlemini, masked bölgeleri önceden eğitilmiş bir difüzyon modelinden örnekleyerek ve masked olmayan alanları verilen görüntüden kopyalayarak değiştirir. Bu yöntemler,任意 difüzyon modellerinde uygulanabilir, ancak masked bölge sınırları ve masked olmayan görüntü bölge bağlamı hakkında sınırlı algısal bilgi nedeniyle tutarlı olmayan doldurma sonuçları verir. Diğer taraftan, özel doldurma modelleri, görüntü doldurma için özel olarak tasarlanmış bir modeli, temel difüzyon modelinin girdi kanalının boyutunu genişleterek ve bozulmuş görüntü ve maskeleri dahil ederek ince ayarlar. Özel doldurma modelleri, daha tatmin edici sonuçlar üretebilir, ancak görüntü doldurma modelleri için en iyi mimari tasarım olmayabilir.
Aşağıdaki görüntüde gösterildiği gibi, özel doldurma modelleri, masked görüntü latensi, gürültülü latens, metin ve maskeyi erken bir aşamada birleştirir. Bu özel doldurma modellerinin mimari tasarımı, masked görüntü özelliklerini etkileyebilir ve UNet mimarisinin sonraki katmanlarının saf masked görüntü özelliklerini elde etmesini engeller, çünkü metin etkisi vardır. Ayrıca, nesil ve koşullandırma işlemlerini tek bir dalda ele alma, UNet mimarisine daha fazla yük bindirir ve bu yöntemler ayrıca farklı difüzyon omurga varyasyonları için ince ayar gerektirir, bu nedenle zaman alıcıdır ve sınırlı taşınabilirlik sağlar.

Ek bir dal ekleyerek masked görüntü özelliklerini çıkarmak yeterli bir çözüm gibi görünse de, mevcut çerçeveler genellikle doldurma için doğrudan uygulanıldığında yetersiz bilgi çıkarır ve ekler. Sonuç olarak, ControlNet gibi mevcut çerçeveler, özel doldurma modellerine kıyasla tatmin edici sonuçlar vermez. Bu sorunu en etkili şekilde çözmek için, BrushNet çerçevesi, orijinal difüzyon ağına bir ek dal ekler ve böylece görüntü doldurma görevleri için daha uygun bir mimari oluşturur. BrushNet çerçevesinin tasarımı ve mimarisi üç noktada özetlenebilir.
- Konvansiyonel katmanları rastgele başlatmak yerine, BrushNet çerçevesi, masked görüntüyü işlemek için bir VAE kodlayıcı uygular. Böylece, BrushNet çerçevesi, görüntüdeki özellikleri UNet dağılımına daha etkili bir şekilde uyarlayabilir.
- BrushNet çerçevesi, tam UNet özellik katmanını katman katman olarak önceden eğitilmiş UNet mimarisine dahil eder, bu da hiyerarşik bir yaklaşım sağlar ve yoğun per-piksel kontrolü sağlar.
- BrushNet çerçevesi, UNet bileşeninden metin çapraz dikkat mekanizmasını kaldırır, böylece yalnızca görüntüye ait saf bilgi dikkate alınır. Ayrıca, BrushNet modeli, daha iyi tutarlılık ve daha geniş bir kontrol aralığını elde etmek için bulanık bir birleştirme stratejisi uygulamayı önerir.
BrushNet: Yöntem ve Mimari
Aşağıdaki şekil, BrushNet çerçevesinin bir özeti sağlar.

Görüldüğü gibi, çerçeve, masked görüntü rehberliği eklemek için çift dalga stratejisi kullanır ve bulanık bir maske ile birleştirme işlemleri gerçekleştirir. BrushNet çerçevesinin, eklenen ölçek üzerinden esnek kontrolü ayarlayabilmesi dikkat çekicidir. Verilen bir masked görüntü girişi ve maske için, BrushNet modeli, doldurma işlemini gerçekleştirir. Model önce maskeyi, latens boyutuna uydurmak için küçültür ve masked görüntüyü, latens dağılımını hizalamak için VAE kodlayıcısına girdi olarak verir. Model daha sonra, masked görüntü latensi, gürültülü latens ve küçültülmüş maskeyi birleştirir ve bu birleştirilmiş özellikleri, sıfır konvansiyonel bir blok之后 UNet katmanına ekler. Gürültü azaltma之后, model, masked görüntüyü ve oluşturulan görüntüyü, bulanık bir maske ile birleştirir.
Masked Görüntü Rehberliği
BrushNet çerçevesi, masked görüntü özelliklerini, görüntü oluşturma işleminin dışında açık bir şekilde ayıran bir ek dal kullanarak, önceden eğitilmiş difüzyon ağına masked görüntü özelliklerini ekler. Girdi, masked görüntü latensi, gürültülü latens ve küçültülmüş maskeyi birleştirmeyi içerir. Daha spesifik olarak, gürültülü latens, görüntü oluşturma işleminin sırasında bilgi sağlar ve masked görüntü özelliğinin semantik tutarlılığını geliştirmeye yardımcı olur. BrushNet çerçevesi, masked görüntüyü, bir Varyasyonel Auto-Encoder kullanarak işler. Ayrıca, çerçeve, maske boyutunu, masked görüntü latensi ve gürültülü latens ile hizalamak için küp içi interpolasyonu kullanır. Masked görüntü özelliklerini işlemek için, BrushNet çerçevesi, önceden eğitilmiş difüzyon modelinin bir klonunu uygular ve difüzyon modelinin çapraz dikkat katmanlarını hariç tutar. Önceden eğitilmiş difüzyon modelinin ağırlıkları, masked görüntü özelliklerini çıkarmak için güçlü bir öncü oluşturur ve çapraz dikkat katmanlarını hariç tutmak, modelin yalnızca ek dal içindeki saf görüntü bilgisini dikkate almasını sağlar. BrushNet çerçevesi, özellikleri, dondurulmuş difüzyon modelinin katmanlarına katman katman olarak ekler, böylece hiyerarşik yoğun per-piksel kontrolü sağlar ve ayrıca, sıfır konvansiyonel katmanları, eğitilebilir BrushNet modeli ile kilidli model arasında bir bağlantı kurmak için kullanır, böylece ilk eğitim aşamalarında, eğitilebilir kopyadaki gizli durumlar üzerinde zararlı gürültünün hiçbir etkisi olmaz.
Birleştirme İşlemi
Önceden de bahsedildiği gibi, birleştirme işlemini latens alanında gerçekleştirmek, maskeleri yeniden boyutlandırmanın neden olduğu several doğrulukları içerir ve BrushNet çerçevesi, latens alanını masked görüntü latensi ile hizalamak için maskeyi yeniden boyutlandırırken benzer bir sorunu karşılar. Ayrıca, Varyasyonel Auto-Encoderaların kodlama ve dekodlama işlemlerinin sınırlı işlemleri vardır ve tam görüntü yeniden oluşturmayı garanti etmez. Masked olmayan bölgeyi tutarlı bir şekilde yeniden oluşturmak için, mevcut çalışmalar, masked olmayan alanları orijinal görüntüden kopyalayan farklı teknikler uygulamıştır. Bu yaklaşım işe yarasa da, son sonuçların semantik tutarlılığını genellikle eksik bırakır. Diğer taraftan, latens birleştirme işlemlerini benimseyen yöntemler, masked olmayan alanlardaki istenilen bilgileri korumakta zorluklarla karşılaşır.
Esnek Kontrol
BrushNet çerçevesinin mimari tasarımı, çeşitli önceden eğitilmiş difüzyon modellerine doğal olarak entegre olabilen bir oynat ve çalıştır bileşeni olarak işlev görür ve esnek koruma ölçeğini sağlar. BrushNet çerçevesi, önceden eğitilmiş difüzyon modelinin ağırlıklarını değiştirmeyerek, geliştiricilerin onu, ince ayarlanmış bir difüzyon modeli ile bir oynat ve çalıştır bileşeni olarak entegre etmesine olanak tanır, böylece kolay benimseme ve deneysel çalışmalara izin verir. Ayrıca, geliştiriciler, koruma ölçeğini, BrushNet modelinin özelliklerini, verilen ağırlık w ile dondurulmuş difüzyon modeline entegre ederek kontrol edebilir, bu da, istenilen koruma seviyelerini ayarlamalarına olanak tanır. Son olarak, BrushNet çerçevesi, kullanıcıların bulanıklaştırma ölçeğini ayarlamasına ve bulanıklaştırma işlemini uygulamaya ya da uygulamamaya karar vermesine olanak tanır, böylece görüntü doldurma işleminin esnek ve ince ayarlı kontrolünü sağlar.
BrushNet: Uygulama ve Sonuçlar
Sonuçlarını analiz etmek için, BrushNet çerçevesi, 600’den fazla görüntüden oluşan ve her görüntüye insan tarafından oluşturulmuş bir maske ve altyazı eklenen bir segmentasyon tabanlı görüntü doldurma veri kümesi olan BrushBench’i önerir. Veri kümesindeki görüntüler, doğal ve yapay görüntüler arasında eşit olarak dağıtılmıştır ve ayrıca farklı kategoriler arasında eşit dağılımı garanti eder, böylece farklı kategoriler arasında adil bir değerlendirme sağlar. Görüntü doldurma görevlerinin analizini daha da geliştirmek için, BrushNet çerçevesi, veri kümesini, kullanılan yöntemlere göre iki ayrı parçaya ayırır: segmentasyon tabanlı ve fırça maskeleri.
Nicel Karşılaştırma
Aşağıdaki tablo, BrushNet çerçevesini, Stable Diffusion modeli temel alınarak BrushBench veri kümesindeki mevcut difüzyon tabanlı görüntü doldurma modelleri ile karşılaştırır.

Görüldüğü gibi, BrushNet çerçevesi, masked bölge korunması, metin hizalama ve görüntü kalitesi açısından dikkat çekici bir verimlilik gösterir. Ayrıca, Stable Diffusion Doldurma, HD-Painter, PowerPaint gibi modeller, görüntü içi doldurma görevlerinde güçlü performans sergiler, ancak özellikle metin hizalama ve görüntü kalitesi açısından dışarıya doldurma görevlerinde performansını tekrarlayamaz. Genel olarak, BrushNet çerçevesi en güçlü sonuçları sağlar.
Ayrıca, aşağıdaki tablo, BrushNet çerçevesini, EditBench veri kümesindeki mevcut difüzyon tabanlı görüntü doldurma modelleri ile karşılaştırır ve performans, BrushBench veri kümesindeki performansa benzerdir. Sonuçlar, BrushNet çerçevesinin, farklı maske türleri ile çeşitli görüntü doldurma görevlerinde güçlü bir performans sergilediğini gösterir.

Nitel Karşılaştırma
Aşağıdaki şekil, BrushNet çerçevesini, mevcut görüntü doldurma yöntemleri ile nitel olarak karşılaştırır ve sonuçlar, yapay zeka ve doğal görüntülerde, farklı doldurma görevleri için, rastgele maske doldurma, segmentasyon maske içi doldurma ve segmentasyon maske dışı doldurma dahil olmak üzere kapsar.

Görüldüğü gibi, BrushNet çerçevesi, masked olmayan bölge tutarlılığı ve arka plan bilinci konusunda dikkat çekici sonuçlar sağlar ve çift dalga ayırma yaklaşımının uygulanması sayesinde, tutarlı bölgelerin bilincini erfolgreich bir şekilde gerçekleştirir. Ayrıca, önceden eğitilmiş difüzyon modelinin dokunulmamış dalı, farklı veri alanlarını, anime ve resim gibi, daha iyi kapsar ve bu da, çeşitli senaryolarda daha iyi performans sağlar.

Son Düşünceler
Bu makalede, BrushNet çerçevesi hakkında konuştuk, bu, önceden eğitilmiş herhangi bir difüzyon modeline piksel düzeyinde masked görüntü özelliklerini gömerek, tutarlılık ve gelişmiş sonuç garantisi veren yeni bir oynat ve çalıştır çerçevesidir. BrushNet çerçevesi, görüntü özelliklerini ve gürültülü latensi ayrı dallara ayırarak yeni bir paradigma sunar. Görüntü özelliklerinin ve gürültülü latenslerin ayırılması, modelin öğrenme yükünü önemli ölçüde azaltır ve hiyerarşik bir şekilde temel masked görüntü bilgisinin nüanslı bir şekilde dahil edilmesini sağlar. BrushNet çerçevesinin yanı sıra, segmentasyon tabanlı performans değerlendirmesi ve görüntü doldurma eğitimi için BrushBench ve BrushData hakkında da konuşacağız.












