Yapay zeka modelleri ve platformları
HD-Painter: Yüksek Çözünürlüklü Metin-Rehberli Resim Doldurma ile Diffusion Modelleri
Diffusion modelleri şüphesiz ki AI ve ML endüstrisinde devrim yaratmış ve gerçek zamanlı uygulamalarımızda önemli bir yer edinmiştir. Metin-görsel modelleri etkileyici yeteneklerini sergiledikten sonra, difüzyon tabanlı görüntü işleme teknikleri, kontrollü üretim, özel ve kişiselleştirilmiş görüntü sentezi, nesne düzeyinde görüntü düzenleme,.prompt koşullu varyasyonlar ve düzenleme gibi uygulamalarla birlikte bilgisayar vizyonu endüstrisinde önemli araştırma konuları haline gelmiştir.
Ancak, etkileyici yeteneklerine ve istisnai sonuçlarına rağmen, metin-görsel çerçeveleri, özellikle metin-görsel doldurma çerçeveleri, hala geliştirme alanları vardır. Bunlar, özellikle yüksek difüzyon adımlarında görüntüyü gürültüden arındırırken, global sahnelerin anlaşılmasını içerir. Bu sorunu ele almak için araştırmacılar, HD-Painter’i tanıttı, bu tamamen eğitim-ücretsiz bir çerçevedir ve.prompt talimatlarını doğru bir şekilde takip eder ve yüksek çözünürlüklü görüntü doldurma ile tutarlı bir şekilde ölçeklenir. HD-Painter çerçevesi, Prompt Aware Introverted Attention (PAIntA) katmanını kullanır, bu, self-attention puanlarını artırmak için prompt bilgilerini kullanır ve daha iyi metin hizalama üretimi sağlar.
Prompt uyumluluğunu daha da iyileştirmek için, HD-Painter modeli, Reweighting Attention Score Guidance (RASG) yaklaşımını tanıtır. Bu yaklaşım, genel DDIM bileşenine sorunsuz bir şekilde entegre edilen bir post-hoc örnek alma stratejisini içerir, böylece dağılımın latent kaymasını önler. Ayrıca, HD-Painter çerçevesi, doldurma için özel olarak tasarlanmış bir süper çözünürlük tekniğine sahiptir, bu da daha büyük ölçeklere uzanmasını sağlar ve görüntünün eksik bölgelerini 2K çözünürlüğe kadar tamamlar.
HD-Painter: Metin-Rehberli Resim Doldurma
Metin-görsel difüzyon modelleri gerçekten son aylarda AI ve ML endüstrisinde önemli bir konu haline gelmiştir, modeller gerçek zamanlı yeteneklerini çeşitli uygulamalarda sergilemiştir. Önceden eğitilmiş metin-görsel üretim modelleri gibi DALL-E, Imagen ve Stable Diffusion, görüntüyü tamamlamak için noised (ürettiği) bilinmeyen bölgeleri bilinen bölgelerle birleştirmiştir. Mevcut modeller, görsel olarak çekici ve uyumlu çıktılar üretmesine rağmen, global sahneyi anlamakta, özellikle yüksek difüzyon adımlarında gürültüden arındırma sürecinde zorluk yaşamaktadır. Önceden eğitilmiş metin-görsel difüzyon modellerini, metin-rehberli görüntü tamamlama için ek konteks bilgileri entegre ederek fine-tune etmek mümkündür.
Dahası, difüzyon modelleri içinde, metin-rehberli doldurma ve metin-rehberli görüntü tamamlama araştırmacılar için önemli ilgi alanlarıdır. Bu ilgi, metin-rehberli doldurma modellerinin, belirli bölgelerde girdi metinlerine dayalı içerik üretebilmesi ve potansiyel uygulamalara yol açmasıyla motive edilir, Örneğin, belirli görüntü bölgelerini düzeltme, konu özniteliklerini değiştirme, nesneleri eklemek veya değiştirmek. Özetle, metin-görsel difüzyon modelleri son zamanlarda gerçekçi ve görsel olarak çekici üretim yetenekleri sayesinde without eşsiz bir başarı elde etti.

Ancak, mevcut çerçevelerin çoğunluğu iki senaryoda prompt ihmalini gösterir. Birincisi, Arka Plan Baskınlığı, model bilinmeyen bölgeyi arka planda prompti görmezden gelerek tamamlarken, ikincisi Yakın Nesne Baskınlığı, model bilinen bölge nesnelerini görsel konteks olasılığına göre bilinmeyen bölgeye yayarken, girdi metnini görmezden gelir. Bu sorun, self-attention katmanlarının sadece mekansal ve prompt-free doğasının bir sonucu olabilir.
Bu engelleri aşmak için, HD-Painter çerçevesi, Prompt Aware Introverted Attention veya PAIntA katmanını tanıtır, bu, self-attention katmanlarının çıkışını kontrol etmek için cross-attention matrisleri ve doldurma maskesini kullanır.
Ayrıca, HD-Painter modeli, post-hoc örnek alma rehberliği yaklaşımını benimser, bu, açık-vokabüler segmentasyon özelliklerini kullanarak cross-attention katmanlarını kullanır. Ancak, bu vanilla post-hoc rehberlik yaklaşımı, difüzyon latentının alanını değiştirebilir ve görüntünün kalitesini düşürebilir. Bu sorunu aşmak için, HD-Painter modeli, Reweighting Attention Score Guidance veya RASG mekanizmasını uygular, bu, latent alanını koruyan bir gradient ağırlama mekanizması sağlar.
HD-Painter: Yöntem ve Mimarisi
Önce, HD-Painter çerçevesinin temelini oluşturan üç temel kavramı anlamak önemlidir: Görüntü Doldurma, Difüzyon Çerçevelerindeki Post-Hoc Rehberlik ve Doldurma Özel Mimari Blokları.
Görüntü doldurma, görüntüdeki eksik bölgeleri doldurmak için bir yaklaşımdır, aynı zamanda üretilen görüntünün görsel çekiciliğini sağlar. Geleneksel derin öğrenme çerçeveleri, bilinen bölgelerden derin özellikler yaymak için yöntemler uygulamıştır. Ancak, difüzyon modellerinin tanıtılması, özellikle metin-rehberli görüntü doldurma çerçevelerinin evrimini sağlamıştır. Geleneksel olarak, önceden eğitilmiş bir metin-görsel difüzyon modeli, noised bilinen bölge versiyonunu kullanarak latentin unmasked bölgesini değiştirir. Bu yaklaşım bir ölçüde çalışsa da, üretilen çıktının kalitesini önemli ölçüde bozar, çünkü gürültüden arındırma ağı sadece noised bilinen bölge versiyonunu görür.
Dahası, geleneksel derin öğrenme modelleri, doldurma için özel tasarım katmanları uygulamıştır, bazı çerçeveler bilinen bölgelerden bilgi çıkarmak için etkili olabilir ve görsel olarak çekici görüntüler üretebilir, bilinen bölgelerle başa çıkmak için özel convolution katmanları tanıtabilir. Bazı çerçeveler, yüksek kaliteli doldurma için tüm-self-attention’ın gereksiz hesaplama gereksinimlerini azaltmak için konteks attention katmanları eklemiştir.
Son olarak, post-hoc rehberlik yöntemleri, bir sonraki latent tahmini için belirli bir fonksiyon minimizasyon hedefine yönelik geriye doğru difüzyon örneklemesi yöntemleridir. Post-hoc rehberlik yöntemleri, özellikle ek kısıtlamalar olduğunda görsel içerik üretimi için faydalıdır. Ancak, post-hoc rehberlik yöntemleri, görüntünün kalitesini düşürebilir, çünkü latent üretim sürecini bir gradient terimiyle değiştirebilir.
HD-Painter mimarisine gelince, çerçevede önce metin-rehberli görüntü tamamlama problemi formüle edilir, ardından iki difüzyon modeli tanıtılır: Stable Inpainting ve Stable Diffusion. HD-Painter modeli, PAIntA ve RASG bloklarını tanıtır ve son olarak doldurma özel süper çözünürlük tekniğine ulaşılır.
Stable Diffusion ve Stable Inpainting
Stable Diffusion, bir oto-encoderin latent uzayında çalışan bir difüzyon modelidir. Metin-görsel sentezi için, Stable Diffusion çerçevesi, bir metin promptunu kullanarak süreci rehberlik eder. Rehberlik fonksiyonu, UNet mimarisine benzer bir yapıya sahiptir ve cross-attention katmanları metin promptlarına koşullu olarak ayarlanır. Ayrıca, Stable Diffusion modeli, bazı değişikliklerle ve fine-tune edilerek görüntü doldurma işlemlerini gerçekleştirebilir.

Üstteki şekil, HD-Painter çerçevesinin genel görünümünü gösterir, bu iki aşamadan oluşur. İlk aşamada, HD-Painter çerçevesi metin-rehberli resim boyama işlemini gerçekleştirir, ikinci aşamada ise model, belirli bir süper çözünürlükte doldurma işlemini gerçekleştirir. Eksik bölgeleri doldurmak ve girdi metniyle tutarlı olmak için, model, önceden eğitilmiş bir doldurma difüzyon modelini alır, self-attention katmanlarını PAIntA katmanlarıyla değiştirir ve post-hoc örnek alma işlemini gerçekleştirmek için RASG mekanizmasını uygular. Model, son olarak estimated latent’i decode eder ve doldurulmuş bir görüntü üretir. HD-Painter, süper stabil difüzyon modelini kullanarak orijinal boyutundaki görüntüyü doldurmaya devam eder ve Stable Diffusion çerçevesinin difüzyon geri proceso işlemini, düşük çözünürlüklü girdi görüntüsüne koşullu olarak gerçekleştirir.
Prompt Aware Introverted Attention veya PAIntA
Mevcut doldurma modelleri gibi Stable Inpainting, genellikle doldurma alanının etrafındaki görsel konteksi dikkate alır ve girdi metinlerini görmezden gelir. Kullanıcı deneyimi temelinde, bu sorun iki kategoriye ayrılabilir: yakın nesne baskınlığı ve arka plan baskınlığı. Görsel konteksin girdi metinlerine göre baskın olması, self-attention katmanlarının sadece mekansal ve prompt-free doğasının bir sonucu olabilir.
Prompt Aware Introverted Attention bileşeni, önce anahtar, değer ve sorgu için projection katmanlarını uygular ve benzerlik matrisini alır. Model, bilinen piksellerin dikkat puanlarını, bilinen bölgenin bilinmeyen bölge üzerindeki güçlü etkisini azaltmak için ayarlar ve metin promptunu kullanarak yeni bir benzerlik matrisi tanımlar.

Reweighting Attention Score Guidance veya RASG
HD-Painter çerçevesi, metin uyumluluğunu daha da artırmak için post-hoc örnek alma rehberliği yaklaşımını benimser. Bir hedef fonksiyonu ile birlikte, post-hoc rehberlik yaklaşımı, cross-attention katmanlarının açık-vokabüler segmentasyon özelliklerini kullanmayı hedefler. Ancak, vanilla post-hoc rehberlik yaklaşımı, difüzyon latentının alanını değiştirebilir ve görüntünün kalitesini düşürebilir. Bu sorunu aşmak için, HD-Painter modeli, Reweighting Attention Score Guidance veya RASG mekanizmasını uygular, bu, latent alanını koruyan bir gradient ağırlama mekanizması sağlar.
HD-Painter: Deneyler ve Sonuçlar
Performansını analiz etmek için, HD-Painter çerçevesi, mevcut durumun en iyi modelleriyle karşılaştırılmıştır, bunlar arasında Stable Inpainting, GLIDE ve BLD veya Blended Latent Diffusion bulunur, bu karşılaştırma 10000 rastgele örnek üzerinden yapılmıştır ve prompt, seçilen örnek maskesinin etiketi olarak seçilmiştir.

Görülebileceği gibi, HD-Painter çerçevesi, mevcut çerçeveleri üç farklı metrikte önemli bir farkla aşar, özellikle CLIP metriğinde 1.5 puanlık bir iyileşme ve diğer durumun en iyi yöntemlerinden yaklaşık %10’luk bir fark vardır.

Ayrıca, aşağıdaki şekil, HD-Painter çerçevesinin diğer doldurma çerçeveleriyle nitel bir karşılaştırmasını gösterir. Görülebileceği gibi, diğer temel modeller ya bilinen bölge nesnelerini bilinmeyen bölgeye yayarak metni görmezden gelir ya da arka plan oluşturur. Öte yandan, HD-Painter çerçevesi, PAIntA ve RASG bileşenlerini kullanarak hedef nesneleri başarılı bir şekilde oluşturur.

Son Düşünceler
Bu makalede, HD-Painter’i, eğitim gerektirmeyen, metin-rehberli yüksek çözünürlüklü doldurma yaklaşımını ele aldık, bu yaklaşım mevcut doldurma çerçevelerinin karşılaştığı zorlukları, özellikle prompt ihmalini ve yakın ve arka plan nesne baskınlığını ele alır. HD-Painter çerçevesi, Prompt Aware Introverted Attention veya PAIntA katmanını uygular, bu, self-attention puanlarını artırmak için prompt bilgilerini kullanır ve daha iyi metin hizalama üretimi sağlar.
Prompt uyumluluğunu daha da iyileştirmek için, HD-Painter modeli, Reweighting Attention Score Guidance veya RASG yaklaşımını tanıtır, bu, post-hoc örnek alma stratejisini DDIM bileşeninin genel formuna sorunsuz bir şekilde entegre eder ve latent kaymasını önler. Ayrıca, HD-Painter çerçevesi, doldurma için özel olarak tasarlanmış bir süper çözünürlük tekniğini tanıtır, bu, daha büyük ölçeklere uzanmasını sağlar ve görüntünün eksik bölgelerini 2K çözünürlüğe kadar tamamlar.












