Yapay zeka modelleri ve platformları
Kendi Dikkat Rehberliği: Difüzyon Modellerinin Örnek Kalitesini İyileştirme
Difüzyon Gürültü Azaltma Modelleri, gürültüden görüntüleri sıralı bir gürültü azaltma işlemiyle sentezleyen üretken AI çerçeveleridir. Bunlar, metin veya sınıf koşullu rehberlik yöntemleri dahil olmak üzere istisnai görüntü oluşturma yetenekleri ve çeşitliliği nedeniyle kutlanıyorlar. Bu modeller, çeşitli ve yüksek kaliteli görüntüler oluşturmakta đáng kể bir şekilde başarılı oldular.
Son araştırmalar, sınıf altyazıları ve etiketler gibi rehberlik tekniklerinin, bu modellerin ürettiği görüntü kalitesini artırmada önemli bir rol oynadığını gösterdi.
Ancak, difüzyon modelleri ve rehberlik yöntemleri belirli dış koşullar altında sınırlamalarla karşı karşıya kalabilir. Etiketsiz Rehberlik (CFG) yöntemi, etiket atlamayı kullanır ve eğitim sürecine karmaşıklık eklerken, Sınıflandırıcı Rehberliği (CG) yöntemi, ek sınıflandırıcı eğitimi gerektirir. Her iki yöntem de, dış koşullara bağımlılıkları nedeniyle sınırlıdır ve koşullu ayarlamalara mahkumdur.
Bu sınırlamaları ele almak için, geliştiriciler difüzyon rehberliği için daha genel bir yaklaşım formüle ettiler; Kendi Dikkat Rehberliği (SAG) olarak bilinen bu yöntem, difüzyon modellerinin ara örneklerinden alınan bilgileri kullanarak görüntüler oluşturur. Bu makalede, SAG’nin işleyişini, metodolojisini ve sonuçlarını mevcut durumun önündeki çerçeveler ve boru hatları ile karşılaştırmalı olarak inceleyeceğiz.
Kendi Dikkat Rehberliği: Difüzyon Modellerinin Örnek Kalitesini İyileştirme
Difüzyon Gürültü Azaltma Modelleri (DDM’ler), gürültüden görüntüleri sıralı bir gürültü azaltma işlemiyle sentezleme yetenekleri nedeniyle popülerlik kazandı. Bu modellerin görüntü sentezleme yetenekleri, büyük ölçüde kullanılan difüzyon rehberlik yöntemlerine bağlıdır.
Görünüşe göre, difüzyon modelleri ve rehberlik tabanlı yöntemler, ek karmaşıklık ve artan hesaplama maliyetleri gibi zorluklarla karşı karşıya kalabilir.
Mevcut sınırlamaları aşmak için, geliştiriciler Kendi Dikkat Rehberliği yöntemini tanıttılar; bu, dış bilgilerden değil, difüzyon rehberliğine daha genel bir formülasyonudur ve bu nedenle, koşulsuz ve esnek bir yaklaşımı kolaylaştırır.
Kendi Dikkat Rehberliği, basit bir ilkeye dayanır: genelleştirilmiş bir formülasyon ve ara örneklerdeki iç bilgiler rehberlik olarak da hizmet edebileceğine dair varsayım. SAG yöntemi, Blur Rehberliği olarak bilinen bir tekniği tanıtlayarak, difüzyon sürecindeki ara yeniden yapılandırmalardan alınan bilgileri kullanır.
Blur rehberliği, Gaussian bulanıklaştırma kullanarak ara örneklerin ince ölçekli detaylarını doğal olarak ortadan kaldırır ve bu bilgileri, görüntülerin ilgiliğini artırmak için rehberlik olarak kullanır. Blur rehberliği, orijinal tahmini bulanık girişle daha fazla farklılaştırmaya neden olur. Gaussian bulanıklaştırmanın iyi huylu özelliği, çıkış sinyallerinin orijinal sinyalden önemli ölçüde sapmasını önler, bu da Gaussian bulanıklaştırmayı önceden eğitilmiş difüzyon modelleri için daha uygun bir yöntem haline getirir.

Özetle, Kendi Dikkat Rehberliği yöntemi:
- Difüzyon çerçevelerinin iç self-attention haritalarını kullanarak örnek görüntü kalitesini iyileştirmek için yeni bir yaklaşım sunar ve ek eğitim veya dış koşullara ihtiyaç duymaz.
- Koşullu rehberlik yöntemlerini koşulsuz bir yönteme dönüştürmeye çalışır ve bu da herhangi bir difüzyon modeliyle entegrasyonunu kolaylaştırır.
- Mevcut koşullu yöntemlere ve çerçevelere ortogonal yeteneklere sahip olduğunu göstererek performansını artırabilir.
Devam ederek, Kendi Dikkat Rehberliği yöntemi, ilgili çerçevelerin bulgularından öğrenir; bunlar arasında Gürültü Azaltma Difüzyon Modelleri, Örnek Rehberliği, Üretken AI Self-Attention yöntemleri ve Difüzyon Modellerinin İç Temsilleri bulunur. Ancak temelde, DDPM veya Gürültü Azaltma Difüzyon Olasılıksal Modelleri, Sınıflandırıcı Rehberliği, Sınıflandırıcı-Olmayan Rehberlik ve Difüzyon Çerçevelerindeki Self-Attention üzerine öğrenmeleri uygular.
Kendi Dikkat Rehberliği: Ön Koşullar, Metodoloji ve Mimarisi
Gürültü Azaltma Difüzyon Olasılıksal Modeli veya DDPM
DDPM veya Gürültü Azaltma Difüzyon Olasılıksal Modeli, beyaz gürültüden bir görüntüyü geri kazanmak için sıralı bir gürültü azaltma işlemine dayanır. Geleneksel olarak, bir DDPM modeli, bir girdi görüntüsü ve bir zaman adımında bir varyans programı alır ve Markovian işlem olarak bilinen bir ileri işlem kullanarak görüntüyü elde eder.
Sınıflandırıcı ve Sınıflandırıcı-Olmayan Rehberlik ile GAN Uygulaması
GAN veya Üretken Karşıt Ağlar, çeşitlilik için doğruluk konusunda benzersiz bir ticaret sunar ve bu yeteneği difüzyon modellerine getirmek için, Kendi Dikkat Rehberliği çerçevesi, ek bir sınıflandırıcı kullanan bir sınıflandırıcı rehberlik yöntemini önerir. Buna karşılık, sınıflandırıcı-olmayan rehberlik yöntemi, aynı sonuçları ek bir sınıflandırıcı kullanmadan elde edebilir.
Difüzyon Rehberliğini Genelleştirme
Sınıflandırıcı ve Sınıflandırıcı-Olmayan Rehberlik yöntemleri, difüzyon modellerinde koşullu oluşturma için istenen sonuçları verir, ancak ek girdilere bağımlıdırlar. Bir difüzyon modelinin girdisi, genelleştirilmiş bir koşul ve genelleştirilmiş koşul olmadan bozulmuş bir örnektir.
Self-Attention Haritalarını Kullanarak Görüntü Kalitesini İyileştirme
Genelleştirilmiş Difüzyon Rehberliği, bozulmuş örnekteki genelleştirilmiş koşulda bulunan seçilen bilgileri kullanarak difüzyon modellerinin ters işlemine rehberlik sağlamak mümkün olduğunu ima eder.
Blur Rehberliği
Kendi Dikkat Rehberliğinde blur rehberliği, Gaussian bulanıklaştırmaya dayanır; bu, bir girdi sinyalinin bir Gaussian filtre ile konvolüsyonudur ve bir çıktı üretir.
Bu öğrenmeden yola çıkarak, Kendi Dikkat Rehberliği çerçevesi blur rehberliği yöntemini tanıtır; bu, difüzyon sürecindeki ara yeniden yapılandırmalardan alınan bilgileri kullanır ve bu bilgileri, görüntülerin ilgiliğini artırmak için rehberlik olarak kullanır.
Blur rehberliği, orijinal tahmini bulanık girişle daha fazla farklılaştırmaya neden olur. Gaussian bulanıklaştırmanın iyi huylu özelliği, çıkış sinyallerinin orijinal sinyalden önemli ölçüde sapmasını önler, bu da Gaussian bulanıklaştırmayı önceden eğitilmiş difüzyon modelleri için daha uygun bir yöntem haline getirir.

Bu sonuçlar, blur rehberliğinin küresel structural belirsizlik introductionuna neden olabileceği için, SAG boru hattının orijinal girişin tahminleriyle bozulmuş girişi hizalamasını zorlaştırabileceğinden kaynaklanabilir.
Self-Attention Mekanizması
Daha önce de bahsedildiği gibi, difüzyon modelleri genellikle self-attention bileşenine sahiptir ve bu, bir difüzyon modeli çerçevesindeki daha önemli bileşenlerden biridir. Self-Attention mekanizması, difüzyon modellerinin core’unda uygulanır ve modelin, üretken işlem sırasında girdinin seçilen kısımlarına dikkat etmesini sağlar.

Önerilen Kendi Dikkat Rehberliği yöntemi, aynı prensibe dayanır ve difüzyon modellerindeki self-attention haritalarının yeteneklerini kullanır. Genel olarak, Kendi Dikkat Rehberliği yöntemi, self-attention patches’i input sinyalinde veya basitçe, difüzyon modellerinin dikkat ettiği yama bilgilerini gizler.
Kendi Dikkat Rehberliği: Deneyler ve Sonuçlar
Performansını değerlendirmek için, Kendi Dikkat Rehberliği boru hattı, 8 Nvidia GeForce RTX 3090 GPU ile örneklenir ve önceden eğitilmiş IDDPM, ADM ve Stable Diffusion çerçevelerine dayanır.
Koşulsuz Oluşturma ile Kendi Dikkat Rehberliği
Koşulsuz modeller üzerindeki SAG boru hattının etkinliğini ölçmek ve Sınıflandırıcı Rehberliği ve Sınıflandırıcı-Olmayan Rehberlik yaklaşımının sahip olmadığı koşulsuz özelliği göstermek için, SAG boru hattı, koşulsuz olarak önceden eğitilmiş çerçevelerde 50.000 örnek üzerinde çalıştırılır.

Görülebileceği gibi, SAG boru hattının uygulanması, koşulsuz girdi için FID, sFID ve IS metriklerini iyileştirirken, aynı zamanda geri çağırma değerini düşürür.


Koşullu Oluşturma ile SAG
SAG boru hattının mevcut çerçevelerde entegrasyonu, koşulsuz oluşturmada istisnai sonuçlar verir ve SAG boru hattı, koşulsuzluk özelliği sayesinde koşullu oluşturmada da uygulanabilir.
Stable Diffusion ile Kendi Dikkat Rehberliği
Orijinal Stable Diffusion çerçevesi zaten yüksek kaliteli görüntüler üretir, ancak Stable Diffusion çerçevesini Kendi Dikkat Rehberliği boru hattıyla entegre etmek, sonuçları önemli ölçüde iyileştirebilir.

Ayrıca, SAG’nin uygulanması, Stable Diffusion çerçevesinin yeteneklerini önemli ölçüde artırabilir; Sınıflandırıcı-Olmayan Rehberliği ile Kendi Dikkat Rehberliğini birleştirmek, Stable Diffusion modellerinin metin-görüntü sentezine genişletilmesine olanak tanır.

Mevcut Sınırlamalar
Kendi Dikkat Rehberliği boru hattının uygulanması, üretilen görüntülerin kalitesini önemli ölçüde iyileştirebilse de, bazı sınırlamaları vardır.
Bunlardan biri, Sınıflandırıcı Rehberliği ve Sınıflandırıcı-Olmayan Rehberlik ile olan ortogonalliktir. Görüldüğü gibi, SAG’nin uygulanması, FID puanını ve tahmin puanını iyileştirir, ancak bu, SAG boru hattının geleneksel rehberlik yöntemleriyle birlikte kullanılabileceği anlamına gelir.

Ancak, bu仍然需要特定的训练方式,这增加了复杂性和计算成本。
Ayrıca, Kendi Dikkat Rehberliği boru hattının uygulanması, hafıza veya zaman tüketimini artırmaz; bu, SAG’deki işlemlerden (masking & blurring) kaynaklanan ek yükün ihmal edilebilir olduğunu gösterir.

Son Düşünceler
Bu makalede, Kendi Dikkat Rehberliği hakkında konuştuk; bu, difüzyon modellerindeki iç bilgilerden yararlanarak yüksek kaliteli görüntüler oluşturmak için yeni ve genel bir rehberlik yöntemidir. Kendi Dikkat Rehberliği, genelleştirilmiş bir formülasyon prensibine ve ara örneklerdeki iç bilgiler rehberlik olarak hizmet edebileceğine dair varsayıma dayanır.












