Yapay zeka modelleri ve platformları
Kavram Kaydırıcıları: LoRA Adaptörleri ile Diffusion Modellerinde Hassas Kontrol
Metin-görsel diffusion modelleri , sanatsal toplulukta büyük bir popülerlik kazanmıştır. Ancak, mevcut modeller, devlet-sanatlı çerçeveler dahil, görsel kavramlar ve öznitelikler üzerinde kontrolü sağlamakta zorluk yaşamaktadır. Çoğu model, yalnızca metin ipuçlarına dayanır, bu da sürekli öznitelikleri kesin olarak ayarlamakta zorluklara neden olur. Bu, son kullanıcılara resimleri belirli ihtiyaçlarına göre ayarlamalarını zorlaştırır. Ayrıca, bu üretken çerçeveler yüksek kaliteli ve gerçekçi resimler üretirler, ancak çarpık yüzler veya eksik parmaklar gibi bozulmalara eğilimlidirler.
Bu sınırlamaları aşmak için, geliştiriciler yorumlanabilir Kavram Kaydırıcıları kullanımını önerdiler. Bu kaydırıcılar, son kullanıcılara görsel öznitelikler üzerinde daha büyük bir kontrol sağlama vaat ediyor. Kavram Kaydırıcıları, diffusion modellerinde, bir kavramın parametre yönünü tanımlayarak ve diğer özniteliklerle olan etkileşimi en aza indirerek çalışır. Çerçeve, bu kaydırıcıları örnek resimlerle veya bir dizi ipucu kullanarak oluşturur, böylece hem metinsel hem de görsel kavramlar için yönler oluşturur.

Nihayet, metin-görsel diffusion modellerinde Kavram Kaydırıcıları kullanımı, minimal bir düzeyde müdahale ile resim oluşturmasına ve çıktı üzerinde artan bir kontrol sağlama yeteneğine sahip olabilir. Ayrıca, resimlerin gerçekçi görünümünü artırmadan içeriklerini değiştirmeden gerçekçi resimler oluşturabilir. Bu makalede, metin-görsel çerçevelerde Kavram Kaydırıcıları kullanımının kavramını daha derinlemesine tartışacağız ve bunların kullanımının daha yüksek kaliteli AI tarafından oluşturulan resimlere nasıl yol açabileceğini analiz edeceğiz.
Kavram Kaydırıcıları Giriş
Önceden de bahsedildiği gibi, mevcut metin-görsel diffusion çerçeveleri, oluşturulan resimlerde görsel kavramlar ve öznitelikler üzerinde kontrolü sağlamakta zorluk yaşamaktadır. Ayrıca, birçok model, sürekli öznitelikleri ayarlamakta zorluk yaşamaktadır. Kavram Kaydırıcıları, bu sorunları hafifletmeye yardımcı olabilir ve içerik oluşturuculara ve son kullanıcılara resim oluşturma sürecinde daha büyük bir kontrol sağlama yeteneği kazandırabilir.
Çoğu güncel metin-görsel diffusion modeli, resim özniteliklerini kontrol etmek için doğrudan metin ipucu değişikliğine dayanır. Bu yaklaşım, resim oluşturmasına izin verir, ancak optimal değildir, çünkü ipucunu değiştirmek resmin yapısını büyük ölçüde değiştirebilir. Başka bir yaklaşım, Post-hoc tekniklerini kullanır, bu da diffusion sürecini tersine çevirir ve görsel kavramları düzenlemek için cross-attentions’u değiştirir. Ancak, Post-hoc teknikleri sınırlamalara sahiptir ve yalnızca sınırlı sayıda eşzamanlı düzenleme destekler ve her yeni kavram için bireysel müdahale geçişleri gerektirir. Ayrıca, dikkatli bir şekilde tasarlanmazlarsa kavramsal karışıklığa neden olabilirler.
Kavram Kaydırıcıları, resim oluşturma için daha verimli bir çözüm sunar. Bu hafif ve kolayca kullanılabilen adaptörler, önceden eğitilmiş modellere uygulanabilir ve istenen kavramlar üzerinde kontrolü ve kesinliği artırabilir. Kavram Kaydırıcıları, görsel kavramları düzenleme yeteneğine sahiptir ve metin ipucu tabanlı düzenleme yöntemlerinden farklı olarak, metinsel açıklamalarla kapsanmayan görsel kavramları düzenleme yeteneğine sahiptir. Resim tabanlı özelleştirme yöntemleri, resim tabanlı kavramlar için token eklemeye etkili bir şekilde kullanılabilir, ancak resimleri düzenlemek için uygulanması zordur. Kavram Kaydırıcıları, son kullanıcılara bir kavramı tanımlamak için küçük bir resim çifti sağlamalarına olanak tanır ve sonra bu kavramı otomatik olarak diğer resimlere uygular, böylece gerçekçiliği artırmaya ve bozulmaları düzeltmeye çalışır.
Kavram Kaydırıcıları, dört üretken AI ve diffusion çerçeve kavramından kaynaklanan sorunları öğrenmek ve çözmek için tasarlanmıştır: Görsel Düzenleme, Rehber Tabanlı Yöntemler, Model Düzenleme ve Semantik Yönlendirme.
Görsel Düzenleme
Mevcut AI çerçeveleri, ya resim yapısını rehberlik etmek için koşullu bir girdi kullanır ya da kaynak resminin hedef ipucuyla cross-attentions’unu manipüle eder, böylece metin-görsel diffusion çerçevelerinde tek resim düzenleme sağlar. Sonuç olarak, bu yaklaşımlar yalnızca tek resimlerde uygulanabilir ve her resim için zaman içindeki geometrik yapıların gelişimi nedeniyle her resim için latent temel optimizasyonu gerektirir.
Rehber Tabanlı Yöntemler
Sınıflandırıcı-free rehber tabanlı yöntemlerin kullanımı, oluşturulan resimlerin kalitesini artırmaya ve metin-görsel hizalamayı tăngırmaya yeteneklerini göstermiştir. Müdahale sırasında rehber terimlerini dahil ederek, bu yöntem, diffusion çerçevelerinin sınırlı bileşenlerini miras alanları geliştirir ve diffusion çerçevelerindeki güvensiz kavramlardan geçişi sağlar.
Model Düzenleme
Kavram Kaydırıcıları kullanımının, bir model düzenleme tekniği olarak da görülebileceği, düşük-rank bir adaptör kullanarak tek bir semantik özniteliği çıkarmak ve sürekli kontrolü sağlayan bir öznitelik oluşturmak için tasarlandığı da söylenebilir. Fine-tuning tabanlı özelleştirme yöntemleri, daha sonra çerçeveyi yeni kavramlar eklemek için kişiselleştirmek için kullanılır. Ayrıca, Özel Diffusion tekniği, yeni görsel kavramları önceden eğitilmiş diffusion modellerine dahil etmek için cross-attention katmanlarını fine-tune etme yöntemini önerir. Metin Diffusion tekniği, model yeteneklerini aktive etmek ve çerçeveye metinsel kavramlar eklemek için bir gömme vektörünü optimize etmeyi önerir.
GAN’lerde Semantik Yönlendirme
Semantik özniteliklerin manipülasyonu, Generatif Karşıt Ağların (GAN) ana özelliklerinden biridir ve latent uzay yolları, kendiliğinden bir şekilde hizalanmış olarak bulunur. Diffusion çerçevelerinde, bu latent uzay yolları, U-Net mimarisinin orta katmanlarında bulunur ve latent uzayların ana yönü, diffusion çerçevelerinde küresel semantikleri yakalar. Kavram Kaydırıcıları, özel özniteliklere karşılık gelen düşük-rank alt uzayları doğrudan eğitir ve metin veya resim çiftlerini kullanarak küresel yönleri optimize ederek kesin ve yerel düzenleme yönleri sağlar.
Kavram Kaydırıcıları: Mimarisi ve Çalışma
Diffusion Modelleri ve LoRA veya Düşük Rütbeli Adaptörler
Diffusion modelleri, temel olarak, veriyi sentezlemek için bir diffusion sürecini tersine çeviren üretken AI çerçevelerinin bir alt sınıfıdır. İlerleyen diffusion süreci, ilk olarak veriye gürültü ekler, böylece organize bir durumdan tam bir Gaussian gürültü durumuna geçiş olur. Diffusion modellerinin birincil amacı, diffusion sürecini tersine çevirmek ve yavaş yavaş gürültüyü temizleyerek bir resim örneği almaktır. Gerçek dünya uygulamalarında, diffusion çerçevelerinin birincil amacı, tam Gaussian gürültü ve ek girdiler gibi koşullama ve zaman adımları ile birlikte verilen gerçek gürültüyü tahmin etmek ve bir resim oluşturmaktır.
LoRA veya Düşük Rütbeli Adaptörler tekniği, önceden eğitilmiş büyük çerçevelerin aşağı akış görevlerinde verimli bir şekilde uyarlanmasını sağlamak için, ağırlık güncellemelerini, hem girdi hem de çıktı boyutlarına göre, düşük boyutlu bir alt uzaya ayırır.
Kavram Kaydırıcıları
Kavram Kaydırıcılarının birincil amacı, diffusion çerçevelerinde kavram hedefli resimlerin üzerinde daha büyük bir kontrol sağlamak için LoRA adaptörlerini fine-tune etmektir ve bu, aşağıdaki resimde gösterilmektedir.

Hedef kavramlara koşullandırıldığında, Kavram Kaydırıcıları, belirli özniteliklerin ifadesini artırmak veya azaltmak için düşük-rütbeli parametre yönleri öğrenir. Bir model ve hedef kavram için, Kavram Kaydırıcılarının birincil amacı, özniteliklerin artırılma olasılığını artırmak ve azaltma olasılığını azaltmak için bir model oluşturmaktır. Parametreleştirme ve Tweedie formülünü kullanarak, çerçeve, bir zaman-varyantlı gürültü süreci tanır ve her puanı bir gürültü temizleme tahmini olarak ifade eder. Ayrıca, ayrıştırma nesnesi, Kavram Kaydırıcıları’ndaki modülleri, önceden eğitilmiş ağırlıkları sabit tutarak fine-tune eder ve LoRA formülasyonunda tanımlanan ölçek faktörü, müdahale sırasında değiştirilir. Ölçek faktörü, ayrıca, düzenlemenin gücünü ayarlamayı sağlar ve düzenlemeleri daha güçlü hale getirmek için çerçeveyi yeniden eğitmeye gerek kalmaz, aşağıdaki resimde gösterildiği gibi.

Önceki çerçeveler tarafından kullanılan düzenleme yöntemleri, daha güçlü düzenlemeler için çerçeveyi artan rehberlik ile yeniden eğitmeyi gerektirirdi. Ancak, ölçek faktörünü müdahale sırasında ölçeklendirme, aynı düzenleme sonuçlarını, yeniden eğitim maliyetini artırmadan sağlar.
Görsel Kavramların Öğrenilmesi
Kavram Kaydırıcıları, metin ipuçlarının iyi tanımlayamadığı görsel kavramları kontrol etmek için tasarlanmıştır ve bu kaydırıcılar, önce veya sonra eşleştirilmiş küçük veri kümelerini kullanarak bu kavramları eğitmek için tasarlanmıştır. Resim çiftleri arasındaki karşıtlık, kaydırıcıların görsel kavramları öğrenmesini sağlar. Ayrıca, Kavram Kaydırıcılarının eğitim süreci, hem ileri hem de geri yönde uygulanan LoRA bileşenini optimize eder. Sonuç olarak, LoRA bileşeni, her iki yönde de görsel etkileri yaratan yöne hizalanır.
Kavram Kaydırıcıları: Uygulama Sonuçları
Performans kazancını analiz etmek için, geliştiriciler, Kavram Kaydırıcılarının kullanımını主要 olarak Stable Diffusion XL üzerinde değerlendirmişlerdir, bu, yüksek çözünürlüklü 1024-piksel bir çerçevedir ve ek deneyler, Stable Diffusion v1.4 çerçevesi üzerinde yapılmıştır, modeller her biri 500 epoch için eğitilmiştir.
Metinsel Kavram Kaydırıcıları
Metinsel Kavram Kaydırıcılarının performansını değerlendirmek için, 30 metin tabanlı kavram üzerinde doğrulanmıştır ve yöntem, standart bir metin ipucu kullanarak sabit bir aantal zaman adımları için karşılaştırılmıştır ve sonra kompozisyonu başlatmak için ipuçlarını eklemeye başlar. Aşağıdaki figura göre, Kavram Kaydırıcılarının kullanımı, daha yüksek CLIP puanı ve LPIPS puanında sürekli bir azalma ile sonuçlanır, bu, orijinal çerçeveden daha iyidir.


Yukarıdaki resimde görüldüğü gibi, Kavram Kaydırıcıları, resim oluşturma sürecinde istenen özniteliklerin kesin bir şekilde düzenlenmesine olanak tanır, böylece resmin genel yapısını korur.
Görsel Kavram Kaydırıcıları
Yalnızca metin ipuçlarına dayanan metin-görsel diffusion modelleri, genellikle sakal veya göz şekli gibi görsel öznitelikler üzerinde daha yüksek bir kontrol sağlamakta zorluk yaşamaktadır. Daha granüler öznitelikler üzerinde daha iyi bir kontrol sağlamak için, Kavram Kaydırıcıları, isteğe bağlı metin rehberliği ile birlikte resim veri kümelerini kullanır. Aşağıdaki figura göre, Kavram Kaydırıcıları, “göz büyüklüğü” ve “kaş şekli” için bireysel kaydırıcılar oluşturur ve resim çiftleri kullanarak istenen dönüşümleri yakalar.

Sonuçlar, belirli bir yüz bölgesine odaklanmak için özel metinler sağlayarak daha da iyileştirilebilir, böylece yön, hedeflenen özniteliğe odaklanır ve adım adım kontrolü sağlar.
Kaydırıcıları Birleştirmek
Kavram Kaydırıcıları kullanımının birincil avantajlarından biri, birleştirilebilirliğidir, bu da kullanıcıların birden fazla kaydırıcıyı birleştirmelerine ve tek bir kavram üzerinde odaklanmak yerine daha büyük bir kontrol sağlamalarına olanak tanır. Ayrıca, Kavram Kaydırıcıları, hafif LoRA adaptörleri olduğu için, paylaşılması kolaydır ve diffusion modelleri üzerine kolayca bindirilebilir. Kullanıcılar, ilginç kaydırıcı setlerini indirerek ve birden fazla düğmeyi aynı anda ayarlayarak karmaşık oluşturmaları yönlendirebilir.

Aşağıdaki resim, kavram kaydırıcılarının birleştirme yeteneklerini gösterir ve birden fazla kaydırıcı, her satırda soldan sağa ilerleyerek, yüksek boyutlu kavram uzaylarını daha büyük bir kontrol ile gezinmeye olanak tanır.

Görsel Kalitesini İyileştirme
Devlet-sanatlı metin-görsel diffusion çerçeveleri ve büyük ölçekli üretken modeller gibi Stable Diffusion XL modeli, gerçekçi ve yüksek kaliteli resimler oluşturabilir, ancak genellikle bulanık veya çarpık nesneler gibi resim bozulmalarına eğilimlidir,尽管 bu çerçevelerin parametreleri, daha az oluşturma ile yüksek kaliteli çıktı üretme yeteneğine sahiptir. Kavram Kaydırıcıları kullanımı, daha az bozulmalarla resim oluşturmasına yol açabilir ve bu modellerin gerçek yeteneklerini kilidini açar ve düşük-rütbeli parametre yönlerini tanımlar.
Elleri Düzeltme
Görsel gerçekçi ellere sahip resimler oluşturmak, diffusion çerçeveleri için her zaman bir engel olmuştur ve Kavram Kaydırıcıları kullanımı, doğrudan ellerin bozulma eğilimini kontrol edebilir. Aşağıdaki resim, “elleri düzeltme” Kavram Kaydırıcılarının kullanımının etkisini gösterir ve çerçeveyi daha gerçekçi görünen ellere sahip resimler oluşturmasına olanak tanır.

Tamir Kaydırıcıları
Kavram Kaydırıcıları kullanımı, yalnızca daha gerçekçi görünen ellere sahip resimler oluşturmakla kalmaz, aynı zamanda oluşturulan resimlerin genel gerçekçiliğini artırmada da potansiyelini göstermiştir. Kavram Kaydırıcıları, ortak bozulma sorunlarından kaçınmak için tek bir düşük-rütbeli parametre yönünü tanımlar ve aşağıdaki resimde gösterilen sonuçları sağlar.

Son Düşünceler
Bu makalede, Kavram Kaydırıcılarından bahsettik, bu, diffusion modellerinde yorumlanabilir kontrolü sağlayan yeni ve ölçeklenebilir bir paradigmadır. Kavram Kaydırıcıları kullanımı, mevcut metin-görsel diffusion çerçevelerinin karşılaştığı sorunları çözmeyi amaçlar, bu çerçeveler, oluşturulan resimlerde görsel kavramlar ve öznitelikler üzerinde kontrolü sağlamakta zorluk yaşamaktadır. Ayrıca, çoğu metin-görsel diffusion modeli, sürekli öznitelikleri ayarlamakta zorluk yaşamaktadır, bu da genellikle tatmin edici olmayan çıktılara yol açar. Kavram Kaydırıcıları kullanımı, bu sorunları hafifletmeye yardımcı olabilir ve içerik oluşturuculara ve son kullanıcılara resim oluşturma sürecinde daha büyük bir kontrol sağlama yeteneği kazandırabilir ve mevcut çerçevelerin karşılaştığı sorunları çözebilir.












