Anderson’un Açısı
NVIDIA’nin eDiffi Difüzyon Modeli ‘Sözcüklerle Boyama’ ve Daha Fazlasını Sağlar

Stable Diffusion gibi latent difüzyon generatif görüntü modelleriyle precisa kompozisyonlar oluşturmak, kedileri gütmek gibi olabilir; sistem, olağanüstü ayrıntı yaratmak ve basit metin-promt’lardan olağanüstü görüntüler oluşturmak için kullanılan aynı hayal gücünü ve yorumlama yeteneklerini kapatmak da zor olabilir.
Şimdi, NVIDIA araştırma ekibinin yeni bir yaklaşımı, “ensemble difüzyon için görüntüler” (eDiffi) adlı bir çalışma, pipeline boyunca aynı yöntemi kullanmak yerine birden fazla gömme ve yorumlama yönteminin karışımını kullanarak oluşturulan içeriğe çok daha fazla kontrol sağlar. Aşağıdaki örnekte, her renk bir metin-promt’tan bir kelimeyi temsil eden bir kullanıcıyı boyarken görüyoruz:

Sözcüklerle boyama, NVIDIA’nin eDiffi difüzyon modelinin iki yeni yeteneğinden biridir. Her bir sürülmüş renk, promt’ta görünen bir kelimeyi temsil eder ve uygulanan alan rengi yalnızca o öğeden oluşur. Daha fazla örnek ve daha iyi çözünürlük için makalenin sonundaki gömülü resmi videya bakın.
Esasen bu, ‘maskelerle boyama’ ve Stable Diffusion’daki npainting paradigmasını tersine çevirir. Stable Diffusion, bozuk veya tatmin edici olmayan görüntüleri düzeltmek veya ilk başta olması gerektiği gibi olan görüntüleri genişletmek için dayanır.
Burada, bunun yerine, boyanmış sürüntülerin kenarları, tek bir kavramdan tek bir öğenin izin verilen yaklaşık sınırlarını temsil eder ve kullanıcı, son canvas boyutunu baştan belirleyebilir ve sonra ayrı ayrı öğeler ekleyebilir.

Makaledeki örnekler. Kaynak: https://arxiv.org/pdf/2211.01324.pdf
eDiffi’de kullanılan çeşitli yöntemler, sistemlerin aynı zamanda uzun ve ayrıntılı promt’lerdeki her öğeyi dahil etme konusunda çok daha iyi bir iş çıkardığını anlamına gelir. Stable Diffusion ve OpenAI’nin DALL-E 2, promt’taki belirli kısımlarını önceliklendirmeye eğilimlidir, ya promt’ta görünme sırasına bağlı olarak ya da çeşitli öğelerin tam bir kompozisyon için gerekli olan çeşitli öğelerin ayrıştırılmasındaki potansiyel zorluğa bağlı olarak.

Makaledeki resim: eDiffi, promt’taki maksimum sayıda öğeyi oluşturmak için daha kapsamlı bir şekilde yinelemeye sahiptir. eDiffi için geliştirilmiş sonuçlar (en sağ sütun) cherry-picked, ancak Stable Diffusion ve DALL-E 2’den karşılaştırmalı görüntüler de cherry-picked.
Dahası, ayrı bir T5 metin-çevir çevirici kullanılması, eDiffi’nin anlamlı İngilizce metin oluşturmasını sağlar, ya da soyut olarak bir promt’tan istendiğinde (yani görüntüde [x] metni içerir) ya da açıkça istendiğinde (yani t-shirt ‘Nvidia Rocks’ der):

eDiffi’de metin-çevir işleminin kullanılması, görüntülerde metni kelimesi kelimesine oluşturulmasını sağlar, bunun yerine yalnızca metin-görüntü yorumlama katmanından geçirilir ve çıktı bozulur.
Yeni çerçevede ayrıca, bir stil promt’ı olarak tek bir görüntüyü sağlamak mümkün, bunun yerine bir DreamBooth modelini eğitmek veya bir metinsel gömme kullanmak gerekmez.

Referans görüntüsünden metin-görüntü promt’ına veya hatta görüntü-görüntü promt’ına stil aktarımı uygulanabilir.
Yeni makale eDiffi: Metin-Görüntü Difüzyon Modelleri ile Uzman Gürültü Azaltıcıların Birlikte Kullanılması başlığını taşır ve
T5 Metin Çevirici
T5 Metin-Çevir Çeviricisi (T5) kullanılması, eDiffi’de gösterilen geliştirilmiş sonuçların anahtarıdır. Ortalama latent difüzyon pipeline, internetten alınan veya daha sonra manuel olarak ayarlanan görüntülerle birlikte gelen açıklamalar arasındaki ilişkiye dayanır.

T5 için Temmuz 2020’de yapılan makale – metin tabanlı dönüşümler, eDiffi’deki (ve potansiyel olarak diğer latent difüzyon modellerindeki) generatif görüntü iş akışını destekleyebilir. Kaynak: https://arxiv.org/pdf/1910.10683.pdf
Kaynak metni yeniden ifade ederek ve T5 modülünü çalıştırarak, orijinal modelde eğitilenlerden daha kesin ilişkiler ve temsilciler elde edilebilir, neredeyse sonradan manuel etiketleme gibi, daha spesifik ve metin-promt’taki şartlara uygulanabilir.
Yazarlar açıklar:
‘Mevcut difüzyon modelleri çalışmalarının çoğunda, gürültü azaltma modeli tüm gürültü seviyeleri boyunca paylaşılmaktadır ve zaman dinamiği, gürültü azaltma modeline bir MLP ağı aracılığıyla beslenen basit bir zaman gömmesi kullanılarak temsil edilir. Biz, gürültü azaltma difüzyonunun karmaşık zaman dinamiğinin, paylaşılan bir modelle sınırlı bir kapasite kullanılarak veriden etkili bir şekilde öğrenilemeyeceğini savunuyoruz.
‘Bunun yerine, gürültü azaltma modelinin kapasitesini, her biri belirli bir gürültü seviyesi aralığına özgü uzman gürültü azaltıcılar kümesini tanıtarak ölçeklendirmeyi öneriyoruz. Bu şekilde, model kapasitesini artırabiliriz, ancak örneklemenin hesaplanma karmaşıklığını aynı düzeyde tutabiliriz.’

eDiffi’nin kavramsal iş akışı.
Mevcut CLIP kodlama modülleri, DALL-E 2 ve Stable Diffusion’da dahil olanlar, aynı zamanda kullanıcı girişine ilgili metin için alternatif görüntü yorumlamalarını bulma konusunda da yeteneklidir. Ancak bunlar, orijinal modelle benzer bilgilerle eğitilir ve eDiffi’de T5 gibi ayrı bir yorumlama katmanı olarak kullanılmazlar.
Yazarlar, eDiffi’nin bir T5 ve bir CLIP kodlayıcının ilk kez tek bir pipeline’a dahil edildiğini belirtiyorlar:
’Bu iki kodlayıcı, farklı hedeflerle eğitildiğinden, aynı girdi metniyle farklı görüntü oluşumlarını destekleyen gömme katmanlarına sahiptir. CLIP metin gömme katmanları, oluşturulan görüntülerin genel görünümünü belirlemede yardımcı olur, ancak çıktı genellikle metinde bulunan ince ayrıntıları kaçırır.
‘Öte yandan, yalnızca T5 metin gömme katmanlarıyla oluşturulan görüntüler, metinde tanımlanan bireysel nesneleri daha iyi yansıtır, ancak genel görünüm daha az doğrudur. Bunları birlikte kullanarak, modelimiz en iyi görüntü oluşturma sonuçlarını elde eder.’
Difüzyon Sürecini Kesintiye Uğratma ve Artırma
Makale, tipik bir latent difüzyon modelinin, metni kullanarak, gürültüden görüntüye giden yolculuğun başlangıcında güvenerek başladığını belirtir.
Gürültü, metin-promt’taki açıklamayı temsil eden bir tür kaba düzen haline geldiğinde, metin-kılavuzlu süreç esasen düşer ve süreç, görsel özelliklerin artırılmasına doğru kayar.
Bu, metin-kılavuzlu gürültü yorumlama aşamasında çözülmemiş olan herhangi bir öğenin, iki sürecin (metin-düzen ve düzen-görüntü) birbirleriyle çok az örtüştüğü ve temel düzenin görüntüleme işleminde ortaya çıktığında oldukça karmaşık hale geldiği için görüntüye daha sonra enjekte edilmesi zordur.

Makaledeki resim: difüzyon işleminin olgunlaşması sırasında pipeline’ın çeşitli kısımlarının dikkat haritaları. CLIP’in görüntüdeki etkisinin alt satırda keskin bir şekilde düşüşünü, T5’in ise görüntüye daha uzun bir süre boyunca etki etmeye devam ettiğini görebiliriz.
Profesyonel Potansiyel
Proje sayfası ve YouTube videosundaki örnekler, PR dostu meme-tastik güzel görüntülerin oluşturulmasına odaklanıyor. NVIDIA araştırma ekibi, son yeniliğinin fotorealistik veya VFX iş akışlarını iyileştirme, derin sahte görüntü ve video oluşturma potansiyelini genellikle küçümsüyor.
Örneklere bir acemi veya amatör kullanıcı, belirli bir öğenin yerleştirilmesi için kaba konturlar çizerken, daha sistematik bir VFX iş akışında, eDiffi’yi, metin-görüntü kullanarak video öğelerinin birden fazla karesini yorumlamak için kullanmak mümkün olabilir, burada konturlar çok nettir ve örneğin yeşil ekran veya algoritmik yöntemler kullanılarak arka planı çıkarılmış figürlerden oluşur.

Runway ML zaten AI tabanlı rotoskopi sunuyor. Bu örnekte, konunun etrafındaki ‘yeşil ekran’, alfa katmanını temsil eder, ve çıkarılma, gerçek bir yeşil ekran arka planının algoritmik olarak çıkarılmasından ziyade makine öğrenimi ile gerçekleştirilmiştir. Kaynak: https://twitter.com/runwayml/status/1330978385028374529
Bir eğitilmiş DreamBooth karakteri ve eDiffi ile görüntü-görüntü pipeline’ı kullanarak, latent difüzyon modelinin bir baş belası olan zamansal istikrarı çivileyebilecek bir başlangıç yapılabilir. Böyle bir durumda, hem uygulanan görüntü hem de görüntünün içeriği, kullanıcı canvas’ına karşı ‘ön yüzer’ ve görüntülenen içeriğin zamansal sürekliliği, ‘hatırlanmış’ eğitim verilerine sahip kilitli bir DreamBooth modeli kullanılarak sağlanır – yorumlanabilirlik için kötü, ancak yeniden üretilebilirlik, sadakat ve süreklilik için harika.
Yöntem, Veri ve Testler
Makale, eDiffi modelinin ‘kamuya açık ve özel veri setlerinin bir koleksiyonu’ üzerinde eğitildiğini, önceden eğitilmiş bir CLIP modeli tarafından ağır bir şekilde süzülerek, genel estetik puanını düşürecek görüntüleri çıkarmak için süzüldüğünü belirtir. Son süzülmüş görüntü kümesi, ‘yaklaşık bir milyar’ metin-görüntü çiftini içerir. Eğitim görüntülerinin boyutu, ‘en kısa kenarın 64 pikselden büyük’ olarak tanımlanır.
Çeşitli modeller, hem temel hem de süper çözünürlük modelleri, AdamW optimizer ile 0.0001’lik öğrenme hızında ve 0.01’lik ağırlık azalmayla, 2048’lik bir toplu işleme boyutunda eğitildi.
Temel model, 256 NVIDIA A100 GPU’larında, ve iki süper çözünürlük modeli, her biri için 128 NVIDIA A100 GPU’larında eğitildi.
Sistem, NVIDIA’nın kendi Imaginaire PyTorch kütüphanesine dayanıyordu. COCO ve Visual Genome veri setleri, modele dahil edilmemiş olsa da, değerlendirme için kullanıldı, MS-COCO ise test için kullanılan específik varyanttı. Karşılaştırılmış sistemler, GLIDE, Make-A-Scene, DALL-E 2, Stable Diffusion ve Google’ın iki görüntü sentez sistemi, Imagen ve Parti idi.
Benzer önceki çalışmalar ile uyumlu olarak, zero-shot FID-30K bir değerlendirme ölçütü olarak kullanıldı. FID-30K altında, 30.000 açıklama, COCO doğrulama kümesinden rastgele çıkarıldı (yani eğitimde kullanılan görüntüler veya metin değil), bunlar daha sonra görüntü sentezlemek için metin-promt’ları olarak kullanıldı.
Oluşturulan ve gerçek görüntüler arasındaki Frechet Inception Distance (FID) hesaplandı, ayrıca oluşturulan görüntüler için CLIP puanı kaydedildi.

COCO 2014 doğrulama veri setindeki zero-shot FID testlerinin sonuçları, daha düşük sonuçlar daha iyidir.
Sonuçlarda, eDiffi, zero-shot FID’de even karşılaştırılmış sistemlerin çok daha fazla parametreye (örneğin, Parti’deki 20 milyar parametre) sahip olmasına rağmen en düşük (en iyi) puanı elde edebildi.
SONUÇ
NVIDIA’nın eDiffi’si, mevcut sistemlere daha fazla veri ve karmaşıklık eklemektense, daha akıllı ve katmanlı bir yaklaşım kullanarak latent difüzyon generatif görüntü sistemlerindeki bazı en zorlu engellere bir alternatif sunar.
Stable Diffusion alt reddit ve Discord’larında, eDiffi için kod oluşturulursa, bu kodun doğrudan dahil edilmesi veya ilkelerin ayrı bir uygulamasının yapılmasıyla ilgili tartışmalar đang sürüyor. Yeni pipeline ise o kadar radikal olarak farklı ki, bu, SD için tüm bir sürüm numarası değişikliği oluştururdu, bazı geri dönüşümsüzlüğü feda ederek, ancak latent difüzyonun çekici hayal gücü yeteneklerini feda etmeden, son oluşturulan görüntüler üzerinde çok daha gelişmiş kontrol seviyeleri sunma olanağı sunar.
İlk olarak 3 Kasım 2022’de yayınlandı.












