Anderson’un Açısı
Google’ın Imagic ve Runway’in ‘Erase and Replace’ ile Nesne Düzenleme

Bu hafta, iki yeni ancak karşıt AI sürücülü grafik algoritmaları, fotoğraflardaki nesnelere son derece ince ve etkili değişiklikler yapma konusunda kullanıcılar için yeni yollar sunuyor.
İlki, Google Araştırma tarafından, İsrail Teknoloji Enstitüsü ve Weizmann Bilim Enstitüsü ile işbirliği içinde geliştirilen Imagic. Imagic, difüzyon modellerinin ince ayarlanması yoluyla metin koşullu, ince ayrıntılı nesne düzenleme sunuyor.

Değiştirmek istediğiniz şeyi değiştirin ve geri kalanını bırakın – Imagic, yalnızca değiştirmek istediğiniz kısımların ince ayrıntılı düzenlenmesini vaat ediyor. Kaynak: https://arxiv.org/pdf/2210.09276.pdf
Herhangi bir Stable Diffusion yeniden 렌derlemeye çalışmış herkes, başarılı bir düzenleme için sistem tarafından değiştirilen beş şeyi bilir. Bu, birçok yetenekli SD entusiastının Stable Diffusion ve Photoshop arasında sürekli olarak geçiş yapmasına neden olan bir eksikliktir. Bu açıdan bakıldığında, Imagic’in başarıları dikkat çekici görünüyor.
Yazının yazıldığı tarihte, Imagic hala bir tanıtım videosuna sahip değildi ve Google’ın dikkatli tutumu nedeniyle, sistemle deney yapma şansımızın ne kadar olacağı belirsizdi.
İkinci teklif, Runway ML’nin daha erişilebilir Sil ve Değiştir özelliği, makine öğrenimi tabanlı görsel efekt araçları koleksiyonunun “AI Magic Tools” bölümünde yeni bir özelliktir.

Runway ML’nin Sil ve Değiştir özelliği, already seen in a preview for a text-to-video editing system. Kaynak: https://www.youtube.com/watch?v=41Qb58ZPO60
Runway’in çıkışını önce inceleyelim.
Sil ve Değiştir
Sil ve Değiştir, Imagic gibi, yalnızca durağan görüntülerle ilgilenir, ancak Runway, henüz yayınlanmayan bir metin-videya düzenleme çözümünde aynı işlevi önizlemiştir:

Herkes görüntülerde yeni Sil ve Değiştir’i test edebilir, ancak video versiyonu henüz halka açık değil. Kaynak: https://twitter.com/runwayml/status/1568220303808991232
Runway ML, Sil ve Değiştir’in arkasındaki teknolojiler hakkında ayrıntı vermedi, ancak bir ev plantını makul bir şekilde ikna edici bir Ronald Reagan büstü ile değiştirmek için gereken hız, bir difüzyon modelinin, muhtemelen Stable Diffusion (veya çok daha az olası bir şekilde, lisanslı DALL-E 2) tarafından çalıştırıldığını gösteriyor.

Bir ev plantını bir Ronald Reagan büstü ile değiştirmek bu kadar hızlı değil, ancak oldukça hızlı.
Sistem, bazı DALL-E 2 türü kısıtlamalarına sahiptir – görüntüler veya metin, Sil ve Değiştir filtrelerini tetikleyecek şekilde işaretlendiğinde, olası hesap askıya alınma uyarısı verir – pratikte OpenAI’nin DALL-E 2 için politikalarının bir klonu.

Runway ML’nin Sil ve Değiştir özelliği, ev masasını ‘buzdan yapılmış bir masa’ ile değiştiriyor.
Sil ve Değiştir, nesne odaklı – boş bir resim parçasını silip metin.promptının sonucuyla dolduramazsınız; bu durumda sistem, maskenin görüş hattı boyunca en yakın görünür nesneyi (duvar, televizyon gibi) izler ve dönüşümü orada uygular.

Sil ve Değiştir’in adı gibi, boş bir alana nesne enjekte edemezsiniz. Burada, en ünlü Sith lordunu çağırmaya çalışırken, ‘replace’ alanının çizildiği yere yakın bir TV’de garip bir Vader ile ilgili mural oluşuyor.
Sil ve Değiştir, etkili bir nesne ikame sistemi ve mükemmel bir doldurma işlemi sunuyor. Ancak, mevcut algılanan nesneleri düzenleyemez, yalnızca değiştirebilir. Mevcut görüntü içeriğini değiştirmedenambient materyali bozmak, bilgisayar görme araştırmalarının ayrıştırma mücadelesiyle bağlantılı daha zor bir görevdir.
Imagic
Bu görevi Imagic ele alıyor. Yeni makale, fotoğrafların bireysel yönlerini değiştirmeyi başaran birçok düzenleme örneği sunuyor.

Imagic’te, değiştirilen görüntüler, derin sahte kukla oyununun karakteristik gerilme, bozulma ve ‘gizleme tahminini’ yaşamaz.
Sistem, üç aşamalı bir süreç kullanıyor – metin gömme optimizasyonu, model ince ayarlaması ve nihayet, değiştirilen görüntünün oluşturulması.

Imagic, hedef metin.promptını almak için ilk metin gömmesini kodlar, sonra sonucu girdiği görüntüyü elde etmek için optimize eder. Ardından, üretken model, kaynak görüntüsüne ince ayarlanır ve bir dizi parametre eklenir, sonra istenen interpolasyona tabi tutulur.
Çerçeve, Google’ın Imagen metin-videya mimarisi üzerine kuruludur, ancak araştırmacılar, sistemin ilkelerinin genel olarak gizil difüzyon modellerine uygulanabilir olduğunu belirtiyorlar.
Imagen, yedi katmanlı bir dizi yerine üç katmanlı bir mimari kullanıyor. Üç ayrı modül, 64x64px çözünürlükte çalışan bir üretken difüzyon modeli, bu çıktıyı 256x256px’ye ölçekleyen bir süper çözünürlük modeli ve son çıktıyı 1024×1024 çözünürlüğe çıkaran ek bir süper çözünürlük modeli içerir.
Imagic, bu sürecin en başlangıcında müdahale eder, 64px aşamasında Adam optimizatörü ile sabit bir öğrenme hızında (0.0001) istenen metin gömmesini optimize eder.

Bir difüzyon, GAN veya NeRF modelinde bir nesnenin rengini değiştirmeye çalışan kullanıcılara, Imagic’in bu dönüşümleri görüntünün geri kalanının tutarlılığını bozmadan gerçekleştirebildiği anlaşılacaktır.
İnce ayar daha sonra Imagen’in temel modeli üzerinde, her girdi görüntüsü için 1500 adımda, revize edilmiş gömme koşullarına göre gerçekleşir. Aynı zamanda, ikincil 64px>256px katmanı, koşullu görüntüde paralel olarak optimize edilir. Araştırmacılar, benzer bir optimizasyonun son 256px>1024px katmanında ‘hiçbir etkisi’ olmadığını ve bu nedenle bunu uygulamadıklarını belirtiyorlar.
Makale, optimizasyon sürecinin her görüntüde yaklaşık sekiz dakika sürdüğünü, çift TPUV4 çipleri kullanılarak belirtiyor. Son render, temel Imagen’de DDIM örneklemesi altında gerçekleşiyor.
Benzer fine-tuning süreçleri gibi Google’ın DreamBooth için, oluşan gömmeler ayrıca stil化 için güç sağlayabilir ve ayrıca photorealistic düzenlemeler için, Imagen’i çalıştıran daha geniş alt yığın veritabanından alınan bilgilerle birlikte kullanılabilir (çünkü, ilk sütun aşağıda gösterildiği gibi, kaynak görüntüler bu dönüşümleri gerçekleştirmek için gerekli içeriğe sahip değildir).

Esnek photoreal hareket ve düzenlemeler Imagic ile elde edilebilir, ayrıca türetilen ve ayrılmış kodlar, stilize edilmiş çıktı için de kullanılabilir.
Araştırmacılar, Imagic’i, 2021’den Stanford Üniversitesi ve Carnegie Mellon Üniversitesi arasındaki bir işbirliği olan GAN tabanlı SDEdit ve Nisan 2022’den Weizmann Bilim Enstitüsü ve NVIDIA arasındaki bir işbirliği olan Text2Live ile karşılaştırdı.

Imagic, SDEdit ve Text2Live arasında görsel karşılaştırma.
İlgili önceki yaklaşımların mücadele ettiği açıkça görülüyor, ancak alt satırda, kaynak materyali tamamen değiştirmek içeren büyük bir değişiklik söz konusu olduğunda, rakipler tamamen başarısız oluyor, Imagic ise önemli bir başarı elde ediyor.
Imagic’in kaynak gereksinimleri ve her görüntüdeki eğitim süresi, bu süreci yerel bir resim düzenleme uygulamasına dahil etmeyiunlikely kılıyor ve bu sürecin tüketici seviyesine indirgenebilir olup olmadığı açık değil.
Şu anda, Imagic, API’lere daha uygun bir teklif sunuyor – Google Araştırma, derin sahte üretim konusundaki eleştirilere karşı temkinli davrandığı için kendilerini daha rahat hissettiği bir ortam.
İlk olarak 18 Ekim 2022’de yayınlandı.












