Anderson’un Açısı
Google’ın Imagic ve Runway’ın ‘Erase and Replace’ Özelliğiyle AI Destekli Nesne Düzenleme

Bu hafta, iki yeni ancak birbirine zıt AI destekli grafik algoritması, son kullanıcıların fotoğraflardaki nesnelerde son derece ayrıntılı ve etkili değişiklikler yapmalarına yeni yollar sunuyor.
İlk olarak, Google Research tarafından, İsrail Teknoloji Enstitüsü ve Weizmann Bilim Enstitüsü iş birliğiyle geliştirilen Imagic geliyor. Imagic, difüzyon modellerinin ince ayarıyla metin koşullandırmalı, ayrıntılı nesne düzenleme imkanı sunuyor.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf
Stable Diffusion ile yeniden render yaparken yalnızca tek bir öğeyi değiştirmeye çalışan herkes, başarılı bir düzenlemenin ardından sistemin beğendiğiniz beş şeyi de değiştirdiğini çok iyi bilir. Bu eksiklik, birçok yetenekli SD meraklısının bu tür ‘yan etkileri’ düzeltmek için Stable Diffusion ve Photoshop arasında sürekli geçiş yapmasına neden oluyor. Bu açıdan bakıldığında, Imagic’in başarıları dikkat çekici görünüyor.
Yazı yazıldığı sırada Imagic henüz bir tanıtım videosuna bile sahip değil ve Google’ın tedbirli tutumu nedeniyle, sınırsız görüntü sentez araçlarını yayınlamaya karşı temkinli olması, sistemi ne ölçüde test edebileceğimiz konusunda belirsizlik yaratıyor.
İkinci sunum ise Runway ML’in daha erişilebilir Erase and Replace özelliği; bu, ‘AI Magic Tools’ bölümündeki yeni bir özellik.

Runway ML’s Erase and Replace feature, already seen in a preview for a text-to-video editing system.
Let’s take a look at Runway’s outing first.
Sil ve Değiştir
Imagic gibi, Sil ve Değiştir sadece sabit görüntülerle çalışır, ancak Runway ön izleme yaptığı aynı işlevi henüz yayınlanmamış bir metin‑video düzenleme çözümünde de gösterdi:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232
Runway ML, Sil ve Değiştir’in arkasındaki teknolojilerin ayrıntılarını yayınlamamış olsa da, bir ev bitkisini makul derecede inandırıcı bir Ronald Reagan büstüyle değiştirme hızı, Stable Diffusion gibi bir difüzyon modelinin (ya da çok daha az olası bir lisanslı DALL‑E 2) Sil ve Değiştir’de seçtiğiniz nesneyi yeniden yaratma motoru olduğunu gösteriyor.

Replacing a house plant with a bust of The Gipper isn’t quite as fast as this, but it’s pretty fast. Source: https://app.runwayml.com/
Sistemde DALL‑E 2 tipi kısıtlamalar bulunuyor – Sil ve Değiştir filtrelerini işaretleyen görüntüler veya metinler, daha fazla ihlal durumunda hesap askıya alınabilir uyarısı tetikleyebilir – bu, OpenAI’nın DALL‑E 2 için yürüttüğü politikalara neredeyse aynen bir kopya.
Sonuçların birçoğu Stable Diffusion’ın tipik pürüzlü kenarlarından yoksun. Runway ML, SD’nin yatırımcıları ve araştırma ortaklarıdır ve muhtemelen açık kaynak 1.4 kontrol noktası ağırlıklarından daha üstün bir özel model eğitmiş olabilir (diğer birçok geliştirme grubu, hobi ve profesyonel olarak Stable Diffusion modellerini eğitiyor veya ince ayar yapıyor).

Substituting a domestic table for a ‘table made of ice’ in Runway ML’s Erase and Replace.
Imagic gibi (aşağıya bakınız), Sil ve Değiştir de bir nevi ‘nesne‑odaklı’dır – görüntünün ‘boş’ bir kısmını silip metin komutunuzun sonucuyla dolduramazsınız; bu durumda sistem, maskenin görüş hattı boyunca en yakın görünen nesneyi (örneğin bir duvar ya da televizyon) izler ve dönüşümü oraya uygular.

As the name indicates, you can’t inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the ‘replace’ area was drawn.
Sil ve Değiştir’in telif hakkı korumalı görüntüleri kullanma konusunda kaçıncı bir tutum sergilediğini (DALL‑E 2’de hâlâ büyük ölçüde engellenen, ancak farklı başarı oranlarıyla gerçekleşen) ya da arka uç render motorunda kullanılan modelin bu tür durumlar için optimize edilmemiş olup olmadığını söylemek zor.

The slightly NSFW ‘Mural of Nicole Kidman’ indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2’s former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous (‘xenomorph’) to the absurd (‘the iron throne’). Inset bottom right, the source picture.
Sil ve Değiştir’in değiştirebildiği nesneleri izole etmek için hangi yöntemleri kullandığını bilmek ilginç olurdu. Muhtemelen görüntü, nesne tanıma ve ardından anlamsal segmentasyonla ayrılmış öğeleri elde etmek için CLIP‘in bir türeviyle işleniyor. Bu işlemlerin hiçbiri, yaygın bir Stable Diffusion kurulumunda bu kadar iyi çalışmıyor.
Ancak hiçbir şey mükemmel değil – bazen sistem silip yerine koymuyor, hatta (yukarıdaki görselde gördüğümüz gibi) alttaki render mekanizması metin komutunun ne anlama geldiğini kesin olarak bildiğinde bile. Bu durumda bir kahve masasını bir xenomorph’a dönüştürmek imkansız oluyor – masa sadece kayboluyor.

A scarier iteration of ‘Where’s Waldo’, as Erase and Replace fails to produce an alien.
Sil ve Değiştir, mükemmel bir doldurma yeteneğine sahip etkili bir nesne değiştirme sistemi gibi görünüyor. Ancak mevcut algılanan nesneleri düzenleyemiyor, sadece yerlerine yenilerini koyabiliyor. Mevcut görüntü içeriğini, ortam materyalini bozmadan değiştirmek, popüler çerçevelerin çeşitli gizli uzaylarındaki ayrıştırma üzerine uzun süredir süren bilgisayarlı görü araştırmalarının zor bir hedefi.
Imagic
Imagic bu görevi ele alıyor. Yeni makale, fotoğrafın bireysel bölümlerini başarılı bir şekilde değiştirirken geri kalanını aynı tutan birçok düzenleme örneği sunuyor.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and ‘occlusion guessing’ characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.
Sistem üç aşamalı bir süreç kullanıyor – metin gömme optimizasyonu; model ince ayarı; ve son olarak düzeltilmiş görüntünün üretilmesi.

Imagic encodes the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.
Beklendiği gibi, çerçeve Google’ın Imagen metin‑video mimarisine dayanıyor, ancak araştırmacılar sistemin prensiplerinin geniş ölçüde gizli difüzyon modellerine uygulanabilir olduğunu belirtiyor.
Imagen, şirketin daha yeni metin‑video sürümü için kullanılan yedi katmanlı yapının aksine üç katmanlı bir mimari kullanıyor. Üç ayrı modül, 64 × 64 px çözünürlükte çalışan bir üretken difüzyon modeli; bu çıktıyı 256 × 256 px’e yükselten bir süper‑çözünürlük modeli; ve çıktıyı 1024 × 1024 px’e kadar çıkartan bir ek süper‑çözünürlük modelinden oluşur.
Imagic, bu sürecin en erken aşamasında devreye girerek, 64 px aşamasında istenen metin gömmesini, sabit 0,0001 öğrenme oranına sahip bir Adam optimizasyonu ile optimize eder.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without ‘tearing apart’ the consistency of the rest of the image.
İnce ayar, ardından Imagen’ın temel modeli üzerinde, revize edilmiş gömme koşullandırmasıyla, her giriş görüntüsü için 1500 adımda gerçekleşir. Aynı anda, ikincil 64 px→256 px katmanı koşullandırılmış görüntü üzerinde paralel olarak optimize edilir. Araştırmacılar, son 256 px→1024 px katmanı için benzer bir optimizasyonun sonuçlar üzerinde ‘çok az ya da hiç etkisi olmadığını’ belirtiyor ve bu yüzden uygulanmadığını söylüyor.
Makale, optimizasyon sürecinin çift TPUV4 çipinde her görüntü için yaklaşık sekiz dakika sürdüğünü belirtiyor. Son render, çekirdek Imagen içinde DDIM örnekleme şeması altında gerçekleşir.
Google’ın DreamBooth için benzer ince ayar süreçleriyle ortak bir noktada, elde edilen gömmeler ayrıca stilizasyonu ve Imagen’ı besleyen daha geniş veri tabanından alınan bilgilerle fotogerçekçi düzenlemeleri desteklemek için kullanılabilir (aşağıdaki ilk sütunda gösterildiği gibi, kaynak görüntüler bu dönüşümleri gerçekleştirmek için gerekli içeriğe sahip değildir).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.
Araştırmacılar, Imagic’i daha önceki çalışmalar olan SDEdit (2021’de Stanford Üniversitesi ve Carnegie Mellon Üniversitesi iş birliğiyle geliştirilen GAN tabanlı bir yaklaşım) ve Text2Live (Nisan 2022’de Weizmann Bilim Enstitüsü ve NVIDIA iş birliği) ile karşılaştırdı.

A visual comparison between Imagic, SDEdit and Text2Live.
Önceki yaklaşımların zorlandığı açık, ancak alt satırda pozda büyük bir değişiklik eklenmesi söz konusu olduğunda, mevcut yöntemler kaynak materyali yeniden şekillendirmekte tamamen başarısız olurken, Imagic belirgin bir başarı gösteriyor.
Imagic’in kaynak gereksinimleri ve görüntü başına eğitim süresi, bu tür çabalar standartlarına göre kısa olsa da, kişisel bilgisayarlarda yerel bir görüntü düzenleme uygulamasına dahil edilmesi olası görünmüyor – ve ince ayar sürecinin tüketici seviyelerine ne kadar indirgenebileceği belirsiz.
Şu anda Imagic, API’lere daha uygun olan etkileyici bir teklif; derin sahte içerik üretimini kolaylaştırma konusunda eleştirilere karşı temkinli olan Google Research için ise muhtemelen en rahat ortam bu.
İlk yayın 18 Ekim 2022.












