Yapay zeka modelleri ve platformları
Yüksek Hassasiyetli Anlamsal Görüntü Düzenleme EditGAN ile
Oluşturucu Karşıt Ağlar veya GAN’ler, son aylarda EditGAN’in popülerlik kazanması nedeniyle görüntü düzenleme endüstrisinde yeni uygulamalar kazanmıştır.
EditGAN modelini detaylı olarak ele alacağız ve neden anlamsal görüntü düzenleme endüstrisinde bir dönüm noktası olabileceğini öğreneceğiz.
Başlayalım. Ancak önce EditGAN’in ne olduğu hakkında bilgi sahibi olmak için, EditGAN’in önemini ve neden önemli bir adım olduğunu anlamamız gerekiyor.
Neden EditGAN?
Geleneksel GAN mimarileri, AI tabanlı görüntü düzenleme endüstrisinin önemli ölçüde ilerlemesine yardımcı olmuştur, ancak bir GAN mimarisini sıfırdan oluştururken bazı önemli zorluklar vardır.
- Eğitim aşamasında, bir GAN mimarisinin büyük miktarda etiketli veri ve anlamsal segmentasyon açıklamalarına ihtiyacı vardır.
- Sadece yüksek düzeyde kontrol sağlayabilirler.
- Ve genellikle, sadece görüntüler arasında ileri geri interpolasyon yaparlar.
Görülebileceği gibi, geleneksel GAN mimarileri işini yapar, ancak geniş ölçekli dağıtıma uygun değildir. Geleneksel GAN mimarilerinin verimsizliği, EditGAN’in 2022 yılında NVIDIA (NVDA ) tarafından sunulmasının nedenidir.
EditGAN, yüksek hassasiyetli ve yüksek kaliteli anlamsal görüntü düzenleme için etkili bir yöntem olarak önerilir ve kullanıcılarına görüntüleri, görüntülerin ayrıntılı segmentasyon maskelerini değiştirerek düzenleme olanağı sağlar. EditGAN’in ölçeklenebilir bir yöntem olmasının nedenlerinden biri de mimarisidir.
EditGAN modeli, görüntüleri ve anlamsal segmentasyonlarını ortaklaşa modelleyen bir GAN çerçevesi üzerine inşa edilmiştir ve yalnızca birkaç etiketli veya açıklamalı eğitim verisi gerektirir. EditGAN geliştiricileri, görüntüyü GAN’ın gizli uzayına gömmeye çalışmış ve koşullu gizli kod optimizasyonunu segmentasyon düzenleme göre gerçekleştirmiştir. Ayrıca, optimizasyonu amortize etmek için model, gizli uzayda “düzenleme vektörleri” bulmaya çalışır.
EditGAN çerçevesinin mimarisi, modelin, daha sonra diğer görüntülere hızlı ve verimli bir şekilde uygulanabilecek, keyfi sayıda düzenleme vektörü öğrenmesini sağlar. Ayrıca, deneysel sonuçlar, EditGAN’in görüntüleri, görüntüdeki ayrıntıları korurken, görülmemiş bir düzeyde düzenleme yapabildiğini gösterir.
EditGAN’i neden needediğimize gelince, bu, yüksek hassasiyetli düzenleme,
- Çok az etiketli veri ile çalışabilir.
- Gerçek zamanlı senaryolarda etkili bir şekilde dağıtılabilir.
- Birden fazla düzenleme için bileşiklik sağlar.
- GAN tarafından üretilen, gerçek gömme ve hatta alan dışı görüntüler üzerinde çalışabilir.
Yüksek Hassasiyetli Anlamsal Görüntü Düzenleme EditGAN ile
StyleGAN2, EditGAN’in birincil görüntü oluşturma bileşenidir. StyleGAN2, çok değişkenli normal dağılımdan alınan gizli kodları gerçekçi görüntülere haritalar.
StyleGAN2, görüntüleri sentezlemek için eğitilmiş derin bir oluşturucu modeldir ve modellenen görüntülerin anlamsal bir anlayışını kazanmıştır.
Segmentasyon Eğitimi ve Tahmin
EditGAN modeli, görüntüyü GAN’ın gizli uzayına optimizasyon ve bir kodlayıcı kullanarak yerleştirir ve yeni bir görüntü üzerinde segmentasyon gerçekleştirir. EditGAN çerçevesi, önceki çalışmalar üzerine inşa edilmiştir ve bir kodlayıcıyı, görüntüleri gizli uzaya gömmek için eğitir.
Sonuç olarak, model, etiketli görüntüleri, anlamsal segmentasyon ile birlikte gizli uzaya yerleştirir ve çapraz entropy kaybını kullanarak segmentasyon dalını eğitir.
Gizli Uzayda Anlamsal Segmentasyon Düzenleme Kullanarak
EditGAN’in birincil amacı, anlamsal segmentasyonların ve görüntülerin ortak dağılımını kullanarak yüksek hassasiyetli görüntü düzenleme gerçekleştirmektir. Diyelim ki, düzenlenmesi gereken bir görüntü var, model bu görüntüyü EditGAN’in gizli uzayına yerleştirir veya modelin örnek görüntülerini kullanır.

Tahmin Sırasında Düzenlemenin Farklı Yolları
Optimizasyon kullanarak elde edilen gizli uzay düzenleme vektörleri, anlamsal olarak anlamlı ve farklı özniteliklerle ayrılmış olarak tanımlanabilir. Bu nedenle, yeni bir görüntüyü düzenlemek için, model bu görüntüyü gizli uzaya yerleştirir ve daha önce öğrendiği aynı düzenleme işlemlerini doğrudan gerçekleştirir, böylece optimizasyonu baştan gerçekleştirmeye gerek kalmaz.
Ayrıca, geliştiricilerin henüz tam olarak ayrılmayı başaramadıkları ve düzenleme vektörlerinin diğer görüntülere uygulandığında her zaman en iyi sonuçları vermediği unutulmamalıdır. Ancak, bu sorun, test zamanında birkaç ek optimizasyon adımıyla diğer görüntü kısımlarından düzenleme kalıntılarını kaldırarak çözülebilir.
Mevcut bilgilerimize dayanarak, EditGAN çerçevesi, üç farklı modda kullanılabilir.
- Gerçek Zamanlı Düzenleme ile Düzenleme Vektörleri
Yerel ve ayrılmış görüntüler için, model daha önce öğrendiği düzenleme vektörlerini kullanarak görüntüleri düzenler ve farklı ölçeklerde manipüle eder.
- Özdenetimli İyileştirme ile Vektör Tabanlı Düzenleme
Yerel ve mükemmel olarak ayrılmayan görüntüler için, model daha önce öğrendiği düzenleme vektörlerini kullanarak görüntüyü düzenler ve test zamanında birkaç ek optimizasyon adımıyla düzenleme kalıntılarını kaldırır.
- Optimizasyon Tabanlı Düzenleme
Büyük ölçekli ve görüntü özgü düzenleme için, model baştan optimizasyon gerçekleştirir, çünkü düzenleme vektörleri bu tür transferleri diğer görüntülere gerçekleştiremez.
Uygulama
EditGAN çerçevesi, dört farklı kategoriye yayılmış görüntüler üzerinde değerlendirilir: Arabalar, Kuşlar, Kediler ve Yüzler. Modelin segmentasyon dalı, sırasıyla Arabalar, Kuşlar, Kediler ve Yüzler için 16, 30, 30, 16 olarak etiketli eğitim verisi kullanılarak eğitilir.
Kedi, Araba ve Yüzler veri seti için, model, GAN çerçevesini eğitmek için kullanılan test veri setinden gerçek görüntüler kullanır. Bu görüntüler doğrudan EditGAN’in gizli uzayına yerleştirilir. Kuşlar kategorisi için, düzenleme GAN tarafından üretilen görüntüler üzerinde gösterilir.
Sonuçlar
Niteliksel Sonuçlar
Alan İçi Sonuçlar

Üstteki görüntü, EditGAN çerçevesinin, daha önce öğrendiği düzenleme vektörlerini yeni görüntülere uygulayarak ve 30 optimizasyon adımı kullanarak görüntüleri iyileştirdiğini gösterir. EditGAN çerçevesi tarafından gerçekleştirilen bu düzenleme işlemleri, tüm sınıflar için ayrılmış ve görüntülerin genel kalitesini korumuştur.
Şaşırtıcı olan, EditGAN çerçevesinin, pupilgenliği artırma veya araba tekerleklerinin spoke’larını düzenleme gibi çok yüksek hassasiyetli düzenleme işlemlerini gerçekleştirebilmesidir. Ayrıca, EditGAN, nesnelerin anlamsal kısımlarını düzenlemek veya büyük ölçekli görüntü değişiklikleri gerçekleştirmek için de kullanılabilir.
Alan Dışı Sonuçlar
EditGAN’in alan dışı performansını değerlendirmek için, MetFaces veri seti kullanılmıştır. EditGAN modeli, in-domain gerçek yüzleri kullanarak düzenleme vektörleri oluşturur ve MetFaces portrelerini 100 adımlık bir optimizasyon süreci kullanarak gizli uzaya yerleştirir ve 30 adımlık özdenetimli iyileştirme işlemi kullanarak düzenleme vektörlerini uygular.

Nicel Sonuçlar
EditGAN’in görüntü düzenleme yeteneklerini nicel olarak ölçmek için, model, MaskGAN tarafından tanımlanan bir gülme düzenleme standardını kullanır. Nötr ifade içeren yüzler, gülümseyen yüzlerle değiştirilir ve performans, üç parametre üzerinden ölçülür.
- Anlamsal Doğru
Model, bir önceden eğitilmiş gülme öznitelik sınıflandırıcı kullanarak, düzenleme后的 görüntülerin gülümseyen ifadeler içerip içermediğini ölçer.
- Dağılım Düzeyinde Görüntü Kalitesi
Çekirdek Inception Mesafesi (KID) ve Frechet Inception Mesafesi (FID), CelebA test veri seti ve 400 düzenlenmiş test görüntüsü arasında hesaplanır.
- Kimlik Koruma
Modelin, düzenleme sırasında konuların kimliğini koruma yeteneği, önceden eğitilmiş bir ArcFace öznitelik çıkarma ağı kullanılarak ölçülür.

Üstteki tablo, EditGAN çerçevesinin, gülme düzenleme standardında diğer temel modellerle karşılaştırıldığını gösterir.
- MaskGAN
MaskGAN, gülümseyen ve gülümsemeyen görüntülerin segmentasyon açıklamaları ve hedef gülme segmentasyon açıklamasını girdi olarak alır.
- Yerel Düzenleme
EditGAN, yerel düzenleme ile de karşılaştırılır, bu yöntem, GAN özelliklerini kümeleyerek yerel düzenleme gerçekleştirmek için kullanılır ve referans görüntülere bağlıdır.
- InterFaceGAN
InterFaceGAN, EditGAN gibi, gizli uzayda düzenleme vektörleri bulmaya çalışır, ancak büyük miktarda etiketli veri, yardımcı öznitelik sınıflandırıcıları gerektirir ve ince düzenleme hassasiyetine sahip değildir.
- StyleGAN2Distillation
Bu yöntem, gerçek görüntü gömme gerektirmeyen alternatif bir yaklaşım sunar ve düzenleme vektörü modeli kullanarak bir eğitim veri seti oluşturur.

Sınırlamalar
EditGAN, GAN çerçevesine dayandığı için, diğer GAN modellerinin aynı sınırlamalarına sahiptir: yalnızca GAN tarafından modellenen görüntülerle çalışabilir. EditGAN’in GAN tarafından modellenen görüntülerle çalışabilme sınırlaması, neden farklı senaryolarda uygulanmasının zor olduğu ana nedenidir. Ancak, EditGAN’in yüksek hassasiyetli düzenleme işlemlerinin, düzenleme vektörleri kullanılarak kolayca diğer görüntülere aktarılabilmesi unutulmamalıdır.
SONUÇ
GAN’in görüntü düzenleme alanında endüstri standardı olmamasının ana nedenlerinden biri, sınırlı pratikliğidir. GAN çerçeveleri genellikle büyük miktarda etiketli eğitim verisi gerektirir ve genellikle yüksek verimlilik ve doğruluk sağlamazlar.
EditGAN, geleneksel GAN çerçevelerinin sunduğu sorunları ele almaya çalışır ve yüksek kaliteli, yüksek hassasiyetli anlamsal görüntü düzenleme için etkili bir yöntem olarak ortaya çıkar. Sonuçlar, EditGAN’in iddia ettiği şeyi gerçekten sunduğunu ve bazı mevcut endüstri standardı uygulamaları ve modellerinden daha iyi performans gösterdiğini gösteriyor.












