Yapay zeka modelleri ve platformları

Yüksek Hassasiyetli Anlamsal Görüntü Düzenleme EditGAN ile

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Oluşturucu Karşıt Ağlar veya GAN’ler, son aylarda EditGAN’in popülerlik kazanması nedeniyle görüntü düzenleme endüstrisinde yeni uygulamalar kazanmıştır.

EditGAN modelini detaylı olarak ele alacağız ve neden anlamsal görüntü düzenleme endüstrisinde bir dönüm noktası olabileceğini öğreneceğiz.

Başlayalım. Ancak önce EditGAN’in ne olduğu hakkında bilgi sahibi olmak için, EditGAN’in önemini ve neden önemli bir adım olduğunu anlamamız gerekiyor.

Neden EditGAN?

Geleneksel GAN mimarileri, AI tabanlı görüntü düzenleme endüstrisinin önemli ölçüde ilerlemesine yardımcı olmuştur, ancak bir GAN mimarisini sıfırdan oluştururken bazı önemli zorluklar vardır.

  1. Eğitim aşamasında, bir GAN mimarisinin büyük miktarda etiketli veri ve anlamsal segmentasyon açıklamalarına ihtiyacı vardır.
  2. Sadece yüksek düzeyde kontrol sağlayabilirler.
  3. Ve genellikle, sadece görüntüler arasında ileri geri interpolasyon yaparlar.

Görülebileceği gibi, geleneksel GAN mimarileri işini yapar, ancak geniş ölçekli dağıtıma uygun değildir. Geleneksel GAN mimarilerinin verimsizliği, EditGAN’in 2022 yılında NVIDIA (NVDA ) tarafından sunulmasının nedenidir.

EditGAN, yüksek hassasiyetli ve yüksek kaliteli anlamsal görüntü düzenleme için etkili bir yöntem olarak önerilir ve kullanıcılarına görüntüleri, görüntülerin ayrıntılı segmentasyon maskelerini değiştirerek düzenleme olanağı sağlar. EditGAN’in ölçeklenebilir bir yöntem olmasının nedenlerinden biri de mimarisidir.

EditGAN modeli, görüntüleri ve anlamsal segmentasyonlarını ortaklaşa modelleyen bir GAN çerçevesi üzerine inşa edilmiştir ve yalnızca birkaç etiketli veya açıklamalı eğitim verisi gerektirir. EditGAN geliştiricileri, görüntüyü GAN’ın gizli uzayına gömmeye çalışmış ve koşullu gizli kod optimizasyonunu segmentasyon düzenleme göre gerçekleştirmiştir. Ayrıca, optimizasyonu amortize etmek için model, gizli uzayda “düzenleme vektörleri” bulmaya çalışır.

EditGAN çerçevesinin mimarisi, modelin, daha sonra diğer görüntülere hızlı ve verimli bir şekilde uygulanabilecek, keyfi sayıda düzenleme vektörü öğrenmesini sağlar. Ayrıca, deneysel sonuçlar, EditGAN’in görüntüleri, görüntüdeki ayrıntıları korurken, görülmemiş bir düzeyde düzenleme yapabildiğini gösterir.

EditGAN’i neden needediğimize gelince, bu, yüksek hassasiyetli düzenleme,

  1. Çok az etiketli veri ile çalışabilir.
  2. Gerçek zamanlı senaryolarda etkili bir şekilde dağıtılabilir.
  3. Birden fazla düzenleme için bileşiklik sağlar.
  4. GAN tarafından üretilen, gerçek gömme ve hatta alan dışı görüntüler üzerinde çalışabilir.

Yüksek Hassasiyetli Anlamsal Görüntü Düzenleme EditGAN ile

StyleGAN2, EditGAN’in birincil görüntü oluşturma bileşenidir. StyleGAN2, çok değişkenli normal dağılımdan alınan gizli kodları gerçekçi görüntülere haritalar.

StyleGAN2, görüntüleri sentezlemek için eğitilmiş derin bir oluşturucu modeldir ve modellenen görüntülerin anlamsal bir anlayışını kazanmıştır.

Segmentasyon Eğitimi ve Tahmin

EditGAN modeli, görüntüyü GAN’ın gizli uzayına optimizasyon ve bir kodlayıcı kullanarak yerleştirir ve yeni bir görüntü üzerinde segmentasyon gerçekleştirir. EditGAN çerçevesi, önceki çalışmalar üzerine inşa edilmiştir ve bir kodlayıcıyı, görüntüleri gizli uzaya gömmek için eğitir.

Sonuç olarak, model, etiketli görüntüleri, anlamsal segmentasyon ile birlikte gizli uzaya yerleştirir ve çapraz entropy kaybını kullanarak segmentasyon dalını eğitir.

Gizli Uzayda Anlamsal Segmentasyon Düzenleme Kullanarak

EditGAN’in birincil amacı, anlamsal segmentasyonların ve görüntülerin ortak dağılımını kullanarak yüksek hassasiyetli görüntü düzenleme gerçekleştirmektir. Diyelim ki, düzenlenmesi gereken bir görüntü var, model bu görüntüyü EditGAN’in gizli uzayına yerleştirir veya modelin örnek görüntülerini kullanır.

Tahmin Sırasında Düzenlemenin Farklı Yolları

Optimizasyon kullanarak elde edilen gizli uzay düzenleme vektörleri, anlamsal olarak anlamlı ve farklı özniteliklerle ayrılmış olarak tanımlanabilir. Bu nedenle, yeni bir görüntüyü düzenlemek için, model bu görüntüyü gizli uzaya yerleştirir ve daha önce öğrendiği aynı düzenleme işlemlerini doğrudan gerçekleştirir, böylece optimizasyonu baştan gerçekleştirmeye gerek kalmaz.

Ayrıca, geliştiricilerin henüz tam olarak ayrılmayı başaramadıkları ve düzenleme vektörlerinin diğer görüntülere uygulandığında her zaman en iyi sonuçları vermediği unutulmamalıdır. Ancak, bu sorun, test zamanında birkaç ek optimizasyon adımıyla diğer görüntü kısımlarından düzenleme kalıntılarını kaldırarak çözülebilir.

Mevcut bilgilerimize dayanarak, EditGAN çerçevesi, üç farklı modda kullanılabilir.

  • Gerçek Zamanlı Düzenleme ile Düzenleme Vektörleri

Yerel ve ayrılmış görüntüler için, model daha önce öğrendiği düzenleme vektörlerini kullanarak görüntüleri düzenler ve farklı ölçeklerde manipüle eder.

  • Özdenetimli İyileştirme ile Vektör Tabanlı Düzenleme

Yerel ve mükemmel olarak ayrılmayan görüntüler için, model daha önce öğrendiği düzenleme vektörlerini kullanarak görüntüyü düzenler ve test zamanında birkaç ek optimizasyon adımıyla düzenleme kalıntılarını kaldırır.

  • Optimizasyon Tabanlı Düzenleme

Büyük ölçekli ve görüntü özgü düzenleme için, model baştan optimizasyon gerçekleştirir, çünkü düzenleme vektörleri bu tür transferleri diğer görüntülere gerçekleştiremez.

Uygulama

EditGAN çerçevesi, dört farklı kategoriye yayılmış görüntüler üzerinde değerlendirilir: Arabalar, Kuşlar, Kediler ve Yüzler. Modelin segmentasyon dalı, sırasıyla Arabalar, Kuşlar, Kediler ve Yüzler için 16, 30, 30, 16 olarak etiketli eğitim verisi kullanılarak eğitilir.

Kedi, Araba ve Yüzler veri seti için, model, GAN çerçevesini eğitmek için kullanılan test veri setinden gerçek görüntüler kullanır. Bu görüntüler doğrudan EditGAN’in gizli uzayına yerleştirilir. Kuşlar kategorisi için, düzenleme GAN tarafından üretilen görüntüler üzerinde gösterilir.

Sonuçlar

Niteliksel Sonuçlar

Alan İçi Sonuçlar

Üstteki görüntü, EditGAN çerçevesinin, daha önce öğrendiği düzenleme vektörlerini yeni görüntülere uygulayarak ve 30 optimizasyon adımı kullanarak görüntüleri iyileştirdiğini gösterir. EditGAN çerçevesi tarafından gerçekleştirilen bu düzenleme işlemleri, tüm sınıflar için ayrılmış ve görüntülerin genel kalitesini korumuştur.

Şaşırtıcı olan, EditGAN çerçevesinin, pupilgenliği artırma veya araba tekerleklerinin spoke’larını düzenleme gibi çok yüksek hassasiyetli düzenleme işlemlerini gerçekleştirebilmesidir. Ayrıca, EditGAN, nesnelerin anlamsal kısımlarını düzenlemek veya büyük ölçekli görüntü değişiklikleri gerçekleştirmek için de kullanılabilir.

Alan Dışı Sonuçlar

EditGAN’in alan dışı performansını değerlendirmek için, MetFaces veri seti kullanılmıştır. EditGAN modeli, in-domain gerçek yüzleri kullanarak düzenleme vektörleri oluşturur ve MetFaces portrelerini 100 adımlık bir optimizasyon süreci kullanarak gizli uzaya yerleştirir ve 30 adımlık özdenetimli iyileştirme işlemi kullanarak düzenleme vektörlerini uygular.

Nicel Sonuçlar

EditGAN’in görüntü düzenleme yeteneklerini nicel olarak ölçmek için, model, MaskGAN tarafından tanımlanan bir gülme düzenleme standardını kullanır. Nötr ifade içeren yüzler, gülümseyen yüzlerle değiştirilir ve performans, üç parametre üzerinden ölçülür.

  • Anlamsal Doğru

Model, bir önceden eğitilmiş gülme öznitelik sınıflandırıcı kullanarak, düzenleme后的 görüntülerin gülümseyen ifadeler içerip içermediğini ölçer.

  • Dağılım Düzeyinde Görüntü Kalitesi

Çekirdek Inception Mesafesi (KID) ve Frechet Inception Mesafesi (FID), CelebA test veri seti ve 400 düzenlenmiş test görüntüsü arasında hesaplanır.

  • Kimlik Koruma

Modelin, düzenleme sırasında konuların kimliğini koruma yeteneği, önceden eğitilmiş bir ArcFace öznitelik çıkarma ağı kullanılarak ölçülür.

Üstteki tablo, EditGAN çerçevesinin, gülme düzenleme standardında diğer temel modellerle karşılaştırıldığını gösterir.

  • MaskGAN

MaskGAN, gülümseyen ve gülümsemeyen görüntülerin segmentasyon açıklamaları ve hedef gülme segmentasyon açıklamasını girdi olarak alır.

  • Yerel Düzenleme

EditGAN, yerel düzenleme ile de karşılaştırılır, bu yöntem, GAN özelliklerini kümeleyerek yerel düzenleme gerçekleştirmek için kullanılır ve referans görüntülere bağlıdır.

  • InterFaceGAN

InterFaceGAN, EditGAN gibi, gizli uzayda düzenleme vektörleri bulmaya çalışır, ancak büyük miktarda etiketli veri, yardımcı öznitelik sınıflandırıcıları gerektirir ve ince düzenleme hassasiyetine sahip değildir.

  • StyleGAN2Distillation

Bu yöntem, gerçek görüntü gömme gerektirmeyen alternatif bir yaklaşım sunar ve düzenleme vektörü modeli kullanarak bir eğitim veri seti oluşturur.

Sınırlamalar

EditGAN, GAN çerçevesine dayandığı için, diğer GAN modellerinin aynı sınırlamalarına sahiptir: yalnızca GAN tarafından modellenen görüntülerle çalışabilir. EditGAN’in GAN tarafından modellenen görüntülerle çalışabilme sınırlaması, neden farklı senaryolarda uygulanmasının zor olduğu ana nedenidir. Ancak, EditGAN’in yüksek hassasiyetli düzenleme işlemlerinin, düzenleme vektörleri kullanılarak kolayca diğer görüntülere aktarılabilmesi unutulmamalıdır.

SONUÇ

GAN’in görüntü düzenleme alanında endüstri standardı olmamasının ana nedenlerinden biri, sınırlı pratikliğidir. GAN çerçeveleri genellikle büyük miktarda etiketli eğitim verisi gerektirir ve genellikle yüksek verimlilik ve doğruluk sağlamazlar.

EditGAN, geleneksel GAN çerçevelerinin sunduğu sorunları ele almaya çalışır ve yüksek kaliteli, yüksek hassasiyetli anlamsal görüntü düzenleme için etkili bir yöntem olarak ortaya çıkar. Sonuçlar, EditGAN’in iddia ettiği şeyi gerçekten sunduğunu ve bazı mevcut endüstri standardı uygulamaları ve modellerinden daha iyi performans gösterdiğini gösteriyor.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.