Anderson’un Açısı
Sinirli Oluşum: Giriş Verilerini Ne Kadar Düşük Olabilir?

Dün, bazı olağanüstü yeni çalışmalar sinirli görüntü sentezinde internetin ve hayal gücünün dikkatini çekti, çünkü Intel araştırmacıları sentetik görüntülerin gerçekçiliğini artırmak için yeni bir yöntem açıkladı.
Sistem, Intel tarafından yapılan bir videoda gösterildiği gibi, Grand Theft Auto V video oyununun görüntü işlem hattına doğrudan müdahale eder ve bir convolutional neural network (CNN) tarafından eğitilen bir görüntü sentez algoritması aracılığıyla görüntüleri otomatik olarak geliştirir. Bu algoritma, gerçek dünya görüntülerinden oluşan Mapillary veri setini ve GTA oyun motorunun daha az gerçekçi aydınlatma ve tekstürünü değiştirir.

Yorumcular, Reddit ve Hacker News gibi topluluklarda çeşitli tepkilerde bulunarak, bu tür sinirli oluşturmanın geleneksel oyun motorlarının ve VFX düzeyindeki CGI’nin menos gerçekçi çıktısını etkili bir şekilde değiştirebileceğini ve bu işlemin çok daha temel girişlerle gerçekleştirilebileceğini öne sürdüler – yani, çok gerçekçi çıktılar üretebilen ‘kukla’ proxy girişleri oluşturmak.
Çift Veri Setleri
Bu prensip, son üç yıl içinde NVIDIA’nın GauGAN gibi yeni bir GAN ve encoder/decoder sistemleri nesli tarafından örneklenmiştir. GauGAN, kaba daublar üzerinden fotogerçekçi manzara görüntüleri oluşturur.
Bu prensip, bilgisayar vizyonunda geleneksel olarak nesneleri tanımlamak ve izole etmek için kullanılan semantik segmentasyonu, bir creative girdi haline dönüştürür. Kullanıcı, sahte bir semantik segmentasyon haritası “boyar” ve sistem, daha önce sınıflandırılmış ve segmentlenmiş bir domaine (örneğin, manzara) ait ilişkileri anladığından, tutarlı görüntüler oluşturur.

Bir makine öğrenimi çerçevesi, çeşitli dış mekan sahnelerine semantik segmentasyonu uygular ve bu, kullanıcıların bir semantik segmentasyon bloğunu “boyayarak” ve sistem tarafından belirli bir domaine (örneğin, Almanya’nın Mapillary sokak görüşü seti) ait görüntülerle doldurulmasını sağlayan bir mimari paradigmaya izin verir. Kaynak: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
Çift veri seti görüntü sentez sistemleri, iki veri setindeki semantik etiketlerin korelasyonunu kullanır: zengin ve đầy đủ bir görüntü seti (gerçek dünya görüntülerinden veya sentetik görüntülerden) ve daha az gerçekçi bir görüntü seti (örneğin, CGI görüntüleri).

Görsel sentez sistemi için çift veri seti örnekleri – solda CGI veri setinden örnekler, ortada ‘sketch’ veri setinden örnekler ve sağda, sinirli oluşturma yoluyla yüksek kaliteli görüntülere dönüştürülmüş çizimler. Kaynak: https://www.youtube.com/watch?v=miLIwQ7yPkA
Dış mekan ortamları, bu tür çift veri seti dönüşümlerini oluştururken nispeten zor değildir, çünkü çıkıntılar genellikle sınırlıdır, topografya sınırlı varyanslara sahiptir ve suni insanları veya Uncanny Valley ile başa çıkmak zorunda kalmazsınız.
Segmentasyon Haritalarını Tersine Çevirme
Google, GauGAN şemasının animasyonlu bir versiyonunu geliştirdi, yani Sonsuz Doğa, sahte semantik haritaları fotogerçekçi görüntülere dönüştürebilen ve NVIDIA’nın SPADE infill sistemi aracılığıyla sürekli ve sonsuz kurgusal manzaralar oluşturabilen bir sistem.

Kaynak: https://www.youtube.com/watch?v=oXUf6anNAtc
Ancak, Sonsuz Doğa bir görüntüyü başlangıç noktası olarak kullanır ve yalnızca ardışık çerçevelerde eksik bölümleri boyamak için SPADE’yi kullanır, oysa SPADE kendisi doğrudan segmentasyon haritalarından görüntü dönüşümleri oluşturur.
Bu yetenek, Intel Görüntü Geliştirme sisteminin hayranlarını etkilemiştir – çok yüksek kaliteli fotogerçekçi görüntüleri, hatta gerçek zamanlı olarak, çok kaba girişlerden elde etme olasılığı.
Sinirli Oluşumla Metin ve Aydınlatma Değiştirme
GTA5 girişinde bazıları, geleneksel oyun motorlarının çıkışı ile karşılaştırıldığında, sinirli oluşturma sistemlerinde, oyun motoru çıkışının daha az gerçekçi metin ve aydınlatmasının gerçekten gerekli olup olmayacağını merak etmiştir. Bu, düşük çözünürlükte, tel çerçeveli düzeyde girişleri, oyun motorlarının gölgelendirme, metin ve aydınlatma yeteneklerini aşan fotogerçekçi videolara dönüştürebilir mi?
Bununla birlikte, Intel’in gösterdiği sinirli oluşturma sisteminin, oyun motoru tarafından üretilen yansımalar, metinler ve diğer çevresel ayrıntılar gibi bazı oyun oluşturma yönlerine gerçekten ihtiyacı olup olmadığı sorusu ortaya çıkmaktadır. NVIDIA’nın UNIT (UNsupervised Image-to-image Translation Networks) adlı çalışması, sadece alanın önemli olduğunu ve gece/gündüz gibi konuların esasen stil aktarımı ile ele alınabileceğini göstermiştir:
Bu, oyun motorunun yalnızca temel geometri ve fizik simülasyonlarını üretmesi gerektiği anlamına gelebilir, çünkü sinirli oluşturma motoru, semantik haritaları yorumlama katmanı olarak kullanarak diğer tüm yönleri veri setinden sentezleyebilir.

Intel sisteminin, GTA5’den tamamen işlenen ve oluşturulmuş bir kareyi geliştirdiğini, segmentasyon ve değerlendirilmiş derinlik haritaları eklediğini göstermektedir – bu iki yön, temel olarak bir oyun motoru tarafından sağlanabilir. Kaynak: https://www.youtube.com/watch?v=P1IcaBn3ej0
Intel’in sinirli oluşturma yaklaşımı, GTA5缓冲区ndan tamamen işlenen çerçevelerin analizini içerir ve sinirli sistem, hem derinlik haritalarını hem de segmentasyon haritalarını oluşturmakla yükümlüdür. Derinlik haritaları geleneksel 3B işleme hatlarında zaten mevcuttur (ve metin, ışın izleme veya küresel aydınlatma üretmekten daha az talep eder), bu nedenle bu kaynakların daha iyi kullanımı, derinlik haritalarını oyun motorunun işleme bırakmak olabilir.
Sinirli Oluşum Motoru İçin Basitleştirilmiş Giriş
Intel görüntü geliştirme ağı’nın mevcut uygulaması, muhtemelen çok fazla冗antı işleme döngüsünü içerir, çünkü oyun motoru, sinirli oluşturma motorunun gerçekten ihtiyacı olmayan, hesaplama açısından yoğun metin ve aydınlatma üretir. Sistem bu şekilde tasarlanmış olabilir, çünkü sinirli oluşturma motorunu mevcut bir işleme hattına uyarlamak, sinirli oluşturma yaklaşımına optimize edilmiş yeni bir oyun motoru oluşturmaktan daha kolaydır.
Bu tür bir oyun sistemi için kaynakların en ekonomik kullanımı, sinirli oluşturma sistemini GPU tarafından tamamen devralması ve basitleştirilmiş proxy girişin CPU tarafından işlenmesiyle sağlanabilir.
Ayrıca, oyun motoru, tüm gölgelendirme ve aydınlatmayı çıkışımda devre dışı bırakarak kendisi temsilci segmentasyon haritaları üretebilir. Ayrıca, normalde gerektirdiği kadar yüksek çözünürlükte video üretmesine gerek kalmaz, çünkü video yalnızca içeriği genel olarak temsil etmelidir ve yüksek çözünürlüklü ayrıntılar sinirli motor tarafından işlenmelidir, bu da yerel hesaplama kaynaklarını daha da serbest bırakır.
Intel ISL’nin Önceki Çalışmaları: Segmentasyon > Görüntü
Segmentasyondan fotogerçekçi videoya doğrudan çeviri tamamen teorik değildir. 2017’de Intel ISL, dünün heyecanının yaratıcıları, kentsel video sentezini doğrudan semantik segmentasyondan gerçekleştirebilen ilk araştırmayı yayınladı.














