Anderson’un Açısı

Disney, ‘Uncanny Valley’ Sorununu Çözmek İçin CGI ve Sinirsel Renderlamayı Birleştiriyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Disney’nin AI araştırma bölümü, yüz sinirsel renderlamasının güçlü yönlerini CGI tabanlı yaklaşımın tutarlılığıyla birleştirerek film kalitesinde yüz simülasyonu için hibrit bir yöntem geliştirdi.

Beklemede olan makale, Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering başlığını taşıyor ve Disney Research YouTube kanalında (makalenin sonunda gömülü*) yeni 10 dakikalık bir video ile ön izleniyor.

Meshes combined with neural facial renders. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Meshes combined with neural facial renders. See video embed at end of article for better detail and quality. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Videoda belirtildiği gibi, yüzlerin sinirsel renderlaması (deepfake’ler dahil) CGI’nin sağlayabildiğinden çok daha gerçekçi göz ve ağız içi görüntüler üretebilir, oysa CGI tabanlı yüz dokuları daha tutarlı ve sinema seviyesinde VFX çıktısı için daha uygundur.

Bu nedenle Disney, NVIDIA’nın StyleGan2 sinirsel üretecinin bir yüzün çevresel özelliklerini ve göz gibi ‘hayati öneme sahip’ unsurları yönetmesine izin verirken, tutarlı CGI yüz derisi ve ilgili öğeleri çıktının üzerine bindirerek bir deney yapıyor.

From the video (see end of article), the architectural concept behind Disney's hybrid approach, where an old-school CGI mesh, of the type used to recreate 'young' Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.

From the video (see end of article), the architectural concept behind Disney’s hybrid approach, where an old-school CGI mesh, of the type used to recreate ‘young’ Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.

Video, ölümünden sonra İngiliz Star Wars oyuncusu Peter Cushing’in Rogue One (2016) filmindeki CGI yeniden yaratımının otantiklik eksikliği ve ‘uncanny valley’ etkisine yönelik sıkça yapılan eleştirilere dolaylı bir gönderide bulunuyor ve şunu kabul ediyor:

‘[İnsanların] kolayca yakalayıp renderleyebildiği ile son foto-gerçekçi dijital ikizler, saç, göz ve ağız içi dahil olmak üzere, arasındaki büyük bir boşluk hâlâ var. Bu boşluğu kapatmak genellikle yetenekli sanatçılardan çok fazla manuel çalışma gerektiriyor.’

Gerçekte, en modern yüz yakalama sistemleri bile gözleri, ağız içlerini veya saçı yeniden oluşturmaya çalışmaz; bu unsurlar ya bu tekniklerde otantiklik sorunları (gözler) ya da zamansal tutarlılık sorunları (saç) yaşar.

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline.

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline, in addition to texturing and lighting.

Aydınlatma Kontrolü

Hibrit yaklaşım, yüzlerin sinirsel renderlamasında önemli bir zorluk olan yeniden aydınlatma konusunda da avantaj sağlar; çünkü CGI deri bindirmeleri daha kolay yeniden aydınlatılabilir.

An animated version of the CGI/Neural approach.

An animated version of the CGI/Neural approach.

Daha zorlu ortamlar, örneğin dış mekan çekimlerinde, araştırmacılar ‘oluşturulan’ kişinin etrafında bir çeşit silahsız bölge etrafında doldurma (inpainting) yöntemi geliştirdiler.

A black margin is generated to allow a 'canvas' for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.

A black margin is generated to allow a ‘canvas’ for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.

Video şunu belirtiyor:

‘[Sinirsel] render arka plan kısıtlamasıyla mükemmel bir şekilde eşleşmiyor. – Bu sadece bir rehber niteliğindedir, çünkü saç, göz ve diş gibi gerçekçi insan bileşenlerini optimize etmek ana hedeftir. Daha zorlu olan, ortam aydınlatmasını değiştirirken tutarlı bir kimliği korumaya çalışmaktır.’

Sinirsel Renderlardan CGI Mesh’leri Oluşturma

Araştırma ekibi, (belirtilmemiş) büyük bir 3D yüz görüntüsü veritabanı üzerinde eğitilmiş bir varyasyonel otokodlayıcı (variational autoencoder) da geliştirdi ve bunun gerçek veri (ground truth) üzerinden ‘rastgele ama makul’ 3D yüz mesh’leri üretebileceğini iddia ediyor.

Bu araştırmanın aşması gereken sınırlamalar var; bunlar arasında sinirsel renderlamalarda saçın zamansal tutarlılığını korumanın zorluğu yer alıyor ve video (aşağıya bakınız) bir CGI/sinirsel yüz etrafında tutarlı bir panoramada bile hızlıca değişen saç örneklerini gösteriyor.

Sinirsel video renderlamasında zamansal tutarlılık, sadece Disney’e özgü bir sorun olmaktan çok daha geniş bir problemdir ve bu sistemin sonraki sürümlerinin saç eklemeyi ‘post‑prodüksiyon’da yapmaya’ veya saç üretimi için çeşitli diğer yaklaşımlara yönelmesi, yeni bir sinirsel yöntemin sonunda sorunu çözeceği umudundan daha olası görünmektedir.

Veri Seti Oluşturma İçin Kullanım Alanları

Yöntem, sentetik veri üretmek ve yüz görüntüsü seti yelpazesini zenginleştirmek için potansiyel bir yöntem olarak da öneriliyor; bu alan son yıllarda tehlikeli derecede tekdüze bir hâle gelmiştir.

Disney envisages the new technique populating facial image datasets.

Disney envisages the new technique populating facial image datasets.

‘[Her] ürettiğimiz foto-gerçekçi sonuç, bilinmeyen kamera açıları ve bilinen aydınlatma ile renderlanmış ilgili bir geometri ve görünüm haritalarına sahiptir. Bu ‘ground truth’ bilgisi, tek göz, 3D yüz yeniden yapılandırma, yüz tanıma veya sahne anlama gibi sonraki uygulamaların eğitimi için hayati öneme sahip olabilir. Böylece her render bir veri örneği olarak kabul edilebilir ve birçok farklı bireyin birçok varyasyonunu üretebiliriz.’

‘Ayrıca, tek bir kişinin tek bir ifadeyle, tek bir bakış açısı ve aydınlatma altında renderlanması durumunda bile, optimizasyon sırasında rastgeleleştirme tohumunu değiştirerek foto-gerçekçi renderın rastgele varyasyonlarını oluşturabiliriz.’

Araştırmacılar, bu yapılandırılabilir çıktı çeşitliliğinin yüz tanıma uygulamalarının eğitimi için faydalı olabileceğini belirtiyor ve şu sonuca varıyor:

‘[Bizim] yöntemimiz, mevcut yüz derisi yakalama, modelleme ve renderleme teknolojilerini kullanarak istenen kimlik, ifade ve sahne konfigürasyonuna uyan tam foto-gerçekçi yüz renderları otomatik olarak oluşturabilir. Bu yaklaşım, film ve eğlence için yüz renderlamada uygulamalara sahiptir, manuel sanatçıların emeğini tasarruf eder ve ayrıca derin öğrenmenin farklı alanlarında veri üretimi için kullanılabilir.’

Yeni yaklaşıma daha derin bir bakış için, bugün yayınlanan 10 dakikalık videoyu izleyin:

 * Bu makale yayınlandıktan 8 saat sonra orijinal video bağlantısı, görünüşte aynı olan başka bir bağlantıyla değiştirildi. Orijinal videoya dair hiçbir iz kalmadığı için tüm ilgili bağlantıları güncelledim.

 

8:24 GMT+2 – Video değiştirildi, çünkü Disney Research YouTube kanalı bir sebeple videoyu değiştirmişti.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai