Anderson’un Açısı
AI ile ‘Daha İyi’ Vücutları Sahtelemek

Alibaba DAMO akademisinden yeni araştırma, vücut görüntülerinin yeniden şekillendirilmesini otomatikleştiren bir AI destekli iş akışı sunuyor – bilgisayarlı görü sektörünün şu anda yüz temelli manipülasyonlar (deepfake’ler ve GAN tabanlı yüz düzenleme) ile meşgul olduğu nadir bir çaba.

‘result’ sütunlarına yerleştirilen, düzeltilmesi gereken alanları tanımlayan oluşturulan dikkat haritaları. Kaynak: https://arxiv.org/pdf/2203.04670.pdf
Araştırmacıların mimarisi, mevcut vücut görüntülerini kavramlandırma ve parametreleştirme konusunda görüntü sentezi ve düzenleme sistemlerinin karşılaştığı daha büyük karmaşıklığı ele almak için iskelet poz tahminini kullanıyor; en azından anlamlı ve seçici düzenlemeye izin veren bir ayrıntı seviyesine ulaşmak için.

Tahmin edilen iskelet haritaları, vücudun üst kol bölgesi gibi yeniden dokunulması muhtemel alanlara dikkat çekmeye ve odaklanmaya yardımcı olur.
Sistem, nihayetinde bir kullanıcının, tam boy veya orta boy fotoğraflarda kişinin ağırlık, kas kütlesi veya ağırlık dağılımı görünümünü değiştirebilecek parametreler ayarlamasına olanak tanır ve giyili ya da çıplak vücut bölümlerinde keyfi dönüşümler üretebilir.

Sol, giriş görüntüsü; orta, türetilen dikkat alanlarının ısı haritası; sağ, dönüştürülmüş görüntü.
Bu çalışmanın motivasyonu, moda, dergi tarzı yayınlar ve tanıtım materyalleri gibi çeşitli medya dallarında fotoğrafçılar ve prodüksiyon grafik sanatçılarının yürüttüğü zahmetli dijital manipülasyonları yerine geçebilecek otomatik iş akışları geliştirmektir.
Genel olarak, yazarlar bu dönüşümlerin genellikle Photoshop ve diğer geleneksel bitmap editörlerinde ‘warp’ teknikleriyle uygulandığını ve neredeyse tamamen kadın görüntülerinde kullanıldığını kabul ediyorlar. Sonuç olarak, yeni süreci kolaylaştırmak için geliştirilen özel veri kümesi çoğunlukla kadın konulu fotoğraflardan oluşmaktadır:
‘Vücut rötuşu çoğunlukla kadınlar tarafından istendiği için, koleksiyonumuzun çoğu kadın fotoğraflarından oluşmaktadır; yaş, ırk (Afrikalı:Asyalı:Kafkas: = 0.33:0.35:0.32), poz ve kıyafet çeşitliliği göz önünde bulundurularak.’
Makale, Structure-Aware Flow Generation for Human Body Reshaping başlığını taşımaktadır ve Alibaba’nın küresel DAMO akademisinden beş yazar tarafından hazırlanmıştır.
Veri Kümesi Geliştirme
Görüntü sentezi ve düzenleme sistemlerinde olduğu gibi, projenin mimarisi özelleştirilmiş bir eğitim veri kümesi gerektirdi. Yazarlar, stok fotoğraf sitesi Unsplash’tan uygun görüntüler üzerinde standart Photoshop manipülasyonları üretmek için üç fotoğrafçıya görev verdi; bu, 2K çözünürlükte 5.000 yüksek kaliteli görüntüden oluşan BR-5K* adlı bir veri kümesiyle sonuçlandı.
Araştırmacılar, bu veri kümesi üzerinde eğitimin amacının çekicilik ya da istenen görünüm indeksine ilişkin ‘idealize’ ve genelleştirilmiş özellikler üretmek değil, vücut görüntülerinin profesyonel manipülasyonlarıyla ilişkili temel özellik eşlemelerini çıkarmak olduğunu vurguluyor.
Bununla birlikte, manipülasyonların nihayetinde ‘gerçek’ten önceden belirlenmiş bir ‘ideal’ kavramına bir ilerleme haritalayan dönüşüm süreçlerini yansıttığını kabul ediyorlar:
‘Üç profesyonel sanatçıyı Photoshop kullanarak bağımsız olarak vücutları rötuş etmeye davet ediyoruz; amaç popüler estetiğe uyan ince figürler elde etmek ve en iyisini gerçek veri olarak seçmektir.’
Çerçeve yüzlerle hiç ilgilenmediği için, bunlar veri kümesine dahil edilmeden önce bulanıklaştırıldı.
Mimari ve Temel Kavramlar
Sistemin iş akışı, yüksek çözünürlüklü bir portreyi girdi olarak alıp, mevcut hesaplama kaynaklarına sığacak daha düşük bir çözünürlüğe küçültmeyi, tahmini bir iskelet haritası pozunu (aşağıdaki görüntünün soldan ikinci figürü) ve ayrıca 2016 yılında Carnegie Mellon Üniversitesi Robotik Enstitüsü tarafından yenilikçi olarak geliştirilen Parça Bağlantı Alanlarını (PAFs) çıkarmayı içerir (aşağıda doğrudan gömülü videoya bakın).
Parça Bağlantı Alanları, uzuvların yönelimini ve daha geniş iskelet çerçevesiyle genel ilişkilendirmeyi tanımlamaya yardımcı olur; yeni projeye ek bir dikkat/konumlandırma aracı sağlar.

2016 Parça Bağlantı Alanları makalesinden, tahmin edilen PAF’ler uzuv yönelimini, uzvun genel konumunu da içeren bir 2B vektörün parçası olarak kodlar. Kaynak: https://arxiv.org/pdf/1611.08050.pdf
Ağırlık görünümüyle doğrudan ilgisiz gibi görünseler de, iskelet haritaları, üst kollar, kalça ve uyluklar gibi düzeltilmesi gereken vücut bölümlerine son dönüşüm süreçlerini yönlendirmede faydalıdır.
Bundan sonra, sonuçlar sürecin merkezi darboğazındaki bir Structure Affinity Self-Attention (SASA) modülüne beslenir (aşağıdaki görsele bakın).

SASA, süreci besleyen akış üreteci tutarlılığını düzenler; bu sonuçlar daha sonra (yukarıdaki görüntünün sağdan ikinci) deformasyon modülüne aktarılır ve bu modül, veri kümesinde yer alan manuel revizyonlarla eğitim sırasında öğrenilen dönüşümleri uygular.

Structure Affinity Self-Attention (SASA) modülü, dikkati ilgili vücut bölgelerine yönlendirerek gereksiz veya ilgisiz dönüşümleri önlemeye yardımcı olur.
Çıktı görüntüsü, daha sonra orijinal 2K çözünürlüğe yükseltilir; bu süreç, DeepFaceLab gibi popüler paketlerin türediği standart 2017 tarzı deepfake mimarisine benzer yöntemler kullanır; yükseltme işlemi aynı zamanda GAN düzenleme çerçevelerinde de yaygındır.
Şema için dikkat ağı, Compositional De-Attention Networks (CODA) adlı, Amazon (AMZN ) AI ve Microsoft ile 2019 yılında yürütülen ABD/Singapur akademik iş birliğinden model alınmıştır.
Testler
Akış tabanlı çerçeve, önceki akış tabanlı yöntemler FAL ve Animating Through Warping (ATW), ayrıca görüntü çevirisi mimarileri Pix2PixHD ve GFLA ile test edildi; değerlendirme ölçütleri olarak SSIM, PSNR ve LPIPS kullanıldı.

İlk testlerin sonuçları (başlıklardaki ok yönü, daha düşük mü yoksa daha yüksek mi değerlerin daha iyi olduğunu gösterir).
Bu benimsenen ölçütlere göre, yazarların sistemi önceki mimarileri geride bırakmaktadır.

Seçilen sonuçlar. Daha yüksek çözünürlüklü karşılaştırmalar için bu makaledeki orijinal PDF’ye bakınız.
Otomatik ölçütlerin yanı sıra, araştırmacılar bir kullanıcı çalışması (önceden gösterilen sonuç tablosunun son sütunu) gerçekleştirdi; bu çalışmada 40 katılımcıya çeşitli yöntemlerle üretilen görüntülerle ilgili 100 soruluk havuzdan rastgele seçilen 30 soru gösterildi. Katılımcıların %70’i yeni tekniği daha ‘görsel açıdan çekici’ olarak tercih etti.
Zorluklar
Yeni makale, AI tabanlı vücut manipülasyonuna nadir bir girişimi temsil ediyor. Görüntü sentezi sektörü şu anda ya Neural Radiance Fields (NeRF) gibi yöntemlerle düzenlenebilir vücutlar üretmeye çok daha fazla ilgi gösteriyor ya da GAN’ların gizli uzayını ve yüz manipülasyonu için otokodlayıcıların potansiyelini keşfetmeye odaklanmış durumda.
Yazarların girişimi şu anda algılanan ağırlıkta değişiklikler üretmekle sınırlı ve birini incelttiğinizde kaçınılmaz olarak ortaya çıkan arka planı geri getirecek bir doldurma (inpainting) tekniği uygulamamışlardır.
Bununla birlikte, portre matting ve dokusal çıkarım yoluyla arka plan karıştırmanın, insan ‘kusurları’ nedeniyle görüntüde daha önce gizli kalan dünya parçalarını geri getirme sorununu basitçe çözebileceğini öneriyorlar.

AI destekli yağ azaltma ile ortaya çıkan arka planı geri getirmek için önerilen bir çözüm.
* Ön baskı, veri kümesi hakkında daha fazla detay ve projeden ek örnekler sunan ek materyale atıfta bulunmasına rağmen, bu materyalin konumu makalede sağlanmamış ve ilgili yazar henüz erişim talebimize yanıt vermemiştir.
İlk yayınlanma tarihi 10 Mart 2022.












