Sudut Anderson
Menyamar ‘Tubuh Lebih Baik’ dengan AI

Penelitian baru dari Alibaba DAMO academy menawarkan alur kerja berbasis AI untuk mengotomatisasi perombakan gambar tubuh – sebuah upaya langka dalam sektor visi komputer yang saat ini didominasi oleh manipulasi berbasis wajah seperti deepfakes dan penyuntingan wajah berbasis GAN.

Inset di kolom ‘result’, peta perhatian yang dihasilkan yang menentukan area yang akan diubah. Source: https://arxiv.org/pdf/2203.04670.pdf
Arsitektur peneliti menggunakan estimasi pose kerangka untuk mengatasi kompleksitas yang lebih besar yang dihadapi sistem sintesis dan penyuntingan gambar dalam mengkonseptualisasikan serta memparametrisasi gambar tubuh yang ada, setidaknya pada tingkat detail yang memungkinkan penyuntingan yang bermakna dan selektif.

Peta kerangka yang diperkirakan membantu mengidentifikasi dan memfokuskan perhatian pada area tubuh yang kemungkinan akan diperbaiki, seperti area lengan atas.
Sistem pada akhirnya memungkinkan pengguna mengatur parameter yang dapat mengubah penampilan berat badan, massa otot, atau distribusi berat dalam foto orang secara penuh atau setengah badan, dan mampu menghasilkan transformasi sewenang-wenang pada bagian tubuh yang berpakaian maupun tidak berpakaian.

Kiri, gambar masukan; tengah, peta panas area perhatian yang dihasilkan; kanan, gambar yang telah diubah.
Motivasi dari pekerjaan ini adalah pengembangan alur kerja otomatis yang dapat menggantikan manipulasi digital yang melelahkan yang dilakukan oleh fotografer dan seniman grafis produksi di berbagai cabang media, mulai dari mode hingga keluaran bergaya majalah dan materi publisitas.
Secara umum, penulis mengakui, transformasi ini biasanya diterapkan dengan teknik ‘warp’ di Photoshop dan editor bitmap tradisional lainnya, dan hampir secara eksklusif digunakan pada gambar wanita. Akibatnya, dataset khusus yang dikembangkan untuk memfasilitasi proses baru ini sebagian besar terdiri dari foto subjek perempuan:
‘Karena retouching tubuh terutama diinginkan oleh perempuan, mayoritas koleksi kami adalah foto perempuan, dengan mempertimbangkan keberagaman usia, ras (Afrika:Asia:Caucasian = 0.33:0.35:0.32), pose, dan pakaian.’
Makalah paper berjudul Structure-Aware Flow Generation for Human Body Reshaping, dan ditulis oleh lima penulis yang terkait dengan Alibaba’s global DAMO academy.
Pengembangan Dataset
Seperti biasanya pada sistem sintesis dan penyuntingan gambar, arsitektur proyek ini memerlukan dataset pelatihan yang disesuaikan. Penulis mempekerjakan tiga fotografer untuk menghasilkan manipulasi Photoshop standar pada gambar yang tepat dari situs fotografi stok Unsplash, menghasilkan dataset—berjudul BR-5K*—sebanyak 5.000 gambar berkualitas tinggi dengan resolusi 2K.
Para peneliti menekankan bahwa tujuan pelatihan pada dataset ini bukan untuk menghasilkan fitur ‘ideal’ dan umum yang terkait dengan indeks daya tarik atau penampilan yang diinginkan, melainkan untuk mengekstrak pemetaan fitur utama yang berhubungan dengan manipulasi profesional pada gambar tubuh.
Namun, mereka mengakui bahwa manipulasi tersebut pada akhirnya mencerminkan proses transformasi yang memetakan progresi dari ‘nyata’ ke konsep ‘ideal’ yang telah ditetapkan:
‘Kami mengundang tiga seniman profesional untuk meretouch tubuh menggunakan Photoshop secara independen, dengan tujuan mencapai sosok ramping yang sesuai dengan estetika populer, dan memilih yang terbaik sebagai ground-truth.’
Karena kerangka kerja ini tidak menangani wajah sama sekali, wajah-wajah tersebut diburamkan sebelum dimasukkan ke dalam dataset.
Arsitektur dan Konsep Inti
Alur kerja sistem melibatkan memasukkan potret resolusi tinggi, menurunkannya ke resolusi lebih rendah yang dapat muat dalam sumber daya komputasi yang tersedia, dan mengekstrak pose peta kerangka yang diperkirakan (gambar kedua dari kiri pada gambar di bawah), serta Part Affinity Fields (PAFs), yang diinovasi pada tahun 2016 oleh The Robotics Institute di Carnegie Mellon University (lihat video yang disematkan langsung di bawah).
Part Affinity Fields membantu mendefinisikan orientasi anggota tubuh dan asosiasi umum dengan kerangka skeletal yang lebih luas, memberikan proyek baru ini alat perhatian/lokalisasi tambahan.

Dari makalah Part Affinity Fields 2016, PAF yang diprediksi mengenkode orientasi anggota tubuh sebagai bagian dari vektor 2D yang juga mencakup posisi umum anggota tubuh. Source: https://arxiv.org/pdf/1611.08050.pdf
Meskipun tampaknya tidak relevan dengan penampilan berat badan, peta kerangka berguna dalam mengarahkan proses transformasi akhir ke bagian tubuh yang akan diubah, seperti lengan atas, bokong, dan paha.
Setelah itu, hasilnya diberikan ke Structure Affinity Self-Attention (SASA) di titik bottleneck pusat proses (lihat gambar di bawah).

SASA mengatur konsistensi generator aliran yang mendukung proses, hasilnya kemudian diteruskan ke modul warping (kedua dari kanan pada gambar di atas), yang menerapkan transformasi yang dipelajari dari pelatihan pada revisi manual yang termasuk dalam dataset.

Modul Structure Affinity Self-Attention (SASA) mengalokasikan perhatian ke bagian tubuh yang relevan, membantu menghindari transformasi yang berlebihan atau tidak relevan.
Gambar output kemudian di-upsample kembali ke resolusi 2K asli, menggunakan proses yang tidak jauh berbeda dari arsitektur deepfake standar gaya 2017 yang menjadi dasar paket populer seperti DeepFaceLab; proses upsampling juga umum dalam kerangka kerja penyuntingan GAN.
Jaringan perhatian untuk skema ini dimodelkan berdasarkan Compositional De-Attention Networks (CODA), sebuah kolaborasi akademik US/Singapura 2019 dengan Amazon (AMZN ) AI dan Microsoft.
Pengujian
Kerangka kerja berbasis aliran ini diuji melawan metode berbasis aliran sebelumnya FAL dan Animating Through Warping (ATW), serta arsitektur translasi gambar Pix2PixHD dan GFLA, dengan SSIM, PSNR, dan LPIPS sebagai metrik evaluasi.

Hasil pengujian awal (arah panah pada judul menunjukkan apakah nilai yang lebih rendah atau lebih tinggi lebih baik).
Berdasarkan metrik yang diadopsi ini, sistem penulis mengungguli arsitektur sebelumnya.

Hasil terpilih. Silakan merujuk ke PDF asli yang ditautkan dalam artikel ini untuk perbandingan resolusi lebih tinggi.
Selain metrik otomatis, para peneliti melakukan studi pengguna (kolom akhir tabel hasil yang ditampilkan sebelumnya), di mana 40 peserta masing-masing ditunjukkan 30 pertanyaan yang dipilih secara acak dari kumpulan 100 pertanyaan yang berkaitan dengan gambar yang dihasilkan melalui berbagai metode. 70% responden lebih menyukai teknik baru sebagai yang lebih ‘menarik secara visual’.
Tantangan
Makalah baru ini merupakan jarak langka ke dalam manipulasi tubuh berbasis AI. Sektor sintesis gambar saat ini jauh lebih tertarik untuk menghasilkan tubuh yang dapat diedit melalui metode seperti Neural Radiance Fields (NeRF), atau terfokus pada eksplorasi ruang laten GAN dan potensi autoencoder untuk manipulasi wajah.
Inisiatif penulis saat ini terbatas pada menghasilkan perubahan pada berat yang dipersepsikan, dan mereka belum menerapkan teknik inpainting apa pun yang dapat memulihkan latar belakang yang tak terhindarkan terungkap ketika Anda menipiskan gambar seseorang.
Namun, mereka mengusulkan bahwa matting potret dan pencampuran latar belakang melalui inferensi tekstural dapat dengan mudah menyelesaikan masalah memulihkan bagian dunia yang sebelumnya tersembunyi dalam gambar karena ‘ketidaksempurnaan’ manusia.

Solusi yang diusulkan untuk memulihkan latar belakang yang terungkap oleh pengurangan lemak berbasis AI.
* Meskipun pra-cetak merujuk pada materi tambahan yang memberikan detail lebih lanjut tentang dataset, serta contoh tambahan dari proyek, lokasi materi ini tidak disediakan dalam makalah, dan penulis korespondensi belum merespons permintaan akses kami.
Terbit pertama 10 Maret 2022.












