มุมมองของ Anderson
การสร้าง ‘ร่างกายที่ดีกว่า’ ด้วย AI

การวิจัยใหม่จาก Alibaba DAMO Academy เสนอการทำงานของ AI ที่ช่วยให้สามารถเปลี่ยนแปลงรูปภาพของร่างกายได้อย่างอัตโนมัติ ซึ่งเป็นความพยายามที่หายากในภาคการมองเห็นของคอมพิวเตอร์ที่ปัจจุบันกำลังถูกครอบครองโดยการเปลี่ยนแปลงที่基於ใบหน้า เช่น deepfakes และการแก้ไขใบหน้าโดยใช้ GAN

Inset in ‘result’ columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf
สถาปัตยกรรมของนักวิจัยใช้การประมาณค่าโครงกระดูกเพื่อแก้ไขปัญหาความซับซ้อนที่ระบบสังเคราะห์และแก้ไขภาพต้องเผชิญในการสร้างและปรับเปลี่ยนภาพของร่างกายที่มีอยู่ โดยเฉพาะอย่างยิ่งในการแก้ไขที่มีรายละเอียดมาก

Estimated skeleton maps help to individuate and focus attention on areas of the body likely to be retouched, such as the upper arm area.
ระบบสุดท้ายช่วยให้ผู้ใช้สามารถตั้งค่าพารามิเตอร์ที่สามารถเปลี่ยนแปลงรูปร่างของน้ำหนัก มวลกล้ามเนื้อ หรือการกระจายน้ำหนักในรูปภาพของคน และสามารถสร้างการเปลี่ยนแปลงได้อย่างอิสระในบริเวณของร่างกายที่สวมเสื้อผ้าหรือไม่สวมเสื้อผ้า

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.
แรงจูงใจในการทำงานนี้คือการสร้างกระบวนการทำงานอัตโนมัติที่สามารถแทนที่การเปลี่ยนแปลงดิจิทัลที่ยุ่งยากซึ่งถูกดำเนินการโดยช่างภาพและศิลปินกราฟิกในหลายสาขาของสื่อ ตั้งแต่แฟชั่นไปจนถึงการผลิตวัสดุประชาสัมพันธ์
โดยทั่วไป ผู้เขียนยอมรับว่าการเปลี่ยนแปลงเหล่านี้มักถูกใช้โดยใช้เทคนิค ‘warp’ ในโปรแกรมแก้ไขภาพแบบดั้งเดิม และเกือบจะใช้กับรูปภาพของผู้หญิงเท่านั้น ดังนั้น ชุดข้อมูลที่ถูกสร้างขึ้นเพื่ออำนวยความสะดวกในการดำเนินงานใหม่นี้จึงประกอบด้วยภาพของผู้หญิงเป็นส่วนใหญ่ โดยพิจารณาจากความหลากหลายของอายุ เชื้อชาติ (แอฟริกา: เอเชีย: คอเคเชียน = 0.33:0.35:0.32) ท่าทาง และเสื้อผ้า
‘As body retouching is mainly desired by females, the majority of our collection are female photos, considering the diversity of ages, races (African:Asian:Caucasian = 0.33:0.35:0.32), poses, and garments.’
เอกสารวิจัยนี้มีชื่อว่า Structure-Aware Flow Generation for Human Body Reshaping และมาจากผู้เขียน 5 คนจาก Alibaba’s global DAMO academy
การสร้างชุดข้อมูล
เช่นเดียวกับระบบสังเคราะห์และแก้ไขภาพอื่นๆ สถาปัตยกรรมสำหรับโครงการนี้ต้องการชุดข้อมูลที่ถูกปรับแต่งแล้ว ผู้เขียนจ้างช่างภาพ 3 คนให้สร้างการเปลี่ยนแปลงภาพโดยใช้ Photoshop จากภาพที่เหมาะสมจากเว็บไซต์ Unsplash ซึ่งผลลัพธ์เป็นชุดข้อมูล – ชื่อ BR-5K* – ของ 5,000 ภาพคุณภาพสูงในความละเอียด 2K
ผู้วิจัยเน้นย้ำว่าจุดมุ่งหมายของการฝึกอบรมบนชุดข้อมูลนี้ไม่ใช่เพื่อสร้างคุณลักษณะ ‘理想化’ และทั่วไปที่เกี่ยวข้องกับดัชนีของความน่าดึงดูดหรือความน่าดึงดูด แต่เพื่อแยกคุณลักษณะที่สำคัญที่เกี่ยวข้องกับการเปลี่ยนแปลงของร่างกายโดยมืออาชีพ
สถาปัตยกรรมและแนวคิดหลัก
กระบวนการทำงานของระบบเกี่ยวข้องกับการป้อนภาพถ่ายที่มีความละเอียดสูง ลดความละเอียดลงเพื่อให้เข้ากับทรัพยากรการคำนวณที่มีอยู่ และการ 추출แผนที่โครงกระดูกที่ประมาณการได้ (รูปที่สองจากซ้ายในภาพด้านล่าง) รวมทั้ง Part Affinity Fields (PAFs) ซึ่งถูกสร้างขึ้นในปี 2016 โดย The Robotics Institute at Carnegie Mellon University
Part Affinity Fields ช่วยให้กำหนดทิศทางของขาและความสัมพันธ์กับโครงกระดูกโดยรวม โดยให้เครื่องมือที่เพิ่มเติมสำหรับการจัดทิศทางและความสนใจ

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf
แม้ว่าแผนที่โครงกระดูกดูเหมือนไม่เกี่ยวข้องกับการปรากฏของน้ำหนัก แต่ก็มีประโยชน์ในการกำหนดทิศทางของกระบวนการเปลี่ยนแปลงสุดท้ายไปยังบริเวณของร่างกายที่ต้องการแก้ไข เช่น ขาหน้า ขาหลัง และต้นขา
การทดสอบ
เฟรมเวิร์กที่ใช้การไหลถูกทดสอบกับวิธีการไหลก่อนหน้า FAL และ Animating Through Warping (ATW) รวมทั้งการแปลภาพ Pix2PixHD และ GFLA โดยใช้ SSIM, PSNR และ LPIPS เป็นตัววัดผล

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).
ตามตัววัดที่นำมาใช้ ระบบของผู้เขียนมีประสิทธิภาพมากกว่าระบบก่อนหน้า
ความท้าทาย
เอกสารวิจัยใหม่นี้เป็นการเดินทางที่หายากในการเปลี่ยนแปลงร่างกายโดยใช้ AI ภาคสังเคราะห์ภาพในปัจจุบันมีความสนใจในการสร้างร่างกายที่สามารถแก้ไขได้โดยใช้วิธีการเช่น Neural Radiance Fields (NeRF) หรือการสำรวจพื้นที่ 潜在ของ GANs และความสามารถของ autoencoders สำหรับการเปลี่ยนแปลงใบหน้า
การเปลี่ยนแปลงที่สามารถทำได้ในปัจจุบันจำกัดอยู่ที่การเปลี่ยนแปลงน้ำหนัก และผู้เขียนยังไม่ได้ใช้เทคนิคการ inpainting ที่จะช่วยให้สามารถฟื้นฟูพื้นหลังที่ถูกเปิดเผยเมื่อมีการลดน้ำหนักภาพ
อย่างไรก็ตาม ผู้เขียนเสนอว่าการ matting ของภาพถ่ายและการผสมผสานพื้นหลังโดยใช้การอนุมานข้อความสามารถช่วยแก้ปัญหาได้อย่างง่ายดาย

A proposed solution for restoring background that’s revealed by AI-driven fat reduction.
* Though the preprint refers to supplemental material giving more details about the dataset, as well as further examples from the project, the location of this material is not made available in the paper, and the corresponding author has not yet responded to our request for access.
First published 10th มีนาคม 2022.












