มุมมองของ Anderson
การทำให้ร่างกาย ‘ดีกว่า’ ด้วย AI

การวิจัยใหม่จาก Alibaba DAMO Academy นำเสนอเวิร์กโฟลว์ที่ขับเคลื่อนด้วย AI สำหรับการทำอัตโนมัติในการปรับรูปร่างของภาพร่างกาย – ความพยายามที่หายากในภาคคอมพิวเตอร์วิชั่นซึ่งในขณะนี้มักมุ่งเน้นไปที่ การดัดแปลงโดยอิงใบหน้า เช่น deepfakes และ การแก้ไขใบหน้าโดยใช้ GAN.

แทรกในคอลัมน์ ‘result’ แผนที่ความสนใจที่สร้างขึ้นซึ่งกำหนดพื้นที่ที่ต้องแก้ไข. Source: https://arxiv.org/pdf/2203.04670.pdf Source: https://arxiv.org/pdf/2203.04670.pdf
สถาปัตยกรรมของนักวิจัยใช้การประมาณท่ากระดูกโครงกระดูกเพื่อรับมือกับความซับซ้อนที่มากขึ้นที่ระบบการสังเคราะห์และแก้ไขภาพต้องเผชิญในการทำความเข้าใจและกำหนดพารามิเตอร์ของภาพร่างกายที่มีอยู่ อย่างน้อยในระดับความละเอียดที่ทำให้สามารถแก้ไขได้อย่างมีความหมายและเลือกสรร

แผนที่โครงกระดูกที่ประมาณได้ช่วยระบุและมุ่งความสนใจไปยังส่วนของร่างกายที่น่าจะต้องทำการรีทัช เช่น บริเวณแขนบน
ระบบในที่สุดทำให้ผู้ใช้สามารถตั้งค่าพารามิเตอร์ที่สามารถเปลี่ยนลักษณะของน้ำหนัก, มวลกล้ามเนื้อ, หรือการกระจายน้ำหนักในภาพถ่ายเต็มตัวหรือครึ่งตัวของบุคคล และสามารถสร้างการแปลงรูปแบบใด ๆ บนส่วนของร่างกายที่สวมเสื้อผ้าหรือไม่สวมเสื้อผ้าได้

ซ้าย, ภาพต้นฉบับ; กลาง, แผนที่ความร้อนของพื้นที่ความสนใจที่ได้; ขวา, ภาพที่แปลงแล้ว.
แรงจูงใจของงานนี้คือการพัฒนาเวิร์กโฟลว์อัตโนมัติที่สามารถทดแทนการดัดแปลงดิจิทัลที่ยุ่งยากซึ่งทำโดยช่างภาพและศิลปินกราฟิกการผลิตในสาขาต่าง ๆ ของสื่อ ตั้งแต่แฟชั่นจนถึงผลลัพธ์สไตล์นิตยสารและ สื่อประชาสัมพันธ์.
โดยทั่วไป ผู้เขียนยอมรับว่าการแปลงเหล่านี้มักถูกนำไปใช้ด้วยเทคนิค ‘warp’ ใน Photoshop และโปรแกรมแก้ไขบิตแมปแบบดั้งเดิมอื่น ๆ และส่วนใหญ่จะใช้กับภาพของผู้หญิงเป็นหลัก ดังนั้นชุดข้อมูลที่กำหนดเองที่พัฒนาขึ้นเพื่ออำนวยความสะดวกให้กระบวนการใหม่จึงประกอบด้วยภาพของผู้หญิงเป็นส่วนใหญ่:
‘เนื่องจากการรีทัชร่างกายส่วนใหญ่ต้องการโดยผู้หญิง ส่วนใหญ่ของคอลเลกชันของเราจึงเป็นภาพผู้หญิง โดยคำนึงถึงความหลากหลายของอายุ, เชื้อชาติ (แอฟริกัน:เอเชีย:คอเคเชียน = 0.33:0.35:0.32), ท่าโพสต์, และเครื่องแต่งกาย’
เอกสาร paper มีชื่อว่า Structure-Aware Flow Generation for Human Body Reshaping และมาจากผู้เขียนห้าคนที่เชื่อมโยงกับ Alibaba’s global DAMO academy.
การพัฒนาชุดข้อมูล
เช่นเดียวกับระบบการสังเคราะห์และแก้ไขภาพทั่วไป สถาปัตยกรรมของโครงการต้องการชุดข้อมูลการฝึกที่กำหนดเอง ผู้เขียนได้ว่าจ้างช่างภาพสามคนให้สร้างการดัดแปลง Photoshop มาตรฐานจากภาพที่เหมาะสมจากเว็บไซต์สต็อกภาพ Unsplash ส่งผลให้ได้ชุดข้อมูลที่มีชื่อว่า BR-5K* ประกอบด้วยภาพคุณภาพสูง 5,000 รูปที่ความละเอียด 2K.
นักวิจัยเน้นว่าจุดมุ่งหมายของการฝึกด้วยชุดข้อมูลนี้ไม่ได้เพื่อสร้างคุณลักษณะ ‘อุดมคติ’ และทั่วไปที่เกี่ยวกับดัชนีของความดึงดูดหรือรูปลักษณ์ที่ต้องการ แต่เพื่อสกัดแผนที่คุณลักษณะศูนย์กลางที่เชื่อมโยงกับการดัดแปลงมืออาชีพของภาพร่างกาย
อย่างไรก็ตาม พวกเขายอมรับว่าการดัดแปลงในที่สุดสะท้อนกระบวนการแปลงที่แมพการเปลี่ยนแปลงจาก ‘จริง’ ไปสู่แนวคิด ‘อุดมคติ’ ที่กำหนดไว้ล่วงหน้า:
‘เราเชิญศิลปินมืออาชีพสามคนให้รีทัชร่างกายโดยใช้ Photoshop อย่างอิสระ โดยมีเป้าหมายเพื่อให้ได้รูปร่างเพรียวที่สอดคล้องกับความงามที่เป็นที่นิยม และเลือกภาพที่ดีที่สุดเป็นค่าพื้นฐาน (ground‑truth)’
เนื่องจากกรอบงานไม่ได้จัดการกับใบหน้าเลย จึงทำการเบลอใบหน้าเหล่านั้นก่อนนำเข้าในชุดข้อมูล
สถาปัตยกรรมและแนวคิดหลัก
เวิร์กโฟลว์ของระบบประกอบด้วยการป้อนภาพพอร์ตเทรตความละเอียดสูง, ลดความละเอียดลงเป็นระดับที่สามารถใส่ในทรัพยากรคอมพิวเตอร์ที่มีอยู่, และสกัดท่าโครงกระดูกที่ประมาณได้ (รูปที่สองจากซ้ายในภาพด้านล่าง) รวมถึง Part Affinity Fields (PAFs) ซึ่งได้รับการ พัฒนา ในปี 2016 โดย The Robotics Institute ของ Carnegie Mellon University (ดูวิดีโอที่ฝังไว้ด้านล่าง).
Part Affinity Fields ช่วยกำหนดทิศทางของแขนขาและการเชื่อมโยงทั่วไปกับโครงกระดูกที่กว้างขวางกว่า ทำให้โครงการใหม่มีเครื่องมือการให้ความสนใจ/การระบุตำแหน่งเพิ่มเติม

จากงานวิจัย Part Affinity Fields ปี 2016, PAFs ที่คาดการณ์ไว้เข้ารหัสทิศทางของแขนขาเป็นส่วนหนึ่งของเวกเตอร์ 2D ที่รวมตำแหน่งทั่วไปของแขนขาด้วย. Source: https://arxiv.org/pdf/1611.08050.pdf Source: https://arxiv.org/pdf/1611.08050.pdf
แม้ว่าพวกมันดูเหมือนไม่เกี่ยวข้องกับลักษณะของน้ำหนัก แผนที่โครงกระดูกก็มีประโยชน์ในการชี้นำกระบวนการแปลงขั้นสุดท้ายไปยังส่วนของร่างกายที่ต้องแก้ไข เช่น แขนบน, สะโพก, และต้นขา
หลังจากนี้ ผลลัพธ์จะถูกส่งต่อไปยัง Structure Affinity Self-Attention (SASA) ในส่วนคอขวดกลางของกระบวนการ (ดูภาพด้านล่าง)

SASA ควบคุมความสอดคล้องของ flow generator ที่ขับเคลื่อนกระบวนการ ผลลัพธ์จากนั้นจะถูกส่งต่อไปยังโมดูลการบิดเบือน (ตำแหน่งที่สองจากขวาในภาพด้านบน) ซึ่งนำการแปลงที่เรียนรู้จากการฝึกด้วยการแก้ไขด้วยมือที่รวมอยู่ในชุดข้อมูลไปใช้

โมดูล Structure Affinity Self-Attention (SASA) จัดสรรความสนใจไปยังส่วนของร่างกายที่เกี่ยวข้อง ช่วยหลีกเลี่ยงการแปลงที่เกินความจำเป็นหรือไม่เกี่ยวข้อง
ภาพผลลัพธ์จะถูกอัปซัมป์กลับไปยังความละเอียด 2K ดั้งเดิมโดยใช้กระบวนการที่คล้ายกับสถาปัตยกรรม deepfake แบบมาตรฐานปี 2017 ซึ่งเป็นพื้นฐานของแพคเกจยอดนิยมเช่น DeepFaceLab; กระบวนการอัปซัมป์นี้ยังเป็นที่พบทั่วไปในกรอบการแก้ไข GAN
เครือข่ายความสนใจสำหรับสคีมานี้ถูกออกแบบโดยอิงจาก Compositional De-Attention Networks (CODA) ซึ่งเป็นความร่วมมือทางวิชาการระหว่างสหรัฐฯ/สิงคโปร์ในปี 2019 กับ Amazon (AMZN ) AI และ Microsoft.
การทดสอบ
กรอบงานที่อิงการไหลนี้ถูกทดสอบเทียบกับวิธีการอิงการไหลก่อนหน้า เช่น FAL และ Animating Through Warping (ATW) รวมถึงสถาปัตยกรรมการแปลภาพเช่น Pix2PixHD และ GFLA โดยใช้ SSIM, PSNR และ LPIPS เป็นเมตริกการประเมินผล

ผลลัพธ์ของการทดสอบเบื้องต้น (ทิศทางลูกศรในหัวข้อบ่งบอกว่าตัวเลขที่ต่ำกว่าหรือสูงกว่าดีที่สุด)
จากเมตริกที่นำมาใช้ ระบบของผู้เขียนแสดงผลเหนือกว่าสถาปัตยกรรมก่อนหน้า
นอกจากเมตริกอัตโนมัติแล้ว นักวิจัยยังได้ทำการศึกษาเชิงผู้ใช้ (คอลัมน์สุดท้ายของตารางผลลัพธ์ที่แสดงไว้ก่อนหน้า) โดยให้ผู้เข้าร่วม 40 คนแต่ละคนตอบคำถาม 30 คำถามที่สุ่มเลือกจากชุดคำถาม 100 คำถามที่เกี่ยวกับภาพที่สร้างโดยวิธีต่าง ๆ 70% ของผู้ตอบแสดงความชื่นชอบเทคนิคใหม่ว่า ‘ดูน่าสนใจทางสายตามากกว่า’
ความท้าทาย
บทความใหม่นี้เป็นการสำรวจที่หายากในด้านการดัดแปลงร่างกายด้วย AI. ภาคส่วนการสังเคราะห์ภาพในขณะนี้สนใจมากกว่าในการสร้างร่างกายที่แก้ไขได้ผ่านวิธีเช่น Neural Radiance Fields (NeRF) หรือมุ่งเน้นการสำรวจ latent space ของ GANs และศักยภาพของ autoencoders สำหรับการดัดแปลงใบหน้า
ความริเริ่มของผู้เขียนในขณะนี้จำกัดอยู่ที่การสร้างการเปลี่ยนแปลงของน้ำหนักที่รับรู้เท่านั้น และพวกเขายังไม่ได้นำเทคนิคการ inpainting ใด ๆ มาปรับใช้เพื่อคืนสภาพพื้นหลังที่ปรากฏขึ้นโดยธรรมชาติเมื่อคุณทำให้ภาพของบุคคลบางลง
อย่างไรก็ตาม พวกเขาเสนอว่าการทำ portrait matting และการผสานพื้นหลังผ่านการสรุปเชิงเทกซ์เจอร์อาจแก้ปัญหาการคืนสภาพส่วนของโลกที่เคยถูกซ่อนในภาพโดย ‘ข้อบกพร่อง’ ของมนุษย์ได้อย่างง่ายดาย

โซลูชันที่เสนอเพื่อคืนสภาพพื้นหลังที่ปรากฏจากการลดไขมันด้วย AI
* แม้ว่า preprint จะอ้างอิงถึงวัสดุเสริมที่ให้รายละเอียดเพิ่มเติมเกี่ยวกับชุดข้อมูล รวมถึงตัวอย่างเพิ่มเติมจากโครงการ แต่ตำแหน่งของวัสดุนี้ไม่ได้เปิดให้เข้าถึงในเอกสาร และผู้เขียนที่รับผิดชอบยังไม่ได้ตอบกลับคำขอการเข้าถึงของเรา.
ตีพิมพ์ครั้งแรกเมื่อ 10 มีนาคม 2022.













