มุมมองของ Anderson

การทำให้ร่างกาย ‘ดีกว่า’ ด้วย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การวิจัยใหม่จาก Alibaba DAMO Academy นำเสนอเวิร์กโฟลว์ที่ขับเคลื่อนด้วย AI สำหรับการทำอัตโนมัติในการปรับรูปร่างของภาพร่างกาย – ความพยายามที่หายากในภาคคอมพิวเตอร์วิชั่นซึ่งในขณะนี้มักมุ่งเน้นไปที่ การดัดแปลงโดยอิงใบหน้า เช่น deepfakes และ การแก้ไขใบหน้าโดยใช้ GAN.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

แทรกในคอลัมน์ ‘result’ แผนที่ความสนใจที่สร้างขึ้นซึ่งกำหนดพื้นที่ที่ต้องแก้ไข. Source: https://arxiv.org/pdf/2203.04670.pdf Source: https://arxiv.org/pdf/2203.04670.pdf

สถาปัตยกรรมของนักวิจัยใช้การประมาณท่ากระดูกโครงกระดูกเพื่อรับมือกับความซับซ้อนที่มากขึ้นที่ระบบการสังเคราะห์และแก้ไขภาพต้องเผชิญในการทำความเข้าใจและกำหนดพารามิเตอร์ของภาพร่างกายที่มีอยู่ อย่างน้อยในระดับความละเอียดที่ทำให้สามารถแก้ไขได้อย่างมีความหมายและเลือกสรร

แผนที่โครงกระดูกที่ประมาณได้ช่วยระบุและมุ่งความสนใจไปยังส่วนของร่างกายที่น่าจะต้องทำการรีทัช เช่น บริเวณแขนบน

ระบบในที่สุดทำให้ผู้ใช้สามารถตั้งค่าพารามิเตอร์ที่สามารถเปลี่ยนลักษณะของน้ำหนัก, มวลกล้ามเนื้อ, หรือการกระจายน้ำหนักในภาพถ่ายเต็มตัวหรือครึ่งตัวของบุคคล และสามารถสร้างการแปลงรูปแบบใด ๆ บนส่วนของร่างกายที่สวมเสื้อผ้าหรือไม่สวมเสื้อผ้าได้

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

ซ้าย, ภาพต้นฉบับ; กลาง, แผนที่ความร้อนของพื้นที่ความสนใจที่ได้; ขวา, ภาพที่แปลงแล้ว.

แรงจูงใจของงานนี้คือการพัฒนาเวิร์กโฟลว์อัตโนมัติที่สามารถทดแทนการดัดแปลงดิจิทัลที่ยุ่งยากซึ่งทำโดยช่างภาพและศิลปินกราฟิกการผลิตในสาขาต่าง ๆ ของสื่อ ตั้งแต่แฟชั่นจนถึงผลลัพธ์สไตล์นิตยสารและ สื่อประชาสัมพันธ์.

โดยทั่วไป ผู้เขียนยอมรับว่าการแปลงเหล่านี้มักถูกนำไปใช้ด้วยเทคนิค ‘warp’ ใน Photoshop และโปรแกรมแก้ไขบิตแมปแบบดั้งเดิมอื่น ๆ และส่วนใหญ่จะใช้กับภาพของผู้หญิงเป็นหลัก ดังนั้นชุดข้อมูลที่กำหนดเองที่พัฒนาขึ้นเพื่ออำนวยความสะดวกให้กระบวนการใหม่จึงประกอบด้วยภาพของผู้หญิงเป็นส่วนใหญ่:

‘เนื่องจากการรีทัชร่างกายส่วนใหญ่ต้องการโดยผู้หญิง ส่วนใหญ่ของคอลเลกชันของเราจึงเป็นภาพผู้หญิง โดยคำนึงถึงความหลากหลายของอายุ, เชื้อชาติ (แอฟริกัน:เอเชีย:คอเคเชียน = 0.33:0.35:0.32), ท่าโพสต์, และเครื่องแต่งกาย’

เอกสาร paper มีชื่อว่า Structure-Aware Flow Generation for Human Body Reshaping และมาจากผู้เขียนห้าคนที่เชื่อมโยงกับ Alibaba’s global DAMO academy.

การพัฒนาชุดข้อมูล

เช่นเดียวกับระบบการสังเคราะห์และแก้ไขภาพทั่วไป สถาปัตยกรรมของโครงการต้องการชุดข้อมูลการฝึกที่กำหนดเอง ผู้เขียนได้ว่าจ้างช่างภาพสามคนให้สร้างการดัดแปลง Photoshop มาตรฐานจากภาพที่เหมาะสมจากเว็บไซต์สต็อกภาพ Unsplash ส่งผลให้ได้ชุดข้อมูลที่มีชื่อว่า BR-5K* ประกอบด้วยภาพคุณภาพสูง 5,000 รูปที่ความละเอียด 2K.

นักวิจัยเน้นว่าจุดมุ่งหมายของการฝึกด้วยชุดข้อมูลนี้ไม่ได้เพื่อสร้างคุณลักษณะ ‘อุดมคติ’ และทั่วไปที่เกี่ยวกับดัชนีของความดึงดูดหรือรูปลักษณ์ที่ต้องการ แต่เพื่อสกัดแผนที่คุณลักษณะศูนย์กลางที่เชื่อมโยงกับการดัดแปลงมืออาชีพของภาพร่างกาย

อย่างไรก็ตาม พวกเขายอมรับว่าการดัดแปลงในที่สุดสะท้อนกระบวนการแปลงที่แมพการเปลี่ยนแปลงจาก ‘จริง’ ไปสู่แนวคิด ‘อุดมคติ’ ที่กำหนดไว้ล่วงหน้า:

‘เราเชิญศิลปินมืออาชีพสามคนให้รีทัชร่างกายโดยใช้ Photoshop อย่างอิสระ โดยมีเป้าหมายเพื่อให้ได้รูปร่างเพรียวที่สอดคล้องกับความงามที่เป็นที่นิยม และเลือกภาพที่ดีที่สุดเป็นค่าพื้นฐาน (ground‑truth)’

เนื่องจากกรอบงานไม่ได้จัดการกับใบหน้าเลย จึงทำการเบลอใบหน้าเหล่านั้นก่อนนำเข้าในชุดข้อมูล

สถาปัตยกรรมและแนวคิดหลัก

เวิร์กโฟลว์ของระบบประกอบด้วยการป้อนภาพพอร์ตเทรตความละเอียดสูง, ลดความละเอียดลงเป็นระดับที่สามารถใส่ในทรัพยากรคอมพิวเตอร์ที่มีอยู่, และสกัดท่าโครงกระดูกที่ประมาณได้ (รูปที่สองจากซ้ายในภาพด้านล่าง) รวมถึง Part Affinity Fields (PAFs) ซึ่งได้รับการ พัฒนา ในปี 2016 โดย The Robotics Institute ของ Carnegie Mellon University (ดูวิดีโอที่ฝังไว้ด้านล่าง).

Part Affinity Fields ช่วยกำหนดทิศทางของแขนขาและการเชื่อมโยงทั่วไปกับโครงกระดูกที่กว้างขวางกว่า ทำให้โครงการใหม่มีเครื่องมือการให้ความสนใจ/การระบุตำแหน่งเพิ่มเติม

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

จากงานวิจัย Part Affinity Fields ปี 2016, PAFs ที่คาดการณ์ไว้เข้ารหัสทิศทางของแขนขาเป็นส่วนหนึ่งของเวกเตอร์ 2D ที่รวมตำแหน่งทั่วไปของแขนขาด้วย. Source: https://arxiv.org/pdf/1611.08050.pdf Source: https://arxiv.org/pdf/1611.08050.pdf

แม้ว่าพวกมันดูเหมือนไม่เกี่ยวข้องกับลักษณะของน้ำหนัก แผนที่โครงกระดูกก็มีประโยชน์ในการชี้นำกระบวนการแปลงขั้นสุดท้ายไปยังส่วนของร่างกายที่ต้องแก้ไข เช่น แขนบน, สะโพก, และต้นขา

หลังจากนี้ ผลลัพธ์จะถูกส่งต่อไปยัง Structure Affinity Self-Attention (SASA) ในส่วนคอขวดกลางของกระบวนการ (ดูภาพด้านล่าง)

SASA ควบคุมความสอดคล้องของ flow generator ที่ขับเคลื่อนกระบวนการ ผลลัพธ์จากนั้นจะถูกส่งต่อไปยังโมดูลการบิดเบือน (ตำแหน่งที่สองจากขวาในภาพด้านบน) ซึ่งนำการแปลงที่เรียนรู้จากการฝึกด้วยการแก้ไขด้วยมือที่รวมอยู่ในชุดข้อมูลไปใช้

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

โมดูล Structure Affinity Self-Attention (SASA) จัดสรรความสนใจไปยังส่วนของร่างกายที่เกี่ยวข้อง ช่วยหลีกเลี่ยงการแปลงที่เกินความจำเป็นหรือไม่เกี่ยวข้อง

ภาพผลลัพธ์จะถูกอัปซัมป์กลับไปยังความละเอียด 2K ดั้งเดิมโดยใช้กระบวนการที่คล้ายกับสถาปัตยกรรม deepfake แบบมาตรฐานปี 2017 ซึ่งเป็นพื้นฐานของแพคเกจยอดนิยมเช่น DeepFaceLab; กระบวนการอัปซัมป์นี้ยังเป็นที่พบทั่วไปในกรอบการแก้ไข GAN

เครือข่ายความสนใจสำหรับสคีมานี้ถูกออกแบบโดยอิงจาก Compositional De-Attention Networks (CODA) ซึ่งเป็นความร่วมมือทางวิชาการระหว่างสหรัฐฯ/สิงคโปร์ในปี 2019 กับ Amazon (AMZN ) AI และ Microsoft.

การทดสอบ

กรอบงานที่อิงการไหลนี้ถูกทดสอบเทียบกับวิธีการอิงการไหลก่อนหน้า เช่น FAL และ Animating Through Warping (ATW) รวมถึงสถาปัตยกรรมการแปลภาพเช่น Pix2PixHD และ GFLA โดยใช้ SSIM, PSNR และ LPIPS เป็นเมตริกการประเมินผล

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

ผลลัพธ์ของการทดสอบเบื้องต้น (ทิศทางลูกศรในหัวข้อบ่งบอกว่าตัวเลขที่ต่ำกว่าหรือสูงกว่าดีที่สุด)

จากเมตริกที่นำมาใช้ ระบบของผู้เขียนแสดงผลเหนือกว่าสถาปัตยกรรมก่อนหน้า

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

ผลลัพธ์ที่เลือก โปรดดู PDF ดั้งเดิมที่เชื่อมโยงในบทความนี้เพื่อเปรียบเทียบความละเอียดที่สูงขึ้น.

นอกจากเมตริกอัตโนมัติแล้ว นักวิจัยยังได้ทำการศึกษาเชิงผู้ใช้ (คอลัมน์สุดท้ายของตารางผลลัพธ์ที่แสดงไว้ก่อนหน้า) โดยให้ผู้เข้าร่วม 40 คนแต่ละคนตอบคำถาม 30 คำถามที่สุ่มเลือกจากชุดคำถาม 100 คำถามที่เกี่ยวกับภาพที่สร้างโดยวิธีต่าง ๆ 70% ของผู้ตอบแสดงความชื่นชอบเทคนิคใหม่ว่า ‘ดูน่าสนใจทางสายตามากกว่า’

ความท้าทาย

บทความใหม่นี้เป็นการสำรวจที่หายากในด้านการดัดแปลงร่างกายด้วย AI. ภาคส่วนการสังเคราะห์ภาพในขณะนี้สนใจมากกว่าในการสร้างร่างกายที่แก้ไขได้ผ่านวิธีเช่น Neural Radiance Fields (NeRF) หรือมุ่งเน้นการสำรวจ latent space ของ GANs และศักยภาพของ autoencoders สำหรับการดัดแปลงใบหน้า

ความริเริ่มของผู้เขียนในขณะนี้จำกัดอยู่ที่การสร้างการเปลี่ยนแปลงของน้ำหนักที่รับรู้เท่านั้น และพวกเขายังไม่ได้นำเทคนิคการ inpainting ใด ๆ มาปรับใช้เพื่อคืนสภาพพื้นหลังที่ปรากฏขึ้นโดยธรรมชาติเมื่อคุณทำให้ภาพของบุคคลบางลง

อย่างไรก็ตาม พวกเขาเสนอว่าการทำ portrait matting และการผสานพื้นหลังผ่านการสรุปเชิงเทกซ์เจอร์อาจแก้ปัญหาการคืนสภาพส่วนของโลกที่เคยถูกซ่อนในภาพโดย ‘ข้อบกพร่อง’ ของมนุษย์ได้อย่างง่ายดาย

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

โซลูชันที่เสนอเพื่อคืนสภาพพื้นหลังที่ปรากฏจากการลดไขมันด้วย AI

 

* แม้ว่า preprint จะอ้างอิงถึงวัสดุเสริมที่ให้รายละเอียดเพิ่มเติมเกี่ยวกับชุดข้อมูล รวมถึงตัวอย่างเพิ่มเติมจากโครงการ แต่ตำแหน่งของวัสดุนี้ไม่ได้เปิดให้เข้าถึงในเอกสาร และผู้เขียนที่รับผิดชอบยังไม่ได้ตอบกลับคำขอการเข้าถึงของเรา.

ตีพิมพ์ครั้งแรกเมื่อ 10 มีนาคม 2022.

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai