มุมมองของ Anderson

การปรับเปลี่ยนรูปร่างร่างกายมนุษย์ด้วย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การวิจัยร่วมใหม่จากประเทศจีนเสนอวิธีการปรับเปลี่ยนรูปร่างร่างกายมนุษย์ในภาพโดยใช้เครือข่ายโค้ดเนอร์ทวินประสานกันภายใต้การควบคุมของแบบจำลองพาราเมตริก ซึ่งช่วยให้ผู้ใช้สามารถปรับเปลี่ยนน้ำหนัก ส่วนสูง และอัตราส่วนของร่างกายได้อย่างมีปฏิสัมพันธ์ผ่านอินเทอร์เฟซกราฟิก

การปรับเปลี่ยนรูปร่างร่างกายแบบพาราเมตริก โดยใช้สลายเดอร์ในการเปลี่ยนแปลงคุณลักษณะทั้งสามแบบ

การปรับเปลี่ยนรูปร่างร่างกายแบบพาราเมตริก โดยใช้สลายเดอร์ในการเปลี่ยนแปลงคุณลักษณะทั้งสามแบบ Source: https://arxiv.org/pdf/2203.10496.pdf

งานวิจัยนี้มีการปรับปรุงหลายอย่างเหนือโครงการที่คล้ายกันในระยะหลังจากอาลีบาบา โดยสามารถเปลี่ยนแปลงส่วนสูงและอัตราส่วนของร่างกายได้เช่นเดียวกับน้ำหนัก และมีเครือข่ายประสาทที่อุทิศให้กับการ ‘填เงิน’ พื้นหลังที่ไม่มีอยู่จริงซึ่งสามารถเปิดเผยได้เมื่อ ‘ลดน้ำหนัก’ ของร่างกาย นอกจากนี้ยังปรับปรุงวิธีการพาราเมตริกสำหรับการปรับเปลี่ยนรูปร่างร่างกายในระยะก่อนหน้านี้โดยการกำจัดความจำเป็นในการแทรกแซงของมนุษย์อย่างกว้างขวางในช่วงการสร้างการเปลี่ยนแปลง

ชื่อ NeuralReshaper สถาปัตยกรรมใหม่นี้ใช้แบบจำลองพาราเมตริก 3 มิติของมนุษย์กับภาพที่ต้องการเปลี่ยนแปลงรูปร่าง แล้วใช้การบิดเบือนของแบบจำลองเพื่อปรับเปลี่ยนภาพเดิมให้เข้ากับค่าพาราเมตริกใหม่

ระบบสามารถจัดการการเปลี่ยนแปลงรูปร่างร่างกายทั้งบนภาพที่สวมเสื้อผ้าและภาพที่สวมเสื้อผ้าบางส่วน (เช่น ชายหาด)

การเปลี่ยนแปลงประเภทนี้มีความสนใจอย่างมากในภาควิจัย AI สำหรับแฟชั่น ซึ่งได้ผลิตแพลตฟอร์มและเครือข่ายประสาทที่หลากหลายสำหรับการ ‘ลองเสื้อผ้าเสมือน’ ที่สามารถปรับเปลี่ยนเสื้อผ้าให้เข้ากับรูปร่างและประเภทของร่างกายจากภาพที่ผู้ใช้ส่งมา หรือช่วยในการสร้างความสอดคล้องทางภาพ

เอกสารวิจัย นี้ มีชื่อเรื่องว่า การเปลี่ยนแปลงรูปร่างร่างกายมนุษย์จากภาพเดียวด้วยเครือข่ายประสาทลึก และมาจากนักวิจัยที่มหาวิทยาลัยเจ้อเจียงในหางโจว และโรงเรียนสื่อสร้างสรรค์ที่มหาวิทยาลัยซิตี้แห่งฮ่องกง

การปรับแต่ง SMPL

NeuralReshaper ใช้แบบจำลอง Skinned Multi-Person Linear (SMPL) ที่พัฒนาโดยสถาบัน Max Planck สำหรับระบบอัจฉริยะและบริษัท VFX ที่มีชื่อเสียง Industrial Light and Magic ในปี 2015

แบบจำลอง SMPL ของมนุษย์จากความร่วมมือระหว่าง Planck และ ILM ในปี 2015

แบบจำลอง SMPL ของมนุษย์จากความร่วมมือระหว่าง Planck และ ILM ในปี 2015 Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

ในขั้นตอนแรกของกระบวนการ จะสร้างแบบจำลอง SMPL จากภาพที่ต้องการเปลี่ยนแปลงรูปร่างร่างกาย การปรับแต่งแบบจำลอง SMPL ให้เข้ากับภาพตาม วิธีการ ของวิธีการ Human Mesh Recovery (HMR) ที่เสนอโดยมหาวิทยาลัยในเยอรมนีและสหรัฐอเมริกาในปี 2018

พาราเมตริกสามตัวสำหรับการบิดเบือน (น้ำหนัก ส่วนสูง อัตราส่วนของร่างกาย) จะถูกคำนวณในขั้นตอนนี้ พร้อมกับการพิจารณาค่าพาราเมตริกของกล้อง เช่น ความยาวโฟกัส จุดยอด 2 มิติและเส้นขอบที่สร้างขึ้นจะให้ขอบเขตสำหรับการบิดเบือนในรูปแบบของเส้นขอบ 2 มิติ ซึ่งเป็นมาตรการเพิ่มเติมที่เพิ่มความแม่นยำของขอบเขตและช่วยให้สามารถ ‘填เงิน’ พื้นหลังได้อย่างแท้จริงในขั้นตอนต่อไปของกระบวนการ

ขั้นตอนการปรับแต่ง SMPL: ซ้าย ภาพที่ต้องการเปลี่ยนแปลงรูปร่าง สองซ้าย ผลลัพธ์จากการปรับแต่งตามวิธีการที่อธิบายไว้ในปี 2016 โดย Max Planck Institute for Intelligent Systems สามซ้าย ผลลัพธ์โดยตรงจากแบบจำลองที่ฝึกไว้สำหรับการฟื้นฟูรูปร่างและท่าทางของมนุษย์ สองขวา ผลลัพธ์หลังการปรับแต่งจุดยอด 2 มิติ และขวา ผลลัพธ์สุดท้ายหลังการปรับแต่งเส้นขอบ

ขั้นตอนการปรับแต่ง SMPL: ซ้าย ภาพที่ต้องการเปลี่ยนแปลงรูปร่าง สองซ้าย ผลลัพธ์จากการปรับแต่งตามวิธีการที่อธิบายไว้ในปี 2016 โดย Max Planck Institute for Intelligent Systems สามซ้าย ผลลัพธ์โดยตรงจากแบบจำลองที่ฝึกไว้สำหรับการฟื้นฟูรูปร่างและท่าทางของมนุษย์ สองขวา ผลลัพธ์หลังการปรับแต่งจุดยอด 2 มิติ และขวา ผลลัพธ์สุดท้ายหลังการปรับแต่งเส้นขอบ

การบิดเบือน 3 มิติจะถูกฉายลงในพื้นที่ภาพของสถาปัตยกรรมเพื่ออำนวยความสะดวกในการสร้างสนามการบิดเบือนที่จะกำหนดการบิดเบือน กระบวนการนี้ใช้เวลาประมาณ 30 วินาทีต่อภาพ

สถาปัตยกรรม NeuralReshaper

NeuralReshaper ใช้เครือข่ายประสาทสองตัวพร้อมกัน: เครือข่ายโค้ดเนอร์สำหรับพื้นหน้าซึ่งสร้างรูปร่างร่างกายที่เปลี่ยนแปลงไป และเครือข่ายโค้ดเนอร์สำหรับพื้นหลังซึ่งมุ่งเน้นไปที่การ ‘填เงิน’ พื้นหลังที่ไม่มีอยู่จริง (ในกรณีของการ ‘ลดน้ำหนัก’ ของร่างกาย ตัวอย่างเช่น)

เฟรมเวิร์กแบบ U-net รวมเอาอินพุตจากคุณลักษณะของทั้งสองเครือข่ายโค้ดเนอร์ก่อนที่จะส่งผลลัพธ์ไปยังเครือข่ายโค้ดเนอร์ที่รวมกันซึ่งสร้างภาพใหม่จากอินพุตทั้งสอง สถาปัตยกรรมนี้มีกลไกการบิดเบือนที่มีคำแนะนำใหม่เพื่ออำนวยความสะดวกในการรวม

การฝึกอบรมและการทดลอง

NeuralReshaper ถูกนำไปใช้โดยใช้ PyTorch บน GPU NVIDIA (NVDA ) 1080ti ที่มี VRAM 11gb เครือข่ายถูกฝึกอบรมเป็นเวลา 100 ยุคภายใต้ตัวเลือก Adam โดยมีการตั้งค่าความสูญเสียเป้าหมายของเครื่องสร้างที่ 0.0001 และตัวเลือกความสูญเสียเป้าหมายของตัววิจารณ์ที่ 0.0004 การฝึกอบรมเกิดขึ้นพร้อมกับขนาดแบตช์ของ 8 สำหรับชุดข้อมูลกลางแจ้งเฉพาะ (ที่ดึงมาจาก COCO, MPII และ LSP) และ 2 สำหรับการฝึกอบรมบนชุดข้อมูล DeepFashion

ซ้าย ภาพที่ต้องการเปลี่ยนแปลงรูปร่าง และขวา ผลลัพธ์ที่ได้จาก NeuralReshaper

ซ้าย ภาพที่ต้องการเปลี่ยนแปลงรูปร่าง และขวา ผลลัพธ์ที่ได้จาก NeuralReshaper

ต่อไปนี้คือตัวอย่างจากชุดข้อมูล DeepFashion ที่ฝึกอบรมสำหรับ NeuralReshaper โดยมีภาพที่ต้องการเปลี่ยนแปลงรูปร่างอยู่ทางซ้ายเสมอ

คุณลักษณะที่ควบคุมได้สามอย่างถูกแยกออกจากกันและสามารถใช้ได้แยกจากกัน

การเปลี่ยนแปลงรูปร่างบนชุดข้อมูลกลางแจ้งมีความท้าทายมากกว่า เนื่องจากมักต้องการการ ‘填เงิน’ พื้นหลังที่ซับซ้อนและเส้นขอบที่ชัดเจนและน่าเชื่อถือของรูปร่างร่างกายที่เปลี่ยนแปลงไป:

ความจำเป็นพาราเมตริก

ตามที่เอกสารวิจัยระบุ การเปลี่ยนแปลงรูปร่างร่างกายในภาพเดียวกันนี้เป็นปัญหาที่ไม่ได้กำหนดไว้อย่างชัดเจนในการสังเคราะห์ภาพ หลายเฟรมเวิร์ก GAN และเครือข่ายโค้ดเนอร์สามารถใช้ภาพคู่ (เช่น โครงการที่ออกแบบมาเพื่อการเปลี่ยนแปลงจาก สเก็ตช์>ภาพถ่าย และ ภาพถ่าย>สเก็ตช์)

อย่างไรก็ตาม ในกรณีนี้จะจำเป็นต้องมีภาพคู่ที่มีคนเดียวกันในคอนฟิกการ์เรشنทางกายภาพที่แตกต่างกัน เช่น ภาพ ‘ก่อนและหลัง’ ในโฆษณาเกี่ยวกับการลดน้ำหนักหรือการผ่าตัดพลาสติก – ข้อมูลที่ยากที่จะหาหรือสร้างขึ้น

เครือข่าย GAN ที่เปลี่ยนแปลงสามารถฝึกอบรมบนข้อมูลที่หลากหลายและดำเนินการเปลี่ยนแปลงโดยการค้นหา ทิศทางลัทธิ ระหว่างโค้ดลัทธิของภาพต้นฉบับ (โค้ดลัทธิของภาพที่ต้องการเปลี่ยนแปลงรูปร่าง) และคลาสที่ต้องการ (ในกรณีนี้ ‘อ้วน’, ‘ผอม’, ‘สูง’ ฯลฯ) อย่างไรก็ตาม วิธีการนี้ยังคงจำกัดเกินไปสำหรับการเปลี่ยนแปลงรูปร่างร่างกายที่ละเอียด

แนวทาง Neural Radiance Fields (NeRF) มีความก้าวหน้ามากกว่าในด้านการจำลองร่างกายที่สมบูรณ์ แต่ยังคงจำกัดอยู่ในฉากและต้องการทรัพยากรมาก และมีความสามารถในการแก้ไขรูปร่างร่างกายในระดับที่ NeuralReshaper และโครงการก่อนหน้านี้พยายามที่จะแก้ไข (นอกเหนือจากการ ลดขนาดร่างกายทั้งหมด เทียบกับสภาพแวดล้อม)

พื้นที่ลัทธิของ GAN ยังคงยากที่จะควบคุม VAEs เพียงอย่างเดียวยังไม่สามารถจัดการกับความซับซ้อนของการสร้างภาพร่างกายที่สมบูรณ์ได้ และความสามารถของ NeRF ในการสร้างรูปร่างร่างกายมนุษย์ใหม่และสมจริงยังคงอยู่ในขั้นตอนเริ่มต้น ดังนั้นการรวม ‘วิธีการดั้งเดิม’ ของ CGI เช่น SMPL จึงดูเหมือนว่าจะยังคงดำเนินต่อไปในภาควิจัยการสังเคราะห์ภาพมนุษย์ เพื่อเป็นวิธีการในการควบคุมและรวมคุณลักษณะ คลาส และโค้ดลัทธิที่พาราเมตริกและความสามารถในการใช้ประโยชน์ยังไม่ได้รับการทำความเข้าใจอย่างเต็มที่ในเทคโนโลยีที่เกิดขึ้นใหม่เหล่านี้

ของ ‘วิธีการดั้งเดิม’ ของ CGI เช่น SMPL ดูเหมือนว่าจะยังคงดำเนินต่อไปในภาควิจัยการสังเคราะห์ภาพมนุษย์ เพื่อเป็นวิธีการในการควบคุมและรวมคุณลักษณะ คลาส และโค้ดลัทธิที่พาราเมตริกและความสามารถในการใช้ประโยชน์ยังไม่ได้รับการทำความเข้าใจอย่างเต็มที่ในเทคโนโลยีที่เกิดขึ้นใหม่เหล่านี้

 

เผยแพร่ครั้งแรกเมื่อวันที่ 31 มีนาคม 2022

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai