มุมมองของ Anderson
การปรับเปลี่ยนรูปร่างร่างกายมนุษย์ด้วย AI

การวิจัยร่วมใหม่จากประเทศจีนเสนอวิธีการปรับเปลี่ยนรูปร่างร่างกายมนุษย์ในภาพโดยใช้เครือข่ายโค้ดเนอร์ทวินประสานกันภายใต้การควบคุมของแบบจำลองพาราเมตริก ซึ่งช่วยให้ผู้ใช้สามารถปรับเปลี่ยนน้ำหนัก ส่วนสูง และอัตราส่วนของร่างกายได้อย่างมีปฏิสัมพันธ์ผ่านอินเทอร์เฟซกราฟิก

การปรับเปลี่ยนรูปร่างร่างกายแบบพาราเมตริก โดยใช้สลายเดอร์ในการเปลี่ยนแปลงคุณลักษณะทั้งสามแบบ Source: https://arxiv.org/pdf/2203.10496.pdf
งานวิจัยนี้มีการปรับปรุงหลายอย่างเหนือโครงการที่คล้ายกันในระยะหลังจากอาลีบาบา โดยสามารถเปลี่ยนแปลงส่วนสูงและอัตราส่วนของร่างกายได้เช่นเดียวกับน้ำหนัก และมีเครือข่ายประสาทที่อุทิศให้กับการ ‘填เงิน’ พื้นหลังที่ไม่มีอยู่จริงซึ่งสามารถเปิดเผยได้เมื่อ ‘ลดน้ำหนัก’ ของร่างกาย นอกจากนี้ยังปรับปรุงวิธีการพาราเมตริกสำหรับการปรับเปลี่ยนรูปร่างร่างกายในระยะก่อนหน้านี้โดยการกำจัดความจำเป็นในการแทรกแซงของมนุษย์อย่างกว้างขวางในช่วงการสร้างการเปลี่ยนแปลง
ชื่อ NeuralReshaper สถาปัตยกรรมใหม่นี้ใช้แบบจำลองพาราเมตริก 3 มิติของมนุษย์กับภาพที่ต้องการเปลี่ยนแปลงรูปร่าง แล้วใช้การบิดเบือนของแบบจำลองเพื่อปรับเปลี่ยนภาพเดิมให้เข้ากับค่าพาราเมตริกใหม่
ระบบสามารถจัดการการเปลี่ยนแปลงรูปร่างร่างกายทั้งบนภาพที่สวมเสื้อผ้าและภาพที่สวมเสื้อผ้าบางส่วน (เช่น ชายหาด)
การเปลี่ยนแปลงประเภทนี้มีความสนใจอย่างมากในภาควิจัย AI สำหรับแฟชั่น ซึ่งได้ผลิตแพลตฟอร์มและเครือข่ายประสาทที่หลากหลายสำหรับการ ‘ลองเสื้อผ้าเสมือน’ ที่สามารถปรับเปลี่ยนเสื้อผ้าให้เข้ากับรูปร่างและประเภทของร่างกายจากภาพที่ผู้ใช้ส่งมา หรือช่วยในการสร้างความสอดคล้องทางภาพ
เอกสารวิจัย นี้ มีชื่อเรื่องว่า การเปลี่ยนแปลงรูปร่างร่างกายมนุษย์จากภาพเดียวด้วยเครือข่ายประสาทลึก และมาจากนักวิจัยที่มหาวิทยาลัยเจ้อเจียงในหางโจว และโรงเรียนสื่อสร้างสรรค์ที่มหาวิทยาลัยซิตี้แห่งฮ่องกง
การปรับแต่ง SMPL
NeuralReshaper ใช้แบบจำลอง Skinned Multi-Person Linear (SMPL) ที่พัฒนาโดยสถาบัน Max Planck สำหรับระบบอัจฉริยะและบริษัท VFX ที่มีชื่อเสียง Industrial Light and Magic ในปี 2015

แบบจำลอง SMPL ของมนุษย์จากความร่วมมือระหว่าง Planck และ ILM ในปี 2015 Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
ในขั้นตอนแรกของกระบวนการ จะสร้างแบบจำลอง SMPL จากภาพที่ต้องการเปลี่ยนแปลงรูปร่างร่างกาย การปรับแต่งแบบจำลอง SMPL ให้เข้ากับภาพตาม วิธีการ ของวิธีการ Human Mesh Recovery (HMR) ที่เสนอโดยมหาวิทยาลัยในเยอรมนีและสหรัฐอเมริกาในปี 2018
พาราเมตริกสามตัวสำหรับการบิดเบือน (น้ำหนัก ส่วนสูง อัตราส่วนของร่างกาย) จะถูกคำนวณในขั้นตอนนี้ พร้อมกับการพิจารณาค่าพาราเมตริกของกล้อง เช่น ความยาวโฟกัส จุดยอด 2 มิติและเส้นขอบที่สร้างขึ้นจะให้ขอบเขตสำหรับการบิดเบือนในรูปแบบของเส้นขอบ 2 มิติ ซึ่งเป็นมาตรการเพิ่มเติมที่เพิ่มความแม่นยำของขอบเขตและช่วยให้สามารถ ‘填เงิน’ พื้นหลังได้อย่างแท้จริงในขั้นตอนต่อไปของกระบวนการ

ขั้นตอนการปรับแต่ง SMPL: ซ้าย ภาพที่ต้องการเปลี่ยนแปลงรูปร่าง สองซ้าย ผลลัพธ์จากการปรับแต่งตามวิธีการที่อธิบายไว้ในปี 2016 โดย Max Planck Institute for Intelligent Systems สามซ้าย ผลลัพธ์โดยตรงจากแบบจำลองที่ฝึกไว้สำหรับการฟื้นฟูรูปร่างและท่าทางของมนุษย์ สองขวา ผลลัพธ์หลังการปรับแต่งจุดยอด 2 มิติ และขวา ผลลัพธ์สุดท้ายหลังการปรับแต่งเส้นขอบ
การบิดเบือน 3 มิติจะถูกฉายลงในพื้นที่ภาพของสถาปัตยกรรมเพื่ออำนวยความสะดวกในการสร้างสนามการบิดเบือนที่จะกำหนดการบิดเบือน กระบวนการนี้ใช้เวลาประมาณ 30 วินาทีต่อภาพ
สถาปัตยกรรม NeuralReshaper
NeuralReshaper ใช้เครือข่ายประสาทสองตัวพร้อมกัน: เครือข่ายโค้ดเนอร์สำหรับพื้นหน้าซึ่งสร้างรูปร่างร่างกายที่เปลี่ยนแปลงไป และเครือข่ายโค้ดเนอร์สำหรับพื้นหลังซึ่งมุ่งเน้นไปที่การ ‘填เงิน’ พื้นหลังที่ไม่มีอยู่จริง (ในกรณีของการ ‘ลดน้ำหนัก’ ของร่างกาย ตัวอย่างเช่น)
เฟรมเวิร์กแบบ U-net รวมเอาอินพุตจากคุณลักษณะของทั้งสองเครือข่ายโค้ดเนอร์ก่อนที่จะส่งผลลัพธ์ไปยังเครือข่ายโค้ดเนอร์ที่รวมกันซึ่งสร้างภาพใหม่จากอินพุตทั้งสอง สถาปัตยกรรมนี้มีกลไกการบิดเบือนที่มีคำแนะนำใหม่เพื่ออำนวยความสะดวกในการรวม
การฝึกอบรมและการทดลอง
NeuralReshaper ถูกนำไปใช้โดยใช้ PyTorch บน GPU NVIDIA (NVDA ) 1080ti ที่มี VRAM 11gb เครือข่ายถูกฝึกอบรมเป็นเวลา 100 ยุคภายใต้ตัวเลือก Adam โดยมีการตั้งค่าความสูญเสียเป้าหมายของเครื่องสร้างที่ 0.0001 และตัวเลือกความสูญเสียเป้าหมายของตัววิจารณ์ที่ 0.0004 การฝึกอบรมเกิดขึ้นพร้อมกับขนาดแบตช์ของ 8 สำหรับชุดข้อมูลกลางแจ้งเฉพาะ (ที่ดึงมาจาก COCO, MPII และ LSP) และ 2 สำหรับการฝึกอบรมบนชุดข้อมูล DeepFashion
ต่อไปนี้คือตัวอย่างจากชุดข้อมูล DeepFashion ที่ฝึกอบรมสำหรับ NeuralReshaper โดยมีภาพที่ต้องการเปลี่ยนแปลงรูปร่างอยู่ทางซ้ายเสมอ
คุณลักษณะที่ควบคุมได้สามอย่างถูกแยกออกจากกันและสามารถใช้ได้แยกจากกัน
การเปลี่ยนแปลงรูปร่างบนชุดข้อมูลกลางแจ้งมีความท้าทายมากกว่า เนื่องจากมักต้องการการ ‘填เงิน’ พื้นหลังที่ซับซ้อนและเส้นขอบที่ชัดเจนและน่าเชื่อถือของรูปร่างร่างกายที่เปลี่ยนแปลงไป:
ความจำเป็นพาราเมตริก
ตามที่เอกสารวิจัยระบุ การเปลี่ยนแปลงรูปร่างร่างกายในภาพเดียวกันนี้เป็นปัญหาที่ไม่ได้กำหนดไว้อย่างชัดเจนในการสังเคราะห์ภาพ หลายเฟรมเวิร์ก GAN และเครือข่ายโค้ดเนอร์สามารถใช้ภาพคู่ (เช่น โครงการที่ออกแบบมาเพื่อการเปลี่ยนแปลงจาก สเก็ตช์>ภาพถ่าย และ ภาพถ่าย>สเก็ตช์)
อย่างไรก็ตาม ในกรณีนี้จะจำเป็นต้องมีภาพคู่ที่มีคนเดียวกันในคอนฟิกการ์เรشنทางกายภาพที่แตกต่างกัน เช่น ภาพ ‘ก่อนและหลัง’ ในโฆษณาเกี่ยวกับการลดน้ำหนักหรือการผ่าตัดพลาสติก – ข้อมูลที่ยากที่จะหาหรือสร้างขึ้น
เครือข่าย GAN ที่เปลี่ยนแปลงสามารถฝึกอบรมบนข้อมูลที่หลากหลายและดำเนินการเปลี่ยนแปลงโดยการค้นหา ทิศทางลัทธิ ระหว่างโค้ดลัทธิของภาพต้นฉบับ (โค้ดลัทธิของภาพที่ต้องการเปลี่ยนแปลงรูปร่าง) และคลาสที่ต้องการ (ในกรณีนี้ ‘อ้วน’, ‘ผอม’, ‘สูง’ ฯลฯ) อย่างไรก็ตาม วิธีการนี้ยังคงจำกัดเกินไปสำหรับการเปลี่ยนแปลงรูปร่างร่างกายที่ละเอียด
แนวทาง Neural Radiance Fields (NeRF) มีความก้าวหน้ามากกว่าในด้านการจำลองร่างกายที่สมบูรณ์ แต่ยังคงจำกัดอยู่ในฉากและต้องการทรัพยากรมาก และมีความสามารถในการแก้ไขรูปร่างร่างกายในระดับที่ NeuralReshaper และโครงการก่อนหน้านี้พยายามที่จะแก้ไข (นอกเหนือจากการ ลดขนาดร่างกายทั้งหมด เทียบกับสภาพแวดล้อม)
พื้นที่ลัทธิของ GAN ยังคงยากที่จะควบคุม VAEs เพียงอย่างเดียวยังไม่สามารถจัดการกับความซับซ้อนของการสร้างภาพร่างกายที่สมบูรณ์ได้ และความสามารถของ NeRF ในการสร้างรูปร่างร่างกายมนุษย์ใหม่และสมจริงยังคงอยู่ในขั้นตอนเริ่มต้น ดังนั้นการรวม ‘วิธีการดั้งเดิม’ ของ CGI เช่น SMPL จึงดูเหมือนว่าจะยังคงดำเนินต่อไปในภาควิจัยการสังเคราะห์ภาพมนุษย์ เพื่อเป็นวิธีการในการควบคุมและรวมคุณลักษณะ คลาส และโค้ดลัทธิที่พาราเมตริกและความสามารถในการใช้ประโยชน์ยังไม่ได้รับการทำความเข้าใจอย่างเต็มที่ในเทคโนโลยีที่เกิดขึ้นใหม่เหล่านี้
ของ ‘วิธีการดั้งเดิม’ ของ CGI เช่น SMPL ดูเหมือนว่าจะยังคงดำเนินต่อไปในภาควิจัยการสังเคราะห์ภาพมนุษย์ เพื่อเป็นวิธีการในการควบคุมและรวมคุณลักษณะ คลาส และโค้ดลัทธิที่พาราเมตริกและความสามารถในการใช้ประโยชน์ยังไม่ได้รับการทำความเข้าใจอย่างเต็มที่ในเทคโนโลยีที่เกิดขึ้นใหม่เหล่านี้
เผยแพร่ครั้งแรกเมื่อวันที่ 31 มีนาคม 2022




















