มุมมองของ Anderson
การสร้าง Deepfakes ที่มีร่างกายเต็มรูปแบบโดยการรวม NeRF หลายตัว

สาขาวิจัยการสร้างภาพสังเคราะห์เต็มไปด้วยข้อเสนอใหม่ๆ สำหรับระบบที่สามารถสร้างวิดีโอและรูปภาพของร่างกายเต็มรูปแบบของคนหนุ่มสาว – โดยส่วนใหญ่เป็นสาวๆ – ในชุดแต่งกายต่างๆ ส่วนใหญ่ภาพที่สร้างขึ้นเป็นภาพนิ่ง แต่บางครั้งการแสดงออกอาจเคลื่อนไหวได้ แต่ไม่ค่อยดีนัก
ความเร็วของสาขาวิจัยนี้ช้ามากเมื่อเทียบกับการพัฒนาที่รวดเร็วในด้านอื่นๆ เช่น โมเดลการกระจายแบบแฝง แต่กลุ่มวิจัยส่วนใหญ่ในเอเชียยังคงทำงานอย่างไม่หยุดยั้งเพื่อแก้ปัญหานี้

หนึ่งในหลายๆ ระบบ ‘ลองเสื้อผ้าเสมือน’ ที่ถูกเสนอหรือเปิดตัวในช่วง 10-15 ปีที่ผ่านมา ซึ่งร่างกายจะถูกประเมินผ่านการรู้จำวัตถุโดยใช้เครื่องจักรและปรับให้เหมาะสมกับชุดแต่งกายที่เสนอ Source: https://www.youtube.com/watch?v=2ZXrgGyhbak
เป้าหมายคือการสร้างระบบใหม่ๆ เพื่อให้สามารถ ‘ลองเสื้อผ้าเสมือน’ สำหรับตลาดแฟชั่นและเสื้อผ้าได้ – ระบบที่สามารถปรับให้เหมาะสมกับลูกค้าและผลิตภัณฑ์ที่มีอยู่หรือกำลังจะออกวางจำหน่ายโดยไม่ต้องใช้การซ้อนทับแบบเรียลไทม์ หรือต้องขอให้ลูกค้าส่งรูปภาพที่ไม่เหมาะสมสำหรับกระบวนการสร้างภาพโดยใช้เครื่องจักร
ไม่มีสถาปัตยกรรมสังเคราะห์ที่ได้รับความนิยมที่ดูเหมือนจะปรับให้เหมาะสมกับงานนี้ได้ง่ายๆ: พื้นที่แฝงของเครือข่าย Adversarial ที่สร้างขึ้น (GANs) ไม่เหมาะสมสำหรับการสร้างการเคลื่อนไหวที่น่าเชื่อถือ (หรือแม้แต่การแก้ไขทั่วไป); แม้ว่า Neural Radiance Fields (NeRF) จะสามารถสร้างการเคลื่อนไหวของมนุษย์ที่สมจริงได้ แต่โดยทั่วไปแล้วจะไม่สามารถแก้ไขได้ และต้องการการปรับให้เหมาะสมเพื่อ ‘สลับ’ คนหรือเสื้อผ้าได้ตามใจชอบ; ตัวเข้ารหัสอัตโนมัติจะต้องมีการฝึกอบรมเฉพาะบุคคล/เสื้อผ้า; และโมเดลการกระจายแบบแฝงเช่น GANs ไม่มีกลไกการสร้างวิดีโอที่เป็นธรรมชาติ
EVA3D
อย่างไรก็ตาม ข้อเสนอใหม่ๆ ยังคงถูกนำเสนอ และข้อเสนอใหม่ล่าสุดนี้มีความน่าสนใจในบรรดาสายวิจัยที่ไม่มีเอกลักษณ์เฉพาะตัวและเน้นธุรกิจเป็นหลัก
EVA3D จากมหาวิทยาลัยเทคโนโลยี Nanyang ในสิงคโปร์ เป็นการแสดงให้เห็นถึงแนวทางที่ได้รับการคาดหวังมาเป็นเวลานาน – การใช้เครือข่าย Neural Radiance Field หลายๆ ตัว แต่ละตัวอุทิศให้กับส่วนต่างๆ ของร่างกาย และจากนั้นจึงประกอบเข้าด้วยกันเพื่อสร้างภาพที่มีประสิทธิภาพ

สาวหนุ่มที่เคลื่อนไหวได้ซึ่งประกอบขึ้นจากเครือข่าย NeRF หลายๆ ตัวสำหรับ EVA3D Source: https://hongfz16.github.io/projects/EVA3D.html
ผลลัพธ์ในการเคลื่อนไหวคือ…โอเค แม้ว่าภาพของ EVA3D จะไม่ออกจากหุบเขาแห่งความไม่ธรรมชาติ แต่ก็สามารถมองเห็นทางออกได้จากที่พวกมันอยู่

สิ่งที่ทำให้ EVA3D โดดเด่นคือว่าผู้วิจัยเบื้องหลังได้เข้าใจว่าเครือข่ายเดียว (GAN, NeRF หรืออื่นๆ) ไม่น่าจะสามารถจัดการการสร้างภาพร่างกายเต็มรูปแบบที่แก้ไขและยืดหยุ่นได้ภายในไม่กี่ปี – ส่วนหนึ่งเนื่องจากความเร็วของการวิจัย และส่วนหนึ่งเนื่องจากข้อจำกัดด้านฮาร์ดแวร์และลอจิสติกส์อื่นๆ
ดังนั้น ทีม Nanyang จึงแบ่งงานออกเป็น 16 เครือข่ายและเทคโนโลยีหลายๆ ตัว – แนวทางที่ได้รับการนำมาใช้แล้วสำหรับการแสดงภาพเมืองโดยใช้ Block-NeRF และ CityNeRF และดูเหมือนว่าจะเป็นวิธีการที่น่าสนใจและอาจเป็นไปได้ในการบรรลุการสร้างภาพร่างกายเต็มรูปแบบในอีก 5 ปีข้างหน้า โดยพิจารณาจากความก้าวหน้าทางแนวคิดหรือฮาร์ดแวร์ใหม่ๆ
ไม่ใช่ทุกความท้าทายในการสร้าง ‘ลองเสื้อผ้าเสมือน’ นี้เป็นเทคนิคหรือลอจิสติกส์ และบทความนี้อธิบายปัญหาเกี่ยวกับข้อมูล โดยเฉพาะอย่างยิ่งเกี่ยวกับการเรียนรู้ที่ไม่มีการดูแล:
‘[ชุดข้อมูลแฟชั่น] ส่วนใหญ่มีท่าทางของมนุษย์ที่จำกัดมาก (ส่วนใหญ่เป็นท่าทางยืนแบบเดียวกัน) และมีมุมมองที่ไม่สมดุล (ส่วนใหญ่เป็นมุมมองด้านหน้า) การกระจายข้อมูล 2 มิติที่ไม่สมดุลนี้อาจขัดขวางการเรียนรู้ที่ไม่มีการดูแลของ GANs 3 มิติ ทำให้เกิดปัญหาในการสังเคราะห์มุมมอง/ท่าทางใหม่ๆ ดังนั้น ยุทธวิธีการฝึกอบรมที่เหมาะสมจึงจำเป็นต้องบรรเทาปัญหา’
กระบวนการทำงานของ EVA3D แบ่งร่างกายออกเป็น 16 ส่วนต่างๆ โดยแต่ละส่วนจะถูกสร้างขึ้นผ่านเครือข่าย NeRF ของตนเอง ซึ่งเห็นได้ชัดว่าทำให้เกิดส่วนที่ ‘ไม่แข็ง’ เพียงพอเพื่อให้สามารถเคลื่อนไหวได้โดยใช้ข้อมูลการเคลื่อนไหวหรือประเภทอื่นๆ ของข้อมูลการเคลื่อนไหว นอกจากข้อได้เปรียบนี้แล้ว ยังช่วยให้ระบบสามารถจัดสรรทรัพยากรสูงสุดให้กับส่วนที่ ‘ขาย’ ภาพโดยรวมได้
ตัวอย่างเช่น เท้าของมนุษย์มีการเคลื่อนไหวที่จำกัดมาก ในขณะที่ความถูกต้องของใบหน้าและศีรษะ นอกเหนือจากคุณภาพของการเคลื่อนไหวของร่างกายโดยรวมแล้ว มีแนวโน้มที่จะเป็นเครื่องหมายของความถูกต้องสำหรับการแสดงภาพ
แนวทางนี้แตกต่างอย่างมากจากโครงการ NeRF ที่เกี่ยวข้องในปี 2021 ซึ่งเป็นโครงการ A-NeRF จากมหาวิทยาลัยブリทิชโคลัมเบียและ Reality Labs Research ซึ่งพยายามเพิ่มโครงร่างควบคุมภายในให้กับ NeRF ‘ชิ้นเดียว’ ที่ไม่เปลี่ยนแปลง ทำให้ยากต่อการกระจายทรัพยากรการประมวลผลให้กับส่วนต่างๆ ของร่างกายตามความจำเป็น

การเคลื่อนไหวก่อนหน้า – A-NeRF ติดตั้ง NeRF ‘ที่ถูกอบ’ ด้วยโครงร่างกลางที่ยืดหยุ่นและขยับได้เหมือนกับที่อุตสาหกรรม VFX ใช้มาเป็นเวลานานในการสร้างตัวละคร CGI Source: https://lemonatsu.github.io/anerf/
ในทำนองเดียวกันกับโครงการที่มีศูนย์กลางอยู่ที่มนุษย์ที่พยายามใช้พื้นที่แฝงของแนวทางที่ได้รับความนิยม EVA3D ใช้ Skinned Multi-Person Linear Model (SMPL) ซึ่งเป็นวิธีการสร้างภาพแบบดั้งเดิมสำหรับการเพิ่มเครื่องมือให้กับการสังเคราะห์แบบทั่วไป
วิธีการ
โมเดล SMPL ที่ใช้ในกระบวนการนี้ถูกปรับให้เหมาะสมกับ ‘ผู้ก่อน’ ของมนุษย์ – คนที่โดยพื้นฐานแล้วถูก ‘deepfake’ โดย EVA3D และน้ำหนักการลอกของ SMPL จะต่อรองความแตกต่างระหว่างพื้นที่มาตรฐาน (เช่น ท่าทาง ‘พัก’ หรือ ‘ท่าทางเป็นกลาง’ ของโมเดล SMPL) และวิธีการแสดงภาพสุดท้าย
ดังที่เห็นในภาพประกอบด้านบน กล่องขอบเขตของ SMPL ถูกใช้เป็นคำจำกัดความของขอบเขตสำหรับเครือข่าย 16 ตัวที่จะประกอบร่างกายในอนาคต
อัลกอริทึม Inverse Linear Blend Skinning (LBS) ของ SMPL ถูกใช้เพื่อถ่ายโอนเรย์ที่มองเห็นได้ไปยังพื้นที่ (ท่าทางพัก) และจากนั้นเครือข่ายย่อย 16 ตัวจะถูกปรับให้เหมาะสมตามคอนฟิกเหล่านี้ และสุดท้ายจะถูกกำหนดให้เป็นภาพสุดท้าย
เครือข่าย NeRF ทั้งหมดจะถูกใช้เพื่อสร้างเฟรมเวิร์ก GAN ของมนุษย์ 3 มิติ
เครือข่ายย่อยแต่ละตัวที่แสดงถึงส่วนต่างๆ ของร่างกายประกอบด้วย Multi-Layer Perceptrons (MLPs) ที่ซ้อนกัน โดยมีการกระตุ้น SIREN (Sinusoidal Representation Networks) แม้ว่า SIREN จะแก้ปัญหาหลายอย่างในกระบวนการนี้และในโครงการที่คล้ายกัน แต่ก็มักจะเกิดการ overfit มากกว่าการสร้างแบบจำลอง และผู้วิจัยแนะนำว่าอาจใช้ไลบรารีทางเลือกในอนาคต (ดูส่วนปลายของบทความ)
ข้อมูล การฝึกอบรม และการทดสอบ
EVA3D ต้องเผชิญกับปัญหาข้อมูลที่ไม่寻常เนื่องจากข้อจำกัดและลักษณะการวางท่าของชุดข้อมูลแฟชั่นที่มีอยู่ ซึ่งมักจะขาดมุมมองใหม่ๆ และซ้ำๆ เพื่อเน้นความสนใจไปที่เสื้อผ้ามากกว่าร่างกายที่สวมใส่
เนื่องจากการกระจายท่าทางที่ไม่สมดุล EVA3D ใช้ ‘ผู้ก่อน’ ของมนุษย์ (ดูข้างบน) โดยอาศัยเรขาคณิตของ SMPL และจากนั้นจึงคาดการณ์ Signed Distance Field (SDF) ของท่าทางนี้ แทนที่จะเป็นท่าทางเป้าหมายโดยตรง
สำหรับการทดสอบที่สนับสนุน ผู้วิจัยใช้ชุดข้อมูล 4 ชุด: DeepFashion; SHHQ; UBCFashion; และ AIST Dance Video Database (AIST Dance DB)
สองชุดข้อมูลหลัง含ท่าทางที่หลากหลายมากกว่าชุดข้อมูลสองชุดแรก แต่แสดงถึงบุคคลเดียวกันซ้ำๆ ซึ่งทำให้ความหลากหลายนี้ไม่มีประโยชน์; ในระยะสั้น ข้อมูลนี้ท้าทายมากเมื่อพิจารณาจากงาน

ตัวอย่างจาก SSHQ Source: https://arxiv.org/pdf/2204.11823.pdf
วิธีการที่ใช้ในการเปรียบเทียบคือ ENARF-GAN ซึ่งเป็นโครงการแรกที่แสดงภาพ NeRF จากชุดข้อมูลภาพ 2 มิติ; EG3D ของ Stanford และ NVIDIA (NVDA ); และ StyleSDF ซึ่งเป็นความร่วมมือระหว่างมหาวิทยาลัยวอชิงตัน Adobe (ADBE ) Research และ Stanford University – วิธีการเหล่านี้ต้องการไลบรารี super-resolution เพื่อปรับขนาดจากความละเอียดเดิมเป็นความละเอียดสูง
มาตรการที่ใช้คือ Frechet Inception Distance (FID) และ Kernel Inception Distance (KID) รวมถึง Percentage of Correct Keypoints (PCKh@0.5)
ในการประเมินคุณภาพ EVA3D เป็นผู้นำในมาตรการทั้งหมดใน 4 ชุดข้อมูล:

ผลลัพธ์เชิงปริมาณ
ผู้วิจัยสังเกตว่า EVA3D มีอัตราความผิดพลาดต่ำสุดสำหรับการแสดงภาพเรขาคณิต ซึ่งเป็นปัจจัยสำคัญในโครงการนี้ พวกเขายังพบว่าระบบสามารถควบคุมท่าทางที่สร้างขึ้นและได้คะแนน PCKh@0.5 ที่สูงกว่าเมื่อเทียบกับ EG3D ซึ่งเป็นวิธีการที่แข่งขันกันเพียงวิธีเดียวที่ได้คะแนนสูงกว่าในหนึ่งหมวดหมู่
EVA3D มีประสิทธิภาพโดยไม่ต้องมีการปรับขนาดขึ้นในความละเอียด 512x512px แต่สามารถปรับขนาดขึ้นเป็นความละเอียด HD ได้อย่างง่ายดายโดยการเพิ่มชั้นการปรับขนาดขึ้นเหมือนกับที่ Google ได้ทำกับ Imagen Video ที่มีความละเอียด 1024
วิธีการนี้ไม่มีข้อจำกัด ผู้เขียนบทความระบุว่าการกระตุ้น SIREN สามารถทำให้เกิดอาการเป็นวงกลมได้ ซึ่งสามารถแก้ไขได้ในรุ่นต่อไปโดยใช้การแสดงภาพฐานที่แตกต่าง เช่น EG3D ร่วมกับดีコ더 2 มิติ นอกจากนี้ยังยากที่จะปรับ SMPL ให้เหมาะสมกับแหล่งข้อมูลแฟชั่น
สุดท้าย ระบบไม่สามารถรองรับเสื้อผ้าที่ใหญ่และไหลได้ง่าย เช่น ชุดกระโปรงขนาดใหญ่; เสื้อผ้าประเภทนี้แสดงให้เห็นถึงพลศาสตร์ของของไหลที่ทำให้การสร้างภาพผมที่แสดงภาพด้วยเครื่องจักรเป็นเรื่องที่ท้าทาย Presumably วิธีแก้ปัญหาที่เหมาะสมสามารถช่วยแก้ไขปัญหาเหล่านี้ได้
เผยแพร่ครั้งแรกเมื่อวันที่ 12 ตุลาคม 2022

















