มุมมองของ Anderson

การสร้าง Deepfakes ที่มีร่างกายเต็มรูปแบบโดยการรวม NeRF หลายตัว

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

สาขาวิจัยการสร้างภาพสังเคราะห์เต็มไปด้วยข้อเสนอใหม่ๆ สำหรับระบบที่สามารถสร้างวิดีโอและรูปภาพของร่างกายเต็มรูปแบบของคนหนุ่มสาว – โดยส่วนใหญ่เป็นสาวๆ – ในชุดแต่งกายต่างๆ ส่วนใหญ่ภาพที่สร้างขึ้นเป็นภาพนิ่ง แต่บางครั้งการแสดงออกอาจเคลื่อนไหวได้ แต่ไม่ค่อยดีนัก

ความเร็วของสาขาวิจัยนี้ช้ามากเมื่อเทียบกับการพัฒนาที่รวดเร็วในด้านอื่นๆ เช่น โมเดลการกระจายแบบแฝง แต่กลุ่มวิจัยส่วนใหญ่ในเอเชียยังคงทำงานอย่างไม่หยุดยั้งเพื่อแก้ปัญหานี้

หนึ่งในหลายๆ ระบบ 'ลองเสื้อผ้าเสมือน' ที่ถูกเสนอหรือเปิดตัวในช่วง 10-15 ปีที่ผ่านมา ซึ่งร่างกายจะถูกประเมินผ่านการรู้จำวัตถุโดยใช้เครื่องจักรและปรับให้เหมาะสมกับชุดแต่งกายที่เสนอ Source: https://www.youtube.com/watch?v=2ZXrgGyhbak

หนึ่งในหลายๆ ระบบ ‘ลองเสื้อผ้าเสมือน’ ที่ถูกเสนอหรือเปิดตัวในช่วง 10-15 ปีที่ผ่านมา ซึ่งร่างกายจะถูกประเมินผ่านการรู้จำวัตถุโดยใช้เครื่องจักรและปรับให้เหมาะสมกับชุดแต่งกายที่เสนอ Source: https://www.youtube.com/watch?v=2ZXrgGyhbak

เป้าหมายคือการสร้างระบบใหม่ๆ เพื่อให้สามารถ ‘ลองเสื้อผ้าเสมือน’ สำหรับตลาดแฟชั่นและเสื้อผ้าได้ – ระบบที่สามารถปรับให้เหมาะสมกับลูกค้าและผลิตภัณฑ์ที่มีอยู่หรือกำลังจะออกวางจำหน่ายโดยไม่ต้องใช้การซ้อนทับแบบเรียลไทม์ หรือต้องขอให้ลูกค้าส่งรูปภาพที่ไม่เหมาะสมสำหรับกระบวนการสร้างภาพโดยใช้เครื่องจักร

ไม่มีสถาปัตยกรรมสังเคราะห์ที่ได้รับความนิยมที่ดูเหมือนจะปรับให้เหมาะสมกับงานนี้ได้ง่ายๆ: พื้นที่แฝงของเครือข่าย Adversarial ที่สร้างขึ้น (GANs) ไม่เหมาะสมสำหรับการสร้างการเคลื่อนไหวที่น่าเชื่อถือ (หรือแม้แต่การแก้ไขทั่วไป); แม้ว่า Neural Radiance Fields (NeRF) จะสามารถสร้างการเคลื่อนไหวของมนุษย์ที่สมจริงได้ แต่โดยทั่วไปแล้วจะไม่สามารถแก้ไขได้ และต้องการการปรับให้เหมาะสมเพื่อ ‘สลับ’ คนหรือเสื้อผ้าได้ตามใจชอบ; ตัวเข้ารหัสอัตโนมัติจะต้องมีการฝึกอบรมเฉพาะบุคคล/เสื้อผ้า; และโมเดลการกระจายแบบแฝงเช่น GANs ไม่มีกลไกการสร้างวิดีโอที่เป็นธรรมชาติ

EVA3D

อย่างไรก็ตาม ข้อเสนอใหม่ๆ ยังคงถูกนำเสนอ และข้อเสนอใหม่ล่าสุดนี้มีความน่าสนใจในบรรดาสายวิจัยที่ไม่มีเอกลักษณ์เฉพาะตัวและเน้นธุรกิจเป็นหลัก

EVA3D จากมหาวิทยาลัยเทคโนโลยี Nanyang ในสิงคโปร์ เป็นการแสดงให้เห็นถึงแนวทางที่ได้รับการคาดหวังมาเป็นเวลานาน – การใช้เครือข่าย Neural Radiance Field หลายๆ ตัว แต่ละตัวอุทิศให้กับส่วนต่างๆ ของร่างกาย และจากนั้นจึงประกอบเข้าด้วยกันเพื่อสร้างภาพที่มีประสิทธิภาพ

สาวหนุ่มที่เคลื่อนไหวได้ซึ่งประกอบขึ้นจากเครือข่าย NeRF หลายๆ ตัวสำหรับ EVA3D Source: https://hongfz16.github.io/projects/EVA3D.html

สาวหนุ่มที่เคลื่อนไหวได้ซึ่งประกอบขึ้นจากเครือข่าย NeRF หลายๆ ตัวสำหรับ EVA3D Source: https://hongfz16.github.io/projects/EVA3D.html

ผลลัพธ์ในการเคลื่อนไหวคือ…โอเค แม้ว่าภาพของ EVA3D จะไม่ออกจากหุบเขาแห่งความไม่ธรรมชาติ แต่ก็สามารถมองเห็นทางออกได้จากที่พวกมันอยู่

สิ่งที่ทำให้ EVA3D โดดเด่นคือว่าผู้วิจัยเบื้องหลังได้เข้าใจว่าเครือข่ายเดียว (GAN, NeRF หรืออื่นๆ) ไม่น่าจะสามารถจัดการการสร้างภาพร่างกายเต็มรูปแบบที่แก้ไขและยืดหยุ่นได้ภายในไม่กี่ปี – ส่วนหนึ่งเนื่องจากความเร็วของการวิจัย และส่วนหนึ่งเนื่องจากข้อจำกัดด้านฮาร์ดแวร์และลอจิสติกส์อื่นๆ

ดังนั้น ทีม Nanyang จึงแบ่งงานออกเป็น 16 เครือข่ายและเทคโนโลยีหลายๆ ตัว – แนวทางที่ได้รับการนำมาใช้แล้วสำหรับการแสดงภาพเมืองโดยใช้ Block-NeRF และ CityNeRF และดูเหมือนว่าจะเป็นวิธีการที่น่าสนใจและอาจเป็นไปได้ในการบรรลุการสร้างภาพร่างกายเต็มรูปแบบในอีก 5 ปีข้างหน้า โดยพิจารณาจากความก้าวหน้าทางแนวคิดหรือฮาร์ดแวร์ใหม่ๆ

ไม่ใช่ทุกความท้าทายในการสร้าง ‘ลองเสื้อผ้าเสมือน’ นี้เป็นเทคนิคหรือลอจิสติกส์ และบทความนี้อธิบายปัญหาเกี่ยวกับข้อมูล โดยเฉพาะอย่างยิ่งเกี่ยวกับการเรียนรู้ที่ไม่มีการดูแล:

‘[ชุดข้อมูลแฟชั่น] ส่วนใหญ่มีท่าทางของมนุษย์ที่จำกัดมาก (ส่วนใหญ่เป็นท่าทางยืนแบบเดียวกัน) และมีมุมมองที่ไม่สมดุล (ส่วนใหญ่เป็นมุมมองด้านหน้า) การกระจายข้อมูล 2 มิติที่ไม่สมดุลนี้อาจขัดขวางการเรียนรู้ที่ไม่มีการดูแลของ GANs 3 มิติ ทำให้เกิดปัญหาในการสังเคราะห์มุมมอง/ท่าทางใหม่ๆ ดังนั้น ยุทธวิธีการฝึกอบรมที่เหมาะสมจึงจำเป็นต้องบรรเทาปัญหา’

กระบวนการทำงานของ EVA3D แบ่งร่างกายออกเป็น 16 ส่วนต่างๆ โดยแต่ละส่วนจะถูกสร้างขึ้นผ่านเครือข่าย NeRF ของตนเอง ซึ่งเห็นได้ชัดว่าทำให้เกิดส่วนที่ ‘ไม่แข็ง’ เพียงพอเพื่อให้สามารถเคลื่อนไหวได้โดยใช้ข้อมูลการเคลื่อนไหวหรือประเภทอื่นๆ ของข้อมูลการเคลื่อนไหว นอกจากข้อได้เปรียบนี้แล้ว ยังช่วยให้ระบบสามารถจัดสรรทรัพยากรสูงสุดให้กับส่วนที่ ‘ขาย’ ภาพโดยรวมได้

ตัวอย่างเช่น เท้าของมนุษย์มีการเคลื่อนไหวที่จำกัดมาก ในขณะที่ความถูกต้องของใบหน้าและศีรษะ นอกเหนือจากคุณภาพของการเคลื่อนไหวของร่างกายโดยรวมแล้ว มีแนวโน้มที่จะเป็นเครื่องหมายของความถูกต้องสำหรับการแสดงภาพ

การเปรียบเทียบคุณภาพระหว่าง EVA3D และวิธีการก่อนหน้า ผู้เขียนอ้างว่าได้ผลลัพธ์ที่ดีที่สุดในด้านนี้

การเปรียบเทียบคุณภาพระหว่าง EVA3D และวิธีการก่อนหน้า

แนวทางนี้แตกต่างอย่างมากจากโครงการ NeRF ที่เกี่ยวข้องในปี 2021 ซึ่งเป็นโครงการ A-NeRF จากมหาวิทยาลัยブリทิชโคลัมเบียและ Reality Labs Research ซึ่งพยายามเพิ่มโครงร่างควบคุมภายในให้กับ NeRF ‘ชิ้นเดียว’ ที่ไม่เปลี่ยนแปลง ทำให้ยากต่อการกระจายทรัพยากรการประมวลผลให้กับส่วนต่างๆ ของร่างกายตามความจำเป็น

การเคลื่อนไหวก่อนหน้า - A-NeRF ติดตั้ง NeRF 'ที่ถูกอบ' ด้วยโครงร่างกลางที่ยืดหยุ่นและขยับได้เหมือนกับที่อุตสาหกรรม VFX ใช้มาเป็นเวลานานในการสร้างตัวละคร CGI

การเคลื่อนไหวก่อนหน้า – A-NeRF ติดตั้ง NeRF ‘ที่ถูกอบ’ ด้วยโครงร่างกลางที่ยืดหยุ่นและขยับได้เหมือนกับที่อุตสาหกรรม VFX ใช้มาเป็นเวลานานในการสร้างตัวละคร CGI Source: https://lemonatsu.github.io/anerf/

ในทำนองเดียวกันกับโครงการที่มีศูนย์กลางอยู่ที่มนุษย์ที่พยายามใช้พื้นที่แฝงของแนวทางที่ได้รับความนิยม EVA3D ใช้ Skinned Multi-Person Linear Model (SMPL) ซึ่งเป็นวิธีการสร้างภาพแบบดั้งเดิมสำหรับการเพิ่มเครื่องมือให้กับการสังเคราะห์แบบทั่วไป

ผลลัพธ์คุณภาพของ EVA3D บน DeepFashion

ผลลัพธ์คุณภาพของ EVA3D บน DeepFashion

วิธีการ

โมเดล SMPL ที่ใช้ในกระบวนการนี้ถูกปรับให้เหมาะสมกับ ‘ผู้ก่อน’ ของมนุษย์ – คนที่โดยพื้นฐานแล้วถูก ‘deepfake’ โดย EVA3D และน้ำหนักการลอกของ SMPL จะต่อรองความแตกต่างระหว่างพื้นที่มาตรฐาน (เช่น ท่าทาง ‘พัก’ หรือ ‘ท่าทางเป็นกลาง’ ของโมเดล SMPL) และวิธีการแสดงภาพสุดท้าย

กระบวนการทำงานเชิงแนวคิดของ EVA3D Source: https://arxiv.org/pdf/2210.04888.pdf

กระบวนการทำงานเชิงแนวคิดของ EVA3D Source: https://arxiv.org/pdf/2210.04888.pdf

ดังที่เห็นในภาพประกอบด้านบน กล่องขอบเขตของ SMPL ถูกใช้เป็นคำจำกัดความของขอบเขตสำหรับเครือข่าย 16 ตัวที่จะประกอบร่างกายในอนาคต

อัลกอริทึม Inverse Linear Blend Skinning (LBS) ของ SMPL ถูกใช้เพื่อถ่ายโอนเรย์ที่มองเห็นได้ไปยังพื้นที่ (ท่าทางพัก) และจากนั้นเครือข่ายย่อย 16 ตัวจะถูกปรับให้เหมาะสมตามคอนฟิกเหล่านี้ และสุดท้ายจะถูกกำหนดให้เป็นภาพสุดท้าย

เครือข่าย NeRF ทั้งหมดจะถูกใช้เพื่อสร้างเฟรมเวิร์ก GAN ของมนุษย์ 3 มิติ

การแสดงภาพของเฟรมเวิร์ก GAN ช่วงที่สองจะถูกฝึกอบรมกับชุดภาพ 2 มิติของมนุษย์/แฟชั่น

การแสดงภาพของเฟรมเวิร์ก GAN ช่วงที่สอง

เครือข่ายย่อยแต่ละตัวที่แสดงถึงส่วนต่างๆ ของร่างกายประกอบด้วย Multi-Layer Perceptrons (MLPs) ที่ซ้อนกัน โดยมีการกระตุ้น SIREN (Sinusoidal Representation Networks) แม้ว่า SIREN จะแก้ปัญหาหลายอย่างในกระบวนการนี้และในโครงการที่คล้ายกัน แต่ก็มักจะเกิดการ overfit มากกว่าการสร้างแบบจำลอง และผู้วิจัยแนะนำว่าอาจใช้ไลบรารีทางเลือกในอนาคต (ดูส่วนปลายของบทความ)

ข้อมูล การฝึกอบรม และการทดสอบ

EVA3D ต้องเผชิญกับปัญหาข้อมูลที่ไม่寻常เนื่องจากข้อจำกัดและลักษณะการวางท่าของชุดข้อมูลแฟชั่นที่มีอยู่ ซึ่งมักจะขาดมุมมองใหม่ๆ และซ้ำๆ เพื่อเน้นความสนใจไปที่เสื้อผ้ามากกว่าร่างกายที่สวมใส่

เนื่องจากการกระจายท่าทางที่ไม่สมดุล EVA3D ใช้ ‘ผู้ก่อน’ ของมนุษย์ (ดูข้างบน) โดยอาศัยเรขาคณิตของ SMPL และจากนั้นจึงคาดการณ์ Signed Distance Field (SDF) ของท่าทางนี้ แทนที่จะเป็นท่าทางเป้าหมายโดยตรง

สำหรับการทดสอบที่สนับสนุน ผู้วิจัยใช้ชุดข้อมูล 4 ชุด: DeepFashion; SHHQ; UBCFashion; และ AIST Dance Video Database (AIST Dance DB)

สองชุดข้อมูลหลัง含ท่าทางที่หลากหลายมากกว่าชุดข้อมูลสองชุดแรก แต่แสดงถึงบุคคลเดียวกันซ้ำๆ ซึ่งทำให้ความหลากหลายนี้ไม่มีประโยชน์; ในระยะสั้น ข้อมูลนี้ท้าทายมากเมื่อพิจารณาจากงาน

ตัวอย่างจาก SSHQ Source: https://arxiv.org/pdf/2204.11823.pdf

ตัวอย่างจาก SSHQ Source: https://arxiv.org/pdf/2204.11823.pdf

วิธีการที่ใช้ในการเปรียบเทียบคือ ENARF-GAN ซึ่งเป็นโครงการแรกที่แสดงภาพ NeRF จากชุดข้อมูลภาพ 2 มิติ; EG3D ของ Stanford และ NVIDIA (NVDA ); และ StyleSDF ซึ่งเป็นความร่วมมือระหว่างมหาวิทยาลัยวอชิงตัน Adobe (ADBE ) Research และ Stanford University – วิธีการเหล่านี้ต้องการไลบรารี super-resolution เพื่อปรับขนาดจากความละเอียดเดิมเป็นความละเอียดสูง

มาตรการที่ใช้คือ Frechet Inception Distance (FID) และ Kernel Inception Distance (KID) รวมถึง Percentage of Correct Keypoints (PCKh@0.5)

ในการประเมินคุณภาพ EVA3D เป็นผู้นำในมาตรการทั้งหมดใน 4 ชุดข้อมูล:

ผลลัพธ์เชิงปริมาณ

ผลลัพธ์เชิงปริมาณ

ผู้วิจัยสังเกตว่า EVA3D มีอัตราความผิดพลาดต่ำสุดสำหรับการแสดงภาพเรขาคณิต ซึ่งเป็นปัจจัยสำคัญในโครงการนี้ พวกเขายังพบว่าระบบสามารถควบคุมท่าทางที่สร้างขึ้นและได้คะแนน PCKh@0.5 ที่สูงกว่าเมื่อเทียบกับ EG3D ซึ่งเป็นวิธีการที่แข่งขันกันเพียงวิธีเดียวที่ได้คะแนนสูงกว่าในหนึ่งหมวดหมู่

EVA3D มีประสิทธิภาพโดยไม่ต้องมีการปรับขนาดขึ้นในความละเอียด 512x512px แต่สามารถปรับขนาดขึ้นเป็นความละเอียด HD ได้อย่างง่ายดายโดยการเพิ่มชั้นการปรับขนาดขึ้นเหมือนกับที่ Google ได้ทำกับ Imagen Video ที่มีความละเอียด 1024

วิธีการนี้ไม่มีข้อจำกัด ผู้เขียนบทความระบุว่าการกระตุ้น SIREN สามารถทำให้เกิดอาการเป็นวงกลมได้ ซึ่งสามารถแก้ไขได้ในรุ่นต่อไปโดยใช้การแสดงภาพฐานที่แตกต่าง เช่น EG3D ร่วมกับดีコ더 2 มิติ นอกจากนี้ยังยากที่จะปรับ SMPL ให้เหมาะสมกับแหล่งข้อมูลแฟชั่น

สุดท้าย ระบบไม่สามารถรองรับเสื้อผ้าที่ใหญ่และไหลได้ง่าย เช่น ชุดกระโปรงขนาดใหญ่; เสื้อผ้าประเภทนี้แสดงให้เห็นถึงพลศาสตร์ของของไหลที่ทำให้การสร้างภาพผมที่แสดงภาพด้วยเครื่องจักรเป็นเรื่องที่ท้าทาย Presumably วิธีแก้ปัญหาที่เหมาะสมสามารถช่วยแก้ไขปัญหาเหล่านี้ได้

 

เผยแพร่ครั้งแรกเมื่อวันที่ 12 ตุลาคม 2022

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai