โมเดลและแพลตฟอร์ม AI
AniPortrait: การสังเคราะห์ภาพพอร์ตเทรตแบบโฟโต้รีลิสติกผ่านเสียง
ตลอดหลายปีที่ผ่านมา การสร้างภาพพอร์ตเทรตแบบเคลื่อนไหวที่มีลักษณะสมจริงและน่าสนใจจากภาพนิ่งและเสียงมีการใช้งานในหลายๆ ด้าน เช่น การเล่นเกม การสื่อสารดิจิทัล ความเป็นจริงเสมือน และอื่นๆ แม้ว่าจะมีการใช้งานที่หลากหลาย แต่ก็ยังคงเป็นเรื่องที่ท้าทายสำหรับนักพัฒนาในการสร้างเฟรมเวิร์กที่สามารถสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงและรักษาความสม่ำเสมอของเวลาได้ สาเหตุหลักของความซับซ้อนคือการประสานการเคลื่อนไหวของปาก การวางตำแหน่งของหัว และน้ำเสียงบนใบหน้าเพื่อสร้างผลกระทบทางภาพที่น่าดึงดูด
ในบทความนี้ เราจะพูดถึง AniPortrait ซึ่งเป็นเฟรมเวิร์กใหม่ที่ออกแบบมาเพื่อสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงโดยใช้ภาพพอร์ตเทรตอ้างอิงและตัวอย่างเสียง การทำงานของ AniPortrait แบ่งออกเป็นสองขั้นตอน ขั้นตอนแรก AniPortrait จะถอดรูป 3 มิติจากตัวอย่างเสียงและแปลงเป็นลำดับของจุดเด่นบนใบหน้า 2 มิติ ต่อไป เฟรมเวิร์กจะใช้แบบจำลองการกระจายที่มีความแข็งแรงร่วมกับโมดูลการเคลื่อนไหวเพื่อแปลงลำดับจุดเด่นเป็นภาพเคลื่อนไหวที่มีคุณภาพสูงและสม่ำเสมอของเวลา ผลการทดลองแสดงให้เห็นถึงความเหนือกว่าและความสามารถของ AniPortrait ในการสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงพร้อมกับความสมจริงที่น่าประทับใจ ความหลากหลายของท่าทาง และความเป็นธรรมชาติของใบหน้า ทำให้ผู้ใช้ได้รับประสบการณ์ที่ดีขึ้นและ丰富ขึ้น นอกจากนี้ AniPortrait ยังมีศักยภาพที่น่าประทับใจในด้านการควบคุมและความยืดหยุ่น และสามารถนำไปใช้ได้อย่างมีประสิทธิภาพในหลายๆ ด้าน เช่น การสร้างภาพพอร์ตเทรตใหม่ การแก้ไขการเคลื่อนไหวของใบหน้า และอื่นๆ บทความนี้มีจุดมุ่งหมายเพื่อครอบคลุม AniPortrait ในเชิงลึก และเราจะสำรวจกลไก การทำงาน โครงสร้างของเฟรมเวิร์ก以及การเปรียบเทียบกับเฟรมเวิร์กอื่นๆ ที่มีคุณภาพสูง
AniPortrait: การสร้างภาพพอร์ตเทรตแบบโฟโต้รีลิสติก
การสร้างภาพพอร์ตเทรตแบบเคลื่อนไหวที่มีลักษณะสมจริงและน่าสนใจเป็นจุดสนใจของนักวิจัยมาเป็นเวลานานแล้ว เนื่องจากมีศักยภาพและใช้งานได้หลากหลาย ตั้งแต่สื่อดิจิทัล ความเป็นจริงเสมือน ไปจนถึงการเล่นเกม แม้ว่าจะมีการวิจัยและพัฒนามาเป็นเวลานาน แต่ก็ยังคงเป็นเรื่องที่ท้าทายสำหรับนักพัฒนาในการสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงและรักษาความสม่ำเสมอของเวลาได้ สาเหตุหลักของความซับซ้อนคือการประสานการเคลื่อนไหวของหัว การวางตำแหน่งของใบหน้า และน้ำเสียงบนใบหน้าเพื่อสร้างผลกระทบทางภาพที่น่าดึงดูด วิธีการที่มีอยู่ไม่สามารถแก้ไขปัญหานี้ได้ เนื่องจากส่วนใหญ่พึ่งพาเครื่องมือสร้างเนื้อหาที่มีขีดจำกัด เช่น NeRF, ตัวถอดรหัสการเคลื่อนไหว และ GAN สำหรับการสร้างเนื้อหาทางภาพ
โดยการสร้างบนความก้าวหน้าของแบบจำลองการกระจาย AniPortrait มีจุดมุ่งหมายเพื่อสร้างภาพพอร์ตเทรตแบบเคลื่อนไหวที่มีคุณภาพสูงโดยใช้ภาพพอร์ตเทรตอ้างอิงและตัวอย่างเสียง การทำงานของ AniPortrait แบ่งออกเป็นสองขั้นตอน ขั้นตอนแรก เฟรมเวิร์กจะใช้แบบจำลองที่ใช้ทรานส์ฟอร์เมอร์ในการถอดรูป 3 มิติและท่าทางของหัวจากตัวอย่างเสียง และแปลงเป็นลำดับของจุดเด่นบนใบหน้า 2 มิติ ขั้นตอนที่สอง เฟรมเวิร์กจะใช้แบบจำลองการกระจายที่มีความแข็งแรงร่วมกับโมดูลการเคลื่อนไหวเพื่อแปลงลำดับจุดเด่นเป็นภาพเคลื่อนไหวที่มีคุณภาพสูงและสม่ำเสมอของเวลา
ผลการทดลองแสดงให้เห็นถึงความเหนือกว่าของ AniPortrait ในการสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงพร้อมกับความสมจริงที่น่าประทับใจ ความหลากหลายของท่าทาง และความเป็นธรรมชาติของใบหน้า โดยการนำเสนอแบบจำลอง 3 มิติเป็นคุณลักษณะระหว่างกลาง AniPortrait มีความยืดหยุ่นในการปรับเปลี่ยนคุณลักษณะเหล่านี้ตามความต้องการ ซึ่งเพิ่มความสามารถในการใช้งานในหลายๆ ด้าน เช่น การสร้างภาพพอร์ตเทตใหม่และการแก้ไขการเคลื่อนไหวของใบหน้า
AniPortrait: การทำงานและวิธีการ
เฟรมเวิร์ก AniPortrait ที่ถูกเสนอประกอบด้วยสองโมดูล คือ Audio2Lmk และ Lmk2Video โมดูล Audio2Lmk มีจุดมุ่งหมายเพื่อถอดรูปลำดับของจุดเด่นที่จับภาพการเคลื่อนไหวของปากและน้ำเสียงบนใบหน้าจากตัวอย่างเสียง ในขณะที่โมดูล Lmk2Video ใช้ลำดับจุดเด่นนี้เพื่อสร้างวิดีโอภาพพอร์ตเทตที่มีคุณภาพสูงและสม่ำเสมอของเวลา

Audio2Lmk
สำหรับชุดตัวอย่างเสียงที่กำหนด จุดมุ่งหมายหลักของ AniPortrait คือการคาดการณ์ลำดับของเมช 3 มิติของใบหน้าพร้อมกับเวกเตอร์ของการแปลและการหมุน เฟรมเวิร์กใช้วิธีการ wav2vec ที่ได้รับการฝึกฝนมาแล้วในการถอดรูปคุณลักษณะเสียง และแบบจำลองนี้แสดงให้เห็นถึงความสามารถในการสร้างแบบจำลองที่สูงและสามารถจดจำน้ำเสียงและคำพูดจากเสียงได้อย่างแม่นยำ ซึ่งจำเป็นต่อการสร้างภาพเคลื่อนไหวของใบหน้าที่สมจริง
Lmk2Video
สำหรับภาพพอร์ตเทตอ้างอิงและลำดับของจุดเด่นบนใบหน้า โมดูล Lmk2Video สร้างภาพเคลื่อนไหวของภาพพอร์ตเทตที่มีคุณภาพสูงและสม่ำเสมอของเวลา โดยการเคลื่อนไหวจะสอดคล้องกับลำดับจุดเด่นและรักษาลักษณะที่สอดคล้องกับภาพพอร์ตเทตอ้างอิง โมดูลนี้ใช้โครงสร้างแบบจำลองที่มาจากแบบจำลอง AnimateAnyone ซึ่งใช้ Stable Diffusion 1.5 เป็นแบบจำลองหลัก และรวมโมดูลการเคลื่อนไหวที่สามารถแปลงอินพุตของเสียงหลายเฟรมเป็นลำดับของเฟรมวิดีโอ
AniPortrait: การนำไปใช้และผลลัพธ์
สำหรับขั้นตอน Audio2Lmk AniPortrait ใช้แบบจำลอง wav2vec2.0 เป็นโครงสร้างหลัก และใช้ MediaPipe ในการถอดรูปเมช 3 มิติและท่าทาง 6 มิติสำหรับการบันทึกข้อมูล โมเดลได้รับการฝึกฝนจากชุดข้อมูลภายในที่ประกอบด้วยข้อมูลเสียงคุณภาพสูงประมาณ 60 นาทีจากผู้พูดคนเดียว
ผลการทดลองแสดงให้เห็นถึงความเหนือกว่าของ AniPortrait ในการสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงพร้อมกับความสมจริงที่น่าประทับใจ ความหลากหลายของท่าทาง และความเป็นธรรมชาติของใบหน้า

เฟรมเวิร์กสามารถใช้การแสดงผล 3 มิติเป็นคุณลักษณะระหว่างกลางเพื่อแก้ไขผลลัพธ์ตามความต้องการ เช่น การสร้างภาพพอร์ตเทตใหม่โดยการเปลี่ยนแปลงท่าทางหรือรูปแบบของใบหน้า
บทสรุป
ในบทความนี้ เราได้พูดถึง AniPortrait ซึ่งเป็นเฟรมเวิร์กใหม่ที่ออกแบบมาเพื่อสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงโดยใช้ภาพพอร์ตเทตอ้างอิงและตัวอย่างเสียง โดยการทำงานที่แบ่งออกเป็นสองขั้นตอน AniPortrait สามารถสร้างภาพเคลื่อนไหวที่มีคุณภาพสูงพร้อมกับความสมจริงที่น่าประทับใจ ความหลากหลายของท่าทาง และความเป็นธรรมชาติของใบหน้า ทำให้ผู้ใช้ได้รับประสบการณ์ที่ดีขึ้นและ丰富ขึ้น












