มุมมองของ Anderson

รุ่งอรุณแห่งอารมณ์ที่ถูกสร้างขึ้น

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยได้พัฒนาเทคนิคการเรียนรู้ของเครื่องใหม่ที่สามารถกำหนดอารมณ์ใหม่ๆ บนใบหน้าในวิดีโอได้อย่างไม่จำกัด โดยใช้เทคโนโลยีที่เกิดขึ้นใหม่ซึ่งเป็นคำตอบสำหรับการจับคู่การเคลื่อนไหวของ губกับการพูดภาษาต่างประเทศ

การวิจัยนี้เป็นการร่วมมือระหว่างมหาวิทยาลัย Northeastern ที่บอสตันและห้องปฏิบัติการสื่อของ MIT และมีชื่อเรื่องว่า การแปลอารมณ์บนใบหน้าจากวิดีโอด้วยเทคนิค Invertable Frowns นักวิจัยยอมรับว่าคุณภาพของผลลัพธ์เบื้องต้นต้องได้รับการพัฒนาต่อไป แต่พวกเขาอ้างว่าเทคนิคนี้ซึ่งเรียกว่า Wav2Lip-Emotion เป็นเทคนิคแรกที่แก้ไขปัญหาการเปลี่ยนแปลงน้ำเสียงบนใบหน้าโดยตรงผ่านเทคนิคเครือข่ายประสาทเทียม

รหัสฐานได้รับการเผยแพร่บน GitHub แล้ว และจะเพิ่มจุดตรวจสอบแบบจำลองลงในคลังซอฟต์แวร์แบบเปิดในภายหลังตามที่ผู้เขียนสัญญาไว้

ทางซ้ายคือเฟรม 'เสียใจ' ของวิดีโอต้นฉบับ ทางขวาคือเฟรม 'มีความสุข' ตรงกลางคือสองวิธีในการสังเคราะห์อารมณ์ที่แตกต่างกัน - แถวบนสุด: ใบหน้าที่ถูกเปลี่ยนแปลงทั้งหมดโดยการแทนที่พื้นผิวน้ำเสียงทั้งหมด; แถวล่าง: วิธีการ Wav2Lip แบบดั้งเดิมซึ่งเปลี่ยนแปลงเฉพาะส่วนล่างของใบหน้า

ทางซ้ายคือเฟรม ‘เสียใจ’ ของวิดีโอต้นฉบับ ทางขวาคือเฟรม ‘มีความสุข’ ตรงกลางคือสองวิธีในการสังเคราะห์อารมณ์ที่แตกต่างกัน – แถวบนสุด: ใบหน้าที่ถูกเปลี่ยนแปลงทั้งหมดโดยการแทนที่พื้นผิวน้ำเสียงทั้งหมด; แถวล่าง: วิธีการ Wav2Lip แบบดั้งเดิมซึ่งเปลี่ยนแปลงเฉพาะส่วนล่างของใบหน้า Source: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

วิดีโอต้นฉบับเป็นข้อมูลต้นกำเนิด

ในทางทฤษฎี การเปลี่ยนแปลงดังกล่าวสามารถทำได้โดยใช้การฝึกอบรมแบบเต็มรูปแบบบนคลังข้อมูล deepfake แบบดั้งเดิม เช่น DeepFaceLab หรือ FaceSwap อย่างไรก็ตาม การทำงานแบบดั้งเดิมจะเกี่ยวข้องกับการใช้เอกลักษณ์ที่แตกต่างจาก ‘เป้าหมาย’ เช่น นักแสดงคนหนึ่งที่เลียนแบบเป้าหมาย โดยที่น้ำเสียงของนักแสดงจะถูกถ่ายทอดไปยังบุคคลอื่นพร้อมกับการแสดงของพวกเขา นอกจากนี้ เทคนิคการปลอมแปลงเสียงแบบ deepfake มักจะจำเป็นต้องใช้ในการสร้างภาพลวงตาที่สมบูรณ์แบบ

นอกจากนี้ การเปลี่ยนแปลงน้ำเสียงของ เป้าหมาย ในวิดีโอต้นฉบับภายใต้โครงสร้างที่ได้รับความนิยมเหล่านี้จะเกี่ยวข้องกับการเปลี่ยนแปลง เวกเตอร์การจัดแนวใบหน้า ในรูปแบบที่โครงสร้างเหล่านี้ไม่ได้ให้การสนับสนุนในปัจจุบัน

Wav2Lip-Emotion รักษาการสอดคล้องกันของการเคลื่อนไหวของ губกับเสียงพูดต้นฉบับในขณะเปลี่ยนแปลงน้ำเสียงที่เกี่ยวข้อง

Wav2Lip-Emotion รักษาการสอดคล้องกันของการเคลื่อนไหวของ губกับเสียงพูดต้นฉบับในขณะเปลี่ยนแปลงน้ำเสียงที่เกี่ยวข้อง.

แทนที่จะทำเช่นนั้น Wav2Lip-Emotion มุ่งหวังที่จะ ‘คัดลอกและวาง’ น้ำเสียงที่เกี่ยวข้องกับอารมณ์จากส่วนหนึ่งของวิดีโอและแทนที่ส่วนอื่น โดยมีการจำกัดข้อมูลต้นกำเนิดที่ตั้งใจจะนำเสนอวิธีการที่ใช้ความพยายามน้อยลงสำหรับการเปลี่ยนแปลงน้ำเสียง

แบบจำลองออฟไลน์สามารถพัฒนาขึ้นในภายหลังโดยการฝึกอบรมบนคลิปวิดีโอที่แตกต่างกันของผู้พูด ซึ่งจะกำจัดความจำเป็นในการมีวิดีโอต้นฉบับใดๆ ที่มี ‘พาเลท’ ของสถานะน้ำเสียงที่สามารถจัดการวิดีโอได้

วัตถุประสงค์ที่เป็นไปได้

ผู้เขียนเสนอวัตถุประสงค์หลายประการสำหรับการเปลี่ยนแปลงน้ำเสียง รวมถึงการกรองวิดีโอสดเพื่อชดเชยผลกระทบของ PTSD และผู้ที่เป็นโรคปาร์กินสัน ผู้เขียนสังเกตว่า:

‘บุคคลที่มีน้ำเสียงที่ถูกจำกัดหรือไม่จำกัดอาจได้รับประโยชน์จากการปรับเปลี่ยนน้ำเสียงของตนเองเพื่อให้เหมาะสมกับสถานการณ์สังคมของตน คนหนึ่งอาจต้องการเปลี่ยนแปลงน้ำเสียงในวิดีโอที่แสดงให้พวกเขาเห็น ผู้พูดอาจกำลังตะคอกกันในช่วงการประชุมวิดีโอ แต่พวกเขาก็ยังต้องการรวบรวมเนื้อหาของการแลกเปลี่ยนโดยไม่มีน้ำเสียงที่ไม่พึงประสงค์ หรือผู้กำกับภาพยนตร์อาจต้องการเพิ่มหรือลดน้ำเสียงของนักแสดง’

เนื่องจากน้ำเสียงเป็นตัวบ่งชี้หลักของเจตนา แม้ว่าจะขัดแย้งกับคำพูดก็ตาม ความสามารถในการเปลี่ยนแปลงน้ำเสียงจึงให้ความสามารถในการเปลี่ยนแปลงวิธีการรับข้อมูลสื่อสารด้วย

งานก่อนหน้า

ความสนใจในการเปลี่ยนแปลงน้ำเสียงด้วยการเรียนรู้ของเครื่องย้อนกลับไปอย่างน้อยในปี 2012 เมื่อการร่วมมือระหว่าง Adobe, Facebook และมหาวิทยาลัย Rutgers เสนอวิธีการเปลี่ยนแปลงน้ำเสียงโดยใช้เทคนิคการสร้างแบบจำลอง 3 มิติแบบ Tensor ซึ่งใช้เวลานานในการวางเมช CGI บนเฟรมของวิดีโอต้นฉบับเพื่อเปลี่ยนแปลงน้ำเสียง

การวิจัยของ Adobe/Facebook ในปี 2012 จัดการกับการเปลี่ยนแปลงน้ำเสียงโดยการนำการเปลี่ยนแปลง CGI มาใช้กับวิดีโอ Source: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

การวิจัยของ Adobe/Facebook ในปี 2012 จัดการกับการเปลี่ยนแปลงน้ำเสียงโดยการนำการเปลี่ยนแปลง CGI มาใช้กับวิดีโอ Source: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

แม้ว่าผลลัพธ์จะน่าหวัง แต่วิธีการนี้ใช้เวลานานและต้องใช้ทรัพยากรมาก ในขณะนั้น เทคโนโลยี CGI ก้าวหน้ากว่าการเข้าถึงพื้นที่คุณลักษณะและจัดการพิกเซลโดยตรง

ที่เกี่ยวข้องมากที่สุดกับงานวิจัยใหม่นี้คือ MEAD ซึ่งเป็นชุดข้อมูลและแบบจำลองการสร้างน้ำเสียงที่เผยแพร่ในปี 2020 ซึ่งสามารถสร้างวิดีโอ ‘ตัวพูด’ ได้ แม้ว่าจะไม่มีความซับซ้อนเท่ากับการเปลี่ยนแปลงวิดีโอต้นฉบับโดยตรง

การสร้างน้ำเสียงด้วย MEAD ซึ่งเป็นการร่วมมือระหว่าง SenseTime Research, Carnegie Mellon และสามมหาวิทยาลัยในจีน Source: https://wywu.github.io/projects/MEAD/MEAD.html

การสร้างน้ำเสียงด้วย MEAD ซึ่งเป็นการร่วมมือระหว่าง SenseTime Research, Carnegie Mellon และสามมหาวิทยาลัยในจีน Source: https://wywu.github.io/projects/MEAD/MEAD.html

ในปี 2018 มีงานวิจัยอื่นหนึ่งซึ่งเรียกว่า GANimation: การสร้างภาพเคลื่อนไหวบนใบหน้าจากภาพเดียว เป็นการร่วมมือระหว่างนักวิชาการในสหรัฐอเมริกาและスペน และใช้เครือข่าย Generative Adversarial ในการเพิ่มหรือเปลี่ยนแปลงน้ำเสียงในภาพนิ่งเท่านั้น

การเปลี่ยนแปลงน้ำเสียงในภาพนิ่งด้วย GANimation Source: https://arxiv.org/pdf/1807.09251.pdf

การเปลี่ยนแปลงน้ำเสียงในภาพนิ่งด้วย GANimation Source: https://arxiv.org/pdf/1807.09251.pdf

Wav2Lip-Emotion

แทนที่จะทำเช่นนั้น โครงการใหม่นี้อาศัย Wav2Lip ซึ่งได้รับความสนใจในปี 2020 ด้วยวิธีการที่อาจเป็นไปได้ในการจับคู่การเคลื่อนไหวของ губกับเสียงพูดใหม่ (หรือเพลง) ที่ไม่เคยปรากฏในวิดีโอต้นฉบับ

โครงสร้าง Wav2Lip ต้นฉบับถูกฝึกอบรมบนคลังข้อมูลของประโยคที่พูดจากคลังข้อมูลของ BBC เพื่อปรับ Wav2Lip ให้เหมาะสมกับการเปลี่ยนแปลงน้ำเสียง นักวิจัยได้ ‘ปรับแต่ง’ โครงสร้างนี้บนชุดข้อมูล MEAD ที่กล่าวมาข้างต้น

MEAD ประกอบด้วยวิดีโอ 40 ชั่วโมงซึ่งมีนักแสดง 60 คนอ่านประโยคเดียวกันโดยแสดงน้ำเสียงที่แตกต่างกัน นักแสดงที่มาจาก 15 ประเทศต่างๆ และนำเสนอคุณลักษณะระหว่างประเทศที่มุ่งช่วยให้โครงการ (และโครงการที่เกี่ยวข้อง) สามารถสังเคราะห์น้ำเสียงที่เหมาะสมและทั่วไป

ในขณะการวิจัย MEAD ได้เผยแพร่ส่วนแรกของชุดข้อมูลซึ่งมีนักแสดง 47 คนแสดงน้ำเสียงต่างๆ เช่น ‘โกรธ’, ‘ไม่พอใจ’, ‘กลัว’, ‘เหยียดหยาม’, ‘มีความสุข’, ‘เสียใจ’ และ ‘ประหลาดใจ’ ในการเปิดตัวครั้งแรกนี้ นักวิจัยจำกัดขอบเขตของโครงการให้แคบลงโดยการวางน้ำเสียงหรือเปลี่ยนแปลงอารมณ์ที่รับรู้ได้ง่ายที่สุด เช่น ‘มีความสุข’ และ ‘เสียใจ’

วิธีการและผลลัพธ์

โครงสร้าง Wav2Lip ต้นฉบับเปลี่ยนแปลงเฉพาะส่วนล่างของใบหน้า ในขณะที่ Wav2Lip-Emotion ทดลองกับหน้ากากการแทนที่ใบหน้าทั้งหมดและสร้างน้ำเสียง ดังนั้นจึงจำเป็นต่อนักวิจัยที่จะแก้ไขวิธีการประเมินภายในที่ไม่ได้ออกแบบมาเพื่อการกำหนดค่าใบหน้าทั้งหมด

ผู้เขียนได้ปรับปรุงรหัสต้นฉบับโดยการรักษาเสียงต้นฉบับไว้ และรักษาความสอดคล้องกันของการเคลื่อนไหวของ губ

ส่วนของเครื่องมือประกอบด้วยเครื่องมือเข้ารหัสตัวตน เครื่องมือเข้ารหัสเสียง และเครื่องมือตัวถอดรหัสใบหน้า ตามงานก่อนหน้านี้ ส่วนของเสียงถูกเข้ารหัสเพิ่มเติมเป็นคอนโวลูชัน 2 มิติที่ถูกวางซ้อนกันและต่อท้ายเฟรมที่เกี่ยวข้อง

除了ส่วนสร้างแล้ว โครงสร้างที่เปลี่ยนแปลงมีส่วนตัดสินสามส่วนหลัก ซึ่งมุ่งเน้นไปที่คุณภาพของการเคลื่อนไหวของ губ วัตถุประสงค์ทางอารมณ์ และวัตถุประสงค์ทางภาพที่ได้รับการฝึกอบรมแบบ Adversarial

สำหรับการสร้างใบหน้าทั้งหมด โครงสร้าง Wav2Lip ต้นฉบับไม่มีแบบอย่าง และดังนั้นแบบจำลองจึงถูกฝึกอบรมจากต้น ในการฝึกอบรมใบหน้าที่ล่าง (หน้ากากครึ่งหน้า) นักวิจัยเริ่มต้นจากจุดตรวจสอบที่รวมอยู่ในโค้ด Wav2Lip ต้นฉบับ

นอกจากการประเมินอัตโนมัติ นักวิจัยใช้ความคิดเห็นจากผู้คนซึ่งจัดหาโดยแพลตฟอร์มบริการแบบกึ่งอัตโนมัติ ผู้ทำงานโดยทั่วไปให้คะแนนผลลัพธ์สูงในด้านการรับรู้อารมณ์ที่ถูกวาง และรายงานการประเมิน ‘ปานกลาง’ สำหรับคุณภาพของภาพ

ผู้เขียนเสนอว่า除了การปรับปรุงคุณภาพวิดีโอที่สร้างขึ้นแล้ว การทำงานในอนาคตอาจครอบคลุมอารมณ์ที่กว้างขึ้น และงานนี้สามารถนำไปใช้กับข้อมูลต้นกำเนิดที่มีฉลากหรืออนุมานอัตโนมัติและชุดข้อมูลในอนาคต ซึ่งนำไปสู่ระบบที่แท้จริงซึ่งอารมณ์สามารถปรับได้ตามใจผู้ใช้ หรือแทนที่ด้วยอารมณ์ที่ขัดแย้งกับวิดีโอต้นฉบับ

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai