มุมมองของ Anderson

โกเกิลเปิดตัว LipSync3D เพื่อปรับปรุงการเคลื่อนไหวของปากที่สังเคราะห์ขึ้น

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การทำงานร่วมกันระหว่างนักวิจัยจาก Google AI และ Indian Institute of Technology Kharagpur ได้เสนอเฟรมเวิร์กใหม่ในการสังเคราะห์หัวที่พูดจากเนื้อหาออดิโอ โครงการนี้มีเป้าหมายในการผลิตวิธีการที่ได้รับการปรับให้เหมาะสมและใช้ทรัพยากรอย่างสมเหตุสมผลในการสร้างเนื้อหาวิดีโอ “หัวที่พูด” จากออดิโอ สำหรับวัตถุประสงค์ของการซิงค์เคลื่อนไหวของปากกับออดิโอที่ดับเบิลหรือแปลโดยเครื่อง และสำหรับการใช้งานในอวตาร การใช้งานแบบโต้ตอบ และในสภาพแวดล้อมแบบเรียลไทม์อื่นๆ

Source: https://www.youtube.com/watch?v=L1StbX9OznY

Source: https://www.youtube.com/watch?v=L1StbX9OznY

โมเดลการเรียนรู้ของเครื่องจักรที่ฝึกอบรมในกระบวนการนี้ – เรียกว่า LipSync3D – ต้องการวิดีโอเพียงวิดีโอเดียวของอัตลักษณ์ใบหน้าที่เป็นเป้าหมายเป็นข้อมูลนำเข้า ข้อมูลการเตรียมการแยกการถอดรหัสเรขาคณิตของใบหน้าจากการประเมินแสงและด้านอื่นๆ ของวิดีโอนำเข้า ทำให้สามารถฝึกอบรมได้อย่างมีประสิทธิภาพและเน้นย้ำมากขึ้น

The two-stage work-flow of LipSync3D. Above, the generation of a dynamically textured 3D face from the 'target' audio; below, the insertion of the generated mesh into a target video.

The two-stage work-flow of LipSync3D. Above, the generation of a dynamically textured 3D face from the ‘target’ audio; below, the insertion of the generated mesh into a target video.

ในความเป็นจริง การมีส่วนร่วมที่สำคัญที่สุดของ LipSync3D ในการวิจัยในพื้นที่นี้อาจเป็นอัลกอริทึมการปรับแสงตามปกติ ซึ่งแยกการฝึกอบรมและการอนุมานการกระจายแสง

Decoupling illumination data from general geometry helps LipSync3D to produce more realistic lip movement output under challenging conditions. Other approaches of recent years have limited themselves to 'fixed' lighting conditions that won't reveal their more limited capacity in this respect.

Decoupling illumination data from general geometry helps LipSync3D to produce more realistic lip movement output under challenging conditions. Other approaches of recent years have limited themselves to ‘fixed’ lighting conditions that won’t reveal their more limited capacity in this respect.

ระหว่างการประมวลผลก่อนของเฟรมข้อมูลนำเข้า ระบบจะต้องระบุและลบจุดกระจายแสง เนื่องจากจุดเหล่านี้เฉพาะเจาะจงกับสภาพแวดล้อมการให้แสงสว่างที่วิดีโอนั้นถูกบันทึกไว้ และจะขัดขวางกระบวนการของการให้แสงใหม่หากไม่ทำเช่นนั้น

LipSync3D ไม่ได้ทำการวิเคราะห์ภาพพิกเซลเพียงอย่างเดียวบนใบหน้าที่มีการประเมิน แต่ใช้การระบุตำแหน่งใบหน้าอย่างแข็งขันเพื่อสร้างเมช CGI ที่เคลื่อนไหวได้ พร้อมด้วยเนื้อหาที่ไม่ขึ้นต่อกันซึ่งหุ้มรอบๆ ในการประมวลผล CGI แบบดั้งเดิม

Pose normalization in LipSync3D. On the left are the input frames and detected features; in the middle, the normalized vertices of the generated mesh evaluation; and on the right, the corresponding texture atlas, which provides the ground truth for texture prediction. Source: https://arxiv.org/pdf/2106.04185.pdf

Pose normalization in LipSync3D. On the left are the input frames and detected features; in the middle, the normalized vertices of the generated mesh evaluation; and on the right, the corresponding texture atlas, which provides the ground truth for texture prediction. Source: https://arxiv.org/pdf/2106.04185.pdf

นอกจากวิธีการให้แสงใหม่ที่เป็นนวัตกรรมแล้ว นักวิจัยยังอ้างว่า LipSync3D มีการประดิษฐ์สามประการในงานวิจัยก่อนหน้านี้: การแยกเรขาคณิต แสง สภาพท่า และเนื้อหาออกเป็นกระแสข้อมูลที่แยกจากกันในพื้นที่ที่มีการปรับให้เหมาะสม; โมเดลการคาดการณ์ข้อความอัตโนมัติที่สามารถฝึกได้ง่ายซึ่งผลิตการ합成วิดีโอที่สอดคล้องกันในเชิงเวลา; และความสมจริงที่เพิ่มขึ้นตามการประเมินของมนุษย์และมาตรการวัตถุ

Splitting out the various facets of the video facial imagery allows greater control in video synthesis.

Splitting out the various facets of the video facial imagery allows greater control in video synthesis.

LipSync3D สามารถอนุมานการเคลื่อนไหวของเรขาคณิตปากที่เหมาะสมโดยตรงจากออดิโอโดยการวิเคราะห์ foneme และด้านอื่นๆ ของการพูด และแปลสิ่งเหล่านั้นเป็นท่าทางกล้ามเนื้อที่ทราบรอบๆ บริเวณปาก

กระบวนการนี้ใช้การคาดการณ์ร่วม โดยที่เรขาคณิตและเนื้อหาที่อนุมานมีเครื่องเข้ารหัสที่มีไว้เฉพาะในเซตอัตโนมัติ แต่แบ่งปันเครื่องเข้ารหัสออดิโอด้วยกับข้อความที่ตั้งใจจะกำหนดให้กับโมเดล:

การสร้างการเคลื่อนไหวที่มีลักษณะเปลี่ยนแปลงได้ของ LipSync3D ยังตั้งใจให้ใช้พลังอวตาร CGI ที่มีลักษณะเฉพาะ ซึ่งโดยพื้นฐานแล้วเป็นเพียงเมชและข้อมูลเนื้อหาที่เหมือนกับภาพที่มีอยู่จริง:

A stylized 3D avatar has its lip movements powered in real time by a source speaker video. In such a scenario, the best results would be obtained by personalized pre-training.

A stylized 3D avatar has its lip movements powered in real time by a source speaker video. In such a scenario, the best results would be obtained by personalized pre-training.

นักวิจัยยังตั้งใจให้ใช้อวตารที่มีลักษณะที่สมจริงมากขึ้น:

เวลาในการฝึกอบรมตัวอย่างสำหรับวิดีโอนั้นอยู่ในช่วง 3-5 ชั่วโมงสำหรับวิดีโอที่มีความยาว 2-5 นาที ในการประมวลผลที่ใช้ TensorFlow, Python และ C++ บน GeForce GTX 1080 การฝึกอบรมใช้ขนาดแบตช์ 128 เฟรมมากกว่า 500-1000 เอพพอค โดยที่แต่ละเอพพอคแสดงถึงการประเมินวิดีโอที่สมบูรณ์

การซิงค์เคลื่อนไหวของปากแบบไดนามิก

สาขาการซิงค์เคลื่อนไหวของปากเพื่อให้เข้ากับเสียงใหม่นั้นได้รับความสนใจอย่างมากในการวิจัยด้านการมองเห็นของคอมพิวเตอร์ในช่วงไม่กี่ปีที่ผ่านมา (ดูรายละเอียดด้านล่าง) ไม่น้อยที่จะเป็นผลพลอยได้จากเทคโนโลยี deepfake ที่ถกเถียงกัน

ในปี 2017 มหาวิทยาลัยวอชิงตัน นำเสนอการวิจัย ที่สามารถเรียนรู้การซิงค์ปากจากออดิโอ โดยใช้เพื่อเปลี่ยนการเคลื่อนไหวของปากของอดีตประธานาธิบดีโอบามา ในปี 2018 สถาบัน Max Planck สำหรับอินฟอร์แมติกส์นำ การวิจัยอีกโครงการหนึ่ง เพื่อให้สามารถถ่ายโอนวิดีโอจากตัวตนหนึ่งไปยังอีกตัวตนหนึ่ง โดยการซิงค์ปากเป็นผลพลอยได้จากกระบวนการนี้; และในเดือนพฤษภาคม 2021 AI สตาร์ทอัพ FlawlessAI เปิดเผยเทคโนโลยีการซิงค์ปากที่เป็นกรรมสิทธิ์ TrueSync ซึ่งได้รับการ ยอมรับอย่างกว้างขวาง ในสื่อว่าเป็นตัวช่วยในการปรับปรุงเทคโนโลยีการดับเบิลสำหรับการเปิดตัวภาพยนตร์หลักข้ามภาษา

และแน่นอนว่าการพัฒนาต่อเนื่องของที่เก็บข้อมูลโอเพ่นซอร์ส deepfake ให้ความสนใจในการวิจัยที่มีส่วนร่วมโดยผู้ใช้ในพื้นที่สังเคราะห์ภาพใบหน้า

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai