มุมมองของ Anderson

ฮุนยวนคัสตอมนำเสนอวิดีโอดีปแฟกส์แบบซิงเกิลอิมเมจ พร้อมเสียงและซิงค์ลิป

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

บทความนี้พูดถึงการเปิดตัวแบบจำลองวิดีโอมัลติม็อดัลฮุนยวนใหม่ชื่อ ‘ฮุนยวนคัสตอม’ ความกว้างขวางของการครอบคลุมในเอกสารใหม่รวมกับปัญหาหลายประการในตัวอย่างวิดีโอที่จัดให้ไว้ที่ หน้าโปรเจค*, ทำให้เราต้องครอบคลุมมากกว่าปกติและจำกัดการทำซ้ำวิดีโอที่มีจำนวนมากที่มาพร้อมกับการเปิดตัวนี้ (เนื่องจากวิดีโอส่วนใหญ่ต้องการการแก้ไขและประมวลผลอย่างมีนัยสำคัญเพื่อปรับปรุงการอ่านรูปแบบ)

โปรดทราบเพิ่มเติมว่าเอกสารอ้างอิงถึงระบบสร้างแบบจำลอง API ชื่อ ‘Keling’ เป็น ‘Kling’ สำหรับความชัดเจน ฉันจะเรียก ‘Kling’ ตลอด

 

เทนเซนต์กำลังจะเปิดตัวเวอร์ชันใหม่ของ แบบจำลองวิดีโอฮุนยวน ที่มีชื่อว่า ฮุนยวนคัสตอม การเปิดตัวใหม่นี้ดูเหมือนจะสามารถทำให้ แบบจำลอง LoRA ของฮุนยวน เป็นเรื่องเกินความจำเป็น โดยทำให้ผู้ใช้สามารถสร้างวิดีโอแบบดีปแฟกส์ได้ด้วย ภาพเดียว:

คลิกเพื่อเล่น คำแนะนำ: ‘ชายกำลังฟังเพลงและทำอาหารเส้นในครัว’ วิธีการใหม่นี้เมื่อเปรียบเทียบกับทั้งวิธีการที่ปิดและเปิดแหล่งที่มา รวมถึง Kling ซึ่งเป็นคู่แข่งที่สำคัญในพื้นที่นี้ แหล่งที่มา: https://hunyuancustom.github.io/ (คำเตือน: เว็บไซต์ใช้ CPU และหน่วยความจำมาก!)

ในคอลัมน์ซ้ายสุดของวิดีโอด้านบน เราจะเห็นภาพต้นฉบับที่ให้มาแก่ฮุนยวนคัสตอม ตามด้วยการตีความคำแนะนำของระบบใหม่ในคอลัมน์ที่สอง ใกล้กัน คอลัมน์ที่เหลือแสดงผลลัพธ์จากระบบที่เป็นกรรมสิทธิ์และ FOSS ต่างๆ: Kling; Vidu; Pika; Hailuo; และ Wan-based SkyReels-A2.

ในวิดีโอด้านล่าง เราจะเห็นตัวอย่างของสามสถานการณ์ที่จำเป็นสำหรับการเปิดตัวนี้: ตามลำดับ บุคคล + วัตถุ; การจำลองตัวละครเดียว; และ การลองเสื้อผ้าเสมือน (บุคคล + เสื้อผ้า):

คลิกเพื่อเล่น ตัวอย่างสามแบบที่แก้ไขจากวัสดุในเว็บไซต์สนับสนุนสำหรับวิดีโอฮุนยวน

เราสามารถสังเกตเห็นหลายสิ่งจากตัวอย่างเหล่านี้ ส่วนใหญ่เกี่ยวข้องกับระบบที่พึ่งพา ภาพต้นฉบับเดียว แทนที่จะเป็นภาพหลายภาพของวัตถุเดียวกัน

ในคลิปแรก ชายแทบจะยังคงหันหน้าเข้าหากล้อง เขาเงยหน้าลงและข้างๆ ไม่เกิน 20-25 องศาของการหมุน แต่เมื่อความเอียงเกินกว่านั้น ระบบจะต้องเดาเกี่ยวกับว่าเขาดูอย่างไรในโปรไฟล์ ซึ่งเป็นเรื่องที่ยากและอาจเป็นไปไม่ได้ที่จะประเมินได้อย่างแม่นยำจากภาพหน้าเดียว

ในตัวอย่างที่สอง เราจะเห็นว่าเด็กหญิง ยิ้ม ในวิดีโอที่แสดงเช่นเดียวกับในภาพที่ให้มา แนวทางนี้ก็เหมือนกัน โดยที่ฮุนยวนคัสตอมจะต้องเดาเกี่ยวกับว่าเธอจะมี ‘ใบหน้าปกติ’ อย่างไร โดยไม่มีภาพอื่นให้พิจารณา นอกจากนี้ ใบหน้าของเธอไม่หันออกจากทิศทางหากล้องมากกว่าตัวอย่างก่อนหน้า (‘ชายกินชิปส์’)

ในตัวอย่างสุดท้าย เราจะเห็นว่าเนื่องจากวัสดุต้นฉบับ – ผู้หญิงและเสื้อผ้าที่เธอใส่ – ไม่ใช่ภาพที่สมบูรณ์ การแสดงผลได้ถูกตัดให้พอดีกับสถานการณ์ – ซึ่งเป็นวิธีแก้ปัญหาที่ดีสำหรับปัญหาเกี่ยวกับข้อมูล!

จุดสำคัญคือแม้ว่าระบบใหม่สามารถจัดการกับหลายภาพ (เช่น บุคคล + ชิปส์ หรือ บุคคล + เสื้อผ้า) แต่ดูเหมือนว่าจะไม่อนุญาตให้มีมุมมองหรือมุมมองที่แตกต่างกัน ของตัวละครเดียว เพื่อให้สามารถรองรับนิพจน์ที่หลากหลายหรือมุมมองที่ไม่ปกติได้ ในด้านนี้ ระบบอาจต้องดิ้นรนในการแทนที่ระบบ LoRA ที่เติบโตขึ้นรอบๆ ฮุนยวนวิดีโอนับตั้งแต่การเปิดตัวเมื่อเดือนธันวาคมที่ผ่านมา เนื่องจากระบบเหล่านั้นสามารถช่วยให้ฮุนยวนวิดีโอสร้างตัวละครที่สอดคล้องกันจากทุกมุมและมีนิพจน์บนใบหน้าที่แสดงอยู่ในเซตการฝึก (20-60 ภาพเป็นปกติ)

เสียงและภาพ

ฮุนยวนคัสตอมใช้ระบบ LatentSync สำหรับการเคลื่อนไหวของ губที่ตรงกับเสียงและข้อความที่ผู้ใช้ให้มา:

มีเสียง คลิกเพื่อเล่น ตัวอย่างต่างๆ ของการซิงค์ลิปจากเว็บไซต์เสริมของฮุนยวนคัสตอม ที่แก้ไขเข้าด้วยกัน

การแก้ไขวิดีโอที่มีอยู่

ระบบใหม่นี้ให้ผลลัพธ์ที่น่าประทับใจมากสำหรับการแก้ไขวิดีโอ (V2V หรือ Vid2Vid) โดยที่ส่วนหนึ่งของวิดีโอที่มีอยู่ถูกปิดบังและแทนที่ด้วยวัตถุที่กำหนดจากภาพอ้างอิงเดียว

คลิกเพื่อเล่น เฉพาะวัตถุกลางเท่านั้นที่มุ่งเป้าไปที่ แต่สิ่งที่เหลืออยู่รอบๆ ก็ถูกเปลี่ยนแปลงเช่นกันในกระบวนการ vid2vid ของฮุนยวนคัสตอม

การเริ่มต้นใหม่?

การเปิดตัวนี้เป็นการพัฒนาของ โปรเจควิดีโอฮุนยวน ไม่ใช่การเปลี่ยนแนวทางพัฒนาใหม่ การปรับปรุงของโปรเจคนี้ถูกนำเข้ามาเป็นการแทรกโครงสร้างที่แยกจากกัน ไม่ใช่การเปลี่ยนแปลงโครงสร้างที่กว้างขวาง โดยมีเป้าหมายที่จะทำให้แบบจำลองสามารถรักษาความสอดคล้องของอัตลักษณ์ข้ามเฟรมได้โดยไม่ต้องอาศัย การปรับให้เหมาะสมเฉพาะวัตถุ เช่น LoRA หรือการผันคำ

การเปิดตัว

หน้าโปรเจคสำหรับ เอกสารใหม่ (ที่มีชื่อว่า ฮุนยวนคัสตอม: สถาปัตยกรรมแบบไดรฟ์มัลติม็อดัลสำหรับการสร้างวิดีโอที่ปรับแต่งได้) มีลิงก์ไปยัง ไซต์ GitHub ที่ ณ เวลาที่เขียนนี้ เพิ่งเริ่มใช้งานได้ และดูเหมือนว่าจะมีรหัสและน้ำหนักที่จำเป็นสำหรับการใช้งานท้องถิ่นพร้อมกับแผนการในอนาคต (โดยที่สิ่งสำคัญที่ยังต้องมาคือการรวม ComfyUI)

การดูเอกสาร

การขนส่งข้อมูลสำหรับฮุนยวนคัสตอมซึ่งดูเหมือนจะสอดคล้องกับกรอบการทำงาน GDPR รวมถึงชุดข้อมูลวิดีโอที่สังเคราะห์และเปิดแหล่งที่มา รวมถึง OpenHumanVid โดยมีหมวดหมู่หลัก 8 ประเภท: มนุษย์, สัตว์, พืช, ภูมิประเทศ, ยานพาหนะ, วัตถุ, สถาปัตยกรรม, และ อนิเมะ

วิดีโอคัสตอม

เพื่อให้สามารถสร้างวิดีโอตามภาพอ้างอิงและคำแนะนำได้ โมดูลสองตัวที่มีศูนย์กลางอยู่ที่ LLaVA ถูกสร้างขึ้น โดยการปรับโครงสร้างการนำเข้าของฮุนยวนวิดีโอเพื่อให้สามารถรับภาพพร้อมกับข้อความได้

เสียงและภาพ

ฮุนยวนคัสตอมมีเงื่อนไขการสร้างเสียง/พูดโดยใช้ข้อความและเสียงที่ผู้ใช้ให้มา โดยช่วยให้ตัวละครในฉากสามารถพูดได้

ข้อมูลและการทดสอบ

ในการทดสอบ ค่ามาตรฐานที่ใช้คือ: โมดูลความสอดคล้องของอัตลักษณ์ใน ArcFace ซึ่งดึงการฝังตัวของใบหน้าจากภาพอ้างอิงและเฟรมทุกเฟรมของวิดีโอที่สร้างขึ้น และคำนวณค่าเฉลี่ยของความคล้ายคลึงกันโคไซน์ระหว่างพวกมัน

สรุป

การเปิดตัวนี้น่าสนใจมาก ไม่เพียงแต่เนื่องจากเป็นเรื่องที่ชุมชนฮอบบี้ไม่พอใจมากขึ้นในขณะนี้ – การขาดการซิงค์ลิป เพื่อให้ความจริงที่เพิ่มขึ้นที่สามารถทำได้ในระบบ เช่น ฮุนยวนวิดีโอและวัน 2.1 มีมิติใหม่ของความสมจริง

เทนเซนต์ ดูเหมือนจะก้าวหน้าไปข้างหน้าในเรื่องนี้ในลักษณะที่น่าประทับใจ

* ปัญหา คือ วิดีโอบางส่วนกว้าง สั้น และมีความละเอียดสูงมาก จนไม่สามารถเล่นได้ในผู้เล่นวิดีโอมาตรฐาน เช่น VLC หรือ Windows Media Player โดยแสดงหน้าจอดำ

เผยแพร่ครั้งแรกวันพฤหัสบดี 8 พฤษภาคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai