มุมมองของ Anderson
ออกไปจากสายตา ออกไปจากใจ: การแก้ปัญหาที่ยิ่งใหญ่ที่สุดใน AI วิดีโอ

ปัญหาที่ยิ่งใหญ่ที่สุดของ AI วิดีโอเจนเนอเรเตอร์ที่ดีที่สุดคือมันลืมได้ง่าย – ปัญหาที่การวิจัยใหม่จากจีนกำลังแก้ไขอยู่
ปัญหาที่ยิ่งใหญ่ที่สุดของ AI วิดีโอเจนเนอเรเตอร์ที่ดีที่สุดและที่ทันสมัยที่สุดคือมันลืมได้ง่าย: หากกล้องถ่ายภาพออกจากวัตถุและกลับมาถึงวัตถุนั้นอีกครั้ง มันจะไม่พบวัตถุนั้นอีก – ตัวละครจะหายไป การเปลี่ยนแปลงรูปร่างและการเคลื่อนไหว และพื้นหลังจะเปลี่ยนแปลงไป
สิ่งนี้เกิดขึ้นเนื่องจากระบบการสร้างภาพแบบกระจายมีหน้าต่างการมองเห็นที่จำกัด และเนื่องจากมันกำลังจัดการกับสิ่งที่มันเห็นในขณะนั้น ในการแสดงออกที่แท้จริงของ solipsism สิ่งที่อยู่นอกเหนือจากเฟรมคือไม่มีอยู่สำหรับ AI ที่สร้างภาพ – มันจะถูกลบออกจากหน่วยความจำ
สิ่งนี้ไม่เคยเป็นปัญหาใน CGI ทั่วไป ซึ่งสามารถอ้างอิงและสร้างวัตถุได้อย่างแม่นยำ รวมถึงรูปร่างและการเคลื่อนไหว ที่ใดก็ตามในวิดีโอที่มีการแสดง

เมชและเท็กซ์เจอร์ของ CGI ทั่วไปสามารถวาดเข้าไปในเฟรมได้ โดยให้การแสดงออกที่สม่ำเสมอ – สิ่งที่ยากที่จะทำได้ใน AI เนื่องจากไม่มี ‘ไฟล์參考’ ที่เทียบเท่า
เนื่องจากองค์ประกอบของ CGI เช่น เมชและเท็กซ์เจอร์ (ดูภาพด้านบน) รวมถึงไฟล์การเคลื่อนไหวและพฤติกรรมอื่นๆ สามารถอยู่บนไดส์กและถูกวาดเข้าไปในเฟรมได้ทุกเมื่อ
ไม่มี ‘คลังข้อมูล’ เช่นนี้ใน AI วิดีโอเจนเนอเรเตอร์; สิ่งที่ใกล้เคียงที่สุดคือ LoRAs – ไฟล์เสริมที่ได้รับการฝึกฝนพิเศษ ซึ่งสามารถฝึกได้บนอุปกรณ์ผู้บริโภค ทำให้ตัวละครใหม่และเสื้อผ้าเฉพาะ สามารถถูกบังคับให้เข้าไปในวิดีโอ
คลิกเพื่อเล่น. ปัญหาของ AI วิดีโอคือสามารถลดลงได้โดยใช้ LoRAs – แต่ผลลัพธ์อาจจะมากเกินไป
สิ่งนี้ไม่ใช่วิธีแก้ปัญหาที่ดีที่สุด อย่างหนึ่ง LoRAs ถูกผูกกับเวอร์ชันเฉพาะของโมเดลพื้นฐาน (เช่น Wan2+ หรือ Hunyuan Video) และ ต้องสร้างใหม่ ทุกครั้งที่โมเดลพื้นฐานเปลี่ยนแปลง
การสร้างภาพที่แม่นยำ
ตอนนี้ การวิจัยใหม่จากจีนกำลังเสนอการแก้ปัญหาที่สำคัญที่สุดในการแก้ปัญหานี้
คลิกเพื่อเล่น. จากเว็บไซต์โครงการใหม่ สองตัวอย่างของตัวละคร AI ที่สร้างขึ้น (WAN) ที่ออกจากเฟรมและกลับเข้ามาในเฟรมได้อย่างแม่นยำแหล่งที่มา
ควรเน้นว่าสิ่งนี้ไม่ใช่สิ่งเดียวกับการบรรลุ ความสม่ำเสมอของตัวละคร ข้ามช็อตต่างๆ – สิ่งที่ถูกอ้างว่าได้รับการบรรลุ เมื่อหนึ่งปีที่แล้ว ในการเปิดตัว Gen 4 ของ Runway และยังคงเป็น การตาม đuổi ในวรรณกรรมวิจัย
วิธีการ
ส่วนกลางของการวิจัยใหม่นี้คือ ความจำไฮบริด ซึ่งอำนวยความสะดวกในการ การค้นหาสิ่งที่อยู่นอกเหนือจากมุมมอง – การรักษาตัวละครและบริบทของมันไว้แม้ว่ามันจะออกจากเฟรมแล้ว

ตัวอย่างการเคลื่อนไหวของกล้องเข้าและออก แหล่งที่มา
ผู้วิจัยระบุว่าใน การฝังตัวแบบกระจาย คุณลักษณะที่ต้องถูกดึงออกและใช้คือ ผูกกันอย่างหนัก กับคุณลักษณะและคุณสมบัติอื่นๆ และการพยายามดึงพวกมันออกอาจทำให้วัตถุ แช่ ในพื้นหลัง
การเดินทางที่ไม่เคยเดิน
การให้เฟรมที่ผ่านมาและเส้นทางกล้องที่ทราบ คือการคาดการณ์มุมมองในอนาคตเมื่อมุมมองของผู้ชมเปลี่ยนแปลงไป ในขณะเดียวกันก็คำนึงถึงตัวละครที่เคลื่อนไหวอิสระและอาจออกจากเฟรมก่อนที่จะกลับเข้ามาใหม่
สิ่งนี้ต้องการมากกว่าการรักษาพื้นหลังที่เสถียร เนื่องจากโมเดลต้องรักษาบันทึกภายในที่สอดคล้องกันเกี่ยวกับว่าตัวละครแต่ละตัวดูและเคลื่อนไหวอย่างไร แม้ว่าจะไม่มองเห็นพวกมันก็ตาม
การแบ่งคำ
HyDRA จัดการกับสิ่งนี้ด้วย การแบ่งคำแบบ 3 มิติ ที่ประมวลผลพื้นที่และเวลาเข้าด้วยกัน – ไม่ใช่การส่งประวัติแบบแฝงเต็มรูปแบบ แต่จะบีบอัดพวกมันให้กลายเป็น โทเค็นความจำ ที่กะทัดรัดและตระหนักถึงการเคลื่อนไหว
การดึงข้อมูลแบบไดนามิก
HyDRA ใช้ การดึงข้อมูลแบบไดนามิก ในบทบาทที่แตกต่าง แต่เสริมกันภายในเฟรมเวิร์ก
การแบ่งคำทำให้ประวัติแบบแฝงจากเฟรมที่ผ่านมาให้กลายเป็น โทเค็นความจำ ที่มีโครงสร้าง ซึ่งกรองเสียงรบกวนในขณะเดียวกันก็รักษาการเคลื่อนไหวในระยะยาว
ข้อมูลและทดสอบ
ในการทดสอบ ระบบ HyDRA ที่ใช้ Wan2.1-T2V-1.3B ถูกฝึกฝนบนชุดข้อมูล HW-World และทดสอบกับชุดข้อมูล WorldPlay
ผลลัพธ์แสดงให้เห็นว่า HyDRA มีประสิทธิภาพสูงกว่าโมเดลพื้นฐานและโมเดลอื่นๆ ในการรักษาความสม่ำเสมอของตัวละครและพื้นหลัง
สรุป
แม้ว่าการพยายามแก้ปัญหาหนึ่งของ AI วิดีโอที่ยิ่งใหญ่ที่สุดจะน่าชื่นชม แต่ก็ดูเหมือนว่าจะเป็นไปไม่ได้ที่จะแก้ปัญหาได้ด้วยวิธีการที่เหมาะสมที่สุด
สิ่งนี้ทำให้เราต้องคิดถึงการแก้ปัญหาในระยะยาวและหาวิธีการที่ดีกว่าในการรักษาความสม่ำเสมอของตัวละครและพื้นหลังใน AI วิดีโอ












