มุมมองของ Anderson

ออกไปจากสายตา ออกไปจากใจ: การแก้ปัญหาที่ยิ่งใหญ่ที่สุดใน AI วิดีโอ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Detail from the first page of the มีนาคม 2026 paper 'Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models'. Source - https://arxiv.org/pdf/2603.25716

ปัญหาที่ยิ่งใหญ่ที่สุดของ AI วิดีโอเจนเนอเรเตอร์ที่ดีที่สุดคือมันลืมได้ง่าย – ปัญหาที่การวิจัยใหม่จากจีนกำลังแก้ไขอยู่

 

ปัญหาที่ยิ่งใหญ่ที่สุดของ AI วิดีโอเจนเนอเรเตอร์ที่ดีที่สุดและที่ทันสมัยที่สุดคือมันลืมได้ง่าย: หากกล้องถ่ายภาพออกจากวัตถุและกลับมาถึงวัตถุนั้นอีกครั้ง มันจะไม่พบวัตถุนั้นอีก – ตัวละครจะหายไป การเปลี่ยนแปลงรูปร่างและการเคลื่อนไหว และพื้นหลังจะเปลี่ยนแปลงไป

สิ่งนี้เกิดขึ้นเนื่องจากระบบการสร้างภาพแบบกระจายมีหน้าต่างการมองเห็นที่จำกัด และเนื่องจากมันกำลังจัดการกับสิ่งที่มันเห็นในขณะนั้น ในการแสดงออกที่แท้จริงของ solipsism สิ่งที่อยู่นอกเหนือจากเฟรมคือไม่มีอยู่สำหรับ AI ที่สร้างภาพ – มันจะถูกลบออกจากหน่วยความจำ

สิ่งนี้ไม่เคยเป็นปัญหาใน CGI ทั่วไป ซึ่งสามารถอ้างอิงและสร้างวัตถุได้อย่างแม่นยำ รวมถึงรูปร่างและการเคลื่อนไหว ที่ใดก็ตามในวิดีโอที่มีการแสดง

เมชและเท็กซ์เจอร์ของ CGI ทั่วไปสามารถวาดเข้าไปในเฟรมได้ โดยให้การแสดงออกที่สม่ำเสมอ - สิ่งที่ยากที่จะทำได้ใน AI เนื่องจากไม่มี 'ไฟล์參考' ที่เทียบเท่า

เมชและเท็กซ์เจอร์ของ CGI ทั่วไปสามารถวาดเข้าไปในเฟรมได้ โดยให้การแสดงออกที่สม่ำเสมอ – สิ่งที่ยากที่จะทำได้ใน AI เนื่องจากไม่มี ‘ไฟล์參考’ ที่เทียบเท่า

เนื่องจากองค์ประกอบของ CGI เช่น เมชและเท็กซ์เจอร์ (ดูภาพด้านบน) รวมถึงไฟล์การเคลื่อนไหวและพฤติกรรมอื่นๆ สามารถอยู่บนไดส์กและถูกวาดเข้าไปในเฟรมได้ทุกเมื่อ

ไม่มี ‘คลังข้อมูล’ เช่นนี้ใน AI วิดีโอเจนเนอเรเตอร์; สิ่งที่ใกล้เคียงที่สุดคือ LoRAs – ไฟล์เสริมที่ได้รับการฝึกฝนพิเศษ ซึ่งสามารถฝึกได้บนอุปกรณ์ผู้บริโภค ทำให้ตัวละครใหม่และเสื้อผ้าเฉพาะ สามารถถูกบังคับให้เข้าไปในวิดีโอ

คลิกเพื่อเล่น. ปัญหาของ AI วิดีโอคือสามารถลดลงได้โดยใช้ LoRAs – แต่ผลลัพธ์อาจจะมากเกินไป

สิ่งนี้ไม่ใช่วิธีแก้ปัญหาที่ดีที่สุด อย่างหนึ่ง LoRAs ถูกผูกกับเวอร์ชันเฉพาะของโมเดลพื้นฐาน (เช่น Wan2+ หรือ Hunyuan Video) และ ต้องสร้างใหม่ ทุกครั้งที่โมเดลพื้นฐานเปลี่ยนแปลง

การสร้างภาพที่แม่นยำ

ตอนนี้ การวิจัยใหม่จากจีนกำลังเสนอการแก้ปัญหาที่สำคัญที่สุดในการแก้ปัญหานี้

คลิกเพื่อเล่น. จากเว็บไซต์โครงการใหม่ สองตัวอย่างของตัวละคร AI ที่สร้างขึ้น (WAN) ที่ออกจากเฟรมและกลับเข้ามาในเฟรมได้อย่างแม่นยำแหล่งที่มา 

ควรเน้นว่าสิ่งนี้ไม่ใช่สิ่งเดียวกับการบรรลุ ความสม่ำเสมอของตัวละคร ข้ามช็อตต่างๆ – สิ่งที่ถูกอ้างว่าได้รับการบรรลุ เมื่อหนึ่งปีที่แล้ว ในการเปิดตัว Gen 4 ของ Runway และยังคงเป็น การตาม đuổi ในวรรณกรรมวิจัย

วิธีการ

ส่วนกลางของการวิจัยใหม่นี้คือ ความจำไฮบริด ซึ่งอำนวยความสะดวกในการ การค้นหาสิ่งที่อยู่นอกเหนือจากมุมมอง – การรักษาตัวละครและบริบทของมันไว้แม้ว่ามันจะออกจากเฟรมแล้ว

ตัวอย่างการเคลื่อนไหวของกล้องเข้าและออก

ตัวอย่างการเคลื่อนไหวของกล้องเข้าและออก แหล่งที่มา

ผู้วิจัยระบุว่าใน การฝังตัวแบบกระจาย คุณลักษณะที่ต้องถูกดึงออกและใช้คือ ผูกกันอย่างหนัก กับคุณลักษณะและคุณสมบัติอื่นๆ และการพยายามดึงพวกมันออกอาจทำให้วัตถุ แช่ ในพื้นหลัง

การเดินทางที่ไม่เคยเดิน

การให้เฟรมที่ผ่านมาและเส้นทางกล้องที่ทราบ คือการคาดการณ์มุมมองในอนาคตเมื่อมุมมองของผู้ชมเปลี่ยนแปลงไป ในขณะเดียวกันก็คำนึงถึงตัวละครที่เคลื่อนไหวอิสระและอาจออกจากเฟรมก่อนที่จะกลับเข้ามาใหม่

สิ่งนี้ต้องการมากกว่าการรักษาพื้นหลังที่เสถียร เนื่องจากโมเดลต้องรักษาบันทึกภายในที่สอดคล้องกันเกี่ยวกับว่าตัวละครแต่ละตัวดูและเคลื่อนไหวอย่างไร แม้ว่าจะไม่มองเห็นพวกมันก็ตาม

การแบ่งคำ

HyDRA จัดการกับสิ่งนี้ด้วย การแบ่งคำแบบ 3 มิติ ที่ประมวลผลพื้นที่และเวลาเข้าด้วยกัน – ไม่ใช่การส่งประวัติแบบแฝงเต็มรูปแบบ แต่จะบีบอัดพวกมันให้กลายเป็น โทเค็นความจำ ที่กะทัดรัดและตระหนักถึงการเคลื่อนไหว

การดึงข้อมูลแบบไดนามิก

HyDRA ใช้ การดึงข้อมูลแบบไดนามิก ในบทบาทที่แตกต่าง แต่เสริมกันภายในเฟรมเวิร์ก

การแบ่งคำทำให้ประวัติแบบแฝงจากเฟรมที่ผ่านมาให้กลายเป็น โทเค็นความจำ ที่มีโครงสร้าง ซึ่งกรองเสียงรบกวนในขณะเดียวกันก็รักษาการเคลื่อนไหวในระยะยาว

ข้อมูลและทดสอบ

ในการทดสอบ ระบบ HyDRA ที่ใช้ Wan2.1-T2V-1.3B ถูกฝึกฝนบนชุดข้อมูล HW-World และทดสอบกับชุดข้อมูล WorldPlay

ผลลัพธ์แสดงให้เห็นว่า HyDRA มีประสิทธิภาพสูงกว่าโมเดลพื้นฐานและโมเดลอื่นๆ ในการรักษาความสม่ำเสมอของตัวละครและพื้นหลัง

สรุป

แม้ว่าการพยายามแก้ปัญหาหนึ่งของ AI วิดีโอที่ยิ่งใหญ่ที่สุดจะน่าชื่นชม แต่ก็ดูเหมือนว่าจะเป็นไปไม่ได้ที่จะแก้ปัญหาได้ด้วยวิธีการที่เหมาะสมที่สุด

สิ่งนี้ทำให้เราต้องคิดถึงการแก้ปัญหาในระยะยาวและหาวิธีการที่ดีกว่าในการรักษาความสม่ำเสมอของตัวละครและพื้นหลังใน AI วิดีโอ

นักเขียนเกี่ยวกับการเรียนรู้ของเครื่องจักร และผู้เชี่ยวชาญด้านสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
พอร์ตโฟลิโอ: martinanderson.ai
ติดต่อ: [email protected]