มุมมองของ Anderson
ออกไปจากสายตา ออกไปจากใจ: การแก้ปัญหาที่ยิ่งใหญ่ที่สุดใน AI วิดีโอ

แม้แต่เครื่องสร้างวิดีโอ AI ที่ดีที่สุดก็ยังมีอาการความจำเสื่อมเรื้อรัง งานวิจัยใหม่จากจีนกำลังแก้ปัญหาการจดจำตัวละครและฉากหลังที่หายออกจากเฟรม
ระบบสร้างวิดีโอแบบ diffusion มีหน้าต่างความสนใจที่เลื่อนไปและมีขนาดจำกัด จึงประมวลผลสิ่งที่มองเห็นในขณะนั้นเป็นหลัก หากกล้องแพนออกจากตัวละครแล้วกลับมา ตัวละครอาจหาย เปลี่ยนรูปลักษณ์หรือการเคลื่อนไหว และฉากหลังก็อาจเปลี่ยน เพราะสิ่งที่อยู่นอกเฟรมถูกทิ้งออกจากความจำของโมเดล
CGI แบบดั้งเดิมสามารถเรียก mesh และ bitmap texture กลับมาใช้เพื่อสร้างรูปลักษณ์เดิมได้เสมอ แต่ AI ไม่มีไฟล์อ้างอิงแยกต่างหากในลักษณะเดียวกัน จึงรักษาความสม่ำเสมอได้ยากกว่า
ใน CGI องค์ประกอบอย่าง mesh, texture, ไฟล์การเคลื่อนไหว และพฤติกรรมต่าง ๆ เก็บแยกไว้บนดิสก์และดึงกลับมาใช้เมื่อใดก็ได้ วิดีโอ AI ไม่มีคลังข้อมูลแบบนั้น วิธีที่ใกล้เคียงที่สุดคือ LoRA ซึ่งใช้บังคับตัวละครหรือเสื้อผ้าเฉพาะเข้าไปในวิดีโอ แต่ LoRA ผูกกับเวอร์ชันของโมเดลฐาน ต้องฝึกใหม่เมื่อโมเดลเปลี่ยน และอาจทำให้อัตลักษณ์ที่ฝึกไว้ลามไปยังตัวละครอื่นในฉาก
คลิกเพื่อเล่น LoRA ลดปัญหาความจำของวิดีโอ AI ได้บางส่วน แต่ผลลัพธ์อาจรุนแรงเกินไป
การกลับมาอย่างถูกต้อง
ความร่วมมือระหว่างสถาบันการศึกษาและอุตสาหกรรมในจีนเสนอ “หน่วยความจำแบบไฮบริด” เพื่อเก็บตัวละครนอกจอและสภาพแวดล้อมใกล้ตัวไว้ใน latent space เมื่อมุมมองกลับมา รูปลักษณ์ การเคลื่อนไหว และฉากจึงต่อเนื่องกัน
คลิกเพื่อเล่น ตัวอย่างตัวละครที่สร้างด้วย WAN ออกจากเฟรมและกลับเข้ามาด้วยรูปลักษณ์ที่ถูกต้อง
สิ่งนี้ไม่เหมือนการรักษาตัวละครให้เหมือนกันระหว่างหลายช็อต งานนี้แก้ปัญหาภายในช็อตต่อเนื่อง: เมื่อคนหรือวัตถุหายจากภาพ โมเดลต้องจำรูปลักษณ์ การเคลื่อนไหว และบริบทเดิมไว้จนกลับมา
คลิกเพื่อเล่น ตัวอย่างหลักอีกสองชุดจากเว็บไซต์โครงการ หลักการเดียวกันใช้ได้กับการสำรวจเมือง การขับรถมุมมองบุคคลที่หนึ่ง และฉากที่ไม่ได้เน้นตัวละคร
งานวิจัยประกอบด้วยชุดข้อมูลเฉพาะที่สร้างด้วย Unreal Engine ตัวชี้วัดใหม่สำหรับปัญหานี้ และเฟรมเวิร์กกำเนิดที่สร้างบน WAN บทความชื่อ Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models จัดทำโดยนักวิจัยเจ็ดคนจาก Huazhong University of Science and Technology และทีม Kling ของ Kuaishou Technology
วิธีการ
แกนกลางของงานคือหน่วยความจำแบบไฮบริดที่ทำให้เกิด “การคาดการณ์นอกมุมมอง” เมื่อกล้องหันไปทางอื่นหรือตัวละครออกจากเฟรม ระบบต้องรักษาตัวละครและบริบทเอาไว้ จึงต้องแยกการประมวลผลเชิงพื้นที่และเวลา เพื่อสร้างภาพที่มองเห็นพร้อมติดตามการมีอยู่ของตัวละครนอกจอ
ตัวอย่างการออกและกลับเข้าจากการเคลื่อนกล้อง ในตัวอย่างอื่น ตัวละครเองเป็นฝ่ายเคลื่อนออกนอกเฟรมชั่วคราว ที่มา
ใน diffusion latent embedding คุณลักษณะที่ต้องการพันกันอย่างแน่นหนากับฉากและคุณสมบัติอื่น การดึงออกอย่างตรงไปตรงมาอาจทำให้ตัวละครเคลื่อนไหว “แข็ง” ติดกับฉากหลัง นักวิจัยจึงสร้าง HM-World เพื่อฝึกหน่วยความจำแบบไฮบริดโดยเฉพาะ
ตัวอย่างจากสี่หมวดของชุดข้อมูล HM-World
HM-World สร้างตามสี่มิติ ได้แก่ วิถีตัวละคร วิถีกล้อง ฉาก และตัวละคร มี 17 ฉากและตัวละคร 49 แบบ ทั้งคนรูปลักษณ์หลากหลายและสัตว์หลายชนิด ระบบวางองค์ประกอบใน Unreal Engine แบบเป็นขั้นตอน กำหนดแอนิเมชันและวิถีสุ่ม มีวิถีกล้อง 28 แบบพร้อมจุดเริ่มหลายตำแหน่งเพื่อสร้างเหตุการณ์ออกและกลับเข้าที่หลากหลาย
ชุดข้อมูลสุดท้ายมีวิดีโอ 59,225 คลิป และใส่คำอธิบายด้วย MiniCPM-V ซึ่งเป็นโมเดลภาษาขนาดใหญ่หลายรูปแบบ
การเปรียบเทียบ HM-World กับชุดข้อมูลเดิม Dynamic Subject หมายถึงวัตถุที่เคลื่อนไหว Subject Exit-Enter คือคลิปที่วัตถุออกและกลับเข้าเฟรม และ Subject Pose คือท่าทาง 3 มิติที่มีคำกำกับ
เส้นทางที่ยังไม่ค่อยมีใครเดิน
เมื่อมีเฟรมในอดีตและเส้นทางกล้อง ระบบต้องทำนายมุมมองในอนาคตพร้อมติดตามวัตถุที่เคลื่อนไหวอิสระและอาจออกนอกเฟรม การรักษาฉากหลังอย่างเดียวไม่พอ โมเดลต้องเก็บบันทึกภายในของรูปลักษณ์และพฤติกรรมตัวละครระหว่างที่มองไม่เห็น
Hybrid Dynamic Retrieval Attention หรือ HyDRA เพิ่มเส้นทางหน่วยความจำที่แยกตัวละครเคลื่อนไหวออกจากฉากคงที่ ทำให้ตัวละครคงอยู่ข้ามเวลาและกลับมาด้วยรูปลักษณ์กับการเคลื่อนไหวที่ต่อเนื่อง
แผนผังแนวคิดของโมเดล HyDRA
HyDRA สร้างบน Wan2.1-T2V-1.3B โดยคง pipeline diffusion เดิมไว้เป็นส่วนใหญ่และเพิ่มบล็อก Transformer ที่มี dynamic retrieval attention โมเดลจึงเรียกคืนสัญญาณรูปลักษณ์และการเคลื่อนไหวจากเฟรมก่อนหน้าได้อย่างเลือกสรร แทนการพึ่งเฉพาะบริบทใกล้เคียง การฝึกใช้เป้าหมาย Flow Matching ที่ปรับแล้วแทน diffusion loss มาตรฐาน
ระบบป้อนวิถีกล้องเป็นเงื่อนไขโดยตรง แต่ละเฟรมกำหนดด้วยการหมุนและการเลื่อน แล้วบีบอัดเป็นตัวแทนการเปลี่ยนมุมมอง camera encoder จะประมวลผลและเพิ่มข้อมูลนี้เข้าในคุณลักษณะ Diffusion Transformer เพื่อให้ตำแหน่งวัตถุสม่ำเสมอเมื่อกล้องเคลื่อน
การสร้างโทเคน
latent ดิบผสมการเคลื่อนไหว รูปลักษณ์ และฉากไว้ด้วยกัน Memory Tokenizer แบบ 3D convolution ของ HyDRA ประมวลผลพื้นที่กับเวลาพร้อมกัน แทนที่จะส่งประวัติ latent ทั้งหมด ระบบบีบอัดเป็นโทเคนหน่วยความจำขนาดเล็กที่รับรู้การเคลื่อนไหวและยังเก็บรูปลักษณ์กับพฤติกรรมไว้
ด้านซ้าย Memory Tokenizer เปลี่ยนเฟรมเก่าเป็นโทเคนหน่วยความจำที่รับรู้การเคลื่อนไหว ด้านขวา Dynamic Retrieval Attention เปรียบเทียบคำถามปัจจุบันกับโทเคน เลือกข้อมูลที่เกี่ยวข้อง และคืนรูปลักษณ์กับการเคลื่อนไหวในเฟรมใหม่
หน่วยความจำแบบมีโครงสร้างนี้กรองสัญญาณรบกวนและรักษาพลวัตระยะยาว โมดูลค้นคืนจึงเลือกจำเฉพาะตัวละครนอกจอที่เกี่ยวข้องกับเฟรมที่กำลังสร้าง
Dynamic Retrieval Attention
Memory Tokenizer สร้างคลังหน่วยความจำถาวร ส่วน Dynamic Retrieval Attention ประเมินคำถามในแต่ละช่วงเทียบกับโทเคนที่เก็บไว้ ตัวละครนอกจอจึงยังดำเนินการเดินหรือวิ่งใน latent state และเมื่อกลับเข้าภาพจะไม่ถูกรีเซ็ตหรือเสื่อมสภาพ
ข้อมูลและการทดสอบ
HyDRA ที่สร้างบน WAN เข้ารหัสและลดขนาด contextual frame 77 เฟรม ก่อนประมวลผลด้วย 3D VAE ส่วน Memory Tokenizer ใช้ 3D convolution ขนาด kernel 2×4×4 โมเดลฝึกบน HM-World 10,000 รอบด้วย GPU 32 ตัวและ batch size 32
ตัวชี้วัดประกอบด้วย PSNR, SSIM, LPIPS และค่าความสม่ำเสมอของตัวละครกับฉากจาก VBench นักวิจัยยังสร้าง Dynamic Subject Consistency (DSC) โดยใช้กรอบจาก YOLO V11 ครอบตัวละครที่เคลื่อนไหว จากนั้นสกัดและเปรียบเทียบคุณลักษณะเชิงความหมาย
HyDRA ถูกเปรียบเทียบกับ Diffusion Forcing Transformer (DFoT) และ Context-As-Memory บน Wan2.1-T2V-1.3B ที่เพิ่ม camera encoder ทุกโมเดลฝึกบน HM-World และใช้ WorldPlay เป็นชุดทดสอบรองแบบ zero-shot
การเปรียบเทียบเชิงปริมาณพบว่า HyDRA ชนะทุก baseline ค่า PSNR เพิ่มจาก 18.696 เป็น 20.357 และ SSIM จาก 0.517 เป็น 0.606 คะแนน Dice อ้างอิงบริบทและ ground truth อยู่ที่ 0.827 และ 0.849 ส่วนความสม่ำเสมอของตัวละครและฉากอยู่ที่ 0.926 และ 0.932
ผลการเปรียบเทียบเชิงปริมาณเบื้องต้นกับวิธีก่อนหน้า
DFoT ทำ PSNR ได้ 17.693 และ Context-As-Memory ได้ 18.921 นักวิจัยให้เครดิตกับการทำงานร่วมกันของ memory tokenization และ dynamic retrieval attention
การเปรียบเทียบเชิงปริมาณระหว่าง HyDRA กับวิธีระดับแนวหน้าในปัจจุบัน
เมื่อทดสอบกับ WorldPlay วิธีใหม่ชนะทุกตัวชี้วัด โดยมีช่องว่าง PSNR 5.502 แม้ WorldPlay จะได้ PSNR อ้างอิง ground truth เพียง 14.855 และ DSCGT 0.832 เนื่องจากความต่างของโดเมนและไม่ได้ปรับแต่งเฉพาะ แต่ยังได้ DSCctx 0.822 ในตัวชี้วัดอ้างอิงบริบท
การเปรียบเทียบเชิงคุณภาพเมื่อวัตถุออกและกลับเข้าเฟรมระหว่างการเคลื่อนกล้อง HyDRA รักษาอัตลักษณ์ ท่าทาง และความต่อเนื่องของการเคลื่อนไหวได้ใกล้ ground truth ขณะที่วิธีอื่นเกิดการเลื่อน การเคลื่อนไหวไม่ต่อเนื่อง หรือรูปลักษณ์เสียหาย
ในเหตุการณ์ที่ซับซ้อน baseline และ Context-As-Memory ทำให้ตัวละครบิดเบือนและเคลื่อนไหวไม่ต่อเนื่อง DFoT รักษาความสมบูรณ์ไม่ได้จนตัวละครหายไป ส่วน WorldPlay รักษารูปลักษณ์ได้แต่การเคลื่อนไหวสะดุดและไม่เป็นธรรมชาติ HyDRA รักษาทั้งอัตลักษณ์และความต่อเนื่องของการเคลื่อนไหวหลังกลับเข้าเฟรม
คลิกเพื่อเล่น ตัวอย่างสี่รายการจากผลทดสอบหกรายการบนเว็บไซต์โครงการ
สรุป
การแก้ข้อบกพร่องสำคัญของวิดีโอ AI นี้น่ายินดี แต่ในระยะยาว วิธีที่เหมาะสมอาจคล้าย CGI มากกว่า คือเก็บวัสดุอ้างอิงที่แก้ไขได้แยกต่างหากแล้วนำเข้าพื้นที่ประกอบภาพ การพยายามรักษา embedding แบบเฉพาะหน้าไว้ตลอดเวลาดูสิ้นเปลือง และยังไม่มีเส้นทางชัดเจนไปสู่ความสม่ำเสมอระหว่างช็อต
หากช็อตถัดไปต้องเข้าถึง latent space ของช็อตก่อนหน้า การให้ทั้งสองช็อตใช้ character embedding แยกที่แชร์ร่วมกันก็อาจเป็นแนวทางที่ตรงกว่า
* ปัญหานี้ยังไม่มีชื่อร่วมที่ยอมรับโดยทั่วไป ** HM-World ยังระบุว่า “coming soon” บนหน้าโครงการ
เผยแพร่ครั้งแรกวันศุกร์ที่ 27 มีนาคม 2026












