มุมมองของ Anderson
สู่การสร้างวิดีโอ Deepfake แบบ Full-Body ที่มีความสมจริงและเสถียร

ในสาขาที่ต้องอาศัยความอดทน ระบบใหม่นี้พาเราเข้าใกล้การจำลองมนุษย์ผ่านไลฟ์สตรีมอีกขั้น โดยไม่ต้องรอการเรนเดอร์ที่ชวนหงุดหงิด
เทคโนโลยีจำลองมนุษย์ทั้งตัวพัฒนาไปมากนับตั้งแต่ความเป็นไปได้ของดีปเฟกทั้งตัว ปรากฏครั้งแรก ในปี 2022 ปัจจุบันเราคุ้นเคยกับความสามารถอันทรงพลังและ มักก่อให้เกิดข้อถกเถียง ของระบบโอเพนซอร์สอย่าง Wan-Animate และระบบปิดอย่าง Grok ที่เปลี่ยนภาพเดียวหรือ หลายภาพ ให้เป็นการแสดงในวิดีโอที่ต่อเนื่องสอดคล้องกัน และมักเปลี่ยนแปลงรูปลักษณ์จากต้นฉบับได้มาก:
คลิกเพื่อเล่นหากจำเป็น: ตัวอย่างการแทนที่บุคคลด้วย WanAnimate-2.2 โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น แหล่งที่มา
นอกจากนี้ เฟรมเวิร์กดีปเฟกใบหน้าแบบสดรุ่นเก่าที่ใช้ ออโตเอนโคเดอร์อย่าง DeepFaceLive ก็ถูกเฟรมเวิร์กที่ซับซ้อนกว่าอย่าง Deep-Live-Cam แซงหน้าไปแล้ว ระบบนี้ประสานการทำงานของ LivePortrait รุ่นต่าง ๆ ร่วมกับโมดูลเดิมอย่าง GAN และ InsightFace เพื่อเป็นผู้สืบทอดแบบเรียลไทม์ที่มีประสิทธิภาพของ DFLive ซึ่งปัจจุบันเลิกพัฒนาแล้ว:
คลิกเพื่อเล่น: ตัวอย่างการปลอมใบหน้าเป็นอีลอน มัสก์ในวิดีโอสดด้วย Deep-Live-Cam โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น แหล่งที่มา
แม้เฟรมเวิร์กอย่าง Deep-Live-Cam จะทำงานและสร้างภาพปลอมต่อเนื่องได้ และสร้างใบหน้าในมุมที่ยากได้ ดีกว่าแต่ก่อน แต่ความละเอียดและขอบเขตความสามารถยังจำกัด ระบบสร้างใบหน้าหรืออัตลักษณ์เฉพาะ พร้อมสีหน้าที่น่าเชื่อถือและการขยับปากตรงเสียงได้ ทว่าหลัก ๆ ยังเป็นเครื่องมือที่เชี่ยวชาญงานเฉพาะอย่าง
รอสักครู่…
ระบบ AI เลียนแบบมนุษย์ส่วนใหญ่ในปัจจุบันก็มีข้อจำกัดหรือความเชี่ยวชาญเฉพาะทางคล้ายกัน ข้อจำกัดที่เกิดซ้ำคือระบบที่ทำได้ดีที่สุดมักเป็นแบบ ออฟไลน์ กล่าวคือ ใช้ทรัพยากรมากเกินกว่าจะทำงานเรียลไทม์ จึงต้องคำนวณก่อนแล้วค่อยแสดงผลให้ผู้ใช้ภายหลัง
ระบบเช่นนี้ย่อมไม่เหมาะกับการแปลงรูปลักษณ์ด้วย AI แบบสด เช่น การถ่ายทอดการเคลื่อนไหวทั้งตัวขณะเต้นในไลฟ์สตรีม
ตัวอย่างช่วงหลังคือระบบที่เปิดเผยน้ำหนักโมเดล Wan2.2. Animate ซึ่งได้รับความนิยมในชุมชนผู้ใช้ทั่วไปและผู้ให้บริการต่อยอดเชิงอาชีพ แต่ยังคงต้อง “สั่งสร้างแล้วรอ”:
คลิกเพื่อเล่น : ตัวอย่างความสามารถของ Wan2.2-Animate จากปี 2025 หากคุณอดใจรอได้เล็กน้อย โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น แหล่งที่มา
สถานการณ์ตอนนี้จึงเป็นการเลือกสองอย่างจากสามอย่าง ได้แก่ คุณภาพสูง ความอเนกประสงค์ และผลลัพธ์ที่ได้ทันที
LiveAnimate
ท่ามกลางภาวะติดขัดนี้ งานใหม่จากจีนเปลี่ยน Wan2.2 Animate ให้เป็นเฟรมเวิร์กแอนิเมชันที่ขับเคลื่อนด้วยอินพุตสด ทำงานได้ใกล้ 20 เฟรมต่อวินาที และให้ผลน่าประทับใจในหลายสถานการณ์:
คลิกเพื่อเล่น: ตัวอย่างจากเว็บไซต์โครงการแสดงการถ่ายทอดท่าทางในฉากเต้นบนเวที ฉากกลางแจ้งที่เห็นทั้งตัว และภาพบุคคลระยะใกล้ โดยจำลองการเคลื่อนไหวของร่างกาย มือ และใบหน้า. โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น แหล่งที่มา
งานใหม่นี้เพิ่มความสามารถแบบสดให้ระบบเดิมด้วยการเปลี่ยน วิธี สร้างวิดีโอ แทนที่จะประมวลผลเฟรมก่อนหน้าและอนาคตพร้อมกัน LiveAnimate สร้างช่วงใหม่ตามการเคลื่อนไหวที่เกิดขึ้น โดยใช้เพียงไม่กี่ขั้นตอน และ เก็บท่าทางก่อนหน้าที่คัดเลือกไว้เพื่อรักษารูปลักษณ์ของบุคคลตลอดเซสชันที่ยาวนาน.
เฟรมก่อนหน้าจึงทำหน้าที่เป็นความจำต่อเนื่องให้เรียกใช้ขณะวิดีโอพัฒนา เพื่อรักษาอัตลักษณ์ไว้ คล้ายกับระบบ CGI แบบดั้งเดิมที่อ้างอิงแผนที่พื้นผิว
แม้จะใช้ LoRA ในขั้นตอนประมวลผล แต่ LiveAnimate ไม่ใช่เพียงระบบ LoRA อีกตัวหนึ่ง ยังมีการสร้างแบบสตรีม ความจำและแคชท่าทาง การอนุมานสามขั้นตอน และการปรับแต่ง GPU รวมถึงเทคนิคอื่นหลายอย่าง ซึ่งบางอย่างเก่ากว่าที่คาด
ระบบรองรับทั้งการขับเคลื่อนร่างกายเต็มตัวตามตัวอย่างข้างต้น และการเคลื่อนไหวช่วงบน เช่น ในการสัมภาษณ์:
คลิกเพื่อเล่น : “การเคลื่อนไหวเล็กน้อยของศีรษะและมือ โดยมีฉากสำนักงานอยู่นิ่ง”
เพื่ออธิบายข้อจำกัดอย่างเป็นธรรม งานวิจัยยอมรับว่าคู่แข่งสองระบบรักษาอัตลักษณ์ได้ดีกว่า LiveAnimate เล็กน้อยในบางเงื่อนไข อย่างไรก็ตาม คู่แข่งเหล่านั้นทั้งหมดเป็นระบบออฟไลน์ ผลงานนี้จึงขยายขอบเขตไปในทิศทางที่เป็นไปได้และมีแนวโน้มที่ดี
การอนุมานต้องใช้ NVIDIA H100 สองตัว รวมหน่วยความจำ VRAM 160 GB*
งานวิจัยระบุว่า:
“LiveAnimate รักษาคุณภาพที่รับรู้และอัตลักษณ์ได้เกือบคงที่ตั้งแต่ 30 วินาทีแรกถึง [นาที] สุดท้าย ขณะที่ระบบก่อนหน้าคุณภาพลดลงมากหรือต้องคำนวณออฟไลน์หลายชั่วโมงเพื่อสร้างลำดับเดียวกัน”
“ผลลัพธ์นี้สร้างจุดสมดุลใหม่ระหว่างคุณภาพ ความหน่วง และระยะเวลาสำหรับแอนิเมชันมนุษย์ทั้งตัวแบบโต้ตอบ”
บทความวิจัยใหม่ มีชื่อว่า LiveAnimate: การสตรีมแอนิเมชันมนุษย์แบบยาวอย่างเสถียรในเวลาจริง เขียนโดยผู้วิจัยเก้าคนจาก The Chinese University of Hong Kong, Qwen Applications Business Group ของ Alibaba และ Liblib AI มีเว็บไซต์โครงการพร้อมวิดีโอที่แสดงในบทความนี้ ให้เข้าชมแล้ว ส่วนโค้ดระบุว่า “จะเผยแพร่เร็ว ๆ นี้” และยังไม่ทราบว่าจะเผยแพร่น้ำหนักโมเดลเมื่อใด
วิธีการ
LiveAnimate ใช้การฝึกสองขั้นตอนเพื่อให้ Wan2.2-Animate สร้างวิดีโอได้รวดเร็วและต่อเนื่อง ตามด้วยระบบความจำที่ค้นท่าทางก่อนหน้าที่มีประโยชน์เมื่อสร้างวิดีโอบล็อกใหม่:

ภาพรวมกระบวนการ LiveAnimate ด้านซ้ายคือการฝึกสองขั้นตอน ด้านขวาคือการสร้างแบบสด โดยจับคู่ท่าทางที่เข้ามากับท่าทางเก่าและรวมกับเฟรมล่าสุดเพื่อสร้างบล็อกใหม่ในสามขั้นตอน แหล่งที่มา
Wan2.2-Animate เดิมพิจารณาลำดับวิดีโอทั้งชุด ไม่ได้ออกแบบให้สร้างต่อไปได้ไม่สิ้นสุด ผู้วิจัยจึงแบ่งวิดีโอฝึกเป็นบล็อกต่อเนื่อง โดยใช้บล็อกก่อนหน้าเป็นบริบทและข้อมูลอ้างอิงที่ถูกต้อง เริ่มจากเรียนรู้การต่อวิดีโอจากข้อมูลที่เชื่อถือได้ ก่อนต้องรับมือกับข้อผิดพลาดที่สะสมจากผลลัพธ์ของตัวเอง
อย่าลืมฉัน
ภาพอ้างอิงเดิมถูกเก็บให้เรียกใช้ได้ตลอดผ่าน “Ref Sink” เพื่อย้ำอัตลักษณ์และรูปลักษณ์ของบุคคล เมื่อสร้างบล็อกเสร็จ “Clean KV Update” จะเปลี่ยนข้อมูลจากบล็อกนั้นเป็นบริบทสำหรับบล็อกถัดไป แต่ไม่ได้แก้ข้อผิดพลาดที่เกิดขึ้นแล้ว
การฝึกขั้นแรกยังต้องใช้ ขั้นตอนกำจัดสัญญาณรบกวน 50 ครั้งต่อบล็อก จึงไม่เหมาะกับงานสด ขั้นที่สองจึงกลั่นกระบวนการให้เหลือสามขั้นตอน พร้อม ให้โมเดลเรียนรู้จากประวัติที่ตัวเองสร้างขึ้น เพราะในการใช้งานจริง ช่วงใหม่ทุกช่วงต้องอาศัยผลลัพธ์ก่อนหน้าที่ไม่สมบูรณ์:

การฝึกสองขั้นตอน† เพื่อเตรียม LiveAnimate สำหรับใช้งาน เริ่มจากบล็อกวิดีโอก่อนหน้าที่ถูกต้อง จากนั้นลดการสร้างเหลือสามขั้นตอนพร้อมฝึกจากผลลัพธ์ที่ไม่สมบูรณ์ของโมเดลเอง
การฝึกกับลำดับที่สร้างเองก่อปัญหาใหม่ เพราะการเก็บประวัติการคำนวณของวิดีโอทั้งหมดมีต้นทุนสูงเกินไป จึงให้ระบบทดลองสร้างครบหนึ่งรอบก่อน แล้วกลับมาฝึกทีละบล็อก แต่ละบล็อกจึงรับการปรับปรุงได้ โดยไม่ต้องเก็บสถานะการคำนวณของลำดับทั้งหมดไว้พร้อมกัน.
เมื่อรวมกับการปรับโมเดลด้วย LoRA ก็สามารถกลั่นโมเดล 14 พันล้านพารามิเตอร์บนโหนดเดียวที่มี H100 ขนาด 80 GB จำนวนแปดตัวได้ นี่คือชุดอุปกรณ์สำหรับฝึก ไม่ใช่สำหรับการอนุมานขณะใช้งาน
สร้างต่อไปไม่หยุด
หากจะสร้างต่อเนื่องไม่สิ้นสุด LiveAnimate ต้องเลือกด้วยว่าสิ่งใด ควรค่าแก่ การจดจำ การเก็บ ทุกอย่าง ทำให้ความต้องการประมวลผลเพิ่มจนควบคุมไม่ได้ แต่ถ้าเก็บเฉพาะเฟรมล่าสุดก็อาจทิ้งมุมมองเก่าที่มีประโยชน์
กลไก Pose-Retrieval Sink Attention หรือ PR-Sink แก้ปัญหานี้ด้วยการเก็บบล็อกแรกเป็น Static Sink ถาวร เก็บท่าทางเก่าที่เกี่ยวข้องเป็น Dynamic Sink ที่เปลี่ยนได้ และใช้หน้าต่างเลื่อนสำหรับบล็อกปัจจุบันกับสองบล็อกก่อนหน้า ภาพอ้างอิงยังอยู่แยกใน Ref Sink ขนาดพื้นที่เก็บคงที่ช่วยให้ต้นทุนไม่เพิ่มตามความยาววิดีโอ
การเลือกความจำระหว่างบล็อก
เพื่อเลือกท่าทางเก่าสำหรับความจำที่จำกัดนี้ ViTPose ย่อตำแหน่งร่างกายและมือจากสามเฟรมเป็นตัวแทนขนาดกะทัดรัด คลังความจำเก็บท่าตัวแทนห้าท่า โดยคัดเลือกใน 20 บล็อกแรกและเน้นความหลากหลายมากกว่าท่าที่เกือบซ้ำกัน
ขณะสร้าง ระบบเทียบท่าที่เข้ามากับตัวแทนเหล่านี้แล้วดึงท่าที่ใกล้เคียงที่สุด เพื่อดูว่าบุคคลเคยมีรูปลักษณ์อย่างไรในท่าคล้ายกัน แต่บล็อกที่อยู่ก่อนหน้าทันทีจะถูก ตัดออกจากการค้น เพราะมีอยู่แล้วในหน้าต่างเลื่อน จึงเปิดให้ Dynamic Sink ค้นข้อมูลที่เก่ากว่านั้น
สุดท้าย ระบบรันถูกปรับความเร็วโดยแบ่งการประมวลผลแอตเทนชันระหว่าง H100 สองตัว ทำการสื่อสารทับซ้อนกับการคำนวณ และใช้ข้อมูลแคชซ้ำเมื่อทำได้
ข้อมูลและการทดสอบ
LiveAnimate ฝึกด้วยวิดีโอพูด 40,000 คลิปจาก AVSpeech และวิดีโอการเคลื่อนไหวมนุษย์ 20,000 คลิปจาก ชุดข้อมูล TikTok และ HumanVid การฝึกและการอนุมานรองรับความละเอียด 480×480, 384×672 และ 672×384 พิกเซล
การฝึกเริ่มจากเช็กพอยต์ Wan2.2-Animate-14B ใช้ LoRA rank 128 บน NVIDIA H100 แปดตัว โดยฝึกขั้นแรก 10,000 สเต็ปและขั้นที่สอง 20,000 สเต็ป
วิดีโอสร้างเป็นบล็อกละสามเฟรมแฝง ซึ่งเป็นตัวแทนข้อมูลภายในที่บีบอัดของโมเดล และเท่ากับ 12 เฟรม RGB การอนุมานใช้ H100 สองตัว
การประเมินเปรียบเทียบกับวิธีแอนิเมชันมนุษย์ที่ขับเคลื่อนด้วยท่าทางทั้งลำดับสั้นและยาว โดยใช้ภาพอ้างอิงและท่าขับเคลื่อนภายใต้เงื่อนไขเดียวกัน การทดสอบแบบยาวสร้างต่อเนื่องสามนาทีเพื่อตรวจสอบคุณภาพและอัตลักษณ์ตามเวลา
ระบบที่เปรียบเทียบได้แก่ EverAnimate, One-to-All, SCAIL††, UniAnimate-DiT และ Wan2.2-Animate
ตัวชี้วัดครอบคลุมคุณภาพภาพ ความสม่ำเสมอของอัตลักษณ์ คุณภาพเชิงการกระจาย และข้อผิดพลาดของการแทนข้อมูลตามเวลา โดย คะแนนความสวยงาม (ASE) และ การประเมินคุณภาพภาพแบบไม่ใช้ภาพอ้างอิง (IQA) วัดคุณภาพระดับเฟรม ส่วนความคล้ายคลึงของ DINO (DINO-S) วัดความสม่ำเสมอของรูปลักษณ์เทียบกับบุคคลอ้างอิง Fréchet Inception Distance (FID) วัดคุณภาพเชิงการกระจาย และ ระยะห่างคุณลักษณะ VideoMAE (V-MAE) วัดว่าวิดีโอรักษาการเคลื่อนไหวตามเวลาได้ดีเพียงใด:

ผลทดสอบคุณภาพและอัตลักษณ์ตลอดการสร้างสามนาที LiveAnimate ค่อนข้างเสถียรในทั้งห้าตัวชี้วัด ขณะที่คู่แข่งหลายระบบเสื่อมลงตามเวลา IQA, ASE และ DINO-S ยิ่งสูงยิ่งดี ส่วน FID และ V-MAE ยิ่งต่ำยิ่งดี
กราฟผลช่วงแรกแสดงว่า LiveAnimate ได้ ASE 2.823 และ IQA 4.047 สูงที่สุดใน 30 วินาทีแรก ผู้วิจัยมองว่านี่แสดงถึงการรักษาคุณภาพที่รับรู้ได้แม้กลั่นเหลือสามขั้นตอนและลดงบการอนุมาน
ที่สำคัญกว่าคือคุณภาพลดลงเพียงเล็กน้อยตลอดสามนาที โดยคะแนนคุณภาพภาพและความสม่ำเสมอของอัตลักษณ์แทบไม่เปลี่ยน
ในทางกลับกัน One-to-All เสื่อมลงมาก ทั้งคุณภาพภาพและอัตลักษณ์ลดลง ขณะที่ข้อผิดพลาดเชิงการกระจายเพิ่มขึ้น Wan2.2-Animate รุ่นฐานก็สูญเสียความสม่ำเสมอของอัตลักษณ์บางส่วน
ผู้วิจัยระบุว่า:
“แนวโน้มเหล่านี้สนับสนุนข้อเสนอหลักของเราว่าการจัดการบริบทระยะยาวอย่างชัดเจนมีความสำคัญต่อแอนิเมชันแบบสตรีม”
มีการทดสอบประสิทธิภาพเมื่อเพิ่ม GPU ด้วย H100 หนึ่งตัวได้ 12.41 FPS สองตัวได้ 19.63 FPS และสี่ตัวได้ 22.13 FPS ผลดีจากการเพิ่มจำนวนถูกจำกัดมากขึ้นด้วยภาระการสื่อสาร จึงเลือกสองตัวเป็นรูปแบบที่เหมาะสม:

ประสิทธิภาพของ H100 หนึ่ง สอง และสี่ตัวที่ความละเอียด 480×480 โดยเปรียบเทียบความหน่วง อัตราเฟรม อัตราเร่ง และประสิทธิภาพ สองตัวได้ 19.63 FPS ส่วนสี่ตัวเพิ่มเพียงเล็กน้อยเป็น 22.13 FPS
ที่ 19.63 FPS ระบบสร้างบล็อก 12 เฟรมใน 0.611 วินาที ขณะที่คู่แข่งใช้ประมาณ 2–5 ชั่วโมงเพื่อสร้างวิดีโอสามนาทีเดียวกัน
การเปรียบเทียบเชิงคุณภาพให้ผลสอดคล้องกัน ในตัวอย่างทั้งตัวด้านล่าง One-to-All เสื่อมลงรุนแรง UniAnimate-DiT และ SCAIL มีภาพกะพริบ ส่วน Wan-Animate และ EverAnimate มีสีหรือพื้นหลังเปลี่ยนไปในช่วงหลัง:

ผลเปรียบเทียบแอนิเมชันทั้งตัวตลอดสามนาที เก็บเฟรมทุก 20 วินาที โดยเครื่องหมายสีแดงชี้การเสื่อมระยะยาวของคู่แข่ง ระบบฐานใช้ประมาณ 2–5 ชั่วโมง ส่วน LiveAnimate ใช้ประมาณสี่นาที โปรดดูบทความวิจัยเพื่อรับชมความละเอียดที่สูงขึ้น
LiveAnimate รักษารูปลักษณ์ของบุคคลและฉากโดยรอบตลอดสามนาที ในการทดสอบช่วงบนที่ง่ายกว่าด้านล่าง EverAnimate และ LiveAnimate มีความเสถียรระยะยาวใกล้เคียงกัน แต่มีเพียง LiveAnimate ที่สร้างได้แบบเรียลไทม์:

ผลเปรียบเทียบแอนิเมชันช่วงบนสามนาที เฟรมที่เก็บทุก 20 วินาทีแสดงว่า LiveAnimate รักษาอัตลักษณ์ เสื้อผ้า และพื้นหลังมืดได้สม่ำเสมอกว่าวิธีคู่แข่ง
ผู้วิจัยสรุปว่า:
“ในการทดสอบสามนาที LiveAnimate รักษาคุณภาพที่รับรู้และอัตลักษณ์ได้เกือบคงที่ที่ 19.63 FPS บน H100 สองตัว โดยหน่วยความจำและความหน่วงไม่ขึ้นกับความยาวสตรีม ขณะที่ระบบออฟไลน์เสื่อมลงอย่างเห็นได้ชัดหรือใช้เวลาคำนวณหลายชั่วโมง”
“ผลลัพธ์นี้ทำให้โมเดลแพร่กระจายวิดีโอระดับพันล้านพารามิเตอร์เข้าใกล้การใช้งานแบบโต้ตอบ เช่น ไลฟ์สตรีม การปรากฏตัวทางไกล และอวตารเสมือน”
บทสรุป
เป็นเรื่องน่ายินดีที่เฟรมเวิร์กสร้างวิดีโอตามอินพุตการเคลื่อนไหวใช้แนวทางใหม่กับปัญหาความจำและอัตลักษณ์ที่เรื้อรังในวิดีโอสร้างด้วย AI ปัจจุบันมีหลายระบบที่อ้างอิงภาพคงที่จากผู้ใช้ได้โดยไม่ต้องแปะภาพอ้างอิงลงในเนื้อหาหลักของการสร้างวิดีโอจากภาพ
อย่างไรก็ตาม วิธีนี้แก้ได้เพียงบางปัญหาของการสร้างคลิปเดียว เช่น การรักษาอัตลักษณ์ เสื้อผ้า และทรงผมของคนที่กลับเข้าฉากหรือถูกบังชั่วคราวแล้วปรากฏอีกครั้ง จนถึงตอนนี้มีเพียงแนวทาง LoRA ที่ใช้ทรัพยากรหนักและ มีผลเพียงชั่วคราวอย่างน่าหงุดหงิด ที่คืบหน้าได้บ้าง แต่ก็ยังจำกัดและไม่ถาวร
สำหรับวิดีโอและการเปลี่ยนแปลงด้วย AI ทั้งหมดในปัจจุบัน การพัฒนาความจำต่อเนื่องที่ มีประสิทธิภาพ เป็นโจทย์สำคัญระดับชี้ชะตา ซึ่งอาจแยกการมาถึงของ AGI ออกจากฤดูหนาว AI ครั้งที่สาม
* นี่เป็นข้อเสียที่ใช้หักล้างได้อีกหรือไม่? แนวคิดปัจจุบันคือโมเดลเฉพาะทางขนาดเล็กอาจทำงานในเครื่องโดยไม่เสียค่าเช่า ขณะที่งานหนักใช้ตลาดเช่า GPU ที่แข่งขันกันและหวังว่าจะกระจายอยู่ในผู้ให้บริการหลายราย สมมติฐานคือบริษัทแนวหน้าไม่สามารถใช้แนวทาง EEE กำจัดคู่แข่ง และยังมีทรัพยากร GPU จำนวนมากให้เข้าถึงได้ ด้วยเหตุนี้ ผู้เขียนจึงไม่มองความต้องการ GPU สูงมากเป็นข้อด้อยอีกต่อไป แต่หวังว่าการเข้าถึงจะทั่วถึงขึ้น และการปรับแต่งภายหลังจะลดทรัพยากรที่ต้องใช้ในตอนแรก
† สร้างด้วย AI และตรวจสอบโดยผู้เขียน
†† การทดสอบวิดีโอยาวขยาย SCAIL และ UniAnimate-DiT ด้วยวิธีหน้าต่างเลื่อนแบบไม่ต้องฝึกเพิ่มเดียวกัน เพราะทั้งสองไม่รองรับการสร้างแบบยาวโดยตรง ส่วน EverAnimate และ One-to-All ใช้วิธีสร้างวิดีโอยาวของตนเอง เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 13 สิงหาคม 2026












