มุมมองของ Anderson

สู่การสร้างวิดีโอ Deepfake แบบ Full-Body ที่มีความสมจริงและเสถียร

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

ในสาขาที่ต้องอาศัยความอดทน ระบบใหม่นี้พาเราเข้าใกล้การจำลองมนุษย์ผ่านไลฟ์สตรีมอีกขั้น โดยไม่ต้องรอการเรนเดอร์ที่ชวนหงุดหงิด

เทคโนโลยีจำลองมนุษย์ทั้งตัวพัฒนาไปมากนับตั้งแต่ความเป็นไปได้ของดีปเฟกทั้งตัว ปรากฏครั้งแรก ในปี 2022 ปัจจุบันเราคุ้นเคยกับความสามารถอันทรงพลังและ มักก่อให้เกิดข้อถกเถียง ของระบบโอเพนซอร์สอย่าง Wan-Animate และระบบปิดอย่าง Grok ที่เปลี่ยนภาพเดียวหรือ หลายภาพ ให้เป็นการแสดงในวิดีโอที่ต่อเนื่องสอดคล้องกัน และมักเปลี่ยนแปลงรูปลักษณ์จากต้นฉบับได้มาก:

คลิกเพื่อเล่นหากจำเป็น: ตัวอย่างการแทนที่บุคคลด้วย WanAnimate-2.2 โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น  แหล่งที่มา 

นอกจากนี้ เฟรมเวิร์กดีปเฟกใบหน้าแบบสดรุ่นเก่าที่ใช้ ออโตเอนโคเดอร์อย่าง DeepFaceLive ก็ถูกเฟรมเวิร์กที่ซับซ้อนกว่าอย่าง Deep-Live-Cam แซงหน้าไปแล้ว ระบบนี้ประสานการทำงานของ LivePortrait รุ่นต่าง ๆ ร่วมกับโมดูลเดิมอย่าง GAN และ InsightFace เพื่อเป็นผู้สืบทอดแบบเรียลไทม์ที่มีประสิทธิภาพของ DFLive ซึ่งปัจจุบันเลิกพัฒนาแล้ว:

คลิกเพื่อเล่น: ตัวอย่างการปลอมใบหน้าเป็นอีลอน มัสก์ในวิดีโอสดด้วย Deep-Live-Cam โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น แหล่งที่มา 

แม้เฟรมเวิร์กอย่าง Deep-Live-Cam จะทำงานและสร้างภาพปลอมต่อเนื่องได้ และสร้างใบหน้าในมุมที่ยากได้ ดีกว่าแต่ก่อน แต่ความละเอียดและขอบเขตความสามารถยังจำกัด ระบบสร้างใบหน้าหรืออัตลักษณ์เฉพาะ พร้อมสีหน้าที่น่าเชื่อถือและการขยับปากตรงเสียงได้ ทว่าหลัก ๆ ยังเป็นเครื่องมือที่เชี่ยวชาญงานเฉพาะอย่าง

รอสักครู่…

ระบบ AI เลียนแบบมนุษย์ส่วนใหญ่ในปัจจุบันก็มีข้อจำกัดหรือความเชี่ยวชาญเฉพาะทางคล้ายกัน ข้อจำกัดที่เกิดซ้ำคือระบบที่ทำได้ดีที่สุดมักเป็นแบบ ออฟไลน์ กล่าวคือ ใช้ทรัพยากรมากเกินกว่าจะทำงานเรียลไทม์ จึงต้องคำนวณก่อนแล้วค่อยแสดงผลให้ผู้ใช้ภายหลัง

ระบบเช่นนี้ย่อมไม่เหมาะกับการแปลงรูปลักษณ์ด้วย AI แบบสด เช่น การถ่ายทอดการเคลื่อนไหวทั้งตัวขณะเต้นในไลฟ์สตรีม

ตัวอย่างช่วงหลังคือระบบที่เปิดเผยน้ำหนักโมเดล Wan2.2. Animate ซึ่งได้รับความนิยมในชุมชนผู้ใช้ทั่วไปและผู้ให้บริการต่อยอดเชิงอาชีพ แต่ยังคงต้อง “สั่งสร้างแล้วรอ”:

คลิกเพื่อเล่น : ตัวอย่างความสามารถของ Wan2.2-Animate จากปี 2025 หากคุณอดใจรอได้เล็กน้อย โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น แหล่งที่มา 

สถานการณ์ตอนนี้จึงเป็นการเลือกสองอย่างจากสามอย่าง ได้แก่ คุณภาพสูง ความอเนกประสงค์ และผลลัพธ์ที่ได้ทันที

LiveAnimate

ท่ามกลางภาวะติดขัดนี้ งานใหม่จากจีนเปลี่ยน Wan2.2 Animate ให้เป็นเฟรมเวิร์กแอนิเมชันที่ขับเคลื่อนด้วยอินพุตสด ทำงานได้ใกล้ 20 เฟรมต่อวินาที และให้ผลน่าประทับใจในหลายสถานการณ์:

คลิกเพื่อเล่น: ตัวอย่างจากเว็บไซต์โครงการแสดงการถ่ายทอดท่าทางในฉากเต้นบนเวที ฉากกลางแจ้งที่เห็นทั้งตัว และภาพบุคคลระยะใกล้ โดยจำลองการเคลื่อนไหวของร่างกาย มือ และใบหน้า. โปรดดูต้นทางเพื่อรับชมความละเอียดที่สูงขึ้น แหล่งที่มา 

งานใหม่นี้เพิ่มความสามารถแบบสดให้ระบบเดิมด้วยการเปลี่ยน วิธี สร้างวิดีโอ แทนที่จะประมวลผลเฟรมก่อนหน้าและอนาคตพร้อมกัน LiveAnimate สร้างช่วงใหม่ตามการเคลื่อนไหวที่เกิดขึ้น โดยใช้เพียงไม่กี่ขั้นตอน และ เก็บท่าทางก่อนหน้าที่คัดเลือกไว้เพื่อรักษารูปลักษณ์ของบุคคลตลอดเซสชันที่ยาวนาน.

เฟรมก่อนหน้าจึงทำหน้าที่เป็นความจำต่อเนื่องให้เรียกใช้ขณะวิดีโอพัฒนา เพื่อรักษาอัตลักษณ์ไว้ คล้ายกับระบบ CGI แบบดั้งเดิมที่อ้างอิงแผนที่พื้นผิว

แม้จะใช้ LoRA ในขั้นตอนประมวลผล แต่ LiveAnimate ไม่ใช่เพียงระบบ LoRA อีกตัวหนึ่ง ยังมีการสร้างแบบสตรีม ความจำและแคชท่าทาง การอนุมานสามขั้นตอน และการปรับแต่ง GPU รวมถึงเทคนิคอื่นหลายอย่าง ซึ่งบางอย่างเก่ากว่าที่คาด

ระบบรองรับทั้งการขับเคลื่อนร่างกายเต็มตัวตามตัวอย่างข้างต้น และการเคลื่อนไหวช่วงบน เช่น ในการสัมภาษณ์:

คลิกเพื่อเล่น : “การเคลื่อนไหวเล็กน้อยของศีรษะและมือ โดยมีฉากสำนักงานอยู่นิ่ง”

เพื่ออธิบายข้อจำกัดอย่างเป็นธรรม งานวิจัยยอมรับว่าคู่แข่งสองระบบรักษาอัตลักษณ์ได้ดีกว่า LiveAnimate เล็กน้อยในบางเงื่อนไข อย่างไรก็ตาม คู่แข่งเหล่านั้นทั้งหมดเป็นระบบออฟไลน์ ผลงานนี้จึงขยายขอบเขตไปในทิศทางที่เป็นไปได้และมีแนวโน้มที่ดี

การอนุมานต้องใช้ NVIDIA H100 สองตัว รวมหน่วยความจำ VRAM 160 GB*

งานวิจัยระบุว่า:

“LiveAnimate รักษาคุณภาพที่รับรู้และอัตลักษณ์ได้เกือบคงที่ตั้งแต่ 30 วินาทีแรกถึง [นาที] สุดท้าย ขณะที่ระบบก่อนหน้าคุณภาพลดลงมากหรือต้องคำนวณออฟไลน์หลายชั่วโมงเพื่อสร้างลำดับเดียวกัน”

“ผลลัพธ์นี้สร้างจุดสมดุลใหม่ระหว่างคุณภาพ ความหน่วง และระยะเวลาสำหรับแอนิเมชันมนุษย์ทั้งตัวแบบโต้ตอบ”

บทความวิจัยใหม่ มีชื่อว่า LiveAnimate: การสตรีมแอนิเมชันมนุษย์แบบยาวอย่างเสถียรในเวลาจริง เขียนโดยผู้วิจัยเก้าคนจาก The Chinese University of Hong Kong, Qwen Applications Business Group ของ Alibaba และ Liblib AI มีเว็บไซต์โครงการพร้อมวิดีโอที่แสดงในบทความนี้ ให้เข้าชมแล้ว ส่วนโค้ดระบุว่า “จะเผยแพร่เร็ว ๆ นี้” และยังไม่ทราบว่าจะเผยแพร่น้ำหนักโมเดลเมื่อใด

วิธีการ

LiveAnimate ใช้การฝึกสองขั้นตอนเพื่อให้ Wan2.2-Animate สร้างวิดีโอได้รวดเร็วและต่อเนื่อง ตามด้วยระบบความจำที่ค้นท่าทางก่อนหน้าที่มีประโยชน์เมื่อสร้างวิดีโอบล็อกใหม่:

An overview of the LiveAnimate pipeline, showing its two-stage training process on the left and live generation on the right, where incoming poses are matched against stored earlier poses and combined with recent frames to generate each new block of video in three steps. Source - https://arxiv.org/pdf/2608.11745

ภาพรวมกระบวนการ LiveAnimate ด้านซ้ายคือการฝึกสองขั้นตอน ด้านขวาคือการสร้างแบบสด โดยจับคู่ท่าทางที่เข้ามากับท่าทางเก่าและรวมกับเฟรมล่าสุดเพื่อสร้างบล็อกใหม่ในสามขั้นตอน แหล่งที่มา 

Wan2.2-Animate เดิมพิจารณาลำดับวิดีโอทั้งชุด ไม่ได้ออกแบบให้สร้างต่อไปได้ไม่สิ้นสุด ผู้วิจัยจึงแบ่งวิดีโอฝึกเป็นบล็อกต่อเนื่อง โดยใช้บล็อกก่อนหน้าเป็นบริบทและข้อมูลอ้างอิงที่ถูกต้อง เริ่มจากเรียนรู้การต่อวิดีโอจากข้อมูลที่เชื่อถือได้ ก่อนต้องรับมือกับข้อผิดพลาดที่สะสมจากผลลัพธ์ของตัวเอง

อย่าลืมฉัน

ภาพอ้างอิงเดิมถูกเก็บให้เรียกใช้ได้ตลอดผ่าน “Ref Sink” เพื่อย้ำอัตลักษณ์และรูปลักษณ์ของบุคคล เมื่อสร้างบล็อกเสร็จ “Clean KV Update” จะเปลี่ยนข้อมูลจากบล็อกนั้นเป็นบริบทสำหรับบล็อกถัดไป แต่ไม่ได้แก้ข้อผิดพลาดที่เกิดขึ้นแล้ว

การฝึกขั้นแรกยังต้องใช้ ขั้นตอนกำจัดสัญญาณรบกวน 50 ครั้งต่อบล็อก จึงไม่เหมาะกับงานสด ขั้นที่สองจึงกลั่นกระบวนการให้เหลือสามขั้นตอน พร้อม ให้โมเดลเรียนรู้จากประวัติที่ตัวเองสร้างขึ้น เพราะในการใช้งานจริง ช่วงใหม่ทุกช่วงต้องอาศัยผลลัพธ์ก่อนหน้าที่ไม่สมบูรณ์:

The two training stages† used to prepare LiveAnimate for deployment, first learning from clean previous video blocks – then reducing generation to three steps, while training on the model's own imperfect output.

การฝึกสองขั้นตอน† เพื่อเตรียม LiveAnimate สำหรับใช้งาน เริ่มจากบล็อกวิดีโอก่อนหน้าที่ถูกต้อง จากนั้นลดการสร้างเหลือสามขั้นตอนพร้อมฝึกจากผลลัพธ์ที่ไม่สมบูรณ์ของโมเดลเอง

การฝึกกับลำดับที่สร้างเองก่อปัญหาใหม่ เพราะการเก็บประวัติการคำนวณของวิดีโอทั้งหมดมีต้นทุนสูงเกินไป จึงให้ระบบทดลองสร้างครบหนึ่งรอบก่อน แล้วกลับมาฝึกทีละบล็อก แต่ละบล็อกจึงรับการปรับปรุงได้ โดยไม่ต้องเก็บสถานะการคำนวณของลำดับทั้งหมดไว้พร้อมกัน.

เมื่อรวมกับการปรับโมเดลด้วย LoRA ก็สามารถกลั่นโมเดล 14 พันล้านพารามิเตอร์บนโหนดเดียวที่มี H100 ขนาด 80 GB จำนวนแปดตัวได้ นี่คือชุดอุปกรณ์สำหรับฝึก ไม่ใช่สำหรับการอนุมานขณะใช้งาน

สร้างต่อไปไม่หยุด

หากจะสร้างต่อเนื่องไม่สิ้นสุด LiveAnimate ต้องเลือกด้วยว่าสิ่งใด ควรค่าแก่ การจดจำ การเก็บ ทุกอย่าง ทำให้ความต้องการประมวลผลเพิ่มจนควบคุมไม่ได้ แต่ถ้าเก็บเฉพาะเฟรมล่าสุดก็อาจทิ้งมุมมองเก่าที่มีประโยชน์

กลไก Pose-Retrieval Sink Attention หรือ PR-Sink แก้ปัญหานี้ด้วยการเก็บบล็อกแรกเป็น Static Sink ถาวร เก็บท่าทางเก่าที่เกี่ยวข้องเป็น Dynamic Sink ที่เปลี่ยนได้ และใช้หน้าต่างเลื่อนสำหรับบล็อกปัจจุบันกับสองบล็อกก่อนหน้า ภาพอ้างอิงยังอยู่แยกใน Ref Sink ขนาดพื้นที่เก็บคงที่ช่วยให้ต้นทุนไม่เพิ่มตามความยาววิดีโอ

การเลือกความจำระหว่างบล็อก

เพื่อเลือกท่าทางเก่าสำหรับความจำที่จำกัดนี้ ViTPose ย่อตำแหน่งร่างกายและมือจากสามเฟรมเป็นตัวแทนขนาดกะทัดรัด คลังความจำเก็บท่าตัวแทนห้าท่า โดยคัดเลือกใน 20 บล็อกแรกและเน้นความหลากหลายมากกว่าท่าที่เกือบซ้ำกัน

ขณะสร้าง ระบบเทียบท่าที่เข้ามากับตัวแทนเหล่านี้แล้วดึงท่าที่ใกล้เคียงที่สุด เพื่อดูว่าบุคคลเคยมีรูปลักษณ์อย่างไรในท่าคล้ายกัน แต่บล็อกที่อยู่ก่อนหน้าทันทีจะถูก ตัดออกจากการค้น เพราะมีอยู่แล้วในหน้าต่างเลื่อน จึงเปิดให้ Dynamic Sink ค้นข้อมูลที่เก่ากว่านั้น

สุดท้าย ระบบรันถูกปรับความเร็วโดยแบ่งการประมวลผลแอตเทนชันระหว่าง H100 สองตัว ทำการสื่อสารทับซ้อนกับการคำนวณ และใช้ข้อมูลแคชซ้ำเมื่อทำได้

ข้อมูลและการทดสอบ

LiveAnimate ฝึกด้วยวิดีโอพูด 40,000 คลิปจาก AVSpeech และวิดีโอการเคลื่อนไหวมนุษย์ 20,000 คลิปจาก ชุดข้อมูล TikTok และ HumanVid การฝึกและการอนุมานรองรับความละเอียด 480×480, 384×672 และ 672×384 พิกเซล

การฝึกเริ่มจากเช็กพอยต์ Wan2.2-Animate-14B ใช้ LoRA rank 128 บน NVIDIA H100 แปดตัว โดยฝึกขั้นแรก 10,000 สเต็ปและขั้นที่สอง 20,000 สเต็ป

วิดีโอสร้างเป็นบล็อกละสามเฟรมแฝง ซึ่งเป็นตัวแทนข้อมูลภายในที่บีบอัดของโมเดล และเท่ากับ 12 เฟรม RGB การอนุมานใช้ H100 สองตัว

การประเมินเปรียบเทียบกับวิธีแอนิเมชันมนุษย์ที่ขับเคลื่อนด้วยท่าทางทั้งลำดับสั้นและยาว โดยใช้ภาพอ้างอิงและท่าขับเคลื่อนภายใต้เงื่อนไขเดียวกัน การทดสอบแบบยาวสร้างต่อเนื่องสามนาทีเพื่อตรวจสอบคุณภาพและอัตลักษณ์ตามเวลา

ระบบที่เปรียบเทียบได้แก่ EverAnimate, One-to-All, SCAIL††, UniAnimate-DiT และ Wan2.2-Animate

ตัวชี้วัดครอบคลุมคุณภาพภาพ ความสม่ำเสมอของอัตลักษณ์ คุณภาพเชิงการกระจาย และข้อผิดพลาดของการแทนข้อมูลตามเวลา โดย คะแนนความสวยงาม (ASE) และ การประเมินคุณภาพภาพแบบไม่ใช้ภาพอ้างอิง (IQA) วัดคุณภาพระดับเฟรม ส่วนความคล้ายคลึงของ DINO (DINO-S) วัดความสม่ำเสมอของรูปลักษณ์เทียบกับบุคคลอ้างอิง Fréchet Inception Distance (FID) วัดคุณภาพเชิงการกระจาย และ ระยะห่างคุณลักษณะ VideoMAE (V-MAE) วัดว่าวิดีโอรักษาการเคลื่อนไหวตามเวลาได้ดีเพียงใด:

Test results pertaining to quality and identity across three minutes of continuous generation, with LiveAnimate remaining comparatively stable across all five metrics as the sequence progresses. Several competing methods show greater degradation over time. Higher readings are better for IQA, ASE, and DINO-S, with lower readings better for FID and V-MAE.

ผลทดสอบคุณภาพและอัตลักษณ์ตลอดการสร้างสามนาที LiveAnimate ค่อนข้างเสถียรในทั้งห้าตัวชี้วัด ขณะที่คู่แข่งหลายระบบเสื่อมลงตามเวลา IQA, ASE และ DINO-S ยิ่งสูงยิ่งดี ส่วน FID และ V-MAE ยิ่งต่ำยิ่งดี

กราฟผลช่วงแรกแสดงว่า LiveAnimate ได้ ASE 2.823 และ IQA 4.047 สูงที่สุดใน 30 วินาทีแรก ผู้วิจัยมองว่านี่แสดงถึงการรักษาคุณภาพที่รับรู้ได้แม้กลั่นเหลือสามขั้นตอนและลดงบการอนุมาน

ที่สำคัญกว่าคือคุณภาพลดลงเพียงเล็กน้อยตลอดสามนาที โดยคะแนนคุณภาพภาพและความสม่ำเสมอของอัตลักษณ์แทบไม่เปลี่ยน

ในทางกลับกัน One-to-All เสื่อมลงมาก ทั้งคุณภาพภาพและอัตลักษณ์ลดลง ขณะที่ข้อผิดพลาดเชิงการกระจายเพิ่มขึ้น Wan2.2-Animate รุ่นฐานก็สูญเสียความสม่ำเสมอของอัตลักษณ์บางส่วน

ผู้วิจัยระบุว่า:

“แนวโน้มเหล่านี้สนับสนุนข้อเสนอหลักของเราว่าการจัดการบริบทระยะยาวอย่างชัดเจนมีความสำคัญต่อแอนิเมชันแบบสตรีม”

มีการทดสอบประสิทธิภาพเมื่อเพิ่ม GPU ด้วย H100 หนึ่งตัวได้ 12.41 FPS สองตัวได้ 19.63 FPS และสี่ตัวได้ 22.13 FPS ผลดีจากการเพิ่มจำนวนถูกจำกัดมากขึ้นด้วยภาระการสื่อสาร จึงเลือกสองตัวเป็นรูปแบบที่เหมาะสม:

Scaling efficiency across one, two and four H100 GPUs at 480×480 resolution, showing latency, frame rate, speedup and efficiency. Two GPUs achieved 19.63 FPS, while further scaling to four produced only a modest increase to 22.13 FPS.

ประสิทธิภาพของ H100 หนึ่ง สอง และสี่ตัวที่ความละเอียด 480×480 โดยเปรียบเทียบความหน่วง อัตราเฟรม อัตราเร่ง และประสิทธิภาพ สองตัวได้ 19.63 FPS ส่วนสี่ตัวเพิ่มเพียงเล็กน้อยเป็น 22.13 FPS

ที่ 19.63 FPS ระบบสร้างบล็อก 12 เฟรมใน 0.611 วินาที ขณะที่คู่แข่งใช้ประมาณ 2–5 ชั่วโมงเพื่อสร้างวิดีโอสามนาทีเดียวกัน

การเปรียบเทียบเชิงคุณภาพให้ผลสอดคล้องกัน ในตัวอย่างทั้งตัวด้านล่าง One-to-All เสื่อมลงรุนแรง UniAnimate-DiT และ SCAIL มีภาพกะพริบ ส่วน Wan-Animate และ EverAnimate มีสีหรือพื้นหลังเปลี่ยนไปในช่วงหลัง:

Test results comparing full-body animation over three minutes. Frames were sampled every 20 seconds, with red annotations highlighting long-term deterioration in competing methods. The baselines required approximately 2–5 hours to generate the sequence, compared with approximately four minutes for LiveAnimate.

ผลเปรียบเทียบแอนิเมชันทั้งตัวตลอดสามนาที เก็บเฟรมทุก 20 วินาที โดยเครื่องหมายสีแดงชี้การเสื่อมระยะยาวของคู่แข่ง ระบบฐานใช้ประมาณ 2–5 ชั่วโมง ส่วน LiveAnimate ใช้ประมาณสี่นาที โปรดดูบทความวิจัยเพื่อรับชมความละเอียดที่สูงขึ้น

LiveAnimate รักษารูปลักษณ์ของบุคคลและฉากโดยรอบตลอดสามนาที ในการทดสอบช่วงบนที่ง่ายกว่าด้านล่าง EverAnimate และ LiveAnimate มีความเสถียรระยะยาวใกล้เคียงกัน แต่มีเพียง LiveAnimate ที่สร้างได้แบบเรียลไทม์:

Test results comparing upper-body animation over three minutes. Frames sampled every 20 seconds show LiveAnimate maintaining the subject’s identity, clothing and dark background more consistently than the competing methods.

ผลเปรียบเทียบแอนิเมชันช่วงบนสามนาที เฟรมที่เก็บทุก 20 วินาทีแสดงว่า LiveAnimate รักษาอัตลักษณ์ เสื้อผ้า และพื้นหลังมืดได้สม่ำเสมอกว่าวิธีคู่แข่ง

ผู้วิจัยสรุปว่า:

“ในการทดสอบสามนาที LiveAnimate รักษาคุณภาพที่รับรู้และอัตลักษณ์ได้เกือบคงที่ที่ 19.63 FPS บน H100 สองตัว โดยหน่วยความจำและความหน่วงไม่ขึ้นกับความยาวสตรีม ขณะที่ระบบออฟไลน์เสื่อมลงอย่างเห็นได้ชัดหรือใช้เวลาคำนวณหลายชั่วโมง”

“ผลลัพธ์นี้ทำให้โมเดลแพร่กระจายวิดีโอระดับพันล้านพารามิเตอร์เข้าใกล้การใช้งานแบบโต้ตอบ เช่น ไลฟ์สตรีม การปรากฏตัวทางไกล และอวตารเสมือน”

บทสรุป

เป็นเรื่องน่ายินดีที่เฟรมเวิร์กสร้างวิดีโอตามอินพุตการเคลื่อนไหวใช้แนวทางใหม่กับปัญหาความจำและอัตลักษณ์ที่เรื้อรังในวิดีโอสร้างด้วย AI ปัจจุบันมีหลายระบบที่อ้างอิงภาพคงที่จากผู้ใช้ได้โดยไม่ต้องแปะภาพอ้างอิงลงในเนื้อหาหลักของการสร้างวิดีโอจากภาพ

อย่างไรก็ตาม วิธีนี้แก้ได้เพียงบางปัญหาของการสร้างคลิปเดียว เช่น การรักษาอัตลักษณ์ เสื้อผ้า และทรงผมของคนที่กลับเข้าฉากหรือถูกบังชั่วคราวแล้วปรากฏอีกครั้ง จนถึงตอนนี้มีเพียงแนวทาง LoRA ที่ใช้ทรัพยากรหนักและ มีผลเพียงชั่วคราวอย่างน่าหงุดหงิด ที่คืบหน้าได้บ้าง แต่ก็ยังจำกัดและไม่ถาวร

สำหรับวิดีโอและการเปลี่ยนแปลงด้วย AI ทั้งหมดในปัจจุบัน การพัฒนาความจำต่อเนื่องที่ มีประสิทธิภาพ เป็นโจทย์สำคัญระดับชี้ชะตา ซึ่งอาจแยกการมาถึงของ AGI ออกจากฤดูหนาว AI ครั้งที่สาม

*  นี่เป็นข้อเสียที่ใช้หักล้างได้อีกหรือไม่? แนวคิดปัจจุบันคือโมเดลเฉพาะทางขนาดเล็กอาจทำงานในเครื่องโดยไม่เสียค่าเช่า ขณะที่งานหนักใช้ตลาดเช่า GPU ที่แข่งขันกันและหวังว่าจะกระจายอยู่ในผู้ให้บริการหลายราย สมมติฐานคือบริษัทแนวหน้าไม่สามารถใช้แนวทาง EEE กำจัดคู่แข่ง และยังมีทรัพยากร GPU จำนวนมากให้เข้าถึงได้ ด้วยเหตุนี้ ผู้เขียนจึงไม่มองความต้องการ GPU สูงมากเป็นข้อด้อยอีกต่อไป แต่หวังว่าการเข้าถึงจะทั่วถึงขึ้น และการปรับแต่งภายหลังจะลดทรัพยากรที่ต้องใช้ในตอนแรก

† สร้างด้วย AI และตรวจสอบโดยผู้เขียน

†† การทดสอบวิดีโอยาวขยาย SCAIL และ UniAnimate-DiT ด้วยวิธีหน้าต่างเลื่อนแบบไม่ต้องฝึกเพิ่มเดียวกัน เพราะทั้งสองไม่รองรับการสร้างแบบยาวโดยตรง ส่วน EverAnimate และ One-to-All ใช้วิธีสร้างวิดีโอยาวของตนเอง เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 13 สิงหาคม 2026

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai