มุมมองของ Anderson

เจนเนอร์เรทีฟ AI วิดีโอที่ดีขึ้นโดยการเรียงลำดับเฟรมระหว่างการฝึกอบรม

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Adobe Firefly, various prompts and edits.

บทความใหม่ที่เผยแพร่เมื่อสัปดาห์ที่แล้วบน Arxiv ได้กล่าวถึงปัญหาที่ผู้ใช้ Hunyuan Video หรือ Wan 2.1 AI วิดีโอเจนเนเรเตอร์อาจพบได้บ่อยๆ ในขณะนี้: การผิดปกติทางเวลา ซึ่งกระบวนการสร้างเนื้อหาทำให้เกิดการเร่งความเร็ว การรวมกัน การละเว้น หรือทำให้เหตุการณ์สำคัญในวิดีโอที่สร้างขึ้นเสียหาย:

คลิกเพื่อเล่น. บางส่วนของปัญหาทางเวลาที่กลายเป็นที่รู้จักกันสำหรับผู้ใช้ระบบวิดีโอสร้างเนื้อหาที่ใหม่ๆ ในบทความใหม่นี้ Source: https://haroldchen19.github.io/FluxFlow/

วิดีโอด้านบนมีตัวอย่างจากวิดีโอทดสอบที่ (ควรเตือน: มีความวุ่นวาย) เว็บไซต์โครงการ สำหรับบทความนี้ เราจะเห็นปัญหาที่เพิ่มขึ้นเรื่อยๆ ที่ได้รับการบรรเทาโดยวิธีของนักวิจัย (ที่เห็นทางด้านขวาในวิดีโอ) ซึ่งเป็นเทคนิคการประมวลผลข้อมูลก่อนการฝึกอบรมที่สามารถใช้กับโครงสร้างวิดีโอสร้างเนื้อหาที่ใดๆ ก็ได้

ในตัวอย่างแรก ซึ่งมีเด็กสองคนเล่นกับลูกบอลที่สร้างโดย CogVideoX เราจะเห็นว่าการสร้างเนื้อหาทางธรรมชาติจะกระโดดผ่านการเคลื่อนไหวขนาดเล็กหลายอย่าง ทำให้ความเร็วของการเคลื่อนไหวของเด็กเร็วขึ้นเป็น “การ์ตูน” ในทางกลับกัน การใช้เทคนิคการประมวลผลข้อมูลก่อนการฝึกอบรมใหม่ที่เรียกว่า FluxFlow (ทางด้านขวาของรูปในวิดีโอด้านล่าง) ให้ผลลัพธ์ที่ดีกว่า:

คลิกเพื่อเล่น.

ในตัวอย่างที่สอง (โดยใช้ NOVA-0.6B) เราจะเห็นว่าการเคลื่อนไหวที่สำคัญที่เกี่ยวข้องกับแมวได้รับผลกระทบหรือตัวอย่างที่ไม่เพียงพอในระหว่างการฝึกอบรม จนระบบสร้างเนื้อหากลายเป็น “麻痺” และไม่สามารถทำให้แมวเคลื่อนไหวได้:

คลิกเพื่อเล่น.

อาการนี้ ซึ่งการเคลื่อนไหวหรือวัตถุ “ติด” คือหนึ่งในปัญหาที่พบมากที่สุดใน HV และ Wan ในกลุ่มสังเคราะห์ภาพและวิดีโอ

บางส่วนของปัญหานี้เกี่ยวข้องกับปัญหาในการเขียนคำบรรยายวิดีโอในเซตข้อมูลต้นกำเนิด ซึ่งเรา พิจารณาเมื่อสัปดาห์ที่แล้ว แต่นักวิจัยในงานใหม่นี้มุ่งเน้นไปที่คุณสมบัติทางเวลาของข้อมูลการฝึกอบรมแทน และให้ข้อโต้แย้งที่น่าเชื่อถือว่าการแก้ไขปัญหาจากมุมมองนี้สามารถให้ผลลัพธ์ที่มีประโยชน์

เช่นเดียวกับที่กล่าวไว้ในบทความก่อนหน้านี้เกี่ยวกับการเขียนคำบรรยายวิดีโอ กีฬาบางชนิดมีความยากที่จะย่อให้เหลือเหตุการณ์สำคัญ ซึ่งหมายความว่าเหตุการณ์สำคัญ (เช่น การทำคะแนน) ไม่ได้รับความสนใจที่จำเป็นในระหว่างการฝึกอบรม:

คลิกเพื่อเล่น.

ในตัวอย่างด้านบน ระบบสร้างเนื้อหาไม่ทราบว่าจะไปสู่ขั้นตอนต่อไปของการเคลื่อนไหว และเปลี่ยนจากท่าหนึ่งไปอีกท่าหนึ่งโดยไม่มีเหตุผล ทำให้ท่าทางและเรขาคณิตของนักกีฬามีการเปลี่ยนแปลง

การเคลื่อนไหวขนาดใหญ่เหล่านี้สูญหายไปในระหว่างการฝึกอบรม แต่การเคลื่อนไหวขนาดเล็กแต่สำคัญ เช่น การบินของปีกผีเสื้อ ก็เสี่ยงต่อการถูกทำลาย:

คลิกเพื่อเล่น.

ไม่เหมือนกับการทำคะแนน การบินของปีกผีเสื้อไม่ใช่เหตุการณ์ที่ “หายาก” แต่เป็นเหตุการณ์ที่เกิดขึ้นซ้ำๆ อย่างต่อเนื่อง แต่ความสม่ำเสมอของมันสูญหายไปในระหว่างการ lấyตัวอย่าง เนื่องจากการเคลื่อนไหวนั้นเร็วมาก จึงยากที่จะกำหนดเวลาได้

ปัญหานี้ไม่ใช่เรื่องใหม่ แต่ได้รับการสนใจมากขึ้นเมื่อระบบสร้างวิดีโอเจนเนเรเตอร์ที่มีพลังงานสูงมีให้สำหรับผู้ที่ต้องการติดตั้งและสร้างวิดีโอฟรี

ชุมชนบน Reddit และ Discord ได้รักษาปัญหานี้ไว้ว่าเป็น “ปัญหาของผู้ใช้” ในตอนแรก ซึ่งเป็นสมมติฐานที่เข้าใจได้ เนื่องจากระบบเหล่านี้ยังใหม่และไม่มีการจัดทำเอกสารอย่างเพียงพอ ดังนั้นผู้เชี่ยวชาญหลายคนจึงแนะนำวิธีการแก้ไขปัญหาเหล่านี้ เช่น การเปลี่ยนการตั้งค่าในคอมโพเนนท์ต่างๆ ของ ComfyUI สำหรับ Hunyuan Video (HV) และ Wan 2.1

ในบางกรณี แทนที่จะสร้างการเคลื่อนไหวที่เร็ว ระบบ HV และ Wan จะสร้างการเคลื่อนไหวที่ “ช้า” แนะนำจาก Reddit และ ChatGPT (ซึ่งใช้ Reddit เป็นหลัก) รวมถึงการเปลี่ยนจำนวนเฟรมในกระบวนการสร้างหรือการลดอัตราเฟรมเรตอย่างมาก*

สิ่งนี้เป็นเรื่องที่ยากมาก ความจริงที่เกิดขึ้นคือเรายังไม่ทราบสาเหตุหรือวิธีแก้ปัญหาเหล่านี้อย่างแน่ชัด และการแก้ไขการตั้งค่าการสร้างเพื่อทำงานรอบๆ ปัญหา (โดยเฉพาะอย่างยิ่งเมื่อมันลดคุณภาพของเอาต์พุต เช่น อัตราเฟรมต่อวินาทีที่ต่ำเกินไป) เป็นเพียงวิธีการชั่วคราว และดีใจที่จะเห็นว่าฉากการวิจัยกำลังแก้ไขปัญหาเหล่านี้อย่างรวดเร็ว

ดังนั้น นอกเหนือจากการที่เราได้ดูการเขียนคำบรรยายวิดีโอก่อนหน้านี้แล้ว มาทำความเข้าใจกับบทความใหม่นี้เกี่ยวกับการควบคุมเวลา และสิ่งที่อาจนำเสนอให้กับฉากวิดีโอสร้างเนื้อหาที่มีอยู่

ความคิดหลักคือเรียบง่ายและไม่ซับซ้อน แต่บทความนี้มีการเพิ่มเนื้อหาที่ไม่จำเป็นเพื่อให้ได้ขนาด 8 หน้า และเราจะข้ามส่วนที่ไม่จำเป็นเหล่านั้น

ปลาในกระบวนการสร้างของ VideoCrafter เป็นภาพนิ่ง ในขณะที่รูปที่ได้รับการปรับเปลี่ยนโดย FluxFlow จับภาพการเปลี่ยนแปลงที่จำเป็น

ปลาในกระบวนการสร้างของ VideoCrafter เป็นภาพนิ่ง ในขณะที่รูปที่ได้รับการปรับเปลี่ยนโดย FluxFlow จับภาพการเปลี่ยนแปลงที่จำเป็น Source: https://arxiv.org/pdf/2503.15417

งานใหม่นี้มีชื่อว่า การควบคุมเวลา ทำให้เครื่องสร้างวิดีโอของคุณแข็งแกร่งขึ้น และมาจากนักวิจัย 8 คนจาก Everlyn AI, Hong Kong University of Science and Technology (HKUST), University of Central Florida (UCF) และ The University of Hong Kong (HKU)

(ณ เวลาที่เขียน มีปัญหาเกี่ยวกับเว็บไซต์โครงการที่มาพร้อมกับบทความ)

FluxFlow

ความคิดหลักเบื้องหลัง FluxFlow คือการเอาชนะปัญหา การกระพริบ และ การไม่สอดคล้องกันทางเวลา โดยการเปลี่ยนลำดับของบล็อกและกลุ่มบล็อกในลำดับเฟรมเวลาเมื่อแสดงข้อมูลต้นกำเนิดให้กับกระบวนการฝึกอบรม:

ความคิดหลักเบื้องหลัง FluxFlow คือการย้ายบล็อกและกลุ่มบล็อกไปยังตำแหน่งที่ไม่คาดคิดและไม่สอดคล้องกันทางเวลา

ความคิดหลักเบื้องหลัง FluxFlow คือการย้ายบล็อกและกลุ่มบล็อกไปยังตำแหน่งที่ไม่คาดคิดและไม่สอดคล้องกันทางเวลา

บทความอธิบายว่า:

‘ปัญหาเหล่านี้เกิดจากข้อจำกัดพื้นฐาน: แม้ว่าจะใช้เซตข้อมูลขนาดใหญ่ แต่แบบจำลองปัจจุบันยังอาศัยรูปแบบเวลาแบบง่ายในข้อมูลการฝึกอบรม (เช่น ทิศทางเดินแบบคงที่หรือการเปลี่ยนเฟรมซ้ำๆ) มากกว่าการเรียนรู้การเคลื่อนไหวที่หลากหลายและสมเหตุสมผล ‘

‘ปัญหานี้ยิ่งรุนแรงขึ้นจากการที่ไม่มีการเพิ่มการเพิ่มความหลากหลายทางเวลาอย่างชัดเจนในระหว่างการฝึกอบรม ทำให้แบบจำลองมีความเสี่ยงต่อการปรับให้เข้ากันอย่างไม่เหมาะสมกับข้อสัมพันธ์ทางเวลาที่ไม่เกี่ยวข้อง (เช่น “เฟรม #5 ต้องตาม #4”) มากกว่าการเรียนรู้ที่จะทั่วไปสำหรับสถานการณ์การเคลื่อนไหวที่หลากหลาย’

แบบจำลองการสร้างวิดีโอส่วนใหญ่ ยังยืมมาจาก การสร้างภาพ มากเกินไป โดยเน้นไปที่ความถูกต้องทางพื้นที่มากกว่าและเพิกเฉยต่อแกนเวลา โดยเทคนิค เช่น การตัด การพลิก และการเปลี่ยนสี ช่วยปรับปรุงคุณภาพของภาพนิ่ง แต่ไม่ใช่วิธีแก้ปัญหาที่เพียงพอเมื่อนำไปใช้กับวิดีโอ ซึ่งการสร้างภาพลวงตาของการเคลื่อนไหวขึ้นอยู่กับการเปลี่ยนแปลงที่สม่ำเสมอระหว่างเฟรม

ปัญหาที่เกิดขึ้นรวมถึงการเปลี่ยนเฟรมที่ไม่สม่ำเสมอ การตัดที่ไม่เหมาะสม และรูปแบบการเคลื่อนไหวที่ซ้ำๆ หรือเรียบง่ายเกินไป

คลิกเพื่อเล่น

บทความอธิบายว่า แม้ว่าแบบจำลองบางรุ่น เช่น Stable Video Diffusion และ LlamaGen จัดการกับปัญหาเหล่านี้ด้วยโครงสร้างที่ซับซ้อนหรือข้อจำกัดที่ถูกออกแบบมา แต่สิ่งเหล่านี้มีค่าใช้จ่ายในแง่ของการคำนวณและความยืดหยุ่น

เนื่องจากการเพิ่มความหลากหลายทางเวลาได้พิสูจน์แล้วว่ามีประโยชน์ในงาน การทำความเข้าใจวิดีโอ (ในเฟรมเวิร์ก เช่น FineCliper, SeFAR และ SVFormer) จึงน่าประหลาดใจที่ยุทธวิธีนี้ไม่ได้ถูกนำมาใช้ในการสร้างเนื้อหาบ่อยๆ

การเปลี่ยนแปลงที่รบกวน

นักวิจัยแย้งว่าการเปลี่ยนแปลงที่เรียบง่ายและเป็นระบบในลำดับเวลาระหว่างการฝึกอบรมช่วยให้แบบจำลองเรียนรู้ที่จะทั่วไปได้ดีกว่าสำหรับการเคลื่อนไหวที่หลากหลาย:

‘โดยการฝึกอบรมด้วยลำดับที่ไม่เรียงติดกัน เครื่องสร้างเนื้อหาจะเรียนรู้ที่จะฟื้นฟูการเคลื่อนไหวที่สมเหตุสมผล โดยการควบคุมความบ้าบิ่นของเวลา FLUXFLOW สะท้อนความแตกต่างระหว่างการเพิ่มความหลากหลายทางเวลาแบบแบ่งแยกและแบบสร้างเนื้อหา โดยการนำเสนอโซลูชันที่ปรับปรุงได้สำหรับการสร้างวิดีโอที่สมเหตุสมผลทางเวลาในขณะที่ปรับปรุงคุณภาพโดยรวม’

‘ไม่เหมือนกับวิธีการที่มีอยู่ซึ่งแนะนำการเปลี่ยนแปลงโครงสร้างหรือพึ่งพาการประมวลผลหลังการสร้าง FLUXFLOW ทำงานโดยตรง ณ ระดับข้อมูล โดยการแนะนำการเปลี่ยนแปลงทางเวลาที่ถูกควบคุมในระหว่างการฝึกอบรม’

คลิกเพื่อเล่น

การเปลี่ยนแปลงระดับเฟรม นักวิจัยระบุว่า การเปลี่ยนแปลงระดับเฟรมแนะนำการเปลี่ยนแปลงที่ละเอียดอ่อนภายในลำดับ ซึ่งไม่แตกต่างจาก การเพิ่มความหลากหลายโดยการปิดบัง ซึ่งบางส่วนของข้อมูลถูกปิดบังแบบสุ่ม เพื่อป้องกันไม่ให้ระบบ ปรับให้เข้ากันมากเกินไป กับจุดข้อมูล และส่งเสริมการเรียนรู้ที่ดีกว่า

การทดสอบ

แม้ว่าความคิดหลักนี้จะไม่ยาวมาก แต่ก็มีส่วนการทดสอบที่เราสามารถดูได้

นักวิจัยทดสอบสำหรับสี่คำถามที่เกี่ยวข้องกับคุณภาพทางเวลาที่ดีขึ้น ในขณะที่ยังคงความถูกต้องทางพื้นที่ไว้; ความสามารถในการเรียนรู้การเคลื่อนไหว/การไหลของภาพ; การรักษาคุณภาพทางเวลาในการสร้างนอกเหนือจากข้อมูลฝึกอบรม; และความไวต่อพารามิเตอร์หลัก

นักวิจัยใช้ FluxFlow กับโครงสร้างการสร้างวิดีโอสามแบบ: U-Net-based ในรูปแบบของ VideoCrafter2; DiT-based ในรูปแบบของ CogVideoX-2B; และ AR-based ในรูปแบบของ NOVA-0.6B

สำหรับการเปรียบเทียบที่ยุติธรรม พวกเขาทำการปรับให้เหมาะสมแบบละเอียดของแบบจำลองฐานของโครงสร้างเหล่านี้ด้วย FluxFlow เป็นระยะการฝึกอบรมเพิ่มเติมหนึ่ง รอบ บนเซตข้อมูล OpenVidHD-0.4M

แบบจำลองเหล่านี้ถูกประเมินกับสองแบบจำลองที่ได้รับความนิยม: UCF-101; และ VBench

สำหรับ UCF ใช้ Fréchet Video Distance (FVD) และ Inception Score (IS) เป็นตัวชี้วัด สำหรับ VBench นักวิจัยเน้นไปที่คุณภาพทางเวลา คุณภาพเฟรมต่อเฟรม และคุณภาพโดยรวม

การประเมินค่า FluxFlow-Frame เริ่มต้น ค่า

การประเมินค่า FluxFlow-Frame เริ่มต้น ค่า "+ Original" หมายถึงการฝึกอบรมโดยไม่มี FLUXFLOW ในขณะที่ "+ Num × 1" แสดงการกำหนดค่า FluxFlow-Frame ที่แตกต่างกัน ผลลัพธ์ที่ดีที่สุดจะถูกเน้นด้วยสี และผลลัพธ์ที่ดีที่สุดเป็นอันดับสองจะถูกขีดเส้นใต้สำหรับแต่ละแบบจำลอง

เมื่อแสดงความคิดเห็นเกี่ยวกับผลลัพธ์เหล่านี้ นักวิจัยระบุว่า:

‘ทั้ง FLUXFLOW-FRAME และ FLUXFLOW-BLOCK ปรับปรุงคุณภาพทางเวลาอย่างมีนัยสำคัญ ตามที่เห็นได้จากตัวชี้วัดในตาราง 1, 2 (เช่น FVD, Subject, Flicker, Motion และ Dynamic) และผลลัพธ์ที่มีคุณภาพใน [รูปด้านล่าง]’

‘ตัวอย่างเช่น การเคลื่อนไหวของรถที่ลอยใน VC2 การเคลื่อนไหวของแมวที่ไล่จับหางใน NOVA และการเคลื่อนไหวของนักโต้คลื่นที่ขี่คลื่นใน CVX กลายเป็นของเหลวมากขึ้นด้วย FLUXFLOW Importantly การปรับปรุงทางเวลานี้ได้รับการบรรลุโดยไม่สูญเสียความถูกต้องทางพื้นที่ ตามที่เห็นได้จากรายละเอียดที่คมชัดของการกระจายน้ำ การปล่อยควัน และการเคลื่อนไหวของคลื่น รวมทั้งความถูกต้องและความสมบูรณ์ทางพื้นที่และโดยรวม’

ด้านล่างนี้คือตัวอย่างจากผลลัพธ์ที่มีคุณภาพที่นักวิจัยอ้างถึง:

ตัวอย่างจากผลลัพธ์ที่มีคุณภาพ

ตัวอย่างจากผลลัพธ์ที่มีคุณภาพ

บทความชี้ว่า แม้ว่าทั้งการเปลี่ยนแปลงระดับเฟรมและระดับบล็อกจะปรับปรุงคุณภาพทางเวลา แต่วิธีการระดับเฟรมมีแนวโน้มที่จะทำงานได้ดีกว่า เนื่องจากความละเอียดอ่อนที่มากขึ้น ซึ่งช่วยให้สามารถปรับเวลาได้อย่างแม่นยำ การเปลี่ยนแปลงระดับบล็อกอาจแนะนำความผิดปกติเนื่องจากรูปแบบที่เชื่อมโยงทางพื้นที่และเวลาอย่างใกล้ชิดภายในบล็อก ซึ่งลดประสิทธิภาพของมัน

สรุป

บทความนี้ ร่วมกับผลงานร่วมของ Bytedance-Tsinghua เกี่ยวกับการเขียนคำบรรยายวิดีโอ ที่เผยแพร่เมื่อสัปดาห์ที่แล้ว ทำให้ฉันเข้าใจว่าความไม่สมบูรณ์ที่เห็นได้ชัดเจนในระบบวิดีโอเจนเนเรเตอร์ใหม่อาจไม่ได้มาจากข้อผิดพลาดของผู้ใช้ ความผิดพลาดของสถาบัน หรือข้อจำกัดของเงินทุน แต่มาจากความสนใจในการวิจัยที่ให้ความสำคัญกับความท้าทายที่เร่งด่วนมากกว่า เช่น การสอดคล้องและความสม่ำเสมอทางเวลา

จนกระทั่งไม่นานมานี้ ผลลัพธ์จากระบบวิดีโอเจนเนเรเตอร์ที่สามารถดาวน์โหลดและติดตั้งได้ฟรี มีข้อบกพร่องอย่างมาก จนไม่มีการพยายามแก้ไขปัญหาเหล่านี้จากชุมชนผู้ใช้ (ไม่น้อยเพราะปัญหาเหล่านี้เป็นปัญหาหลักและไม่สามารถแก้ไขได้ง่ายๆ)

ตอนนี้ที่เรากำลังเข้าใกล่ยุคของวิดีโอที่สร้างขึ้นโดย AI ที่มีคุณภาพสูงมากขึ้น มันชัดเจนว่าทั้งฉากการวิจัยและชุมชนผู้ใช้กำลังให้ความสนใจในการแก้ไขปัญหาเหล่านี้อย่างลึกซึ้งและสร้างสรรค์ยิ่งขึ้น และหวังว่าปัญหาเหล่านี้จะไม่ใช่สิ่งกีดขวางที่ไม่สามารถเอาชนะได้

 

* อัตราเฟรมเรตพื้นฐานของ Wan คือ 16fps และในคำตอบของปัญหาของฉันเอง ฉันสังเกตเห็นว่าฟอรัมแนะนำให้ลดอัตราเฟรมเรตให้ต่ำถึง 12fps แล้วใช้ FlowFrames หรือระบบการไหลของ AI อื่นๆ เพื่อแทรกช่องว่างระหว่างจำนวนเฟรมที่หายากมาก

เผยแพร่ครั้งแรกวันศุกร์ที่ 21 มีนาคม 2025

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai