โมเดลและแพลตฟอร์ม AI

การปรุงนาราทีฟความต่อเนื่องสำหรับการสร้างวิดีโอยาว

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

การเปิดตัวสาธารณะของโมเดล Hunyuan Video ที่สร้างโดย AI ได้เพิ่มการอภิปรายเกี่ยวกับศักยภาพของโมเดลการมองเห็นและภาษาที่มีขนาดใหญ่ในการสร้างภาพยนตร์สมบูรณ์ในอนาคต

อย่างไรก็ตาม ตามที่เราได้สังเกตเห็นแล้ว นี่เป็นเรื่องที่อยู่ห่างไกลมากในขณะนี้ เนื่องจากหลายสาเหตุ หนึ่งในนั้นคือช่วงความสนใจที่สั้นมากของระบบ AI ที่สร้างวิดีโอ ซึ่งพยายามที่จะรักษาความต่อเนื่องแม้เพียงในหนึ่งภาพเดียว ไม่เช่นนั้นในซีรีส์ของภาพ

อีกสิ่งหนึ่งคือการอ้างอิงที่สม่ำเสมอถึงเนื้อหาวิดีโอ (เช่น สภาพแวดล้อมที่สามารถสำรวจได้ ซึ่งไม่ควรเปลี่ยนแปลงแบบสุ่มหากคุณย้อนกลับไปตามขั้นตอนของพวกมัน) สามารถทำได้เฉพาะในโมเดลการกระจายโดยใช้เทคนิคการปรับแต่ง เช่น การปรับแต่งอันดับต่ำ (LoRA) ซึ่งจำกัดความสามารถของโมเดลพื้นฐาน

ดังนั้น การพัฒนาของวิดีโอที่สร้างโดย AI จึงมีแนวโน้มที่จะหยุดชะงักจนกว่าจะมีการพัฒนาวิธีการใหม่ๆ สำหรับการรักษานาราทีฟความต่อเนื่อง

สูตรสำหรับความต่อเนื่อง

ด้วยการมองเห็นเช่นนี้ การร่วมมือใหม่ระหว่างสหรัฐอเมริกาและจีนได้เสนอการใช้ วิดีโอสอนทำอาหาร เป็นแบบจำลองที่เป็นไปได้สำหรับระบบความต่อเนื่องนาราทีฟในอนาคต

คลิกเพื่อเล่น ระบบ VideoAuteur วิเคราะห์กระบวนการทำอาหาร และสร้างชุดข้อมูลใหม่พร้อมวิธีการกำกับสำหรับการสร้างวิดีโอสอนทำอาหาร อ้างอิงจากแหล่งที่มา: https://videoauteur.github.io/

ชื่อ VideoAuteur โครงการนี้เสนอการสร้างวิดีโอสอนทำอาหารโดยใช้สถานะที่สอดคล้องกันโดยการรวมเฟรมหลักและคำบรรยาย โดยบรรลุผลลัพธ์ที่ดีที่สุดในพื้นที่ที่ยังไม่ได้รับการสนับสนุน

หน้าโครงการ VideoAuteur ยังมีวิดีโอที่น่าสนใจอื่นๆ ที่ใช้เทคนิคเดียวกัน เช่น ทรेलเลอร์สำหรับภาพยนตร์ Marvel/DC ที่ไม่มีอยู่จริง:

คลิกเพื่อเล่น

ในระหว่างการพัฒนา VideoAuteur ผู้เขียนทดลองกับฟังก์ชันการเสียหายที่หลากหลายและแนวทางใหม่ๆ เพื่อพัฒนาวิธีการสร้างวิดีโอสอนทำอาหาร พวกเขายังรวบรวม CookGen ซึ่งเป็นชุดข้อมูลที่ใหญ่ที่สุดในโดเมนการทำอาหาร โดยมีคลิปวิดีโอ 200,000 คลิป โดยมีระยะเวลาเฉลี่ย 9.5 วินาที

โดยเฉลี่ย 768.3 คำต่อวิดีโอ CookGen เป็นชุดข้อมูลที่มีการบันทึกย่อมากที่สุดในประเภทของมัน โมเดลการมองเห็นและภาษาที่หลากหลายถูกใช้เพื่อให้แน่ใจว่าคำบรรยายเป็นไปอย่างละเอียดและแม่นยำ

วิดีโอสอนทำอาหารถูกเลือกเพราะว่ามีนาราทีฟที่มีโครงสร้างและไม่กำกวม ทำให้การบันทึกย่อและประเมินเป็นงานที่ง่ายขึ้น

(TSLA )

ผู้เขียนระบุว่า:

‘วิธีการสองขั้นตอนของเรา ซึ่งรวมถึงผู้กำกับนาราทีฟที่ยาวและแบบจำลองการสร้างวิดีโอที่มีเงื่อนไขการมองเห็น แสดงให้เห็นถึงการปรับปรุงที่สัญญาไว้ในด้านความสอดคล้องทางนาราทีฟและความจริงของภาพในคลิปวิดีโอที่สร้างขึ้น’

‘ผ่านการทดลองบนชุดข้อมูลของเรา เราพบการปรับปรุงที่ดีขึ้นในด้านความสอดคล้องเชิงพื้นที่และเวลาในลำดับวิดีโอ’

‘เราหวังว่างานของเราจะช่วยให้เกิดการวิจัยเพิ่มเติมเกี่ยวกับการสร้างวิดีโอนาราทีฟที่ยาว’

งานใหม่นี้มีชื่อว่า VideoAuteur: การสร้างวิดีโอนาราทีฟที่ยาว และมาจากผู้เขียนแปดคนจากมหาวิทยาลัยจอนส์ฮอปกินส์ ByteDance และ ByteDance Seed

การรวบรวมชุดข้อมูล

ในการพัฒนา CookGen ซึ่งเป็นระบบสองขั้นตอนสำหรับการสร้างวิดีโอสอนทำอาหารโดย AI ผู้เขียนใช้วัสดุจาก YouCook และ HowTo100M

ผู้เขียนเปรียบเทียบขนาดของ CookGen กับชุดข้อมูลก่อนหน้าที่มุ่งเน้นไปที่การพัฒนานาราทีฟในวิดีโอที่สร้างโดย AI เช่น Flintstones dataset ชุดข้อมูลการ์ตูน Pororo StoryGen ชุดข้อมูล StoryStream ของ Tencent และ VIST

การเปรียบเทียบระหว่างภาพและความยาวข้อความของ CookGen และชุดข้อมูลที่ใกล้เคียงที่สุด

การเปรียบเทียบระหว่างภาพและความยาวข้อความของ CookGen และชุดข้อมูลที่ใกล้เคียงที่สุด อ้างอิงจาก: https://arxiv.org/pdf/2501.06173

CookGen มุ่งเน้นไปที่เรื่องราวในโลกแห่งความเป็นจริง โดยเฉพาะกิจกรรมแบบขั้นตอน เช่น การทำอาหาร ซึ่งให้เรื่องราวที่ชัดเจนและง่ายต่อการบันทึกย่อมากกว่าชุดข้อมูลการ์ตูนแบบภาพ

นักวิจัย ปรับแต่งโมเดลการบันทึกย่อ โดยใช้ LLaVA-NeXT เป็นฐาน

ตัวอย่างเช่น ChatGPT-4o ถูกใช้เพื่อสร้างชุดข้อมูลคำบรรยาย และถูกขอให้มุ่งเน้นไปที่การโต้ตอบระหว่างวัตถุ (เช่น มือจับเครื่องมือและอาหาร) คุณลักษณะของวัตถุ และพลวัตเชิงเวลา

เนื่องจากสคริปต์ ASR มีแนวโน้มที่จะมีข้อผิดพลาดและไม่ชัดเจน การคำนวณส่วนตัดกัน (IoU) ถูกใช้เป็นตัววัดเพื่อประเมินว่าคำบรรยายสอดคล้องกับวิดีโอที่พวกมันกำลังอ้างอิงอยู่มากน้อยเพียงใด

คลิปที่ถูกเลือกให้ประเมินโดยใช้ Fréchet Video Distance (FVD) ซึ่งวัดความแตกต่างระหว่างตัวอย่างที่แท้จริง (โลกแห่งความเป็นจริง) และตัวอย่างที่สร้างขึ้น โดยมีหรือไม่มีเฟรมหลักจากตัวอย่าง

การใช้ FVD เพื่อประเมินระยะห่างระหว่างวิดีโอที่สร้างขึ้นด้วยคำบรรยายใหม่

การใช้ FVD เพื่อประเมินระยะห่างระหว่างวิดีโอที่สร้างขึ้นด้วยคำบรรยายใหม่

นอกจากนี้ คลิปเหล่านี้ยังถูกประเมินโดย GPT-4o และผู้บันทึกย่อหกคน ตามคำจำกัดความของ LLaVA-Hound เกี่ยวกับ ‘การหลอกลวง’ (เช่น ความสามารถของโมเดลในการสร้างเนื้อหาที่ไม่มีอยู่จริง)

นักวิจัยเปรียบเทียบคุณภาพของคำบรรยายกับ Qwen2-VL-72B โดยได้คะแนนเล็กน้อยที่ดีขึ้น

การเปรียบเทียบระหว่างคะแนน FVD และการประเมินของมนุษย์ระหว่าง Qwen2-VL-72B และชุดข้อมูลของผู้เขียน

การเปรียบเทียบระหว่างคะแนน FVD และการประเมินของมนุษย์ระหว่าง Qwen2-VL-72B และชุดข้อมูลของผู้เขียน

วิธีการ

ระยะการสร้างของ VideoAuteur แบ่งออกเป็น ผู้กำกับนาราทีฟที่ยาว (LND) และ แบบจำลองการสร้างวิดีโอที่มีเงื่อนไขการมองเห็น (VCVGM)

LND สร้างลำดับของการฝังตัวการมองเห็นหรือเฟรมหลักที่แสดงถึงการไหลของนาราทีฟ ในทำนองเดียวกับ ‘ไฮไลท์ที่สำคัญ’ VCVGM สร้างคลิปวิดีโอตามตัวเลือกเหล่านี้

สเคมาสำหรับกระบวนการประมวลผลของ VideoAuteur

สเคมาสำหรับกระบวนการประมวลผลของ VideoAuteur

ผู้เขียนอภิปรายถึงคุณประโยชน์ที่แตกต่างกันของ ผู้กำกับการมองเห็นและข้อความที่สอดคล้องกัน และผู้กำกับที่มุ่งเน้นไปที่ภาษา และสรุปว่าแบบแรกมีประสิทธิภาพมากกว่า

ผู้กำกับการมองเห็นและข้อความที่สอดคล้องกันสร้างลำดับโดยการสลับข้อความและการฝังตัวการมองเห็น โดยใช้ แบบจำลองการสร้างอัตโนมัติ เพื่อคาดการณ์ตัวต่อไปตามบริบทที่รวมของข้อความและภาพ

โดยการเปรียบเทียบ ผู้กำกับที่มุ่งเน้นไปที่ภาษาสังเคราะห์เฟรมหลักโดยใช้ แบบจำลองการกระจายที่มีเงื่อนไขภาษา โดยไม่รวมการฝังตัวการมองเห็นในการสร้าง

นักวิจัยพบว่าแม้ว่าผู้กำกับที่มุ่งเน้นไปที่ภาษาจะสร้างเฟรมหลักที่น่าดึงดูด แต่ก็ขาดความต่อเนื่องระหว่างเฟรม โดยโต้แย้งว่าผู้กำกับการมองเห็นและข้อความที่สอดคล้องกันบรรลุคะแนนสูงสุดในด้านความจริงและความต่อเนื่องของภาพ

นอกจากนี้ พวกเขายังพบว่าผู้กำกับการมองเห็นและข้อความที่สอดคล้องกันสามารถเรียนรู้รูปแบบการมองเห็นที่สมจริงผ่านการฝึกอบรมได้ แม้ว่าบางครั้งจะมีองค์ประกอบที่ซ้ำกันหรือมีเสียงรบกวน

ไม่เหมือนกับการวิจัยที่โดดเด่นซึ่งใช้ Stable Diffusion และ Flux ในกระบวนการ ผู้เขียนใช้ SEED-X 7B-พารามิเตอร์แบบจำลอง LLM หลายรูปแบบเป็นพื้นฐานสำหรับกระบวนการสร้าง (แม้ว่าแบบจำลองนี้จะใช้ SDXL ของ Stability.ai สำหรับส่วนหนึ่งของสถาปัตยกรรม)

ผู้เขียนระบุว่า:

‘ไม่เหมือนกับคลาสสิก Image-to-Video (I2V) ที่ใช้ภาพเป็นเฟรมเริ่มต้น วิธีการของเรานำ การฝังตัวการมองเห็นที่ถูกย้อนกลับ มาใช้เป็นเงื่อนไขที่ต่อเนื่องกันตลอดลำดับ’

‘นอกจากนี้ เรายังปรับปรุงความแข็งแกร่งและคุณภาพของวิดีโอที่สร้างขึ้นโดยการปรับให้เหมาะสมกับการฝังตัวการมองเห็นที่มีเสียงรบกวน เนื่องจากการฝังตัวการมองเห็นที่ถูกย้อนกลับอาจไม่สมบูรณ์แบบเนื่องจากข้อผิดพลาดในการย้อนกลับ’

การทดสอบ

ตามวิธีการของ SeedStory นักวิจัยใช้ SEED-X เพื่อใช้การปรับแต่ง LoRA บนชุดข้อมูลนาราทีฟ โดยอธิบายผลลัพธ์เป็น ‘แบบจำลอง Sora’ ที่ได้รับการฝึกอบรมก่อนบนคู่วิดีโอ/ข้อความขนาดใหญ่ และสามารถรับข้อความและเงื่อนไขการมองเห็นได้

32,000 วิดีโอนาราทีฟถูกใช้ในการพัฒนาแบบจำลอง โดยมี 1,000 ตัวอย่างถูกเก็บไว้เป็นตัวอย่างการตรวจสอบ

สำหรับการฝึกอบรม การสร้างนาราทีฟถูกประเมินหลักๆ บนตัวอย่างการตรวจสอบ YouCook2

สำหรับการสูญเสียเงื่อนไขการมองเห็น ผู้เขียนใช้การสูญเสียการกระจายจาก DiT และงาน ปี 2024 ที่สร้างขึ้นรอบๆ Stable Diffusion

เพื่อพิสูจน์ข้อโต้แย้งของพวกเขาเกี่ยวกับวิธีการที่ดีกว่า ผู้เขียนจัดให้ VideoAuteur ต่อสู้กับวิธีการอื่นๆ ที่พึ่งพาข้อความเป็นหลัก: EMU-2, SEED-X, SDXL และ FLUX.1-schnell (FLUX.1-s)

การให้คำสั่งระดับโลก 'คู่มือการทำอาหารมะปู' ผู้กำกับการมองเห็นและข้อความที่สอดคล้องกันสร้างการกระทำ คำบรรยาย และการฝังตัวการมองเห็นตามลำดับเพื่ออธิบายกระบวนการ

การให้คำสั่งระดับโลก ‘คู่มือการทำอาหารมะปู’ ผู้กำกับการมองเห็นและข้อความที่สอดคล้องกันสร้างการกระทำ คำบรรยาย และการฝังตัวการมองเห็นตามลำดับเพื่ออธิบายกระบวนการ

ผู้เขียนระบุว่า:

‘วิธีการที่มุ่งเน้นไปที่ภาษาโดยใช้แบบจำลองข้อความถึงภาพสร้างเฟรมหลักที่น่าดึงดูด แต่ขาดความต่อเนื่องระหว่างเฟรมเนื่องจากข้อมูลร่วมกันที่จำกัด ในทางกลับกัน วิธีการสร้างที่สอดคล้องกันใช้การฝังตัวการมองเห็นที่สอดคล้องกับภาษา และบรรลุผลลัพธ์ที่สมจริงผ่านการฝึกอบรม’

‘อย่างไรก็ตาม มันสร้างภาพที่มีองค์ประกอบซ้ำกันหรือมีเสียงรบกวน เนื่องจากแบบจำลองการสร้างอัตโนมัติพยายามที่จะสร้างการฝังตัวที่แม่นยำในครั้งเดียว’

การประเมินของมนุษย์ยังยืนยันข้อโต้แย้งของผู้เขียนเกี่ยวกับการทำงานที่ดีขึ้นของวิธีการที่สอดคล้องกัน โดยวิธีการที่สอดคล้องกันบรรลุคะแนนสูงสุดในการสำรวจ

การเปรียบเทียบระหว่างวิธีการต่างๆ จากการศึกษาที่ทำสำหรับบทความ

การเปรียบเทียบระหว่างวิธีการต่างๆ จากการศึกษาที่ทำสำหรับบทความ

อย่างไรก็ตาม เราสังเกตเห็นว่าวิธีการที่มุ่งเน้นไปที่ภาษาบรรลุคะแนนสูงสุดในด้าน สุนทรียศาสตร์

คลิกเพื่อเล่น ส่วนของวิดีโอที่สร้างโดย VideoAuteur สำหรับวิดีโอทำพิซซ่า

สรุป

ด้านวิจัยที่ได้รับความนิยมมากที่สุดเกี่ยวกับความท้าทายนี้ คือ ความต่อเนื่องของนาราทีฟในวิดีโอที่ยาว โดยมุ่งเน้นไปที่ภาพเดียว โครงการเหล่านี้รวมถึง DreamStory, StoryDiffusion, TheaterGen และ ConsiStory ของ NVIDIA

ในทางหนึ่ง VideoAuteur ก็เข้ามาในหมวดหมู่ ‘นิ่ง’ เหมือนกัน เนื่องจากใช้ภาพที่ถูกเลือกให้สร้างคลิป แต่การสลับกันระหว่างวิดีโอและเนื้อหาสมองทำให้กระบวนการใกล้เคียงกับกระบวนการปฏิบัติใช้จริงมากขึ้น

เผยแพร่ครั้งแรกวันพฤหัสบดี 16 มกราคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai