มุมมองของ Anderson

การคิดใหม่เกี่ยวกับการฝึกอบรม AI วิดีโอโดยใช้ข้อมูลที่เน้นผู้ใช้

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Examples from the paper ' VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation'

ประเภทของเนื้อหาที่ผู้ใช้อาจต้องการสร้างโดยใช้โมเดลที่สร้างขึ้น เช่น Flux หรือ Hunyuan Video อาจไม่ได้พร้อมใช้งานเสมอไป แม้ว่าคำขอเนื้อหาจะไม่ซับซ้อน และคุณอาจคิดว่าเครื่องกำเนิดสามารถจัดการได้

ตัวอย่างหนึ่ง ซึ่งแสดงไว้ในเอกสารวิจัยใหม่ที่เราจะพิจารณาในบทความนี้ ระบุว่าโมเดล OpenAI Sora ที่ถูกกลบด้วยความสนใจมีความยากในการแสดงภาพตัวต่อไฟที่ถูกต้อง โดยใช้คำสั่ง ‘ตัวต่อไฟกำลังสว่างบนใบหญ้าในค่ำคืนฤดูร้อนที่เงียบสงบ’:

OpenAI's Sora มีความเข้าใจที่ไม่ถูกต้องเกี่ยวกับกายวิภาคของตัวต่อไฟ

OpenAI’s Sora มีความเข้าใจที่ไม่ถูกต้องเกี่ยวกับกายวิภาคของตัวต่อไฟ Source: https://arxiv.org/pdf/2503.01739

เนื่องจากฉันไม่เคยยอมรับคำกล่าวอ้างของการวิจัยโดยไม่มีการตรวจสอบ ฉันจึงทดสอบคำสั่งเดียวกันกับ Sora วันนี้และได้ผลลัพธ์ที่ดีขึ้นเล็กน้อย อย่างไรก็ตาม Sora ยังคงล้มเหลวในการแสดงแสงสว่างที่ถูกต้อง – แทนที่จะส่องสว่างที่ปลายหางของตัวต่อไฟที่มีการเรืองแสง Sora จึงวางแสงที่ใกล้กับเท้าของแมลง:

การทดสอบของฉันโดยใช้คำสั่งของนักวิจัยใน Sora ทำให้ได้ผลลัพธ์ที่แสดงให้เห็นว่า Sora ไม่เข้าใจว่าแสงสว่างของตัวต่อไฟมาจากที่ไหน

การทดสอบของฉันโดยใช้คำสั่งของนักวิจัยใน Sora ทำให้ได้ผลลัพธ์ที่แสดงให้เห็นว่า Sora ไม่เข้าใจว่าแสงสว่างของตัวต่อไฟมาจากที่ไหน

ในทางกลับกัน เครื่องกำเนิดการกระจายแบบสร้างสรรค์ของ Adobe Firefly ที่ฝึกอบรมจากภาพถ่ายและวิดีโอที่มีลิขสิทธิ์ของบริษัท สามารถสร้างผลลัพธ์ที่ถูกต้องได้เพียง 1 ใน 3 ครั้ง เมื่อฉันพยายามใช้คำสั่งเดียวกันในฟังก์ชัน AI ที่สร้างสรรค์ของ Photoshop:

เพียงผลลัพธ์สุดท้ายของการสร้างสามครั้งโดยใช้คำสั่งของนักวิจัยใน Adobe Firefly (มีนาคม 2025) ที่มีแสงสว่างอยู่ในตำแหน่งที่ถูกต้องของกายวิภาคของแมลง

เพียงผลลัพธ์สุดท้ายของการสร้างสามครั้งโดยใช้คำสั่งของนักวิจัยใน Adobe Firefly (มีนาคม 2025) ที่มีแสงสว่างอยู่ในตำแหน่งที่ถูกต้องของกายวิภาคของแมลง

ตัวอย่างนี้ถูกนำมาใช้โดยนักวิจัยในเอกสารวิจัยใหม่เพื่อแสดงให้เห็นว่าการกระจาย การเน้น และการครอบคลุมของชุดข้อมูลที่ใช้ในการฝึกอบรมโมเดลที่เป็นพื้นฐานอาจไม่สอดคล้องกับความต้องการของผู้ใช้ แม้ว่าผู้ใช้จะไม่ขออะไรที่ซับซ้อนมากนัก

ผู้เขียนระบุว่า:

‘[Sora] ไม่สามารถจับแนวคิดของตัวต่อไฟที่กำลังสว่างได้ ในขณะที่สามารถสร้างหญ้าและค่ำคืนฤดูร้อนได้สำเร็จ จากมุมมองของข้อมูล เราอนุมานว่าสิ่งนี้เกิดจาก [Sora] ไม่ได้รับการฝึกอบรมเกี่ยวกับหัวข้อที่เกี่ยวข้องกับตัวต่อไฟ ในขณะที่ได้รับการฝึกอบรมเกี่ยวกับหญ้าและค่ำคืน นอกจากนี้ หาก [Sora] ได้เห็นวิดีโอที่แสดงไว้ข้างต้น มันจะเข้าใจว่าตัวต่อไฟที่กำลังสว่างควรจะมีลักษณะอย่างไร’

ข้อมูลสำหรับผู้ใช้

โดยพื้นฐานแล้ว ข้อเสนอของพวกเขานำเสนอแนวทางในการคัดเลือกข้อมูลที่อยู่ระหว่างข้อมูลที่กำหนดเองสำหรับโมเดล เช่น LoRA และชุดข้อมูลขนาดใหญ่ที่ไม่เลือก lọc เช่น LAION ซึ่งไม่ได้ถูกออกแบบมาเพื่อใช้งานเฉพาะเจาะจง

แนวทางใหม่นี้ ซึ่งเป็นทั้งวิธีการและชุดข้อมูลใหม่ ถูกตั้งชื่อว่า Users’ FOcus in text-to-video หรือ VideoUFO ชุดข้อมูล VideoUFO ประกอบด้วยคลิปวิดีโอ 1.9 ล้านคลิปที่ครอบคลุมหัวข้อ 1,291 หัวข้อที่เน้นผู้ใช้ หัวข้อเหล่านี้ถูกพัฒนาจากชุดข้อมูลวิดีโอที่มีอยู่แล้วและผ่านกระบวนการประมวลผลภาษาธรรมชาติและเทคนิคการประมวลผลภาษาธรรมชาติ:

ตัวอย่างหัวข้อที่ถูกทำให้เข้มข้นในเอกสารวิจัยใหม่

ตัวอย่างหัวข้อที่ถูกทำให้เข้มข้นในเอกสารวิจัยใหม่

ชุดข้อมูล VideoUFO มีคลิปวิดีโอที่ใหม่และไม่เคยปรากฏในข้อมูลวิจัยมาก่อน ‘ใหม่’ ในความหมายที่ว่าคลิปวิดีโอที่ใช้ไม่ได้อยู่ในชุดข้อมูลวิดีโอที่นิยมใช้ในงานวิจัย และไม่ได้อยู่ในชุดข้อมูลย่อยที่ถูกสร้างขึ้นจากชุดข้อมูลเหล่านั้น (และคลิปวิดีโอบางส่วนถูกอัปโหลดหลังจากชุดข้อมูลเก่าถูกสร้างขึ้น)

จริงๆ แล้ว ผู้เขียนอ้างว่า มีเพียง 0.29% ของคลิปวิดีโอใน VideoUFO ที่มีอยู่ในชุดข้อมูลวิดีโอที่มีอยู่แล้ว – ซึ่งเป็นการแสดงให้เห็นถึงความใหม่ของชุดข้อมูลนี้

หนึ่งในสาเหตุอาจเป็นเพราะผู้เขียนจะยอมรับคลิปวิดีโอจาก YouTube ที่มีใบอนุญาต Creative Commons ซึ่งจะทำให้ผู้ใช้ไม่ต้องเผชิญกับปัญหาในอนาคต:

นอกจากนี้ คลิปวิดีโอดังกล่าวถูกขอตามความต้องการของผู้ใช้ (ดูภาพด้านบน) และไม่ได้ถูกเก็บเกี่ยวโดยไม่มีการเลือก lọc:

สิ่งเหล่านี้อาจนำไปสู่ชุดข้อมูลที่ใหม่และไม่เคยปรากฏมาก่อน

แม้ว่าไม่ทุกสิ่งในเอกสารวิจัยใหม่จะน่าเชื่อถือ แต่ก็เป็นเรื่องที่น่าสนใจที่เน้นย้ำถึงความท้าทายที่เราเผชิญในงานวิจัยด้านชุดข้อมูล

งานวิจัยใหม่นี้มีชื่อว่า VideoUFO: ชุดข้อมูลขนาดใหญ่ 1 ล้านรายการสำหรับการสร้างวิดีโอจากข้อความ และมาจากนักวิจัยสองคนจาก University of Technology Sydney ในออสเตรเลียและ Zhejiang University ในจีน

ตัวอย่างจากชุดข้อมูลที่ได้รับ

ตัวอย่างจากชุดข้อมูลที่ได้รับ

‘ผู้ช่วยส่วนตัว’ สำหรับข้อมูล AI

เนื้อหาที่ปรากฏบนอินเทอร์เน็ตไม่จำเป็นต้องสะท้อนถึงสิ่งที่ผู้ใช้จะขอจากระบบกำเนิด แม้ว่าเนื้อหาจะมีอยู่และผู้ใช้จะสนใจ (เช่น โป๊ ที่มีอยู่บนอินเทอร์เน็ตและเป็นที่สนใจของหลายๆ คน) สิ่งนี้อาจไม่สอดคล้องกับวัตถุประสงค์ของผู้พัฒนา

นอกจากปริมาณเนื้อหาที่ไม่เหมาะสมที่อัปโหลดทุกวันแล้ว สัดส่วนของเนื้อหาที่มีอยู่บนอินเทอร์เน็ตมักจะมาจากผู้ลงโฆษณาและผู้ที่พยายามที่จะหลอกลวง SEO ซึ่งทำให้การกระจายของเนื้อหานั้นไม่สมดุล และยากที่จะพัฒนาระบบ AI ที่สามารถจัดการกับปัญหานี้ได้

ดังนั้น ผู้เขียนจึงเข้าใกล้ปัญหานี้โดยการย้อนกลับคำสั่ง โดยการกำหนดสิ่งที่ผู้ใช้ต้องการและหาวิดีโอที่สอดคล้องกับความต้องการเหล่านั้น

บนพื้นผิวแล้ว แนวทางนี้ดูเหมือนจะน่าจะทำให้เกิดการแข่งขันที่ไม่สมดุลได้เช่นกัน แต่ลองมาดูกันว่าเอกสารวิจัยนี้มีอะไรบ้าง

การทำให้เข้มข้นของแนวคิดด้วยความระมัดระวัง

นักวิจัยใช้ชุดข้อมูล VidProM ปี 2024 เป็นแหล่งที่มาของการวิเคราะห์หัวข้อที่จะใช้ในการเก็บเกี่ยววิดีโอ

ชุดข้อมูลนี้ถูกเลือกเพราะเป็นชุดข้อมูลขนาดใหญ่ 1 ล้านรายการแรกที่มีเนื้อหาที่เขียนโดยผู้ใช้จริง และควรทราบว่าชุดข้อมูลนี้ถูกสร้างขึ้นโดยนักวิจัยสองคนนี้เอง

เอกสารวิจัยระบุว่า:

‘ก่อนอื่น เราใส่ข้อความ 1.67 ล้านข้อจาก VidProM ลงในเวกเตอร์ขนาด 384 มิติโดยใช้ SentenceTransformers ต่อไป เราใช้ K-means เพื่อจัดกลุ่มเวกเตอร์เหล่านี้ สิ่งสำคัญคือเราตั้งค่าจำนวนกลุ่มไว้ที่ 2,000 และรวมกลุ่มที่คล้ายกันในขั้นตอนต่อไป’

‘สุดท้าย สำหรับแต่ละกลุ่ม เราใช้ GPT-4o เพื่อสรุปหัวข้อ (หนึ่งหรือสองคำ)’

ผู้เขียนชี้ให้เห็นว่าแนวคิดบางอย่างมีความแตกต่างที่ชัดเจน แต่ก็อยู่ใกล้กัน เช่น คริสตจักร และ อาสนวิหาร มาตรฐานที่ละเอียดเกินไปสำหรับกรณีเหล่านี้จะนำไปสู่การสร้างการฝังตัวของแนวคิด (เช่น สำหรับแต่ละสายพันธุ์สุนัข) แทนที่จะเป็นคำว่า สุนัข ในทางกลับกัน มาตรฐานที่กว้างเกินไปอาจทำให้แนวคิดที่หลากหลายถูกจัดกลุ่มเข้าด้วยกัน

รูปแบบเอกพจน์และพหูพจน์ถูกทำให้เหมือนกัน และคำกริยาได้รับการฟื้นฟูเป็นรูปแบบฐาน (รูปแบบอนุกรมน์)

คำที่กว้างเกินไป เช่น การเคลื่อนไหว, ฉาก, ภาพยนตร์ และ การเคลื่อนไหว ถูกถอดออก

ดังนั้น จึงได้หัวข้อ 1,291 หัวข้อ (ดูรายการทั้งหมดในเอกสารวิจัย)

การเก็บเกี่ยววิดีโอแบบเลือก

ต่อไป นักวิจัยใช้ API ของ YouTube อย่างเป็นทางการเพื่อค้นหาวิดีโอตามเกณฑ์ที่ได้รับจากชุดข้อมูลปี 2024 โดยพยายามที่จะหาวิดีโอ 500 คลิปสำหรับแต่ละหัวข้อ นอกจากใบอนุญาต Creative Commons ที่จำเป็นแล้ว วิดีโอที่มีคุณภาพต้องมีความละเอียด 720p หรือสูงกว่า และต้องมีความยาวไม่เกิน 4 นาที

ด้วยวิธีนี้ จึงได้วิดีโอ 586,490 คลิปจาก YouTube

ผู้เขียนเปรียบเทียบ ID ของวิดีโอที่ดาวน์โหลดกับชุดข้อมูลที่มีชื่อเสียงหลายชุด: OpenVid-1M, HD-VILA-100M, Intern-Vid, Koala-36M, LVD-2M, MiraData, Panda-70M, VidGen-1M และ WebVid-10M

พวกเขาพบว่ามีเพียง 1,675 ID (0.29%) ของคลิปวิดีโอ VideoUFO เท่านั้นที่ปรากฏในคอลเลกชันเก่าเหล่านี้ และต้องยอมรับว่าแม้ว่ารายการคอลเลกชันจะไม่ครอบคลุมทั้งหมด แต่ก็รวมถึงผู้เล่นหลักและผู้มีอิทธิพลที่สุดในงานวิจัยเกี่ยวกับวิดีโอ

การแบ่งและประเมิน

วิดีโอที่ได้รับถูกแบ่งออกเป็นหลายคลิป ตามวิธีการที่อธิบายไว้ในเอกสาร Panda-70M ที่อ้างอิงข้างต้น

แต่ละรายการในฐานข้อมูล VideoUFO มีคลิป วิดีโอ ID เวลาเริ่มต้นและเวลาปลาย และคำบรรยายที่สั้นและยาว

แต่ละรายการในฐานข้อมูล VideoUFO มีคลิป วิดีโอ ID เวลาเริ่มต้นและเวลาปลาย และคำบรรยายที่สั้นและยาว

คำบรรยายที่สั้นถูกจัดการโดยวิธีการ Panda-70M และคำบรรยายวิดีโอที่ยาวโดย Qwen2-VL-7B ตามแนวทางที่กำหนดไว้ใน Open-Sora-Plan ในกรณีที่คลิปไม่ได้แสดงแนวคิดที่ตั้งใจไว้ คำบรรยายที่ยาวสำหรับคลิปแต่ละคลิปถูกส่งเข้าไปใน GPT-4o mini เพื่อดูว่ามันเหมาะสมกับหัวข้อนั้นหรือไม่

การประเมินคุณภาพวิดีโอถูกจัดการด้วยวิธี 6 วิธีจากโครงการ VBench

การเปรียบเทียบ

ผู้เขียนทำซ้ำกระบวนการค้นหาหัวข้อในคอลเลกชันเก่า

เพื่อทำเช่นนี้ จำเป็นต้องจับคู่แนวคิดที่ได้รับจาก VideoUFO กับแนวคิดในคอลเลกชันอื่นๆ ซึ่งเป็นกระบวนการที่มีความเป็น chủ quanและอาจไม่น่าเชื่อถือ

อย่างไรก็ตาม ผลลัพธ์ที่ได้รับจากวิธีนี้แสดงไว้ด้านล่าง:

การเปรียบเทียบคุณลักษณะพื้นฐานที่ได้รับจาก VideoUFO และคอลเลกชันเก่า

การเปรียบเทียบคุณลักษณะพื้นฐานที่ได้รับจาก VideoUFO และคอลเลกชันเก่า

นักวิจัยรับทราบว่าการวิเคราะห์ของพวกเขาขึ้นอยู่กับคำบรรยายและคำอธิบายที่มีอยู่ในคอลเลกชันแต่ละชุด

พวกเขาให้การยอมรับว่าการให้คำบรรยายใหม่สำหรับคอลเลกชันเก่าโดยใช้วิธีการเดียวกันกับ VideoUFO อาจทำให้ได้ผลลัพธ์ที่ตรงไปตรงมา hơn

การสร้าง

ผู้เขียนพัฒนาเครื่องมือมาตรฐานเพื่อประเมินประสิทธิภาพของโมเดลวิดีโอจากข้อความที่มีแนวคิดที่เน้นผู้ใช้ โดยใช้ชื่อว่า BenchUFO

เครื่องมือนี้ใช้คำนาม 791 คำจากหัวข้อ 1,291 หัวข้อที่ได้รับจาก VideoUFO

สำหรับแต่ละหัวข้อ คำสั่ง 10 คำจาก VidProM ถูกเลือกแบบสุ่ม

คำสั่งแต่ละคำถูกส่งเข้าไปในโมเดลวิดีโอจากข้อความ โดยใช้ Qwen2-VL-7B ในการประเมินผลลัพธ์ที่ได้รับ

สเคมาของกระบวนการ BenchUFO

สเคมาของกระบวนการ BenchUFO

โมเดลที่ถูกประเมิน ได้แก่ Mira, Show-1, LTX-Video, Open-Sora-Plan, Open Sora, TF-T2V, Mochi-1, HiGen, Pika, RepVideo, T2V-Zero, CogVideoX, Latte-1, Hunyuan Video, LaVie และ Pyramidal

นอกจากนี้ยังมีการใช้ MVDiT-VidGen และ MVDit-OpenVid เป็นชุดข้อมูลฝึกอบรมทางเลือก

ผลลัพธ์ถูกประเมินโดยพิจารณาจากหัวข้อ 10 อันดับที่ดีที่สุดและ 10 อันดับที่แย่ที่สุดในแต่ละสถาปัตยกรรมและชุดข้อมูล

ผลลัพธ์ของโมเดลวิดีโอจากข้อความสาธารณะเมื่อเทียบกับโมเดลที่ฝึกอบรมโดยผู้เขียนใน BenchUFO

ผลลัพธ์ของโมเดลวิดีโอจากข้อความสาธารณะเมื่อเทียบกับโมเดลที่ฝึกอบรมโดยผู้เขียนใน BenchUFO

ผู้เขียนให้ความเห็นว่า:

‘โมเดลวิดีโอจากข้อความที่มีอยู่ไม่สามารถทำงานได้ดีในหัวข้อที่เน้นผู้ใช้ทั้งหมด โดยเฉพาะมีความแตกต่างของผลลัพธ์ระหว่างหัวข้อ 10 อันดับแรกและ 10 อันดับสุดท้าย ซึ่งแสดงให้เห็นว่าโมเดลเหล่านี้อาจไม่เข้าใจหัวข้อบางอย่าง เช่น “หมึกยักษ์”, “เซลล์สัตว์”, “วินเซนต์ ฟัน โก๊ะ” และ “อียิปต์ древ”

‘โมเดลวิดีโอจากข้อความที่มีอยู่แสดงให้เห็นถึงความสม่ำเสมอในการทำงานที่ดีในหัวข้อบางอย่าง โดยเฉพาะหัวข้อที่เกี่ยวข้องกับสัตว์ เช่น “นกนางนวล”, “แพนด้า”, “โลมา”, “อูฐ” และ “หัวหอก”‘

สรุป

VideoUFO เป็นข้อเสนอที่น่าสนใจ หากพิจารณาจากมุมมองของข้อมูลใหม่ๆ หากไม่มีข้อผิดพลาดในการประเมินและกำจัด ID ของ YouTube และหากชุดข้อมูลมีขนาดใหญ่พอที่จะไม่ซ้ำกัน มันจะเป็นข้อเสนอที่มีคุณค่า

ด้านลบคือต้องให้ความเชื่อถือในแนวทางหลักของวิธีการ หากคุณไม่เชื่อว่าความต้องการของผู้ใช้ควรเป็นแนวทางในการเก็บเกี่ยววิดีโอ คุณจะซื้อชุดข้อมูลที่มีความลำเอียง

นอกจากนี้ ยังมีข้อจำกัดในการใช้หัวข้อที่ได้รับ ซึ่ง phụ thuộc vàoความน่าเชื่อถือของวิธีการที่ใช้ในการทำให้เข้มข้น และวิธีการสร้างชุดข้อมูลปี 2024 ที่ใช้เป็นแหล่งที่มา

อย่างไรก็ตาม VideoUFO ควรได้รับการพิจารณาเพิ่มเติม – และมันสามารถเข้าถึงได้ที่ Hugging Face

 

* การแทนที่การอ้างอิงของนักเขียนด้วยลิงก์

เผยแพร่ครั้งแรกวันพุธที่ 5 มีนาคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai