มุมมองของ Anderson
การคิดใหม่เกี่ยวกับการฝึกอบรม AI วิดีโอโดยใช้ข้อมูลที่เน้นผู้ใช้

ประเภทของเนื้อหาที่ผู้ใช้อาจต้องการสร้างโดยใช้โมเดลที่สร้างขึ้น เช่น Flux หรือ Hunyuan Video อาจไม่ได้พร้อมใช้งานเสมอไป แม้ว่าคำขอเนื้อหาจะไม่ซับซ้อน และคุณอาจคิดว่าเครื่องกำเนิดสามารถจัดการได้
ตัวอย่างหนึ่ง ซึ่งแสดงไว้ในเอกสารวิจัยใหม่ที่เราจะพิจารณาในบทความนี้ ระบุว่าโมเดล OpenAI Sora ที่ถูกกลบด้วยความสนใจมีความยากในการแสดงภาพตัวต่อไฟที่ถูกต้อง โดยใช้คำสั่ง ‘ตัวต่อไฟกำลังสว่างบนใบหญ้าในค่ำคืนฤดูร้อนที่เงียบสงบ’:

OpenAI’s Sora มีความเข้าใจที่ไม่ถูกต้องเกี่ยวกับกายวิภาคของตัวต่อไฟ Source: https://arxiv.org/pdf/2503.01739
เนื่องจากฉันไม่เคยยอมรับคำกล่าวอ้างของการวิจัยโดยไม่มีการตรวจสอบ ฉันจึงทดสอบคำสั่งเดียวกันกับ Sora วันนี้และได้ผลลัพธ์ที่ดีขึ้นเล็กน้อย อย่างไรก็ตาม Sora ยังคงล้มเหลวในการแสดงแสงสว่างที่ถูกต้อง – แทนที่จะส่องสว่างที่ปลายหางของตัวต่อไฟที่มีการเรืองแสง Sora จึงวางแสงที่ใกล้กับเท้าของแมลง:

การทดสอบของฉันโดยใช้คำสั่งของนักวิจัยใน Sora ทำให้ได้ผลลัพธ์ที่แสดงให้เห็นว่า Sora ไม่เข้าใจว่าแสงสว่างของตัวต่อไฟมาจากที่ไหน
ในทางกลับกัน เครื่องกำเนิดการกระจายแบบสร้างสรรค์ของ Adobe Firefly ที่ฝึกอบรมจากภาพถ่ายและวิดีโอที่มีลิขสิทธิ์ของบริษัท สามารถสร้างผลลัพธ์ที่ถูกต้องได้เพียง 1 ใน 3 ครั้ง เมื่อฉันพยายามใช้คำสั่งเดียวกันในฟังก์ชัน AI ที่สร้างสรรค์ของ Photoshop:

เพียงผลลัพธ์สุดท้ายของการสร้างสามครั้งโดยใช้คำสั่งของนักวิจัยใน Adobe Firefly (มีนาคม 2025) ที่มีแสงสว่างอยู่ในตำแหน่งที่ถูกต้องของกายวิภาคของแมลง
ตัวอย่างนี้ถูกนำมาใช้โดยนักวิจัยในเอกสารวิจัยใหม่เพื่อแสดงให้เห็นว่าการกระจาย การเน้น และการครอบคลุมของชุดข้อมูลที่ใช้ในการฝึกอบรมโมเดลที่เป็นพื้นฐานอาจไม่สอดคล้องกับความต้องการของผู้ใช้ แม้ว่าผู้ใช้จะไม่ขออะไรที่ซับซ้อนมากนัก
ผู้เขียนระบุว่า:
‘[Sora] ไม่สามารถจับแนวคิดของตัวต่อไฟที่กำลังสว่างได้ ในขณะที่สามารถสร้างหญ้าและค่ำคืนฤดูร้อนได้สำเร็จ จากมุมมองของข้อมูล เราอนุมานว่าสิ่งนี้เกิดจาก [Sora] ไม่ได้รับการฝึกอบรมเกี่ยวกับหัวข้อที่เกี่ยวข้องกับตัวต่อไฟ ในขณะที่ได้รับการฝึกอบรมเกี่ยวกับหญ้าและค่ำคืน นอกจากนี้ หาก [Sora] ได้เห็นวิดีโอที่แสดงไว้ข้างต้น มันจะเข้าใจว่าตัวต่อไฟที่กำลังสว่างควรจะมีลักษณะอย่างไร’
ข้อมูลสำหรับผู้ใช้
โดยพื้นฐานแล้ว ข้อเสนอของพวกเขานำเสนอแนวทางในการคัดเลือกข้อมูลที่อยู่ระหว่างข้อมูลที่กำหนดเองสำหรับโมเดล เช่น LoRA และชุดข้อมูลขนาดใหญ่ที่ไม่เลือก lọc เช่น LAION ซึ่งไม่ได้ถูกออกแบบมาเพื่อใช้งานเฉพาะเจาะจง
แนวทางใหม่นี้ ซึ่งเป็นทั้งวิธีการและชุดข้อมูลใหม่ ถูกตั้งชื่อว่า Users’ FOcus in text-to-video หรือ VideoUFO ชุดข้อมูล VideoUFO ประกอบด้วยคลิปวิดีโอ 1.9 ล้านคลิปที่ครอบคลุมหัวข้อ 1,291 หัวข้อที่เน้นผู้ใช้ หัวข้อเหล่านี้ถูกพัฒนาจากชุดข้อมูลวิดีโอที่มีอยู่แล้วและผ่านกระบวนการประมวลผลภาษาธรรมชาติและเทคนิคการประมวลผลภาษาธรรมชาติ:

ตัวอย่างหัวข้อที่ถูกทำให้เข้มข้นในเอกสารวิจัยใหม่
ชุดข้อมูล VideoUFO มีคลิปวิดีโอที่ใหม่และไม่เคยปรากฏในข้อมูลวิจัยมาก่อน ‘ใหม่’ ในความหมายที่ว่าคลิปวิดีโอที่ใช้ไม่ได้อยู่ในชุดข้อมูลวิดีโอที่นิยมใช้ในงานวิจัย และไม่ได้อยู่ในชุดข้อมูลย่อยที่ถูกสร้างขึ้นจากชุดข้อมูลเหล่านั้น (และคลิปวิดีโอบางส่วนถูกอัปโหลดหลังจากชุดข้อมูลเก่าถูกสร้างขึ้น)
จริงๆ แล้ว ผู้เขียนอ้างว่า มีเพียง 0.29% ของคลิปวิดีโอใน VideoUFO ที่มีอยู่ในชุดข้อมูลวิดีโอที่มีอยู่แล้ว – ซึ่งเป็นการแสดงให้เห็นถึงความใหม่ของชุดข้อมูลนี้
หนึ่งในสาเหตุอาจเป็นเพราะผู้เขียนจะยอมรับคลิปวิดีโอจาก YouTube ที่มีใบอนุญาต Creative Commons ซึ่งจะทำให้ผู้ใช้ไม่ต้องเผชิญกับปัญหาในอนาคต:
นอกจากนี้ คลิปวิดีโอดังกล่าวถูกขอตามความต้องการของผู้ใช้ (ดูภาพด้านบน) และไม่ได้ถูกเก็บเกี่ยวโดยไม่มีการเลือก lọc:
สิ่งเหล่านี้อาจนำไปสู่ชุดข้อมูลที่ใหม่และไม่เคยปรากฏมาก่อน
แม้ว่าไม่ทุกสิ่งในเอกสารวิจัยใหม่จะน่าเชื่อถือ แต่ก็เป็นเรื่องที่น่าสนใจที่เน้นย้ำถึงความท้าทายที่เราเผชิญในงานวิจัยด้านชุดข้อมูล
งานวิจัยใหม่นี้มีชื่อว่า VideoUFO: ชุดข้อมูลขนาดใหญ่ 1 ล้านรายการสำหรับการสร้างวิดีโอจากข้อความ และมาจากนักวิจัยสองคนจาก University of Technology Sydney ในออสเตรเลียและ Zhejiang University ในจีน

ตัวอย่างจากชุดข้อมูลที่ได้รับ
‘ผู้ช่วยส่วนตัว’ สำหรับข้อมูล AI
เนื้อหาที่ปรากฏบนอินเทอร์เน็ตไม่จำเป็นต้องสะท้อนถึงสิ่งที่ผู้ใช้จะขอจากระบบกำเนิด แม้ว่าเนื้อหาจะมีอยู่และผู้ใช้จะสนใจ (เช่น โป๊ ที่มีอยู่บนอินเทอร์เน็ตและเป็นที่สนใจของหลายๆ คน) สิ่งนี้อาจไม่สอดคล้องกับวัตถุประสงค์ของผู้พัฒนา
นอกจากปริมาณเนื้อหาที่ไม่เหมาะสมที่อัปโหลดทุกวันแล้ว สัดส่วนของเนื้อหาที่มีอยู่บนอินเทอร์เน็ตมักจะมาจากผู้ลงโฆษณาและผู้ที่พยายามที่จะหลอกลวง SEO ซึ่งทำให้การกระจายของเนื้อหานั้นไม่สมดุล และยากที่จะพัฒนาระบบ AI ที่สามารถจัดการกับปัญหานี้ได้
ดังนั้น ผู้เขียนจึงเข้าใกล้ปัญหานี้โดยการย้อนกลับคำสั่ง โดยการกำหนดสิ่งที่ผู้ใช้ต้องการและหาวิดีโอที่สอดคล้องกับความต้องการเหล่านั้น
บนพื้นผิวแล้ว แนวทางนี้ดูเหมือนจะน่าจะทำให้เกิดการแข่งขันที่ไม่สมดุลได้เช่นกัน แต่ลองมาดูกันว่าเอกสารวิจัยนี้มีอะไรบ้าง
การทำให้เข้มข้นของแนวคิดด้วยความระมัดระวัง
นักวิจัยใช้ชุดข้อมูล VidProM ปี 2024 เป็นแหล่งที่มาของการวิเคราะห์หัวข้อที่จะใช้ในการเก็บเกี่ยววิดีโอ
ชุดข้อมูลนี้ถูกเลือกเพราะเป็นชุดข้อมูลขนาดใหญ่ 1 ล้านรายการแรกที่มีเนื้อหาที่เขียนโดยผู้ใช้จริง และควรทราบว่าชุดข้อมูลนี้ถูกสร้างขึ้นโดยนักวิจัยสองคนนี้เอง
เอกสารวิจัยระบุว่า:
‘ก่อนอื่น เราใส่ข้อความ 1.67 ล้านข้อจาก VidProM ลงในเวกเตอร์ขนาด 384 มิติโดยใช้ SentenceTransformers ต่อไป เราใช้ K-means เพื่อจัดกลุ่มเวกเตอร์เหล่านี้ สิ่งสำคัญคือเราตั้งค่าจำนวนกลุ่มไว้ที่ 2,000 และรวมกลุ่มที่คล้ายกันในขั้นตอนต่อไป’
‘สุดท้าย สำหรับแต่ละกลุ่ม เราใช้ GPT-4o เพื่อสรุปหัวข้อ (หนึ่งหรือสองคำ)’
ผู้เขียนชี้ให้เห็นว่าแนวคิดบางอย่างมีความแตกต่างที่ชัดเจน แต่ก็อยู่ใกล้กัน เช่น คริสตจักร และ อาสนวิหาร มาตรฐานที่ละเอียดเกินไปสำหรับกรณีเหล่านี้จะนำไปสู่การสร้างการฝังตัวของแนวคิด (เช่น สำหรับแต่ละสายพันธุ์สุนัข) แทนที่จะเป็นคำว่า สุนัข ในทางกลับกัน มาตรฐานที่กว้างเกินไปอาจทำให้แนวคิดที่หลากหลายถูกจัดกลุ่มเข้าด้วยกัน
รูปแบบเอกพจน์และพหูพจน์ถูกทำให้เหมือนกัน และคำกริยาได้รับการฟื้นฟูเป็นรูปแบบฐาน (รูปแบบอนุกรมน์)
คำที่กว้างเกินไป เช่น การเคลื่อนไหว, ฉาก, ภาพยนตร์ และ การเคลื่อนไหว ถูกถอดออก
ดังนั้น จึงได้หัวข้อ 1,291 หัวข้อ (ดูรายการทั้งหมดในเอกสารวิจัย)
การเก็บเกี่ยววิดีโอแบบเลือก
ต่อไป นักวิจัยใช้ API ของ YouTube อย่างเป็นทางการเพื่อค้นหาวิดีโอตามเกณฑ์ที่ได้รับจากชุดข้อมูลปี 2024 โดยพยายามที่จะหาวิดีโอ 500 คลิปสำหรับแต่ละหัวข้อ นอกจากใบอนุญาต Creative Commons ที่จำเป็นแล้ว วิดีโอที่มีคุณภาพต้องมีความละเอียด 720p หรือสูงกว่า และต้องมีความยาวไม่เกิน 4 นาที
ด้วยวิธีนี้ จึงได้วิดีโอ 586,490 คลิปจาก YouTube
ผู้เขียนเปรียบเทียบ ID ของวิดีโอที่ดาวน์โหลดกับชุดข้อมูลที่มีชื่อเสียงหลายชุด: OpenVid-1M, HD-VILA-100M, Intern-Vid, Koala-36M, LVD-2M, MiraData, Panda-70M, VidGen-1M และ WebVid-10M
พวกเขาพบว่ามีเพียง 1,675 ID (0.29%) ของคลิปวิดีโอ VideoUFO เท่านั้นที่ปรากฏในคอลเลกชันเก่าเหล่านี้ และต้องยอมรับว่าแม้ว่ารายการคอลเลกชันจะไม่ครอบคลุมทั้งหมด แต่ก็รวมถึงผู้เล่นหลักและผู้มีอิทธิพลที่สุดในงานวิจัยเกี่ยวกับวิดีโอ
การแบ่งและประเมิน
วิดีโอที่ได้รับถูกแบ่งออกเป็นหลายคลิป ตามวิธีการที่อธิบายไว้ในเอกสาร Panda-70M ที่อ้างอิงข้างต้น

แต่ละรายการในฐานข้อมูล VideoUFO มีคลิป วิดีโอ ID เวลาเริ่มต้นและเวลาปลาย และคำบรรยายที่สั้นและยาว
คำบรรยายที่สั้นถูกจัดการโดยวิธีการ Panda-70M และคำบรรยายวิดีโอที่ยาวโดย Qwen2-VL-7B ตามแนวทางที่กำหนดไว้ใน Open-Sora-Plan ในกรณีที่คลิปไม่ได้แสดงแนวคิดที่ตั้งใจไว้ คำบรรยายที่ยาวสำหรับคลิปแต่ละคลิปถูกส่งเข้าไปใน GPT-4o mini เพื่อดูว่ามันเหมาะสมกับหัวข้อนั้นหรือไม่
การประเมินคุณภาพวิดีโอถูกจัดการด้วยวิธี 6 วิธีจากโครงการ VBench
การเปรียบเทียบ
ผู้เขียนทำซ้ำกระบวนการค้นหาหัวข้อในคอลเลกชันเก่า
เพื่อทำเช่นนี้ จำเป็นต้องจับคู่แนวคิดที่ได้รับจาก VideoUFO กับแนวคิดในคอลเลกชันอื่นๆ ซึ่งเป็นกระบวนการที่มีความเป็น chủ quanและอาจไม่น่าเชื่อถือ
อย่างไรก็ตาม ผลลัพธ์ที่ได้รับจากวิธีนี้แสดงไว้ด้านล่าง:

การเปรียบเทียบคุณลักษณะพื้นฐานที่ได้รับจาก VideoUFO และคอลเลกชันเก่า
นักวิจัยรับทราบว่าการวิเคราะห์ของพวกเขาขึ้นอยู่กับคำบรรยายและคำอธิบายที่มีอยู่ในคอลเลกชันแต่ละชุด
พวกเขาให้การยอมรับว่าการให้คำบรรยายใหม่สำหรับคอลเลกชันเก่าโดยใช้วิธีการเดียวกันกับ VideoUFO อาจทำให้ได้ผลลัพธ์ที่ตรงไปตรงมา hơn
การสร้าง
ผู้เขียนพัฒนาเครื่องมือมาตรฐานเพื่อประเมินประสิทธิภาพของโมเดลวิดีโอจากข้อความที่มีแนวคิดที่เน้นผู้ใช้ โดยใช้ชื่อว่า BenchUFO
เครื่องมือนี้ใช้คำนาม 791 คำจากหัวข้อ 1,291 หัวข้อที่ได้รับจาก VideoUFO
สำหรับแต่ละหัวข้อ คำสั่ง 10 คำจาก VidProM ถูกเลือกแบบสุ่ม
คำสั่งแต่ละคำถูกส่งเข้าไปในโมเดลวิดีโอจากข้อความ โดยใช้ Qwen2-VL-7B ในการประเมินผลลัพธ์ที่ได้รับ

สเคมาของกระบวนการ BenchUFO
โมเดลที่ถูกประเมิน ได้แก่ Mira, Show-1, LTX-Video, Open-Sora-Plan, Open Sora, TF-T2V, Mochi-1, HiGen, Pika, RepVideo, T2V-Zero, CogVideoX, Latte-1, Hunyuan Video, LaVie และ Pyramidal
นอกจากนี้ยังมีการใช้ MVDiT-VidGen และ MVDit-OpenVid เป็นชุดข้อมูลฝึกอบรมทางเลือก
ผลลัพธ์ถูกประเมินโดยพิจารณาจากหัวข้อ 10 อันดับที่ดีที่สุดและ 10 อันดับที่แย่ที่สุดในแต่ละสถาปัตยกรรมและชุดข้อมูล

ผลลัพธ์ของโมเดลวิดีโอจากข้อความสาธารณะเมื่อเทียบกับโมเดลที่ฝึกอบรมโดยผู้เขียนใน BenchUFO
ผู้เขียนให้ความเห็นว่า:
‘โมเดลวิดีโอจากข้อความที่มีอยู่ไม่สามารถทำงานได้ดีในหัวข้อที่เน้นผู้ใช้ทั้งหมด โดยเฉพาะมีความแตกต่างของผลลัพธ์ระหว่างหัวข้อ 10 อันดับแรกและ 10 อันดับสุดท้าย ซึ่งแสดงให้เห็นว่าโมเดลเหล่านี้อาจไม่เข้าใจหัวข้อบางอย่าง เช่น “หมึกยักษ์”, “เซลล์สัตว์”, “วินเซนต์ ฟัน โก๊ะ” และ “อียิปต์ древ”
‘โมเดลวิดีโอจากข้อความที่มีอยู่แสดงให้เห็นถึงความสม่ำเสมอในการทำงานที่ดีในหัวข้อบางอย่าง โดยเฉพาะหัวข้อที่เกี่ยวข้องกับสัตว์ เช่น “นกนางนวล”, “แพนด้า”, “โลมา”, “อูฐ” และ “หัวหอก”‘
สรุป
VideoUFO เป็นข้อเสนอที่น่าสนใจ หากพิจารณาจากมุมมองของข้อมูลใหม่ๆ หากไม่มีข้อผิดพลาดในการประเมินและกำจัด ID ของ YouTube และหากชุดข้อมูลมีขนาดใหญ่พอที่จะไม่ซ้ำกัน มันจะเป็นข้อเสนอที่มีคุณค่า
ด้านลบคือต้องให้ความเชื่อถือในแนวทางหลักของวิธีการ หากคุณไม่เชื่อว่าความต้องการของผู้ใช้ควรเป็นแนวทางในการเก็บเกี่ยววิดีโอ คุณจะซื้อชุดข้อมูลที่มีความลำเอียง
นอกจากนี้ ยังมีข้อจำกัดในการใช้หัวข้อที่ได้รับ ซึ่ง phụ thuộc vàoความน่าเชื่อถือของวิธีการที่ใช้ในการทำให้เข้มข้น และวิธีการสร้างชุดข้อมูลปี 2024 ที่ใช้เป็นแหล่งที่มา
อย่างไรก็ตาม VideoUFO ควรได้รับการพิจารณาเพิ่มเติม – และมันสามารถเข้าถึงได้ที่ Hugging Face
* การแทนที่การอ้างอิงของนักเขียนด้วยลิงก์
เผยแพร่ครั้งแรกวันพุธที่ 5 มีนาคม 2025












