โมเดลและแพลตฟอร์ม AI
Stable Video Diffusion: โมเดลการกระจายวิดีโอที่เสถียรสำหรับชุดข้อมูลขนาดใหญ่
Generative AI ได้เป็นแรงผลักดันสำคัญใน cộng đồng AI มาเป็นเวลานาน และความก้าวหน้าที่ทำได้ในด้านการสร้างภาพแบบเจนเนอรатив โดยเฉพาะอย่างยิ่งการใช้โมเดลการกระจาย ได้ช่วยให้โมเดลวิดีโอเจนเนอรативก้าวหน้าอย่างมาก ไม่เพียงแต่ในด้านการวิจัยเท่านั้น แต่ยังรวมถึงการประยุกต์ใช้ในโลกแห่งความเป็นจริงด้วย
โดยการนำความก้าวหน้าในโมเดลวิดีโอเจนเนอรативไปสู่ขั้นตอนต่อไป ในบทความนี้ เราจะพูดถึง Stable Video Diffusion Model ซึ่งเป็นโมเดลการกระจายวิดีโอที่สามารถสร้างวิดีโอความละเอียดสูงและเนื้อหาวิดีโอที่มีคุณภาพสูงได้ เราจะพูดถึงวิธีการที่โมเดลการกระจายแบบเจนเนอรативที่ใช้สำหรับการสร้างภาพ 2 มิติได้ปรับปรุงความสามารถและประสิทธิภาพของโมเดลวิดีโอเจนเนอรативโดยการเพิ่มชั้นเวลาและปรับแต่งโมเดลบนชุดข้อมูลขนาดเล็กที่มีวิดีโอความละเอียดสูง
Stable Video Diffusion Model และ Generative Video Models: การแนะนำ
ด้วยศักยภาพที่เกือบจะไม่มีขอบเขต Generative AI ได้เป็นหัวข้อหลักของการวิจัยสำหรับนักวิจัยและผู้ปฏิบัติงาน AI และ ML มาเป็นเวลานาน และในช่วงไม่กี่ปีที่ผ่านมาได้เห็นความก้าวหน้าอย่างรวดเร็วทั้งในด้านประสิทธิภาพและความสามารถของโมเดลการสร้างภาพเจนเนอรатив
ด้วยความก้าวหน้าที่ทำได้ในโมเดลการสร้างภาพเจนเนอรатив นักวิจัยได้สังเกตเห็นว่าผลกระทบของการกระจายตัวของข้อมูลฝึกอบรมต่อประสิทธิภาพของโมเดลเจนเนอรативนั้นเป็นเรื่องที่สำคัญและไม่มีข้อโต้แย้ง นอกจากนี้ นักวิจัยยังพบว่าการฝึกอบรมโมเดลการสร้างภาพเจนเนอรативบนชุดข้อมูลขนาดใหญ่และหลากหลาย ตามด้วยการปรับแต่งบนชุดข้อมูลขนาดเล็กที่มีคุณภาพดีกว่า thườngจะช่วยปรับปรุงประสิทธิภาพได้อย่างมาก

โมเดลวิดีโอเจนเนอรативที่ล่าสุดนั้นพึ่งพาโมเดลการกระจายและวิธีการปรับแต่งข้อความหรือภาพเพื่อสร้างวิดีโอหรือภาพหลายเฟรมที่สอดคล้องกัน โมเดลการกระจายเป็นที่รู้จักในความสามารถในการเรียนรู้วิธีการลดความเสียหายของตัวอย่างจากการกระจายตัวปกติโดยใช้กระบวนการปรับแต่งแบบเรียงซ้อน และได้ให้ผลลัพธ์ที่น่าพอใจบนการสร้างวิดีโอและข้อความถึงภาพสูง
Stable Video Diffusion Model ติดตามกลยุทธ์ที่ไม่เคยถูกนำมาใช้โดยโมเดลวิดีโอเจนเนอรативใดๆ โดยพึ่งพาโมเดลการกระจายวิดีโอที่มีฐานรากและกลยุทธ์การฝึกอบรมที่กำหนดไว้แล้ว และประเมินผลกระทบของการคัดเลือกข้อมูล
Latent Video Diffusion Models
Latent Video Diffusion Models หรือ Video-LDMs นั้นใช้แนวทางในการฝึกอบรมโมเดลเจนเนอรативหลักในพื้นที่ 潜伏ที่มีความซับซ้อนที่ลดลง และส่วนใหญ่ของ Video-LDMs นั้นใช้โมเดลการสร้างภาพถึงข้อความที่ได้รับการฝึกอบรมล่วงหน้าพร้อมกับการเพิ่มชั้นเวลาในโครงสร้างการฝึกอบรม
Data Curation
Data Curation เป็นส่วนประกอบที่สำคัญไม่เพียงแต่ของ Stable Video Diffusion Model แต่สำหรับโมเดลเจนเนอรативโดยรวมด้วย เนื่องจากจำเป็นต้องฝึกอบรมโมเดลขนาดใหญ่บนชุดข้อมูลขนาดใหญ่เพื่อเพิ่มประสิทธิภาพในการทำงานต่างๆ รวมถึงการสร้างภาษาหรือการสร้างภาพถึงข้อความ
Data Curation สำหรับการสังเคราะห์วิดีโอความละเอียดสูง
ตามที่กล่าวไว้ในตอนต้น Stable Video Diffusion Model นั้นใช้กลยุทธ์การฝึกอบรมสามขั้นตอน ซึ่งนำไปสู่ผลลัพธ์ที่ดีขึ้นและความก้าวหน้าอย่างมากในการทำงาน
ขั้นตอนแรกคือการฝึกอบรมภาพ ซึ่งใช้โมเดลการกระจายภาพถึงข้อความ 2 มิติ ขั้นตอนที่สองคือการฝึกอบรมวิดีโอ ซึ่งโมเดลจะฝึกอบรมบนชุดข้อมูลวิดีโอที่มีขนาดใหญ่ และขั้นตอนที่สามคือการปรับแต่งวิดีโอ ซึ่งโมเดลจะถูกปรับแต่งบนชุดข้อมูลวิดีโอที่มีคุณภาพสูงและความละเอียดสูง
Stage I: Image Pre-Training
ขั้นตอนแรกของ Stable Video Diffusion Model คือการฝึกอบรมภาพ โดยใช้โมเดลการกระจายภาพถึงข้อความ 2 มิติ
Stage II: Video Pre-Training
ขั้นตอนที่สองคือการฝึกอบรมวิดีโอ โดยโมเดลจะฝึกอบรมบนชุดข้อมูลวิดีโอที่มีขนาดใหญ่
Stage III: High-Quality Fine-tuning
ขั้นตอนที่สามคือการปรับแต่งวิดีโอ โดยโมเดลจะถูกปรับแต่งบนชุดข้อมูลวิดีโอที่มีคุณภาพสูงและความละเอียดสูง
Results and Findings
ตอนนี้เรามาดูผลลัพธ์ของ Stable Video Diffusion Framework กัน
ผลลัพธ์แสดงให้เห็นว่า Stable Video Diffusion Framework สามารถสร้างวิดีโอความละเอียดสูงและเนื้อหาวิดีโอที่มีคุณภาพสูงได้
Pre-Trained Base Model
Stable Video Diffusion Model นั้นใช้โมเดลการกระจายภาพถึงข้อความ 2 มิติเป็นฐาน
Frame Interpolation and Multi-View Generation
Stable Video Diffusion Framework สามารถสร้างวิดีโอหลายมุมมองได้
Final Thoughts
ในบทความนี้ เราได้พูดถึง Stable Video Diffusion Model ซึ่งเป็นโมเดลการกระจายวิดีโอที่สามารถสร้างวิดีโอความละเอียดสูงและเนื้อหาวิดีโอที่มีคุณภาพสูงได้
เราพูดถึงวิธีการที่โมเดลการกระจายแบบเจนเนอรативที่ใช้สำหรับการสร้างภาพ 2 มิติได้ปรับปรุงความสามารถและประสิทธิภาพของโมเดลวิดีโอเจนเนอรативโดยการเพิ่มชั้นเวลาและปรับแต่งโมเดลบนชุดข้อมูลขนาดเล็กที่มีวิดีโอความละเอียดสูง
Stable Video Diffusion Framework ใช้สามขั้นตอนในการฝึกอบรม ซึ่งได้แก่ การฝึกอบรมภาพ การฝึกอบรมวิดีโอ และการปรับแต่งวิดีโอ












