โมเดลและแพลตฟอร์ม AI

Stable Video Diffusion: โมเดลการกระจายวิดีโอที่เสถียรสำหรับชุดข้อมูลขนาดใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Generative AI ได้เป็นแรงผลักดันสำคัญใน cộng đồng AI มาเป็นเวลานาน และความก้าวหน้าที่ทำได้ในด้านการสร้างภาพแบบเจนเนอรатив โดยเฉพาะอย่างยิ่งการใช้โมเดลการกระจาย ได้ช่วยให้โมเดลวิดีโอเจนเนอรативก้าวหน้าอย่างมาก ไม่เพียงแต่ในด้านการวิจัยเท่านั้น แต่ยังรวมถึงการประยุกต์ใช้ในโลกแห่งความเป็นจริงด้วย

โดยการนำความก้าวหน้าในโมเดลวิดีโอเจนเนอรативไปสู่ขั้นตอนต่อไป ในบทความนี้ เราจะพูดถึง Stable Video Diffusion Model ซึ่งเป็นโมเดลการกระจายวิดีโอที่สามารถสร้างวิดีโอความละเอียดสูงและเนื้อหาวิดีโอที่มีคุณภาพสูงได้ เราจะพูดถึงวิธีการที่โมเดลการกระจายแบบเจนเนอรативที่ใช้สำหรับการสร้างภาพ 2 มิติได้ปรับปรุงความสามารถและประสิทธิภาพของโมเดลวิดีโอเจนเนอรативโดยการเพิ่มชั้นเวลาและปรับแต่งโมเดลบนชุดข้อมูลขนาดเล็กที่มีวิดีโอความละเอียดสูง

Stable Video Diffusion Model และ Generative Video Models: การแนะนำ

ด้วยศักยภาพที่เกือบจะไม่มีขอบเขต Generative AI ได้เป็นหัวข้อหลักของการวิจัยสำหรับนักวิจัยและผู้ปฏิบัติงาน AI และ ML มาเป็นเวลานาน และในช่วงไม่กี่ปีที่ผ่านมาได้เห็นความก้าวหน้าอย่างรวดเร็วทั้งในด้านประสิทธิภาพและความสามารถของโมเดลการสร้างภาพเจนเนอรатив

ด้วยความก้าวหน้าที่ทำได้ในโมเดลการสร้างภาพเจนเนอรатив นักวิจัยได้สังเกตเห็นว่าผลกระทบของการกระจายตัวของข้อมูลฝึกอบรมต่อประสิทธิภาพของโมเดลเจนเนอรативนั้นเป็นเรื่องที่สำคัญและไม่มีข้อโต้แย้ง นอกจากนี้ นักวิจัยยังพบว่าการฝึกอบรมโมเดลการสร้างภาพเจนเนอรативบนชุดข้อมูลขนาดใหญ่และหลากหลาย ตามด้วยการปรับแต่งบนชุดข้อมูลขนาดเล็กที่มีคุณภาพดีกว่า thườngจะช่วยปรับปรุงประสิทธิภาพได้อย่างมาก

โมเดลวิดีโอเจนเนอรативที่ล่าสุดนั้นพึ่งพาโมเดลการกระจายและวิธีการปรับแต่งข้อความหรือภาพเพื่อสร้างวิดีโอหรือภาพหลายเฟรมที่สอดคล้องกัน โมเดลการกระจายเป็นที่รู้จักในความสามารถในการเรียนรู้วิธีการลดความเสียหายของตัวอย่างจากการกระจายตัวปกติโดยใช้กระบวนการปรับแต่งแบบเรียงซ้อน และได้ให้ผลลัพธ์ที่น่าพอใจบนการสร้างวิดีโอและข้อความถึงภาพสูง

Stable Video Diffusion Model ติดตามกลยุทธ์ที่ไม่เคยถูกนำมาใช้โดยโมเดลวิดีโอเจนเนอรативใดๆ โดยพึ่งพาโมเดลการกระจายวิดีโอที่มีฐานรากและกลยุทธ์การฝึกอบรมที่กำหนดไว้แล้ว และประเมินผลกระทบของการคัดเลือกข้อมูล

Latent Video Diffusion Models

Latent Video Diffusion Models หรือ Video-LDMs นั้นใช้แนวทางในการฝึกอบรมโมเดลเจนเนอรативหลักในพื้นที่ 潜伏ที่มีความซับซ้อนที่ลดลง และส่วนใหญ่ของ Video-LDMs นั้นใช้โมเดลการสร้างภาพถึงข้อความที่ได้รับการฝึกอบรมล่วงหน้าพร้อมกับการเพิ่มชั้นเวลาในโครงสร้างการฝึกอบรม

Data Curation

Data Curation เป็นส่วนประกอบที่สำคัญไม่เพียงแต่ของ Stable Video Diffusion Model แต่สำหรับโมเดลเจนเนอรативโดยรวมด้วย เนื่องจากจำเป็นต้องฝึกอบรมโมเดลขนาดใหญ่บนชุดข้อมูลขนาดใหญ่เพื่อเพิ่มประสิทธิภาพในการทำงานต่างๆ รวมถึงการสร้างภาษาหรือการสร้างภาพถึงข้อความ

Data Curation สำหรับการสังเคราะห์วิดีโอความละเอียดสูง

ตามที่กล่าวไว้ในตอนต้น Stable Video Diffusion Model นั้นใช้กลยุทธ์การฝึกอบรมสามขั้นตอน ซึ่งนำไปสู่ผลลัพธ์ที่ดีขึ้นและความก้าวหน้าอย่างมากในการทำงาน

ขั้นตอนแรกคือการฝึกอบรมภาพ ซึ่งใช้โมเดลการกระจายภาพถึงข้อความ 2 มิติ ขั้นตอนที่สองคือการฝึกอบรมวิดีโอ ซึ่งโมเดลจะฝึกอบรมบนชุดข้อมูลวิดีโอที่มีขนาดใหญ่ และขั้นตอนที่สามคือการปรับแต่งวิดีโอ ซึ่งโมเดลจะถูกปรับแต่งบนชุดข้อมูลวิดีโอที่มีคุณภาพสูงและความละเอียดสูง

Stage I: Image Pre-Training

ขั้นตอนแรกของ Stable Video Diffusion Model คือการฝึกอบรมภาพ โดยใช้โมเดลการกระจายภาพถึงข้อความ 2 มิติ

Stage II: Video Pre-Training

ขั้นตอนที่สองคือการฝึกอบรมวิดีโอ โดยโมเดลจะฝึกอบรมบนชุดข้อมูลวิดีโอที่มีขนาดใหญ่

Stage III: High-Quality Fine-tuning

ขั้นตอนที่สามคือการปรับแต่งวิดีโอ โดยโมเดลจะถูกปรับแต่งบนชุดข้อมูลวิดีโอที่มีคุณภาพสูงและความละเอียดสูง

Results and Findings

ตอนนี้เรามาดูผลลัพธ์ของ Stable Video Diffusion Framework กัน

ผลลัพธ์แสดงให้เห็นว่า Stable Video Diffusion Framework สามารถสร้างวิดีโอความละเอียดสูงและเนื้อหาวิดีโอที่มีคุณภาพสูงได้

Pre-Trained Base Model

Stable Video Diffusion Model นั้นใช้โมเดลการกระจายภาพถึงข้อความ 2 มิติเป็นฐาน

Frame Interpolation and Multi-View Generation

Stable Video Diffusion Framework สามารถสร้างวิดีโอหลายมุมมองได้

Final Thoughts

ในบทความนี้ เราได้พูดถึง Stable Video Diffusion Model ซึ่งเป็นโมเดลการกระจายวิดีโอที่สามารถสร้างวิดีโอความละเอียดสูงและเนื้อหาวิดีโอที่มีคุณภาพสูงได้

เราพูดถึงวิธีการที่โมเดลการกระจายแบบเจนเนอรативที่ใช้สำหรับการสร้างภาพ 2 มิติได้ปรับปรุงความสามารถและประสิทธิภาพของโมเดลวิดีโอเจนเนอรативโดยการเพิ่มชั้นเวลาและปรับแต่งโมเดลบนชุดข้อมูลขนาดเล็กที่มีวิดีโอความละเอียดสูง

Stable Video Diffusion Framework ใช้สามขั้นตอนในการฝึกอบรม ซึ่งได้แก่ การฝึกอบรมภาพ การฝึกอบรมวิดีโอ และการปรับแต่งวิดีโอ

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล