โมเดลและแพลตฟอร์ม AI

AnimateLCM : การจำลองการเคลื่อนไหวของโมเดลการกระจายส่วนบุคคล

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในช่วงไม่กี่ปีที่ผ่านมา โมเดลการกระจายได้ประสบความสำเร็จและได้รับการยอมรับอย่างมากในการสร้างภาพและวิดีโอ โมเดลการกระจายวิดีโอมีความน่าสนใจเป็นพิเศษเนื่องจากสามารถสร้างวิดีโอที่มีความสอดคล้องและความเที่ยงธรรมสูงได้ โมเดลเหล่านี้สร้างวิดีโอคุณภาพสูงโดยใช้กระบวนการ denoising ที่ซ้ำกันในโครงสร้างของตน ซึ่งเปลี่ยน noise ที่มีมิติสูงเป็นข้อมูลจริง

Stable Diffusion เป็นหนึ่งในโมเดลที่เป็นตัวแทนของการสร้างภาพโดยใช้ Variational AutoEncoder (VAE) เพื่อสร้างความสัมพันธ์ระหว่างภาพจริงและคุณลักษณะที่มีขนาดลดลง โมเดลนี้ช่วยลดต้นทุนการสร้างภาพในขณะที่กลไก cross-attention ในโครงสร้างของมันช่วยให้สามารถสร้างภาพตามเงื่อนไขข้อความได้ ในไม่กี่ปีที่ผ่านมา โมเดล Stable Diffusion ได้สร้างพื้นฐานสำหรับอุปกรณ์ปลั๊กอินหลายตัวเพื่อให้ได้ผลลัพธ์ที่สร้างสรรค์และมีประสิทธิภาพมากขึ้นในการสร้างภาพหรือวิดีโอ อย่างไรก็ตาม กระบวนการสร้างภาพที่ซ้ำกันซึ่งใช้โดยโมเดลการกระจายวิดีโอส่วนใหญ่ทำให้กระบวนการสร้างภาพใช้เวลานานและต้องใช้ต้นทุนการคำนวณมาก ซึ่งจำกัดความสามารถในการใช้งาน

ในบทความนี้ เราจะพูดถึง AnimateLCM ซึ่งเป็นโมเดลการกระจายส่วนบุคคลที่มีอุปกรณ์ปลั๊กอินเพื่อสร้างวิดีโอคุณภาพสูงโดยใช้ขั้นตอนและต้นทุนการคำนวณที่น้อยที่สุด โครงสร้าง AnimateLCM ได้รับแรงบันดาลใจจาก Consistency Model ซึ่งเร่งกระบวนการสร้างภาพโดยใช้ขั้นตอนที่น้อยที่สุดโดยการแยกโมเดลการกระจายภาพที่ได้รับการฝึกฝนแล้ว นอกจากนี้ การขยายความสำเร็จของ Consistency Model ซึ่งก็คือ Latent Consistency Model (LCM) ช่วยให้สามารถสร้างภาพตามเงื่อนไขได้ แทนที่จะทำการเรียนรู้ความสอดคล้องโดยตรงบนชุดข้อมูลวิดีโอที่ไม่ได้ประมวลผล โครงสร้าง AnimateLCM เสนอการใช้กลยุทธ์การเรียนรู้ความสอดคล้องที่แยกออกจากกัน ซึ่งแยกการกลั่นกรองของ motion generation priors และ image generation priors ทำให้โมเดลสามารถเพิ่มคุณภาพของเนื้อหาที่สร้างขึ้นและปรับปรุงประสิทธิภาพการฝึกฝนในเวลาเดียวกัน

นอกจากนี้ โมเดล AnimateLCM เสนอการฝึกอุปกรณ์ปลั๊กอินจากต้นหรือการปรับอุปกรณ์ปลั๊กอินที่มีอยู่แล้วให้เข้ากับโมเดลความสอดคล้องของวิดีโอที่กลั่นกรองแล้ว ซึ่งช่วยให้สามารถรวมอุปกรณ์ปลั๊กอินแบบปลั๊กอินในตระกูลโมเดลการกระจายที่เสถียรเพื่อให้ได้ฟังก์ชันต่างๆ โดยไม่กระทบต่อความเร็วในการสร้างภาพ

AnimateLCM : การจำลองการเคลื่อนไหวของโมเดลการกระจายส่วนบุคคล

โมเดลการกระจายได้กลายเป็นโครงสร้างที่เป็นที่นิยมสำหรับการสร้างภาพและวิดีโอเนื่องจากความสามารถและประสิทธิภาพในการสร้างภาพ โมเดลการกระจายส่วนใหญ่ขึ้นอยู่กับกระบวนการ denoising ที่ซ้ำกันเพื่อสร้างภาพ ซึ่งเปลี่ยน noise ที่มีมิติสูงเป็นข้อมูลจริง แม้ว่าวิธีการนี้จะให้ผลลัพธ์ที่น่าพอใจ แต่กระบวนการซ้ำกันและจำนวนการซ้ำกันทำให้กระบวนการสร้างภาพช้าและเพิ่มต้นทุนการคำนวณของโมเดลการกระจาย ซึ่งทำให้โมเดลการกระจายช้ากว่าโครงสร้างการสร้างภาพอื่นๆ เช่น GAN หรือ Generative Adversarial Networks

InstantID : วิธีการและโครงสร้าง

โครงสร้าง InstantID ได้รับแรงบันดาลใจจากโมเดลการกระจายและกลยุทธ์การเร่งความเร็วในการสร้างภาพ โมเดลการกระจายหรือโมเดลการสร้างภาพตามคะแนนได้แสดงให้เห็นถึงความสามารถในการสร้างภาพที่น่าประทับใจภายใต้การนำทางของคะแนน การสร้างตัวอย่างแบบซ้ำกันซึ่งใช้โดยโมเดลการกระจายจะลบ noise ที่ปนเปื้อนออกจากข้อมูลทีละน้อย

การเปลี่ยนจากโมเดลการกระจายไปสู่โมเดลความสอดคล้อง

โครงสร้าง AnimateLCM นำการปรับเปลี่ยนของ Stable Diffusion Model หรือ DM ไปสู่ Consistency Model หรือ CM ตามการออกแบบของ Latent Consistency Model หรือ LCM

การเรียนรู้ความสอดคล้องที่แยกออกจากกัน

ในการทำความสอดคล้อง การกลั่นกรองของ motion generation priors และ image generation priors จะถูกแยกออกจากกัน

การปรับเปลี่ยนโดยไม่ต้องมีครู

โมเดลการกระจายที่เสถียรและอุปกรณ์ปลั๊กอินแบบปลั๊กอินมักจะถูกใช้ร่วมกัน แต่การปรับเปลี่ยนโดยไม่ต้องมีครูเป็นวิธีการที่ง่ายและ有效ในการปรับอุปกรณ์ปลั๊กอินให้เข้ากับโมเดลการกระจายที่มีอยู่แล้วหรือฝึกอุปกรณ์ปลั๊กอินใหม่จากต้น

AnimateLCM: การทดลองและผลลัพธ์

โครงสร้าง AnimateLCM ใช้ Stable Diffusion v1-5 เป็นโมเดลฐานและใช้ DDIM ODE solver สำหรับการฝึกอบรม

ผลลัพธ์เชิงปริมาณ

ผลลัพธ์เชิงปริมาณแสดงให้เห็นถึงความสามารถของโครงสร้าง AnimateLCM ในการสร้างวิดีโอคุณภาพสูงโดยใช้ขั้นตอนที่น้อยที่สุด

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง AnimateLCM ซึ่งเป็นโมเดลการกระจายส่วนบุคคลที่มีอุปกรณ์ปลั๊กอินเพื่อสร้างวิดีโอคุณภาพสูงโดยใช้ขั้นตอนที่น้อยที่สุดและต้นทุนการคำนวณที่น้อยที่สุด โครงสร้าง AnimateLCM ได้รับแรงบันดาลใจจาก Consistency Model ซึ่งเร่งกระบวนการสร้างภาพโดยใช้ขั้นตอนที่น้อยที่สุดโดยการแยกโมเดลการกระจายภาพที่ได้รับการฝึกฝนแล้ว

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล