โมเดลและแพลตฟอร์ม AI
CameraCtrl : การควบคุมกล้องสำหรับการสร้างวิดีโอจากข้อความ
เฟรมเวิร์กที่พยายามสร้างวิดีโอจากข้อความหรือ T2V Generation ใช้โมเดลการกระจายเพื่อเพิ่มความเสถียรในการฝึกอบรม และ Video Diffusion Model เป็นหนึ่งในผู้บุกเบิกในการสร้างวิดีโอจากข้อความ โดยขยายโครงสร้างการกระจายภาพ 2 มิติเพื่อรองรับข้อมูลวิดีโอ และฝึกโมเดลพร้อมกับข้อมูลวิดีโอและภาพจากต้นกำเนิด การสร้างบนพื้นฐานเดียวกัน และเพื่อนำโมเดล Stable Diffusion มาใช้ในการสร้างภาพที่มีประสิทธิภาพ โมเดลใหม่ๆ ได้ขยายโครงสร้าง 2 มิติโดยการแทรกชั้นเวลาระหว่างชั้น 2 มิติที่ฝึกอบรมไว้แล้ว และปรับโมเดลใหม่บนเซตข้อมูลขนาดใหญ่ที่ไม่เคยเห็นมาก่อน
尽管他们采用这种方法,โมเดลการสร้างวิดีโอจากข้อความยังคงเผชิญกับความท้าทายที่สำคัญ เนื่องจากความคลุมเครือของข้อความที่ใช้เพียงอย่างเดียวในการสร้างวิดีโอนั้นบ่อยครั้งทำให้โมเดลมีการควบคุมการสร้างที่อ่อนแอ เพื่อแก้ไขข้อจำกัดนี้ บางโมเดลให้คำแนะนำที่ดีขึ้น ในขณะที่โมเดลอื่นๆ ทำงานกับสัญญาณที่แม่นยำเพื่อควบคุมการเคลื่อนไหวหรือการเคลื่อนไหวของมนุษย์ในวิดีโอที่สังเคราะห์ไว้ ด้วยทางกลับกัน มีเฟรมเวิร์กการสร้างวิดีโอจากข้อความเพียงไม่กี่ตัวที่ใช้ภาพเป็นสัญญาณควบคุมสำหรับเครื่องสร้างวิดีโอ ซึ่งนำไปสู่การสร้างความสัมพันธ์ทางเวลาหรือคุณภาพวิดีโอที่แม่นยำ
สามารถพูดได้ว่าการควบคุมมีบทบาทสำคัญในการสร้างภาพและวิดีโอ เนื่องจากช่วยให้ผู้ใช้สามารถสร้างเนื้อหาที่ต้องการได้ อย่างไรก็ตาม เฟรมเวิร์กที่มีอยู่มักมองข้ามการควบคุมการวางตำแหน่งกล้องที่แม่นยำ ซึ่งเป็นภาษacinematic ที่ใช้เพื่อแสดงความแตกต่างของเรื่องราวให้กับโมเดลได้ดีขึ้น เพื่อแก้ไขข้อจำกัดในปัจจุบัน ในบทความนี้ เราจะพูดถึง CameraCtrl ซึ่งเป็นแนวคิดใหม่ที่พยายามทำให้การควบคุมการวางตำแหน่งกล้องสำหรับโมเดลการสร้างวิดีโอจากข้อความเป็นไปได้ หลังจากที่กำหนดเส้นทางของการวางตำแหน่งกล้องอย่างแม่นยำ โมเดลจะฝึกโมดูลกล้องแบบปลั๊กแอนด์เพลย์บนโมเดลการสร้างวิดีโอจากข้อความ และปล่อยให้ส่วนประกอบอื่นๆ ไม่เปลี่ยนแปลง
CameraCtrl : การควบคุมกล้องสำหรับการสร้างวิดีโอจากข้อความ
การปรับปรุงและการพัฒนาของโมเดลการกระจายล่าสุดได้เพิ่มการสร้างวิดีโอจากข้อความอย่างมีนัยสำคัญในช่วงไม่กี่ปีที่ผ่านมา และปฏิวัติวงจรการออกแบบเนื้อหา การควบคุมมีบทบาทสำคัญในการใช้งานการสร้างวิดีโอจริง เนื่องจากช่วยให้ผู้ใช้สามารถปรับเปลี่ยนผลลัพธ์ที่สร้างขึ้นตามความต้องการและข้อกำหนดของตนได้ ด้วยการควบคุมที่สูง โมเดลสามารถเพิ่มความจริง ความคมชัด และความสามารถในการใช้งานของวิดีโอที่สร้างขึ้นได้ ในขณะที่ข้อความและภาพถูกใช้โดยโมเดลทั่วไปเพื่อเพิ่มการควบคุมโดยรวม แต่พวกมันบ่อยครั้งไม่มีการควบคุมการเคลื่อนไหวและเนื้อหาที่แม่นยำ
เพื่อแก้ไขข้อจำกัดนี้ เฟรมเวิร์กบางตัวได้เสนอให้ใช้สัญญาณควบคุม เช่น โครงร่างการเคลื่อนไหว สัญญาณการไหลของแสง และสัญญาณหลายรูปแบบอื่นๆ เพื่อทำให้การควบคุมการสร้างวิดีโอมีความแม่นยำมากขึ้น อีกข้อจำกัดหนึ่งที่เฟรมเวิร์กที่มีอยู่เผชิญคือการขาดการควบคุมที่แม่นยำในการกระตุ้นหรือปรับจุดกล้องในวิดีโอ เนื่องจากความสามารถในการควบคุมกล้องเป็นสิ่งสำคัญ ไม่เพียงแต่เพิ่มความจริงของวิดีโอที่สร้างขึ้นเท่านั้น แต่ยังช่วยให้ผู้ใช้สามารถมีมุมมองที่กำหนดเองได้ ซึ่งเป็นคุณลักษณะที่จำเป็นในการพัฒนาเกม ความเป็นจริงเสริม และความเป็นจริงเสมือน
CameraCtrl: โครงสร้างโมเดล
ก่อนที่เราจะมองไปที่โครงสร้างและพาราได้ม์ของการฝึกอบรมสำหรับเครื่องเข้ารหัสกล้อง มันจำเป็นที่เราต้องเข้าใจการแสดงกล้องที่แตกต่างกัน โดยทั่วไป การวางตำแหน่งกล้องหมายถึงพารามิเตอร์ที่เป็นของและภายนอก และหนึ่งในตัวเลือกที่ตรงไปตรงมาที่จะให้เครื่องสร้างวิดีโอขึ้นอยู่กับการวางตำแหน่งกล้องคือการป้อนค่าของพารามิเตอร์กล้องเข้าไปในเครื่องสร้าง อย่างไรก็ตาม การใช้วิธีนี้อาจไม่เพิ่มการควบคุมกล้องที่แม่นยำสำหรับหลายเหตุผล
การควบคุมกล้องในวิดีโอ
เมื่อโมเดลกำหนดเส้นทางของการวางตำแหน่งกล้องให้เป็นลำดับของการฝัง plucker โมเดลมีทางเลือกในการใช้โมเดลเครื่องเข้ารหัสเพื่อแยกคุณลักษณะของกล้อง และจากนั้นรวมคุณลักษณะของกล้องเข้ากับเครื่องสร้างวิดีโอ เช่นเดียวกับเครื่องปรับเปลี่ยนรูปแบบข้อความไปเป็นภาพ โมเดล CameraCtrl นำเสนอเครื่องเข้ารหัสกล้องที่ออกแบบมาเฉพาะสำหรับวิดีโอ
การเรียนรู้การกระจายกล้อง
การฝึกอบรมส่วนเครื่องเข้ารหัสกล้องภายในเฟรมเวิร์ก CameraCtrl บนวิดีโอจำเป็นต้องมีวิดีโอที่มีฉลากและคำอธิบายที่ดีจำนวนมาก โดยที่โมเดลสามารถรับเส้นทางของการวางตำแหน่งกล้องโดยใช้การเคลื่อนไหวจากโครงสร้างหรือ SfM
CameraCtrl : การทดลองและผลลัพธ์
เฟรมเวิร์ก CameraCtrl ใช้โมเดล AnimateDiff เป็นโมเดลการสร้างวิดีโอจากข้อความพื้นฐาน และเหตุผลหลักที่อยู่เบื้องหลังการกระทำนี้คือกลยุทธ์การฝึกอบรมของโมเดล AnimateDiff ที่ช่วยให้โมดูลการเคลื่อนไหวสามารถรวมกับโมเดลข้อความไปเป็นภาพหรือ LoRA ของข้อความไปเป็นภาพเพื่อรองรับการสร้างวิดีโอบนหลายประเภทและโดเมน
เพื่อประเมินประสิทธิภาพของเฟรมเวิร์ก CameraCtrl โมเดลจะถูกประเมินเทียบกับเฟรมเวิร์กการควบคุมกล้องที่มีอยู่สองตัว ได้แก่ MotionCtrl และ AnimateDiff
ความคิดสุดท้าย
ในบทความนี้ เราได้พูดถึง CameraCtrl ซึ่งเป็นแนวคิดใหม่ที่พยายามทำให้การควบคุมการวางตำแหน่งกล้องสำหรับโมเดลการสร้างวิดีโอจากข้อความเป็นไปได้ หลังจากที่กำหนดเส้นทางของการวางตำแหน่งกล้องอย่างแม่นยำ โมเดลจะฝึกโมดูลกล้องแบบปลั๊กแอนด์เพลย์บนโมเดลการสร้างวิดีโอจากข้อความ และปล่อยให้ส่วนประกอบอื่นๆ ไม่เปลี่ยนแปลง












