AGI และ AI แห่งอนาคต

วิดีโอเจนเนอเรเตอร์ AI: สืบสานโมเดล Sora ของ OpenAI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

OpenAI เปิดตัวการสร้าง AI ล่าสุด – Sora วิดีโอเจนเนอเรเตอร์แบบที่สามารถสร้างวิดีโอคุณภาพสูงได้ยาวถึง 1 นาทีจากข้อความที่ให้มา Sora เป็นตัวอย่างที่สำคัญของการสร้างวิดีโอ AI ที่มีความสามารถเหนือกว่าโมเดลก่อนหน้านี้

ในบทความนี้ เราจะพูดถึงเทคนิคการทำงานของ Sora วิธีการทำงานเบื้องหลัง ความสามารถหลัก และข้อจำกัดในปัจจุบัน รวมถึงศักยภาพที่ยิ่งใหญ่ที่ Sora มีต่ออนาคตของการสร้างสรรค์ AI

ภาพรวมของ Sora

ในระดับสูง Sora ใช้ข้อความที่ให้มาเป็นข้อมูลเข้า (เช่น “สองตัวเล่นในสนาม”) และสร้างวิดีโอที่ตรงกันพร้อมภาพที่สมจริง การเคลื่อนไหว และเสียง

ความสามารถหลักของ Sora ได้แก่

  • สร้างวิดีโอยาวถึง 60 วินาทีในความละเอียดสูง (1080p หรือสูงกว่า)
  • สร้างวิดีโอคุณภาพสูงและมีความสอดคล้องกันของวัตถุ เนื้อผ้า และการเคลื่อนไหว
  • รองรับหลายรูปแบบวิดีโอ อัตราส่วนและความละเอียด
  • สามารถปรับแต่งและเปลี่ยนแปลงวิดีโอตามที่ต้องการ
  • แสดงความสามารถในการจำลอง 3D และความสม่ำเสมอของวัตถุในระยะยาว

เบื้องหลัง Sora รวมและขยายสองเทคนิค AI ที่สำคัญ – โมเดลการแพร่กระจาย และ ทรานส์ฟอร์เมอร์ – เพื่อให้ได้ความสามารถในการสร้างวิดีโอที่ไม่เคยเห็นมาก่อน

รากฐานทางเทคนิคของ Sora

Sora สร้างขึ้นจากสองเทคนิค AI ที่มีผลกระทบอย่างมาก – โมเดลการแพร่กระจายและทรานส์ฟอร์เมอร์

โมเดลการแพร่กระจาย

โมเดลการแพร่กระจายเป็นประเภทของโมเดลการสร้างที่สามารถสร้างภาพและวิดีโอที่สมจริงได้ พวกมันทำงานโดยการเพิ่มสัญญาณรบกวนให้กับข้อมูลการฝึกอบรมจริง และฝึกอบรมเครือข่ายประสาทเพื่อลบสัญญาณรบกวนนั้นออกไปใน từngขั้นตอนเพื่อ복원ข้อมูลเดิม

Sora ใช้โมเดลการแพร่กระจายแบบ การลดสัญญาณรบกวนแบบความน่าจะเป็น (DDPM) DDPM แยกกระบวนการสร้างภาพ/วิดีโอออกเป็นหลายขั้นตอน ทำให้ง่ายต่อการฝึกอบรมโมเดลเพื่อสร้างตัวอย่างที่ชัดเจน

โดยเฉพาะ Sora ใช้โมเดลการแพร่กระจายแบบวิดีโอที่เรียกว่า DVD-DDPM ซึ่งออกแบบมาเพื่อสร้างวิดีโอโดยตรงในโดเมนเวลา และบรรลุความสอดคล้องทางเวลาระหว่างเฟรม

ทรานส์ฟอร์เมอร์

ทรานส์ฟอร์เมอร์เป็นโครงสร้างเครือข่ายประสาทที่ปฏิวัติวิธีการประมวลผลภาษา自然ในหลายปีที่ผ่านมา ทรานส์ฟอร์เมอร์ประมวลผลข้อมูลแบบขนานผ่านบล็อกที่อาศัยความสนใจ ทำให้สามารถสร้างแบบจำลองความสัมพันธ์ที่ซับซ้อนในลำดับได้

Sora ปรับทรานส์ฟอร์เมอร์ให้ทำงานกับข้อมูลภาพโดยการป้อนแพทช์ของวิดีโอที่แบ่งออกเป็นโทเค็นแทนโทเค็นข้อความ ทำให้โมเดลเข้าใจความสัมพันธ์ทางพื้นที่และเวลาในลำดับวิดีโอ

ด้วยการรวมสองเทคนิคเหล่านี้ – การใช้ DDPM สำหรับการสังเคราะห์วิดีโอและทรานส์ฟอร์เมอร์สำหรับการทำความเข้าใจและความสอดคล้อง – Sora ขยายขอบเขตของความเป็นไปได้ในด้านการสร้างวิดีโอ AI

ข้อจำกัดและความท้าทายในปัจจุบัน

แม้จะมีความสามารถสูง Sora ยังคงมีข้อจำกัดบางประการ

  • การขาดความเข้าใจทางกายภาพ – Sora ไม่มีความเข้าใจที่แข็งแกร่งเกี่ยวกับฟิสิกส์และสาเหตุและผลกระทบ ตัวอย่างเช่น วัตถุที่แตกอาจ “ฟื้นตัว” ในช่วงวิดีโอ
  • การไม่สอดคล้องกันในระยะยาว – อาร์ติแฟคต์ทางภาพและความไม่สอดคล้องสามารถสะสมในตัวอย่างที่ยาวกว่า 1 นาที การรักษาความสอดคล้องที่สมบูรณ์แบบสำหรับวิดีโอที่ยาวมากยังคงเป็นความท้าทาย
  • ข้อบกพร่องของวัตถุ – Sora บางครั้งสร้างวิดีโอที่วัตถุเปลี่ยนตำแหน่งไม่ธรรมดาหรือหายไปจากเฟรม
  • ความยากในการจัดการกับข้อความที่ไม่คาดคิด – ข้อความที่ไม่คาดคิดมากซึ่งอยู่นอกการกระจายของ Sora สามารถทำให้เกิดตัวอย่างที่มีคุณภาพต่ำ ความสามารถของ Sora มีความแข็งแกร่งที่สุดใกล้กับข้อมูลการฝึกอบรม

การปรับปรุงขนาดของโมเดล การฝึกอบรมข้อมูล และเทคนิคใหม่ๆ จะต้องดำเนินการเพื่อแก้ไขข้อจำกัดเหล่านี้ การสร้างวิดีโอ AI ยังคงมีเส้นทางยาวที่จะเดินต่อไป

การสร้างวิดีโอ AI ที่มีความรับผิดชอบ

เช่นเดียวกับเทคโนโลยีที่กำลังพัฒนาอย่างรวดเร็ว มีความเสี่ยงที่ต้องพิจารณาไปพร้อมกับประโยชน์

  • การสร้างข้อมูลเท็จ – Sora ทำให้การสร้างวิดีโอที่ถูกบิดเบือนและปลอมเป็นเรื่องที่ง่ายกว่าที่เคย มาตรการป้องกันจะจำเป็นต้องตรวจจับวิดีโอที่สร้างขึ้นและจำกัดการใช้ในทางที่ผิด
  • ความลำเอียงของข้อมูล – โมเดลเช่น Sora สะท้อนความลำเอียงและข้อจำกัดของข้อมูลการฝึกอบรม ซึ่งต้องมีความหลากหลายและเป็นตัวแทน
  • เนื้อหาที่เป็นอันตราย – หากไม่มีการควบคุมที่เหมาะสม วิดีโอ AI ที่สร้างขึ้นอาจสร้างเนื้อหาที่รุนแรง อันตราย หรือไม่เหมาะสม นโยบายการดูแลเนื้อหาที่รอบคอบจึงจำเป็น
  • ปัญหาเรื่องสิทธิ์ในทรัพย์สินทางปัญญา – การฝึกอบรมด้วยข้อมูลที่มีลิขสิทธิ์โดยไม่ได้รับอนุญาตทำให้เกิดปัญหาเกี่ยวกับผลงานที่อนุพันธ์ การออกใบอนุญาตข้อมูลจะต้องได้รับการพิจารณาอย่างรอบคอบ

OpenAI จะต้องดำเนินการด้วยความระมัดระวังในการนำ Sora ไปใช้เพื่อป้องกันปัญหาเหล่านี้โดยรวมแล้ว Sora เป็นเครื่องมือที่มีพลังมากสำหรับการสร้างสรรค์ การมองเห็น ความบันเทิง และอื่นๆ

อนาคตของวิดีโอ AI

Sora แสดงให้เห็นว่าการพัฒนาวิดีโอ AI ที่น่าตื่นเต้นกำลังจะเกิดขึ้น นี่คือทิศทางที่น่าตื่นเต้นที่เทคโนโลยีนี้อาจจะพัฒนาไปในอนาคต

  • การสร้างวิดีโอที่ยาวขึ้น – โมเดลอาจจะสามารถสร้างวิดีโอที่ยาวหลายชั่วโมงได้ในขณะที่ยังคงความสอดคล้อง
  • การควบคุมพื้นที่เวลาเต็ม – ผู้ใช้สามารถควบคุมวิดีโอได้โดยตรงผ่านการโต้ตอบ
  • การจำลองที่สามารถควบคุมได้ – โมเดลเช่น Sora อาจจะทำให้ผู้ใช้สามารถควบคุมโลกจำลองผ่านข้อความและโต้ตอบ
  • วิดีโอที่ปรับแต่งให้เหมาะกับบุคคล – AI อาจจะสร้างวิดีโอที่ปรับแต่งให้เหมาะกับผู้ชมแต่ละคนหรือบริบท
  • การผสมผสานหลายรูปแบบ – การผสมผสานรูปแบบต่างๆ เช่น ภาษา เสียง และวิดีโออาจจะทำให้เกิดประสบการณ์แบบโต้ตอบที่มีประสิทธิภาพสูง
  • โดเมนเฉพาะ – โมเดลวิดีโอที่มีโดเมนเฉพาะอาจจะทำได้ดีในแอปพลิเคชันเฉพาะ เช่น การถ่ายภาพทางการแพทย์ การตรวจสอบอุตสาหกรรม การสร้างเกม และอื่นๆ

สรุป

ด้วย Sora OpenAI ได้ทำการกระโดดหนึ่งใหญ่ในด้านการสร้างวิดีโอ AI โดยแสดงให้เห็นถึงความสามารถที่ดูเหมือนจะอยู่ห่างออกไปเพียงไม่กี่ปีที่แล้ว

โมเดลอื่นๆ จาก DeepMind, Google (GOOGL ), Meta และอื่นๆ จะยังคงผลักดันขอบเขตในพื้นที่นี้ อนาคตของวิดีโอ AI ที่สร้างโดย AI ดูเหมือนจะสดใสมาก

เราสามารถคาดหวังว่าเทคโนโลยีนี้จะขยายความเป็นไปได้ในการสร้างสรรค์และพบการใช้งานที่มีประโยชน์มากมายในอนาคต ในขณะเดียวกันก็ต้องมีการกำกับดูแลอย่างรอบคอบเพื่อลดความเสี่ยง

เป็นเวลาที่น่าตื่นเต้นสำหรับทั้งผู้พัฒนา AI และผู้ใช้ เมื่อโมเดลการสร้างวิดีโอยัง Sora เปิดโอกาสใหม่ๆ สำหรับสิ่งที่เป็นไปได้ ผลกระทบที่อาจเกิดขึ้นต่อสื่อ ความบันเทิง การจำลอง การมองเห็น และอื่นๆ เพิ่งเริ่มต้น

ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป