โมเดลและแพลตฟอร์ม AI

OmniHuman-1: ByteDance’s AI ที่เปลี่ยนรูปภาพเดียวให้เป็นคนเคลื่อนไหวและพูดได้

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ลองนึกภาพถ่ายรูปคนหนึ่งภาพ และภายในไม่กี่วินาที คุณจะเห็นพวกเขาเคลื่อนไหว พูด จестиชั่น และแสดงออกโดยไม่ต้องบันทึกวิดีโอจริงๆ นั่นคือพลังของ OmniHuman-1 ของ ByteDance โมเดล AI ที่สร้างความน่าสนใจล่าสุดนี้ให้ภาพนิ่งมีชีวิตชีวาโดยการสร้างวิดีโอที่มีลิปซิงค์ที่สอดคล้องกัน การเคลื่อนไหวของร่างกายทั้งหมด และการแสดงออกทางใบหน้าที่น่าประทับใจ ทั้งหมดนี้ได้รับแรงผลักดันจากคลิปเสียง

ไม่เหมือนกับเทคโนโลยี deepfake ที่传统 ซึ่งมุ่งเน้นไปที่การเปลี่ยนใบหน้าในวิดีโอ OmniHuman-1 ทำให้ร่างคนเคลื่อนไหวตั้งแต่หัวถึงเท้า ไม่ว่าจะเป็นนักการเมืองที่กล่าวสุนทรพจน์ บุคคลในประวัติศาสตร์ที่มีชีวิตใหม่ หรืออวตารที่สร้างโดย AI ที่แสดงเพลง โมเดลนี้ทำให้เราทุกคนคิดอย่างลึกซึ้งเกี่ยวกับการสร้างวิดีโอ และมาพร้อมกับผลกระทบหลายอย่างทั้งด้านบวกและด้านลบ

สิ่งที่ทำให้ OmniHuman-1 มีเอกลักษณ์

OmniHuman-1 เป็นก้าวยักษ์ในการสร้างความสมจริงและฟังก์ชัน ซึ่งเป็นสาเหตุที่ทำให้มันไปไวรัล

มีหลายเหตุผลที่ทำให้ OmniHuman-1 มีเอกลักษณ์:

  • มากกว่าแค่หัวที่พูด: วิดีโอและ AI ที่สร้างวิดีโอ ส่วนใหญ่จำกัดอยู่ที่การเคลื่อนไหวใบหน้า ซึ่งมักจะทำให้เกิดการเคลื่อนไหวที่ไม่ธรรมชาติ OmniHuman-1 ทำให้ร่างคนเคลื่อนไหวทั้งหมด โดยจับจุดยืนที่เป็นธรรมชาติ การสัมผัส และแม้กระทั่งการโต้ตอบกับวัตถุ
  • ลิปซิงค์ที่น่าประทับใจและอารมณ์ที่ซับซ้อน: ไม่ใช่แค่ทำให้ปากเคลื่อนไหวแบบสุ่ม AI จะทำให้การเคลื่อนไหวของลิป การแสดงออกทางใบหน้า และภาษากายสอดคล้องกับเสียงอินพุต ทำให้ผลลัพธ์เป็นรูปธรรมมาก
  • ปรับให้เข้ากับหลายรูปแบบภาพ: ไม่ว่าจะเป็นภาพพอร์เทรตคุณภาพสูง ภาพถ่ายคุณภาพต่ำ หรือแม้กระทั่งภาพวาด OmniHuman-1 ปรับให้เข้ากันได้อย่างชาญฉลาด โดยสร้างการเคลื่อนไหวที่น่าเชื่อถือโดยไม่คำนึงถึงคุณภาพของภาพอินพุต

ระดับความแม่นยำนี้เป็นไปได้เพราะของชุดข้อมูลวิดีโอของมนุษย์ขนาด 18,700 ชั่วโมงของ ByteDance และโมเดล diffusion-transformer ที่ซับซ้อน ซึ่งเรียนรู้การเคลื่อนไหวของมนุษย์ที่ซับซ้อน ผลลัพธ์คือวิดีโอที่สร้างโดย AI ที่รู้สึกเหมือนจริงมาก

เทคนิคเบื้องหลัง (อธิบายเป็นภาษาที่เข้าใจง่าย)

เมื่อดู เอกสารอย่างเป็นทางการ OmniHuman-1 เป็นโมเดล diffusion-transformer ซึ่งเป็นเฟรมเวิร์ก AI ที่ซับซ้อนในการสร้างการเคลื่อนไหวโดยการคาดการณ์และปรับแต่งรูปแบบการเคลื่อนไหวเฟรมต่อเฟรม วิธีนี้รับประกันการเปลี่ยนแปลงที่ราบรื่นและพลศาสตร์ของร่างกายที่สมจริง ซึ่งเป็นก้าวสำคัญที่เหนือกว่าโมเดล deepfake ที่传统

ByteDance ได้ฝึก OmniHuman-1 ด้วยชุดข้อมูลวิดีโอของมนุษย์ขนาด 18,700 ชั่วโมง ทำให้โมเดลสามารถเข้าใจการเคลื่อนไหวที่หลากหลาย การแสดงออกทางใบหน้า และท่าทางต่างๆ ได้อย่างกว้างขวาง โดยการให้ AI ได้รับประสบการณ์จากวิดีโอที่หลากหลาย ทำให้เนื้อหาที่สร้างขึ้นมีความรู้สึกเป็นธรรมชาติมากขึ้น

หนึ่งในนวัตกรรมที่สำคัญคือกลยุทธ์ “omni-conditions” ในการฝึกอบรม โดยที่สัญญาณอินพุตหลายอย่าง เช่น คลิปเสียง ข้อความ และการอ้างอิงท่าทาง จะถูกใช้พร้อมกันระหว่างการฝึกอบรม วิธีนี้ช่วยให้ AI คาดการณ์การเคลื่อนไหวได้อย่างแม่นยำมากขึ้น แม้ในสถานการณ์ที่ซับซ้อน เช่น การสั่นไหวมือ การแสดงออกทางอารมณ์ และมุมกล้องต่างๆ

คุณลักษณะ ข้อได้เปรียบของ OmniHuman-1
การสร้างการเคลื่อนไหว ใช้โมเดล diffusion-transformer สำหรับการเคลื่อนไหวที่ราบรื่นและสมจริง
ข้อมูลการฝึกอบรม 18,700 ชั่วโมงของวิดีโอ เพื่อให้ได้คุณภาพสูง
การเรียนรู้หลายสภาพ รวมอินพุตเสียง ข้อความ และการอ้างอิงท่าทาง สำหรับการสอดคล้องที่แม่นยำ
การเคลื่อนไหวของร่างกายทั้งหมด จับจุดยืนที่เป็นธรรมชาติ การสัมผัส และการแสดงออกทางใบหน้า
ความสามารถในการปรับให้เข้ากัน ทำงานกับหลายรูปแบบภาพและมุมกล้อง

ข้อกังวลด้านจริยธรรมและความเป็นไปได้

เมื่อ OmniHuman-1 ตั้งมาตรฐานใหม่สำหรับวิดีโอที่สร้างโดย AI มันก็ทำให้เกิดข้อกังวลด้านจริยธรรมและความปลอดภัยที่สำคัญ:

  • ความเสี่ยงของ deepfake: ความสามารถในการสร้างวิดีโอที่สมจริงจากภาพเดียวเปิดโอกาสให้เกิดการบิดเบือนข้อมูล การขโมยตัวตน และการปลอมตัวทางดิจิทัล ซึ่งอาจส่งผลกระทบต่อการรายงานข่าว การเมือง และความไว้วางใจของสาธารณชนต่อสื่อ
  • การละเมิดที่อาจเกิดขึ้น: การหลอกลวงที่ใช้ AI อาจถูกใช้ในทางที่ไม่ดี รวมถึงการสร้าง deepfake ในทางการเมือง การฉ้อโกงทางการเงิน และเนื้อหาที่สร้างโดย AI ที่ไม่ได้รับอนุญาต ซึ่งทำให้การควบคุมและเครื่องหมายการค้าเป็นเรื่องสำคัญ
  • ความรับผิดชอบของ ByteDance: ปัจจุบัน OmniHuman-1 ยังไม่ได้รับการเผยแพร่สู่สาธารณะ อาจเป็นเพราะข้อกังวลด้านจริยธรรม หากได้รับการเผยแพร่ ByteDance จะต้องนำระบบป้องกันที่เข้มงวด เช่น การทำเครื่องหมายดิจิทัล การติดตามความถูกต้องของเนื้อหา และอาจมีข้อจำกัดในการใช้งานเพื่อป้องกันการละเมิด
  • ความท้าทายในการควบคุม: รัฐบาลและองค์กรเทคโนโลยีกำลังพยายามหาวิธีในการควบคุมสื่อที่สร้างโดย AI ความพยายามเช่น AI Act ใน EU และข้อเสนอของสหรัฐฯ สำหรับการออกกฎหมายเกี่ยวกับ deepfake เน้นย้ำถึงความจำเป็นเร่งด่วนในการกำกับดูแล
  • การแข่งขันระหว่างการตรวจจับและการสร้าง: เมื่อโมเดล AI เช่น OmniHuman-1 ดีขึ้น ระบบตรวจจับก็จำเป็นต้องดีขึ้นด้วย บริษัทเช่น Google (GOOGL ) และ OpenAI กำลังพัฒนาเครื่องมือในการตรวจจับ AI แต่การตามทันความสามารถ AI ที่กำลังพัฒนาอย่างรวดเร็วนี้ยังคงเป็นความท้าทาย

สิ่งที่จะเกิดขึ้นต่อไปสำหรับอนาคตของมนุษย์ที่สร้างโดย AI

การสร้างมนุษย์ที่มีชีวิตโดย AI จะเคลื่อนไปอย่างรวดเร็ว โดยมี OmniHuman-1 เป็นจุดเริ่มต้น หนึ่งใน应用ที่ใกล้จะเกิดขึ้นคือการรวมเข้ากับแพลตฟอร์มเช่น TikTok และ CapCut ซึ่งเป็นของ ByteDance ซึ่งจะทำให้ผู้ใช้สามารถสร้างอวตารที่มีลักษณะสมจริงที่สามารถพูด ร้องเพลง หรือแสดงออกได้ด้วยการอินพุตที่น้อยที่สุด หากได้รับการนำไปใช้ จะสามารถเปลี่ยนแปลงเนื้อหาที่สร้างโดยผู้ใช้ และทำให้ผู้มีอิทธิพล ธุรกิจ และผู้ใช้ทั่วไปสามารถสร้างวิดีโอที่น่าดึงดูดได้อย่างง่ายดาย

นอกเหนือจากสื่อสังคมแล้ว OmniHuman-1 มีผลกระทบสำคัญต่อ ฮอลลีวูดและอุตสาหกรรมภาพยนตร์ เกม และผู้มีอิทธิพลในโลกเสมือน อุตสาหกรรมบันเทิงกำลังสำรวจตัวละครที่สร้างโดย AI และความสามารถของ OmniHuman-1 ในการแสดงออกที่มีลักษณะสมจริงอาจช่วยผลักดันสิ่งนี้ไปข้างหน้าได้

จากมุมมองทางภูมิรัฐศาสตร์ ความก้าวหน้าของ ByteDance ทำให้เกิดการแข่งขัน AI ระหว่างจีนและยักษ์ใหญ่ด้านเทคโนโลยีของสหรัฐฯ เช่น OpenAI และ Google โดยที่จีนลงทุนอย่างมากในการวิจัย AI OmniHuman-1 เป็นความท้าทายที่จริงจังในด้านเทคโนโลยีสื่อที่สร้างโดย AI ซึ่งอาจกำหนดรูปแบบการแข่งขันในด้านความเป็นผู้นำ AI และการนำไปใช้ในระดับโลก

คำถามที่พบบ่อย (FAQ)

1. OmniHuman-1 คืออะไร?

OmniHuman-1 เป็นโมเดล AI ที่พัฒนาโดย ByteDance ซึ่งสามารถสร้างวิดีโอที่มีลักษณะสมจริงจากภาพเดียวและคลิปเสียง โดยสร้างการเคลื่อนไหวที่มีชีวิตชีวาของคน

2. OmniHuman-1 แตกต่างจากเทคโนโลยี deepfake ที่传统อย่างไร?

ไม่เหมือนกับ deepfake ที่传统 ซึ่งมุ่งเน้นไปที่การเปลี่ยนใบหน้า OmniHuman-1 ทำให้ร่างคนเคลื่อนไหวทั้งหมด รวมถึงการเคลื่อนไหวของลิป การแสดงออกทางใบหน้า และท่าทาง

3. OmniHuman-1 มีให้ใช้สำหรับสาธารณะหรือไม่?

ปัจจุบัน ByteDance ยังไม่ได้เผยแพร่ OmniHuman-1 สำหรับการใช้งานสาธารณะ

4. มีข้อเสี่ยงด้านจริยธรรมใดๆ ที่เกี่ยวข้องกับ OmniHuman-1 หรือไม่?

โมเดลนี้อาจถูกใช้เพื่อการบิดเบือนข้อมูล การฉ้อโกง และเนื้อหาที่สร้างโดย AI ที่ไม่ได้รับอนุญาต ซึ่งทำให้ความปลอดภัยดิจิทัลเป็นเรื่องสำคัญ

5. วิธีการตรวจจับวิดีโอที่สร้างโดย AI?

บริษัทและนักวิจัยกำลังพัฒนาเครื่องมือในการทำเครื่องหมายและวิเคราะห์ทางนิติเวชเพื่อช่วยแยกแยะวิดีโอที่สร้างโดย AI จากวิดีโอที่แท้จริง

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก