โมเดลและแพลตฟอร์ม AI
OmniHuman-1: ByteDance’s AI ที่เปลี่ยนรูปภาพเดียวให้เป็นคนเคลื่อนไหวและพูดได้

ลองนึกภาพถ่ายรูปคนหนึ่งภาพ และภายในไม่กี่วินาที คุณจะเห็นพวกเขาเคลื่อนไหว พูด จестиชั่น และแสดงออกโดยไม่ต้องบันทึกวิดีโอจริงๆ นั่นคือพลังของ OmniHuman-1 ของ ByteDance โมเดล AI ที่สร้างความน่าสนใจล่าสุดนี้ให้ภาพนิ่งมีชีวิตชีวาโดยการสร้างวิดีโอที่มีลิปซิงค์ที่สอดคล้องกัน การเคลื่อนไหวของร่างกายทั้งหมด และการแสดงออกทางใบหน้าที่น่าประทับใจ ทั้งหมดนี้ได้รับแรงผลักดันจากคลิปเสียง
ไม่เหมือนกับเทคโนโลยี deepfake ที่传统 ซึ่งมุ่งเน้นไปที่การเปลี่ยนใบหน้าในวิดีโอ OmniHuman-1 ทำให้ร่างคนเคลื่อนไหวตั้งแต่หัวถึงเท้า ไม่ว่าจะเป็นนักการเมืองที่กล่าวสุนทรพจน์ บุคคลในประวัติศาสตร์ที่มีชีวิตใหม่ หรืออวตารที่สร้างโดย AI ที่แสดงเพลง โมเดลนี้ทำให้เราทุกคนคิดอย่างลึกซึ้งเกี่ยวกับการสร้างวิดีโอ และมาพร้อมกับผลกระทบหลายอย่างทั้งด้านบวกและด้านลบ
สิ่งที่ทำให้ OmniHuman-1 มีเอกลักษณ์
OmniHuman-1 เป็นก้าวยักษ์ในการสร้างความสมจริงและฟังก์ชัน ซึ่งเป็นสาเหตุที่ทำให้มันไปไวรัล
มีหลายเหตุผลที่ทำให้ OmniHuman-1 มีเอกลักษณ์:
- มากกว่าแค่หัวที่พูด: วิดีโอและ AI ที่สร้างวิดีโอ ส่วนใหญ่จำกัดอยู่ที่การเคลื่อนไหวใบหน้า ซึ่งมักจะทำให้เกิดการเคลื่อนไหวที่ไม่ธรรมชาติ OmniHuman-1 ทำให้ร่างคนเคลื่อนไหวทั้งหมด โดยจับจุดยืนที่เป็นธรรมชาติ การสัมผัส และแม้กระทั่งการโต้ตอบกับวัตถุ
- ลิปซิงค์ที่น่าประทับใจและอารมณ์ที่ซับซ้อน: ไม่ใช่แค่ทำให้ปากเคลื่อนไหวแบบสุ่ม AI จะทำให้การเคลื่อนไหวของลิป การแสดงออกทางใบหน้า และภาษากายสอดคล้องกับเสียงอินพุต ทำให้ผลลัพธ์เป็นรูปธรรมมาก
- ปรับให้เข้ากับหลายรูปแบบภาพ: ไม่ว่าจะเป็นภาพพอร์เทรตคุณภาพสูง ภาพถ่ายคุณภาพต่ำ หรือแม้กระทั่งภาพวาด OmniHuman-1 ปรับให้เข้ากันได้อย่างชาญฉลาด โดยสร้างการเคลื่อนไหวที่น่าเชื่อถือโดยไม่คำนึงถึงคุณภาพของภาพอินพุต
ระดับความแม่นยำนี้เป็นไปได้เพราะของชุดข้อมูลวิดีโอของมนุษย์ขนาด 18,700 ชั่วโมงของ ByteDance และโมเดล diffusion-transformer ที่ซับซ้อน ซึ่งเรียนรู้การเคลื่อนไหวของมนุษย์ที่ซับซ้อน ผลลัพธ์คือวิดีโอที่สร้างโดย AI ที่รู้สึกเหมือนจริงมาก
เทคนิคเบื้องหลัง (อธิบายเป็นภาษาที่เข้าใจง่าย)
เมื่อดู เอกสารอย่างเป็นทางการ OmniHuman-1 เป็นโมเดล diffusion-transformer ซึ่งเป็นเฟรมเวิร์ก AI ที่ซับซ้อนในการสร้างการเคลื่อนไหวโดยการคาดการณ์และปรับแต่งรูปแบบการเคลื่อนไหวเฟรมต่อเฟรม วิธีนี้รับประกันการเปลี่ยนแปลงที่ราบรื่นและพลศาสตร์ของร่างกายที่สมจริง ซึ่งเป็นก้าวสำคัญที่เหนือกว่าโมเดล deepfake ที่传统
ByteDance ได้ฝึก OmniHuman-1 ด้วยชุดข้อมูลวิดีโอของมนุษย์ขนาด 18,700 ชั่วโมง ทำให้โมเดลสามารถเข้าใจการเคลื่อนไหวที่หลากหลาย การแสดงออกทางใบหน้า และท่าทางต่างๆ ได้อย่างกว้างขวาง โดยการให้ AI ได้รับประสบการณ์จากวิดีโอที่หลากหลาย ทำให้เนื้อหาที่สร้างขึ้นมีความรู้สึกเป็นธรรมชาติมากขึ้น
หนึ่งในนวัตกรรมที่สำคัญคือกลยุทธ์ “omni-conditions” ในการฝึกอบรม โดยที่สัญญาณอินพุตหลายอย่าง เช่น คลิปเสียง ข้อความ และการอ้างอิงท่าทาง จะถูกใช้พร้อมกันระหว่างการฝึกอบรม วิธีนี้ช่วยให้ AI คาดการณ์การเคลื่อนไหวได้อย่างแม่นยำมากขึ้น แม้ในสถานการณ์ที่ซับซ้อน เช่น การสั่นไหวมือ การแสดงออกทางอารมณ์ และมุมกล้องต่างๆ
| คุณลักษณะ | ข้อได้เปรียบของ OmniHuman-1 |
|---|---|
| การสร้างการเคลื่อนไหว | ใช้โมเดล diffusion-transformer สำหรับการเคลื่อนไหวที่ราบรื่นและสมจริง |
| ข้อมูลการฝึกอบรม | 18,700 ชั่วโมงของวิดีโอ เพื่อให้ได้คุณภาพสูง |
| การเรียนรู้หลายสภาพ | รวมอินพุตเสียง ข้อความ และการอ้างอิงท่าทาง สำหรับการสอดคล้องที่แม่นยำ |
| การเคลื่อนไหวของร่างกายทั้งหมด | จับจุดยืนที่เป็นธรรมชาติ การสัมผัส และการแสดงออกทางใบหน้า |
| ความสามารถในการปรับให้เข้ากัน | ทำงานกับหลายรูปแบบภาพและมุมกล้อง |
ข้อกังวลด้านจริยธรรมและความเป็นไปได้
เมื่อ OmniHuman-1 ตั้งมาตรฐานใหม่สำหรับวิดีโอที่สร้างโดย AI มันก็ทำให้เกิดข้อกังวลด้านจริยธรรมและความปลอดภัยที่สำคัญ:
- ความเสี่ยงของ deepfake: ความสามารถในการสร้างวิดีโอที่สมจริงจากภาพเดียวเปิดโอกาสให้เกิดการบิดเบือนข้อมูล การขโมยตัวตน และการปลอมตัวทางดิจิทัล ซึ่งอาจส่งผลกระทบต่อการรายงานข่าว การเมือง และความไว้วางใจของสาธารณชนต่อสื่อ
- การละเมิดที่อาจเกิดขึ้น: การหลอกลวงที่ใช้ AI อาจถูกใช้ในทางที่ไม่ดี รวมถึงการสร้าง deepfake ในทางการเมือง การฉ้อโกงทางการเงิน และเนื้อหาที่สร้างโดย AI ที่ไม่ได้รับอนุญาต ซึ่งทำให้การควบคุมและเครื่องหมายการค้าเป็นเรื่องสำคัญ
- ความรับผิดชอบของ ByteDance: ปัจจุบัน OmniHuman-1 ยังไม่ได้รับการเผยแพร่สู่สาธารณะ อาจเป็นเพราะข้อกังวลด้านจริยธรรม หากได้รับการเผยแพร่ ByteDance จะต้องนำระบบป้องกันที่เข้มงวด เช่น การทำเครื่องหมายดิจิทัล การติดตามความถูกต้องของเนื้อหา และอาจมีข้อจำกัดในการใช้งานเพื่อป้องกันการละเมิด
- ความท้าทายในการควบคุม: รัฐบาลและองค์กรเทคโนโลยีกำลังพยายามหาวิธีในการควบคุมสื่อที่สร้างโดย AI ความพยายามเช่น AI Act ใน EU และข้อเสนอของสหรัฐฯ สำหรับการออกกฎหมายเกี่ยวกับ deepfake เน้นย้ำถึงความจำเป็นเร่งด่วนในการกำกับดูแล
- การแข่งขันระหว่างการตรวจจับและการสร้าง: เมื่อโมเดล AI เช่น OmniHuman-1 ดีขึ้น ระบบตรวจจับก็จำเป็นต้องดีขึ้นด้วย บริษัทเช่น Google (GOOGL ) และ OpenAI กำลังพัฒนาเครื่องมือในการตรวจจับ AI แต่การตามทันความสามารถ AI ที่กำลังพัฒนาอย่างรวดเร็วนี้ยังคงเป็นความท้าทาย
สิ่งที่จะเกิดขึ้นต่อไปสำหรับอนาคตของมนุษย์ที่สร้างโดย AI
การสร้างมนุษย์ที่มีชีวิตโดย AI จะเคลื่อนไปอย่างรวดเร็ว โดยมี OmniHuman-1 เป็นจุดเริ่มต้น หนึ่งใน应用ที่ใกล้จะเกิดขึ้นคือการรวมเข้ากับแพลตฟอร์มเช่น TikTok และ CapCut ซึ่งเป็นของ ByteDance ซึ่งจะทำให้ผู้ใช้สามารถสร้างอวตารที่มีลักษณะสมจริงที่สามารถพูด ร้องเพลง หรือแสดงออกได้ด้วยการอินพุตที่น้อยที่สุด หากได้รับการนำไปใช้ จะสามารถเปลี่ยนแปลงเนื้อหาที่สร้างโดยผู้ใช้ และทำให้ผู้มีอิทธิพล ธุรกิจ และผู้ใช้ทั่วไปสามารถสร้างวิดีโอที่น่าดึงดูดได้อย่างง่ายดาย
นอกเหนือจากสื่อสังคมแล้ว OmniHuman-1 มีผลกระทบสำคัญต่อ ฮอลลีวูดและอุตสาหกรรมภาพยนตร์ เกม และผู้มีอิทธิพลในโลกเสมือน อุตสาหกรรมบันเทิงกำลังสำรวจตัวละครที่สร้างโดย AI และความสามารถของ OmniHuman-1 ในการแสดงออกที่มีลักษณะสมจริงอาจช่วยผลักดันสิ่งนี้ไปข้างหน้าได้
จากมุมมองทางภูมิรัฐศาสตร์ ความก้าวหน้าของ ByteDance ทำให้เกิดการแข่งขัน AI ระหว่างจีนและยักษ์ใหญ่ด้านเทคโนโลยีของสหรัฐฯ เช่น OpenAI และ Google โดยที่จีนลงทุนอย่างมากในการวิจัย AI OmniHuman-1 เป็นความท้าทายที่จริงจังในด้านเทคโนโลยีสื่อที่สร้างโดย AI ซึ่งอาจกำหนดรูปแบบการแข่งขันในด้านความเป็นผู้นำ AI และการนำไปใช้ในระดับโลก
คำถามที่พบบ่อย (FAQ)
1. OmniHuman-1 คืออะไร?
OmniHuman-1 เป็นโมเดล AI ที่พัฒนาโดย ByteDance ซึ่งสามารถสร้างวิดีโอที่มีลักษณะสมจริงจากภาพเดียวและคลิปเสียง โดยสร้างการเคลื่อนไหวที่มีชีวิตชีวาของคน
2. OmniHuman-1 แตกต่างจากเทคโนโลยี deepfake ที่传统อย่างไร?
ไม่เหมือนกับ deepfake ที่传统 ซึ่งมุ่งเน้นไปที่การเปลี่ยนใบหน้า OmniHuman-1 ทำให้ร่างคนเคลื่อนไหวทั้งหมด รวมถึงการเคลื่อนไหวของลิป การแสดงออกทางใบหน้า และท่าทาง
3. OmniHuman-1 มีให้ใช้สำหรับสาธารณะหรือไม่?
ปัจจุบัน ByteDance ยังไม่ได้เผยแพร่ OmniHuman-1 สำหรับการใช้งานสาธารณะ
4. มีข้อเสี่ยงด้านจริยธรรมใดๆ ที่เกี่ยวข้องกับ OmniHuman-1 หรือไม่?
โมเดลนี้อาจถูกใช้เพื่อการบิดเบือนข้อมูล การฉ้อโกง และเนื้อหาที่สร้างโดย AI ที่ไม่ได้รับอนุญาต ซึ่งทำให้ความปลอดภัยดิจิทัลเป็นเรื่องสำคัญ
5. วิธีการตรวจจับวิดีโอที่สร้างโดย AI?
บริษัทและนักวิจัยกำลังพัฒนาเครื่องมือในการทำเครื่องหมายและวิเคราะห์ทางนิติเวชเพื่อช่วยแยกแยะวิดีโอที่สร้างโดย AI จากวิดีโอที่แท้จริง












