نماذج ومنصات الذكاء الاصطناعي

OmniHuman-1: نموذج ByteDance للذكاء الاصطناعي الذي يحول صورة واحدة إلى شخص متحرك ومتكلم

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تخيل أن تأخذ صورة واحدة لشخص وترى ذلك الشخص يتكلم ويتحرك ويعبر بدون تسجيل فيديو حقيقي. هذا هو قوة نموذج ByteDance’s OmniHuman-1. النموذج الشهير للذكاء الاصطناعي يمكن أن يحيي الصور الثابتة من خلال توليد فيديوهات واقعية للغاية، كاملة مع حركات شفاه متزامنة وحركات جسدية كاملة وتعابير وجهية تعبيرية، كل ذلك مدفوعًا بمقطع صوتي.

على عكس التكنولوجيا التقليدية deepfake، التي تركز في الغالب على تبادل الوجوه في الفيديوهات، يحيي OmniHuman-1 شخصية بشرية كاملة، من الرأس إلى القدم. سواء كان سياسيًا يلقي خطابًا أو شخصية تاريخية أحياها أو تمثيلية محسنة تؤدي أغنية، هذا النموذج يجعلهم جميعًا يفكرون بعمق في إنشاء الفيديو. ومع هذه الابتكارات تأتي مجموعة من الآثار – كلها مثيرة ومقلقة.

ما الذي يجعل OmniHuman-1 يبرز؟

OmniHuman-1 حقًا قفزة عملاقة في الواقعية والوظائف، وهو بالضبط السبب في أنه أصبح مشهورًا.

هذه هي بعض الأسباب:

  • أكثر من مجرد رؤوس متكلمة: معظم تقنيات الفيديوهات المحسنة بالذكاء الاصطناعي كانت مقتصرة على تحريك الوجه، مما ينتج عنه حركات غير طبيعية أو جامدة. يحيي OmniHuman-1 الجسم كله، ويضبط الحركات الطبيعية والوضعيات والتفاعلات مع الأشياء.
  • تزامن شفتين رائع وتنوع في العواطف: لا يجعلهم يتكلمون فقط؛ يضمن الذكاء الاصطناعي أن تتزامن حركات الشفاه والتعبيرات الوجهية واللغة الجسدية مع الصوت المُدخل، مما يجعل النتيجة واقعية للغاية.
  • يتكيف مع أنماط الصور المختلفة: سواء كانت صورة عالية الدقة أو صورة منخفضة الجودة أو حتى رسم متحرك، يتعامل OmniHuman-1 بذكاء، ويخلق حركة سلسة ومُقنعة بغض النظر عن جودة الإدخال.

يمكن تحقيق هذا المستوى من الدقة بفضل قاعدة بيانات ByteDance الضخمة التي تضم 18,700 ساعة من مقاطع فيديو بشرية، إلى جانب نموذجها المتقدم للتحويل والانتشار، الذي يتعلم الحركات البشرية المعقدة. النتيجة هي فيديوهات محسنة بالذكاء الاصطناعي التي تُعتبر غير متميزة تقريبًا عن المقاطع الفعلية. إنه الأفضل الذي رأيته حتى الآن.

التكنولوجيا وراءه (بمعنى بسيط)

عند النظر إلى الورقة الرسمية، OmniHuman-1 هو نموذج تحويل وانتشار، إطار ذكاء اصطناعي متقدم يولد الحركة عن طريق التنبؤ بالأنماط الحركية وتحسينها إطارًا تلو الآخر. هذا النهج يضمن انتقالات سلسة وديناميكيات جسدية واقعية، خطوة كبيرة أمام نماذج Deepfake التقليدية.

قامت ByteDance بتدريب OmniHuman-1 على قاعدة بيانات واسعة تضم 18,700 ساعة من مقاطع فيديو بشرية، مما يسمح للنموذج بفهم مجموعة واسعة من الحركات والتعبيرات الوجهية والايماءات. من خلال تعريض الذكاء الاصطناعي لمجموعة غير مسبوقة من الحركات الحياتية، يُحسن من الشعور الطبيعي بالمحتوى المُحسن.

التكنولوجيا الرئيسية التي يجب معرفتها هي استراتيجية التدريب “omni-conditions”، حيث يتم استخدام إشارات إدخال متعددة – مثل مقاطع الصوت والنصوص الإرشادية ومراجع الوضع – في نفس الوقت أثناء التدريب. هذه الطريقة تساعد الذكاء الاصطناعي على توقع الحركة بدقة أكبر، حتى في السيناريوهات المعقدة التي تتضمن حركات اليد والتعبيرات العاطفية وزوايا الكاميرا المختلفة.

الميزة ميزة OmniHuman-1
توليد الحركة يستخدم نموذج تحويل وانتشار لحركة سلسة وواقعية
بيانات التدريب 18,700 ساعة من الفيديو، مما يضمن دقة عالية
التعلم المتعددي الشرط يدمج مقاطع الصوت والنصوص ومراجع الوضع لتنسيق دقيق
التحريك الكامل للجسم يضبط الايماءات والوضعية الجسدية والتعبيرات الوجهية
التكيف يعمل مع أنماط الصور المختلفة والزوايا

القلق الأخلاقي والعملي

مع تحديد OmniHuman-1 لمعيار جديد في الفيديوهات المحسنة بالذكاء الاصطناعي، يثير أيضًا مخاوف أخلاقية وأمنية كبيرة:

  • مخاطر Deepfake: القدرة على إنشاء فيديوهات واقعية للغاية من صورة واحدة تفتح الباب أمام المعلومات الخاطئة والسرقة الهوية والتصوير الرقمي. قد يؤثر هذا على الصحافة والسياسة والثقة العامة في الإعلام.
  • إمكانية سوء الاستخدام: يمكن استخدام خداع الذكاء الاصطناعي بطرق خبيثة، بما في ذلك Deepfake السياسي والاحتيال المالي والمحتوى المُحسن بالذكاء الاصطناعي غير المُتَضَمَّن. هذا يجعل التنظيم والتوقيع الرقمي من القضايا الحاسمة.
  • مسؤولية ByteDance: حاليًا، لم يتم إصدار OmniHuman-1 للاستخدام العام، على الأرجح بسبب هذه المخاوف الأخلاقية. إذا تم إصداره، سيتعين على ByteDance تنفيذ حماية قوية، مثل التوقيع الرقمي، وتتبع مصداقية المحتوى، وربما قيود على الاستخدام لمنع الإساءة.
  • تحديات التنظيم: تحاول الحكومات والمنظمات التكنولوجية التعامل مع كيفية تنظيم وسائل الإعلام المُحسنة بالذكاء الاصطناعي. الجهود مثل قانون الذكاء الاصطناعي في الاتحاد الأوروبي وال提قات الأمريكية لتشريعات Deepfake تبرز الحاجة الملحة إلى الإشراف.
  • سباق الكشف عن الجيل: مع تحسين نماذج الذكاء الاصطناعي مثل OmniHuman-1، يجب أن تتحسن أنظمة الكشف أيضًا. الشركات مثل Google (GOOGL ) وOpenAI تطور أدوات الكشف عن الذكاء الاصطناعي، لكن الحفاظ على وتيرة هذه القدرات التي تتحرك بسرعة فائقة يبقى تحديًا.

ماذا يأتي بعد المستقبل للبشر المُحسنين بالذكاء الاصطناعي؟

إنشاء البشر المُحسنين بالذكاء الاصطناعي سيتحرك بسرعة كبيرة الآن، مع OmniHuman-1 الذي يفتح الطريق. واحدة من التطبيقات الفورية لهذا النموذج يمكن أن تكون دمجه في منصات مثل TikTok وCapCut، حيث يمتلك ByteDance هذه المنصات. قد يسمح هذا للمستخدمين بإنشاء تمثيليات واقعية يمكنها التكلم أو الغناء أو أداء أفعال بدخول قليل. إذا تم تنفيذه، قد يغير ذلك محتوى المستخدم المُنشأ، ويمكن للمؤثرين والشركات والمستخدمين العاديين إنشاء فيديوهات مدفوعة بالذكاء الاصطناعي بسهولة.

ما وراء وسائل التواصل الاجتماعي، OmniHuman-1 له آثار مهمة على هوليوود والسينما والألعاب والمتأثرين الافتراضيين. تعمل صناعة الترفيه على استكشاف الشخصيات المُحسنة بالذكاء الاصطناعي، ويمكن أن يساعد OmniHuman-1 في تقديم أداء واقعي في دفع هذه الأمور إلى الأمام.

من منظور جيوسياسي، تُطرح تقدمات ByteDance مرة أخرى منافسة الذكاء الاصطناعي المتزايدة بين الصين وشركات التكنولوجيا الأمريكية الكبرى مثل OpenAI وGoogle. مع استثمار الصين بشكل كبير في أبحاث الذكاء الاصطناعي، OmniHuman-1 يُشكل تحديًا جادًا في تكنولوجيا الإعلام التوليدي. مع استمرار ByteDance في تعزيز هذا النموذج، قد يضع ذلك المسرح لمنافسة أوسع على قيادة الذكاء الاصطناعي، مما يؤثر على كيفية تطوير أدوات الفيديو الذكية، وتنظيمها، واعتمادها في جميع أنحاء العالم.

الأسئلة الشائعة (FAQ)

1. ما هو OmniHuman-1؟

OmniHuman-1 هو نموذج ذكاء اصطناعي طوره ByteDance يمكنه توليد فيديوهات واقعية من صورة واحدة ومقطع صوتي، مما يخلق تحريكًا واقعيًا للأشخاص.

2. كيف يختلف OmniHuman-1 عن تقنية Deepfake التقليدية؟

على عكس تقنيات Deepfake التقليدية التي تتبادل الوجوه في الغالب، يحيي OmniHuman-1 شخصًا كاملاً، بما في ذلك الحركات الجسدية الكاملة والحركات الشفوية المتزامنة والتعبيرات الوجهية.

3. هل OmniHuman-1 متاح للجمهور؟

حاليًا، لم يتم إصدار OmniHuman-1 للاستخدام العام.

4. ما هي المخاطر الأخلاقية المرتبطة ب OmniHuman-1؟

يمكن استخدام النموذج لانتشار المعلومات الخاطئة والاحتيال والتصوير الرقمي غير المُتَضَمَّن، مما يجعل الأمن الرقمي قلقًا رئيسيًا.

5. كيف يمكن الكشف عن الفيديوهات المُحسنة بالذكاء الاصطناعي؟

تطوير الشركات والباحثين أدوات التوقيع الرقمي وطرق التحليل الجنائي لمساعدة التمييز بين الفيديوهات المُحسنة بالذكاء الاصطناعي والفيديوهات الفعلية.

Alex McFarland هو صحفي وكاتب في مجال الذكاء الاصطناعي يستكشف أحدث التطورات في الذكاء الاصطناعي. وقد تعاون مع العديد من الشركات الناشئة في مجال الذكاء الاصطناعي والمنشورات في جميع أنحاء العالم.