زاوية Anderson
صعود Hunyuan الفيديو Deepfakes

نظرًا لطبيعة بعض المواد المناقشة هنا ، سيحتوي هذا المقال على روابط مرجعية وأشكال توضيحية أقل من المعتاد.
شيء ملحوظ يحدث حاليًا في مجتمع التركيب الإبداعي للذكاء الاصطناعي ، على الرغم من أن أهميته قد تأخذ بعض الوقت لتصبح واضحة. الهواة يدرّبون نماذج فيديو إبداعية للذكاء الاصطناعي لتكرار شبه الناس ، باستخدام فيديوهات LoRAs القائمة على Tencent’s الإطار المفتوح Hunyuan Video.*
انقر للعب. نتائج متنوعة من Hunyuan-based LoRA التخصيص ، متاحة مجانًا في مجتمع Civit. من خلال تدريب نماذج التكيف منخفض الرتبة (LoRAs) ، يتم تقليل مشاكل الاستقرار الزمني ، التي عانت منها توليد فيديو الذكاء الاصطناعي لمدة عامين ، بشكل كبير. مصادر: civit.ai
في الفيديو المظهر أعلاه ، تم تدريب شبه الممثلات ناتالي بورتمان ، كريستينا هندريكس و سكارليت جوهانسون ، جنبًا إلى جنب مع زعيم التكنولوجيا إيلون ماسك ، إلى ملفات إضافة صغيرة للنظام التوليدي Hunyuan الفيديو ، والتي يمكن تثبيتها بدون مرشحات المحتوى (مثل مرشحات NSFW) على جهاز الكمبيوتر للمستخدم.
يصرح مؤلف LoRA كريستينا هندريكس المظهر أعلاه أنه تم استخدام 16 صورة فقط من برنامج Mad Men لتطوير النموذج (الذي يبلغ حجمه 307mb فقط) ؛ تؤكد منشورات متعددة من مجتمع Stable Diffusion على Reddit و Discord أن LoRAs من هذا النوع لا يتطلبون كميات كبيرة من بيانات التدريب أو أوقات التدريب ، في معظم الحالات.
انقر للعب. أرنولد شوارزنيجر يأتي إلى الحياة في Hunyuan فيديو LoRA يمكن تنزيله في Civit. انظر لمزيد من أمثلة Arnie ، من هواية Bob Doyle.
يمكن تدريب Hunyuan LoRAs على الصور الثابتة أو الفيديوهات ، على الرغم من أن التدريب على الفيديوهات يتطلب موارد أجهزة أكبر ووقت تدريب أطول.
يتميز نموذج Hunyuan Video ب 13 مليار معامل ، متجاوزًا معاملات Sora البالغة 12 مليار معامل ، ومتجاوزًا بشكل كبير النموذج الأقل قدرة Hunyuan-DiT الذي تم إصداره كمصدر مفتوح في صيف 2024 ، والذي يحتوي على 1.5 مليار معامل فقط.
كما كان الحال منذ عامين ونصف العام مع Stable Diffusion و LoRA (انظر أمثلة على Stable Diffusion 1.5 ‘الnative’ المشاهير هنا) ، فإن النموذج الأساسي المعني له فهم محدود للشخصيات المشهورة ، مقارنة بمستوى الدقة الذي يمكن الحصول عليه من خلال تطبيقات LoRA المخصصة.
بصورة فعالة ، يحصل LoRA المخصص والموجه على هوية على “رحلة مجانية” على قدرات التركيب الكبيرة للنموذج Hunyuan الأساسي ، ويوفر تركيبًا بشريًا أكثر فعالية من الذي يمكن الحصول عليه إما بواسطة الترميز التلقائي Deepfakes من عام 2017 أو محاولة إضافة الحركة إلى الصور الثابتة عبر أنظمة مثل LivePortrait الشهيرة.
يمكن تنزيل جميع LoRAs الموضحة هنا مجانًا من مجتمع Civit الشهير ، في حين يمكن أن يخلق LoRAs المخصصة القديمة المعتمدة على الصور الثابتة “صور بذرة” لعملية إنشاء الفيديو (أي ، صورة إلى فيديو ، وهو إصدار قادم لـ Hunyuan Video ، على الرغم من أن الحلول البديلة ممكنة ، للوقت الحالي).
انقر للعب. أعلى ، عينات من ‘static’ Flux LoRA ؛ أدناه ، أمثلة من Hunyuan فيديو LoRA يضم الموسيقي تايلور سويفت. كلا هذين LoRAs متاحان مجانًا في مجتمع Civit.
عند كتابة هذه السطور ، يقدم موقع Civit 128 نتيجة بحث عن ‘Hunyuan’*. تقريبا جميعها في بعض الطرق NSFW نماذج ؛ 22 تمثل المشاهير ؛ 18 مصممة لتسهيل توليد البورنوغرافيا الصريحة ؛ و 7 فقط منها تمثل الرجال بدلاً من النساء.
ما الجديد؟
نظرًا لتطور مصطلح الdeepfake ، و محدودية الفهم العام لمحدوديات (الغاية) أنظمة التركيب البشري للفيديو الذكاء الاصطناعي حتى الآن ، فإن أهمية Hunyuan LoRA ليست سهلة الفهم لشخص يتابع بلا إلهام مجتمع التركيب الإبداعي للذكاء الاصطناعي. دعونا نراجع بعض الفروق الرئيسية بين Hunyuan LoRAs والمناهج السابقة لتوليد فيديو الهوية القائمة على الذكاء الاصطناعي.
1: التثبيت المحلي غير المقيد
الجانب الأكثر أهمية من Hunyuan Video هو حقيقة أنه يمكن تنزيله محليًا ، ويوفر نظام توليد فيديو الذكاء الاصطناعي القوي وغير المحدد في أيدي المستخدم العادي ، بالإضافة إلى مجتمع VFX (في حدود ما يسمح به الترخيص عبر المناطق الجغرافية).
كانت المرة الأخيرة التي حدثت فيها كانت ظهور إصدار Stable Diffusion مفتوح المصدر في صيف 2022. في ذلك الوقت ، كان DALL-E2 قد أسر الخيال العام ، على الرغم من أن DALLE-2 كان خدمة مدفوعة مع قيود ملحوظة (التي نمت مع مرور الوقت).
عندما أصبح Stable Diffusion متاحًا ، وأصبح من الممكن توليد صور للهوية أي شخص (مشاهير أو غيرهم) من خلال التكيف منخفض الرتبة ، ساعدت مجموعة كبيرة من الاهتمام بالتطوير والاستهلاك في جعل Stable Diffusion يتجاوز شعبية DALLE-2 ؛ على الرغم من أن الأخير كان نظامًا أكثر قدرة خارج الصندوق ، كانت روتيناته للتSENSOR موضع إعجاب من قبل العديد من مستخدميه ، وكانت التخصيص غير ممكن.
يمكن القول بأن السيناريو نفسه ينطبق الآن على Sora و Hunyuan – أو ، بدقة أكبر ، بين Sora-grade أنظمة توليد فيديو التوليد التقليدية ، والمنافسين مفتوحي المصدر ، من بينهم Hunyuan هو الأول – ولكن من المحتمل أن لا يكون الأخير (هنا ، ضع في اعتبارك أن Flux سوف يكتسب في النهاية أرضًا كبيرة على Stable Diffusion).
يمكن للمستخدمين الذين يرغبون في إنشاء Hunyuan LoRA الإخراج ، ولكنهم يفتقرون إلى المعدات القوية الفعالة ، أن يرسلوا جانب GPU من التدريب إلى خدمات الحوسبة عبر الإنترنت مثل RunPod. هذا ليس مثل إنشاء فيديوهات الذكاء الاصطناعي على منصات مثل Kaiber أو Kling ، منذ أن لا يوجد ترشيح семанти أو قائم على الصور (الرقابة) يتعين في إيجار GPU لدعم تدفق العمل المحلي.
2: لا حاجة إلى فيديوهات ‘المضيف’ والجهد العالي
عندما ظهرت Deepfakes على الساحة في نهاية 2017 ، سوف يتطور الكود المنشور بشكل مجهول إلى الفروع الشهيرة DeepFaceLab و FaceSwap (بالإضافة إلى DeepFaceLive نظام Deepfaking في الوقت الفعلي).
يتطلب هذا الأسلوب جمعpainstaking من آلاف صور الوجه لكل هوية يتم تبديلها ؛ كلما كان الجهد أقل في هذه المرحلة ، كلما كان النموذج أقل فعالية. بالإضافة إلى ذلك ، تختلف أوقات التدريب بين 2-14 يومًا ، اعتمادًا على الأجهزة المتاحة ، مما يضغط على الأنظمة القادرة في الأجل الطويل.
عندما كان النموذج جاهزًا في النهاية ، يمكنه فقط فرض الوجوه على فيديو موجود ، وغالبًا ما كان يحتاج إلى ‘هدف’ (أي ، هوية حقيقية) كان قريبًا في المظهر من الهوية المتراكبة.
في الآونة الأخيرة ، قدم ROOP و LivePortrait و إطارات مماثلة وظيفية مماثلة مع جهد أقل ، وأحيانًا مع نتائج متفوقة – ولكن بدون القدرة على توليد deepfakes كاملة الجسم – أو أي عنصر آخر غير الوجوه.

أمثلة على ROOP Unleashed و LivePortrait (إدراج أدناه في اليسار) ، من تيار المحتوى Bob Doyle على YouTube. مصادر: https://www.youtube.com/watch?v=i39xeYPBAAM و https://www.youtube.com/watch?v=QGatEItg2Ns
بالمقارنة ، يسمح Hunyuan LoRAs (وأنظمة مماثلة التي سوف تتبع بالتأكيد) بإنشاء عالَم كامل ، بما في ذلك محاكاة كاملة الجسم للهوية LoRA المدربة من قبل المستخدم.
3: تحسين الاستقرار الزمني بشكل كبير
لقد كان الاستقرار الزمني الغاية المقدسة لتوليد فيديو التخلف لعدة سنوات الآن. يمنح استخدام LoRA ، جنبًا إلى جنب مع التوجيهات المناسبة ، Hunyuan فيديو توليد هوية ثابتة للاستمرار. في النظرية (هذه الأيام المبكرة) ، يمكن تدريب LoRAs متعددة للهوية معينة ، كل منها يرتدي ملابس محددة.
تحت هذه الظروف ، من الأقل احتمالًا أن “يتحول” الملابس خلال توليد الفيديو (منذ أن يعتمد النظام التوليدي الإطار التالي على نافذة محدودة من الإطارات السابقة).
(بديلًا ، كما هو الحال مع أنظمة LoRA القائمة على الصور ، يمكن تطبيق LoRAs متعددة ، مثل هويات + LoRAs ملابس ، على توليد فيديو واحد)
4: الوصول إلى ‘تجربة الإنسان’
كما لاحظت مؤخرًا ، يبدو أن القطاع التقليداني للذكاء الاصطناعي الآن خائفًا بشكل واضح من الانتقادات المحتملة المتعلقة بقدرات التركيب البشري لمشاريعه ، لدرجة أن الأشخاص الفعليين نادرًا ما يظهرون في صفحات المشروع للإعلانات والإعلانات. بدلاً من ذلك ، تتميل الأدبيات الترويجية المتعلقة بها بشكل متزايد إلى عرض مواضيع “لطيفة” و “غير مهددة” في النتائج الم 合ة.
مع ظهور Hunyuan LoRAs ، للمرة الأولى ، يكون للمجتمع فرصة للضغط على حدود التركيب البشري للفيديو القائم على LoRA في نظام قوي للغاية ( chứ لا نظام هامشي) ، و لاستكشاف الموضوع الذي يهم معظمنا – الناس.
الآثار
نظرًا لأن البحث عن ‘Hunyuan’ في مجتمع Civit يظهر في الغالب LoRAs المشاهير و ‘LoRAs الصريحة’ ، فإن الآثار المركزية لظهور Hunyuan LoRAs هي أنها سوف تستخدم لإنشاء فيديوهات إباحية أو مهينة للهوية الحقيقية – المشاهير والمجهولين على حد سواء.
لأغراض الامتثال ، يمنع الهواة الذين يخلقون Hunyuan LoRAs و الذين يجرّبونها على خواديم Discord المتنوعة من نشر أمثلة للأشخاص الحقيقيين. الحقيقة هي أن حتى الصور Deepfakes قد أصبحت مسلحة بشكل كبير ؛ و قد يبرر إضافة فيديوهات واقعية حقًا إلى المزيج في النهاية مخاوف متكررة في وسائل الإعلام خلال السنوات السبع الماضية ، والتي أدت إلى لوائح جديدة.
القوة الدافعة
كما هو الحال دائمًا ، يبقى البورنوغرافيا القوة الدافعة للتكنولوجيا. مهما كانت آراؤنا حول هذا الاستخدام ، فإن هذا المحرك المتواصل للزخم يدفع التقدم في حالة الفن التي يمكن أن يستفيد منها التبني الأكثر شيوعًا في النهاية.
في هذه الحالة ، من المحتمل أن يكون السعر أعلى من المعتاد ، منذ أن يكون إصدار إنشاء فيديو الواقعي للغاية مفتوح المصدر له آثار واضحة على الاستخدام غير القانوني والسياسي والأخلاقي.
هناك مجموعة Reddit (التي لن أذكرها هنا) مخصصة لتوليد فيديو NSFW بالذكاء الاصطناعي ، و لها خادم Discord مفتوح حيث يطور المستخدمون تدفقات عمل ComfyUI لإنشاء فيديو Hunyuan القائم على البورنو. يوميًا ، ينشر المستخدمون أمثلة على مقاطع NSFW – العديد منها يمكن وصفها بشكل معقول على أنها “متطرفة” أو على الأقل تتعارض مع قيود المجموعة.
كما تحتفظ هذه المجتمع بمستودع GitHub كبير ومطوّر يحتوي على أدوات يمكنها تحميل ومعالجة فيديوهات إباحية ، لتوفير بيانات تدريب لنماذج جديدة.
منذ أن يدعم Kohya-ss ، أفضل مدرب LoRA ، الآن Hunyuan LoRA التدريب ، فإن الحواجز أمام الدخول إلى تدريب الفيديو التوليدي غير المقيد تقل يومًا بعد يوم ، إلى جانب متطلبات الأجهزة لتدريب وإنشاء Hunyuan.
الجانب الحاسم في مخططات التدريب المخصصة للبورنوغرافيا القائمة على الذكاء الاصطناعي (بدلاً من نماذج الهوية) هو أن نموذج Hunyuan الأساسي لا يتم تدريبه بشكل خاص على الإخراج NSFW ، و قد يؤدي ذلك إلى أداء ضعيف عند الطلب منه توليد محتوى NSFW ، أو فشل في فك الارتباط المفاهيم والارتباطات المكتسبة بطريقة مقنعة أو متوافقة.
من خلال تطوير نماذج LoRAs و LoRAs المحددة ل NSFW ، سوف يصبح من الممكن بشكل متزايد 투영 الهويات المدرّبة إلى مجال فيديو البورنو المخصص ؛ بعد كل شيء ، هذا هو الإصدار الفيديو لشيء حدث بالفعل للفوتوغرافيا الثابتة خلال السنوات والنصف الماضية.
VFX
الزيادة الكبيرة في الاستقرار الزمني التي تقدمها Hunyuan Video LoRAs هي نعمة واضحة للصناعة التأثيرات البصرية للذكاء الاصطناعي ، التي تعتمد بشكل كبير على تعديل البرامج مفتوحة المصدر.
على الرغم من أن Hunyuan Video LoRA يولد إطارًا كاملاً وبيئة ، فإن شركات VFX قد بدأت بالفعل في تجربة عزل الوجوه الثابتة الزمنيًا التي يمكن الحصول عليها بهذه الطريقة ، لتركيبها أو دمجها في مقاطع الفيديو الحقيقية.
مثل مجتمع الهواة ، يجب على شركات VFX الانتظار حتى يتم إصدار Hunyuan Video’s image-to-video و video-to-video ، وهو الجسر الأكثر فائدة بين محتوى ‘deepfake’ القائم على LoRA و ID. أو ، يمكنهم التلاعب و استخدام الفترة لاستكشاف القدرات الخارجية للإطار و التفرع المخصص.
على الرغم من أن شروط الترخيص ل Hunyuan Video تسمح تقنيًا بعرض الأفراد الحقيقيين طالما تم الحصول على إذن ، فإنها تحظر استخدامها في الاتحاد الأوروبي و المملكة المتحدة و كوريا الجنوبية. على مبدأ “ما يحدث في لاس فيغاس يبقى في لاس فيغاس” ، هذا لا يعني بالضرورة أن Hunyuan Video لن يتم استخدامه في هذه المناطق ؛ ومع ذلك ، قد يجعل خطر التدقيق البياني الخارجي ، لفرض التنظيم المتزايد حول الذكاء الاصطناعي ، استخدامًا غير قانوني مخاطرة.
هناك منطقة أخرى محتملة الغموض في شروط الترخيص تنص على:
‘إذا كان عدد المستخدمين النشطين الشهريين لجميع المنتجات أو الخدمات المتاحة من قبل أو من أجل المرخص لهم أكثر من 100 مليون مستخدم نشط شهريًا في الشهر السابق ، فيجب عليك طلب ترخيص من Tencent ، والذي قد يمنحه لك Tencent وفقًا لتقديرها الخاص ، وأنت غير مخول بالاستفادة من أي حقوق بموجب هذه الاتفاقية حتى يمنحك Tencent حقوقها بشكل صريح.’
يهدف هذا البند明显ًا إلى الكثير من الشركات التي من المحتمل أن “توسط” Hunyuan Video لمستخدمين تقنيين غير متقدمين ، و التي ستكون مطالبة بتقسيم Tencent في العمل ، فوق سقف معين من المستخدمين.
قد تحتاج مسألة ما إذا كان النص الواسع قد يغطي أيضًا الاستخدام “غير المباشر” (أي ، عبر توفير مخرجات التأثيرات البصرية Hunyuan-تمكين في الأفلام والتلفزيون الشهيرة) إلى توضيح.
الخلاصة
منذ أن تم إنشاء فيديو Deepfake لفترة طويلة ، سيكون من السهل التقليل من أهمية Hunyuan Video LoRA كنهج لتركيب الهوية و Deepfaking ؛ وافتراض أن الجهود الحالية التي تظهر في مجتمع Civit و في Discords و subreddits ذات الصلة تمثل مجرد دفع صغير نحو تركيب بشري قابل للتحكم.
من المرجح أن تمثل الجهود الحالية فقط جزءًا من إمكانات Hunyuan Video لإنشاء deepfakes كاملة وواقعية ؛ بمجرد إصدار مكون صورة إلى فيديو (الذي من المقرر أن يحدث هذا الشهر) ، سوف يصبح مستوى أكثر دقة من القوة التوليدية متاحًا للمجتمعات الهواة والمحترفة.
عندما أصدرت Stability.ai Stable Diffusion في 2022 ، لم يكن من الممكن معرفة سبب إعطاء الشركة نظام التوليد التقليداني القوي للغاية مجانًا. مع Hunyuan Video ، يتم بناء الدافع الربحي مباشرة في الترخيص – على الرغم من أنه قد يثبت صعوبة على Tencent تحديد ما إذا كان شركة ما تؤدي إلى مخطط تقاسم الأرباح.
في أي حال ، النتيجة هي نفسها كما كانت في 2022: تكوين مجتمعات تطوير مخصصة فورًا وبحماس شديد حول الإصدار. بعض الطرق التي سوف تأخذها هذه الجهود في السنوات ال 12 القادمة من المحتمل أن تثير عناوين جديدة.
* حتى 136 في وقت النشر.
نشر لأول مرة يوم الثلاثاء ، 7 يناير 2025












