زاوية Anderson

HunyuanCustom يُقدم فيديوهات ديبفيك مُعدلة من صورة واحدة، مع صوت وتناغم شفوي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

تُناقش هذه المقالة إصدارًا جديدًا من نموذج Hunyuan Video متعدد الوضعيات يُدعى “HunyuanCustom”. يُظهر مدى تغطية الورقة الجديدة، بالإضافة إلى مشاكل عديدة في العديد من الفيديوهات المُرفقة في صفحة المشروع، أننا بحاجة إلى تغطية أكثر عمومية من المعتاد، وتحديدًا فيما يتعلق بالفيديوهات التي تُصاحب هذا الإصدار (حيث أن العديد من الفيديوهات تتطلب تحريرًا وتعديلات كبيرة لتحسين قابليتها للقراءة).

يرجى ملاحظة أن الورقة تشير إلى نظام Kling القائم على واجهة برمجة التطبيقات باسم “Keling”. من أجل الوضوح، أستخدم مصطلح “Kling” في جميع أنحاء هذا النص.

 

تعتبر تينسنت في proceso لإطلاق إصدار جديد من نموذج Hunyuan Video، والذي يُسمى HunyuanCustom. يبدو أن هذا الإصدار الجديد قادر على جعل نماذج Hunyuan LoRA غير ضرورية، من خلال السماح للمستخدمين بإنشاء فيديوهات مُعدلة من صورة واحدة.

انقر للتشغيل. الطلب: “رجل يستمع إلى الموسيقى ويتناول حبوب في المطبخ”. يُقارن الأسلوب الجديد مع الطرق المفتوحة والمغلقة، بما في ذلك Kling، وهو منافس كبير في هذا المجال. المصدر: https://hunyuancustom.github.io/ (تحذير: موقع يتطلب الكثير من الذاكرة والمعالجة!)

في العمود الأيسر من الفيديو أعلاه، نرى الصورة الأصلية التي تم توفيرها إلى HunyuanCustom، يليها تفسير النظام للطلب في العمود التالي، ثم النتائج من الأنظمة المُختلفة: Kling؛ Vidu؛ Pika؛ Hailuo؛ وWan-based SkyReels-A2.

في الفيديو التالي، نرى ثلاثة سيناريوهات مهمة لهذا الإصدار: على التوالي، شخص + كائن؛ تمثيل الشخصية المفردة؛ والجلسة الافتراضية (شخص + ملابس):

انقر للتشغيل. ثلاثة أمثلة مُعدلة من المواد على الموقع الداعم ل Hunyuan Video.

نستطيع ملاحظة بعض الأشياء من هذه الأمثلة، معظمها يتعلق بنظام يعتمد على صورة مصدر واحدة، بدلاً من صور متعددة لنفس الموضوع.

في اللقطة الأولى، الرجل يُظهر نفسه بشكل أساسي أمام الكاميرا. يُغمر رأسه لأسفل وجانبيًا بزاوية تزيد قليلاً عن 20-25 درجة من الدوران، لكن في ميل يفوق ذلك، النظام سوف يضطر إلى التخمين بشكل جيد ما يبدو عليه من الجانب.

في المثال الثاني، نرى أن الطفلة تبتسم في الفيديو المُrenders كما تفعل في الصورة الثابتة الأصلية. مرة أخرى، مع هذه الصورة الواحدة كمرجع، HunyuanCustom سوف يضطر إلى التخمين بشكل غير مُستنير حول ما يبدو عليه وجهها “في حالة راحة”. بالإضافة إلى ذلك، وجهها لا يبتعد عن مواجهة الكاميرا بأكثر من المثال السابق (“رجل يأكل رقائق”).

في المثال الأخير، نرى أن المواد الأصلية – المرأة والملابس التي تمت إضافتها إليها – ليست صورًا كاملة، لذلك تم تقليم السيناريو لتناسب – وهو في الواقع حل جيد لمشكلة البيانات!

النقطة هي أن النظام الجديد يمكنه التعامل مع صور متعددة (مثل شخص + رقائق، أو شخص + ملابس)، ولكنه لا يسمح بزوايا أو مناظر بديلة لشخصية واحدة، بحيث يمكن تلبية تعابير أو زوايا غير عادية. في هذه الحالة، قد يجد النظام صعوبة في استبدال النظام المتزايد للنماذج LoRA التي برزت حول HunyuanVideo منذ إطلاقه في ديسمبر الماضي، حيث يمكنها مساعدة HunyuanVideo على إنتاج شخصيات متسقة من أي زاوية وبتعبيرات وجه مُختلفة تمثلت في مجموعة التدريب (20-60 صورة عادة).

مصمم للصوت

للمصادر الصوتية، يستخدم HunyuanCustom نظام LatentSync (الذي يُعتبر صعبًا على الهواة لإعداده والحصول على نتائج جيدة منه) للحصول على حركات شفوية مطابقة للصوت والنص الذي يقدمه المستخدم:

يحتوي على صوت. انقر للتشغيل. أمثلة مختلفة من التزامن الشفوي من الموقع الإضافي ل HunyuanCustom، مُعدلة معًا.

في وقت الكتابة، لا توجد أمثلة بلغة إنجليزية، ولكنها تظهر جيدة جدًا – خاصة إذا كان طريقة إنشائها سهلة التثبيت ومتاحة.

تحرير الفيديو الحالي

يقدم النظام الجديد نتائج مُبهرة للتعديل من فيديو إلى فيديو (V2V، أو Vid2Vid)، حيث يتم إزالة جزء من فيديو حقيقي موجود وستتم استبداله بموضوع معين في صورة مرجعية واحدة. فيما يلي مثال من موقع المواد الإضافية:

انقر للتشغيل.

كما نرى، وعلى النحو المعتاد في سيناريو Vid2Vid، يتم تعديل الفيديو بأكمله إلى حد ما من خلال العملية، على الرغم من أن الجزء الأكثر تعديلًا هو المنطقة المستهدفة، أي اللعبة الناعمة. يُفترض أن يمكن تطوير خطوط أنابيب لإنشاء مثل هذه التحويلات تحت نهج garbage matte الذي يترك معظم محتوى الفيديو الأصلي متطابقًا مع الأصلي. هذا ما تفعله Adobe Firefly تحت الغطاء، ويفعله بشكل جيد – ولكنها عملية غير مدروسة جيدًا في مشهد التوليد المفتوح.

مع ذلك، فإن معظم الأمثلة البديلة المُقدمة تفعل عملًا أفضل في استهداف هذه التكاملات، كما نرى في التجميع التالي:

انقر للتشغيل. أمثلة مختلفة من المحتوى المُقدم باستخدام Vid2Vid في HunyuanCustom، مع احترام ملحوظ للمواد غير المستهدفة.

بداية جديدة؟

تُعتبر هذه المبادرة تطويرًا لمشروع Hunyuan Video، وليست انحرافًا عن هذا تيار التطوير. يتم تقديم تحسينات المشروع كإدراجات معمارية منفصلة بدلاً من تغييرات هيكلية شاملة، تهدف إلى تمكين النموذج من الحفاظ على صحة الهوية عبر الإطارات دون الاعتماد على التحسين الدقيق المحدد للموضوع، كما هو الحال مع LoRA أو نهج الانعطاف النصي.

للموضوع، HunyuanCustom ليس مدربًا من الصفر، بل هو تحسين لنموذج HunyuanVideo الأساسي في ديسمبر 2024.

أولئك الذين طوروا HunyuanVideo LoRAs قد يتساءلون عما إذا كانت ستعمل مع هذا الإصدار الجديد، أو ما إذا كانوا سيضطرون إلى إعادة اختراع عجلة LoRA مرة أخرى إذا أرادوا المزيد من قدرات التخصيص أكثر مما هو مدمج في هذا الإصدار الجديد.

بشكل عام، فإن إصدارًا مُحسّنًا بشكل كبير لنموذج بمقياس هائل يغير أوزان النموذج بما يكفي بحيث لن تعمل LoRAs التي تم إنشاؤها للنموذج السابق بشكل صحيح، أو على الإطلاق، مع النموذج المُحسّن حديثًا.

في بعض الأحيان، ومع ذلك، يمكن أن يُغير شعبية التحسين من أصوله: مثال على تحسين أصبح فرعًا فعالًا، مع نظام بيئي مخصص ومتابعين خاصين به، هو تحسين Pony Diffusion ل Stable Diffusion XL (SDXL). Pony حاليًا لديه أكثر من 592,000 تحميل على المجال المتغير CivitAI، مع مجموعة واسعة من LoRAs التي استخدمت Pony (وليس SDXL) كنموذج أساسي، والذي يتطلب Pony في وقت الاستدلال.

الإطلاق

يحتوي موقع المشروع للورقة الجديدة (التي تحمل عنوان HunyuanCustom: معمارية قادرة على دفع التوليد المخصص للفيديو) على روابط إلى موقع GitHub الذي أصبح وظيفيًا في الوقت الذي أكتب فيه، ويبدو أنه يحتوي على جميع الشفرة والأوزان اللازمة للتنفيذ المحلي، إلى جانب جدول زمني مقترح (حيث أن الشيء الوحيد المهم الذي لم يأت بعد هو دمج ComfyUI).

في وقت الكتابة، لا يزال وجود المشروع على Hugging Face هو 404. ومع ذلك، هناك إصدار قائم على واجهة برمجة التطبيقات API حيث يمكن للمستخدمين تجربة النظام، شريطة أن يتمكنوا من تقديم رمز مسح WeChat.

نادرًا ما رأيت استخدامًا如此 متقنًا ومُكثفًا لمثل هذه المجموعة الواسعة من المشاريع في تجميع واحد، كما هو الحال في HunyuanCustom – ومن المفترض أن بعض التراخيص ستفرض إطلاقًا كاملًا.

يتم الإعلان عن نموذجين في صفحة GitHub: نسخة 720px1280px تتطلب 8) جيجابايت من الذاكرة العرضية للوحة الرسومات، ونسخة 512px896px تتطلب 60 جيجابايت من الذاكرة العرضية للوحة الرسومات.

يُذكر المستودع أن “الحد الأدنى للذاكرة العرضية للوحة الرسومات المطلوبة هو 24 جيجابايت ل 720px1280px129f ولكنها بطيئة جدًا… نوصي باستخدام لوحة رسومات ذات 80 جيجابايت من الذاكرة للحصول على جودة أفضل” – ويُشير إلى أن النظام تم اختباره حتى الآن فقط على نظام Linux.

كان نموذج Hunyuan Video السابق، منذ إطلاقه الرسمي، قد تم الكمية إلى أحجام يمكن تشغيلها بأقل من 24 جيجابايت من VRAM، ويبدو من المعقول أن يتم تكييف النموذج الجديد أيضًا إلى أشكال أكثر ملاءمة للمستهلكين من قبل المجتمع، وسيتم تعديله بسرعة للاستخدام على أنظمة Windows أيضًا.

بسبب القيود الزمنية والكم الهائل من المعلومات التي تُصاحب هذا الإصدار، يمكننا فقط النظر بشكل أوسع، بدلاً من نظر دقيق، إلى هذا الإصدار. ومع ذلك، دعونا نلقي نظرة على HunyuanCustom قليلًا.

نظرًا إلى الورقة

يبدو أن خط أنابيب البيانات ل HunyuanCustom، والذي يتوافق مع إطار GDPR، يدمج مجموعات بيانات فيديو مُ合نة ومفتوحة المصدر، بما في ذلك OpenHumanVid، مع ثمانية فئات أساسية تمثلت: بشر، حيوانات، نباتات، مناظر طبيعية، مركبات، أشياء، هندسة معمارية، وأنمي.

من الورقة، نظرة عامة على الحزم المُختلفة المُساهمة في خط أنابيب بناء HunyuanCustom. المصدر: https://arxiv.org/pdf/2505.04512

من الورقة، نظرة عامة على الحزم المُختلفة المُساهمة في خط أنابيب بناء HunyuanCustom. المصدر: https://arxiv.org/pdf/2505.04512

تبدأ المرحلة الأولية للتنقية مع PySceneDetect، الذي يقسم الفيديوهات إلى مقاطع فيديو منفردة. ثم يتم استخدام TextBPN-Plus-Plus لإزالة الفيديوهات التي تحتوي على نص شاشة زائد، أو عناوين، أو علامات مائية.

为了 معالجة عدم الاتساق في الدقة والمدة، يتم تحديد المقاطع إلى خمس ثوانٍ في الطول وتم تحجيمها إلى 512 أو 720 بكسل على الجانب القصير. يتم التعامل مع التنقية الجمالية باستخدام Koala-36M، مع تطبيق عتبة مخصصة من 0.06 على مجموعة البيانات المُحسّنة من قبل باحثي الورقة.

يتم دمج عملية استخراج الموضوع مع Qwen7B نموذج اللغة الكبيرة (LLM)، وإطار YOLO11X لتحديد الكائنات، وعمارة InsightFace الشهيرة، لتحديد والتحقق من الهويات البشرية.

对于 مواضيع غير بشرية، يتم استخدام QwenVL وGrounded SAM 2 لاستخراج صناديق التحديد المُختلفة، والتي يتم التخلص منها إذا كانت صغيرة جدًا.

أمثلة من التجزئة الدلالية مع Grounded SAM 2، المستخدمة في مشروع Hunyuan Control. المصدر: https://github.com/IDEA-Research/Grounded-SAM-2

أمثلة من التجزئة الدلالية مع Grounded SAM 2، المستخدمة في مشروع Hunyuan Control. المصدر: https://github.com/IDEA-Research/Grounded-SAM-2

يتم استخدام Florence2 لتعليم صندوق التحديد، وGrounded SAM 2 للتنقية، يليها التجميع والتنقية الزمنية لإطارات التدريب.

يتم تعزيز المقاطع المُعالجة من خلال التعليقات باستخدام نظام تعليقات مُруктуر مُطوّر من قبل فريق Hunyuan، والذي يوفر بيانات مُتعددة الطبقات مثل الوصف وإشارات حركة الكاميرا.

تم تطبيق استراتيجيات تعزيز التخفي، بما في ذلك التحويل إلى صناديق التحديد، خلال التدريب لتقليل التعلم الزائد وضمان أن النموذج يتكيف مع أشكال كائنات مُختلفة.

تم مزامنة بيانات الصوت باستخدام LatentSync المذكور سابقًا، وتم التخلص من المقاطع إذا انخفضت درجات التزامن عن عتبة معينة.

تم استخدام إطار HyperIQA لتقييم جودة الصورة لاستبعاد مقاطع الفيديو التي تُحصل على درجات أقل من 40 (على مقياس HyperIQA المُخصص). ثم تم معالجة المسارات الصوتية الصالحة باستخدام Whisper لاستخراج الميزات للاستخدامات المُستقبلية.

يُشدد المؤلفون على المركز المركزي لهذا الإطار في HunyuanCustom، حيث يتم استخدام LLaVA خلال مرحلة التعليقات، ويساعد في محاذاة المحتوى المرئي مع الطلبات النصية، مما يدعم بناء إشارة تدريب متسقة عبر الوضعيات:

إطار HunyuanCustom يدعم توليد فيديو متسق مع الهوية مشروطًا بالنص والصورة والصوت والفيديو.

إطار HunyuanCustom يدعم توليد فيديو متسق مع الهوية مشروطًا بالنص والصورة والصوت والفيديو.

من خلال الاستفادة من قدرات محاذاة اللغة والرؤية في LLaVA، يكتسب خط الأنابيب طبقة إضافية من الاتساق الدلالي بين العناصر المرئية ووصفها النصي – خاصة في السيناريوهات المُتعددة أو المُعقدة.

فيديو مُخصص

为了 السماح بتوليد الفيديو بناءً على صورة مرجعية وطلب، تم إنشاء وحدتين مركزتين حول LLaVA، أولاً بتحويل هيكل الإدخال ل HunyuanVideo بحيث يمكنه قبول صورة مع نص.

تم ذلك من خلال تنسيق الطلب بطريقة تضمين الصورة مباشرة أو وضع علامة تعريف قصيرة لها. تم استخدام رمز فاصل لمنع تعبئة الصورة للمحتوى.

نظرًا لأن معالج الصور في LLaVA يضغط أو يتخلص من التفاصيل المُفصلة المكانية أثناء محاذاة ميزات الصورة والنص (特别 عند ترجمة صورة مرجعية واحدة إلى تمثيل семантиكي عام)، تم دمج وحدة تعزيز الهوية. نظرًا لأن معظم نماذج التوليد اللاتنتيجة للفيديو تُعاني من صعوبة في الحفاظ على الهوية دون LoRA، حتى في مقطع قصير يبلغ خمس ثوانٍ، قد يُثبت أداء هذه الوحدة أهميته في الاختبارات المجتمعية.

في أي حال، يتم تحجيم الصورة المرجعية وتشفيرها باستخدام 3D-VAE القائم على السبب من النموذج الأصلي HunyuanVideo، ويتم إدراج اللاتنتي في لاتنسات الفيديو عبر المحور الزمني، مع تطبيق تعويض مكاني لمنع إعادة إنتاج الصورة بشكل مباشر في الإخراج، مع الحفاظ على التوجيه.

تم تدريب النموذج باستخدام Flow Matching، مع عينات ضوضاء مُستمدة من توزيع logit-normal – وتم تدريب الشبكة على استعادة الفيديو الصحيح من هذه اللاتنسات المُضطربة. تم تحسين LLaVA ونموذج التوليد الفيديوي معًا بحيث يمكن أن يوجه الإخراج بشكل أكثر سلاسة ويحافظ على هوية الموضوع.

对于 طلبات مُتعددة المواضيع، تم تضمين كل زوج من الصورة والنص بشكل منفصل وتعيينه لموقع زمني مُختلف، مما يسمح بالتمييز بين الهويات ودعم توليد مشاهد تضم مواضيع متعددة تفاعلية.

الصوت والرؤية

يُشروط HunyuanCustom توليد الصوت / الكلام باستخدام كل من المدخلات الصوتية للمستخدم والطلب النصي، مما يسمح للأشخاص بالتحدث في المشاهد التي تعكس الإعداد المُوصوف:

为了 دعم ذلك، يُقدم وحدة Identity-disentangled AudioNet ميزات صوتية دون تعطيل إشارات الهوية المضمنة من الصورة المرجعية والطلب، ويتم محاذاة هذه الميزات مع الجدول الزمني المضغوط للفيديو، مقسمًا إلى مقاطع على مستوى الإطار، ويتم حقنها باستخدام آلية الانتباه المكاني التي تحافظ على كل إطار منفصل، مما يحافظ على اتساق الموضوع ويتجنب التداخل الزمني.

يُقدم وحدة temporal injection ثانية تحكم أكثر دقةً في التوقيت والحركة، تعمل بالتандم مع AudioNet، وتُ ánhة ميزات الصوت إلى مناطق محددة من التسلسل اللاتنتي، وتم استخدام الشبكة العصبية متعددة الطبقات (MLP) لتحويلها إلى ميزات حركة على مستوى الرمز. هذا يسمح بالإشارات والحركات بالوجه بالتزامن مع إيقاع وتنغيم المدخلات الصوتية.

يسمح HunyuanCustom بمعالجة الأشخاص في الفيديوهات الحالية بشكل مباشر، واستبدال أو إدراج أشخاص أو كائنات في المشهد دون الحاجة إلى إعادة بناء مقطع الفيديو كله من الصفر. هذا يجعلها مفيدة للمهام التي تتضمن تعديل المظهر أو الحركة بطريقة مستهدفة.

انقر للتشغيل. مثال إضافي من الموقع الإضافي.

为了 تسهيل استبدال الموضوع في الفيديوهات الحالية، يتجنب النظام الجديد النهج المُكلف للموارد من الأساليب الحديثة، مثل VACE، أو تلك التي تدمج تسلسلات فيديو كاملة معًا، مفضلًا بدلاً من ذلك ضغط فيديو مرجعي باستخدام 3D-VAE المُسبق التدريب – وتم محاذاته مع لاتنسات توليد الفيديو الداخلية، ثم إضافتهما معًا. هذا يحافظ على العملية خفيفة الوزن، مع السماح للمحتوى الفيديوي الخارجي بتوجيه الإخراج.

يُتعامل شبكة عصبية صغيرة مع المحاذاة بين الفيديو النظيف المدخل واللاتنسات المُضطربة المستخدمة في التوليد. وجد المؤلفون أن الطريقة الثانية تعمل بشكل أفضل، وتتجنب فقدان الجودة مع الحفاظ على الحمل الحسابي غير المُغيّر.

بيانات واختبارات

في الاختبارات، تم استخدام المعايير التالية: وحدة اتساق الهوية في ArcFace، الذي يُستخرج التضمينات الوجهية من الصورة المرجعية وكل إطار من إطارات الفيديو المُولدة، ثم يُحسب المعدل平均 للتشابه الزاوي بينهما؛ تشابه الموضوع، عبر إرسال مقاطع YOLO11x إلى Dino 2 للمقارنة؛ CLIP-B، محاذاة النص-الفيديو، الذي يقيس التشابه بين الطلب والفيديو المُولد؛ CLIP-B مرة أخرى، لتحديد التشابه بين كل إطار وإطاراته المجاورة والإطار الأول، بالإضافة إلى الاتساق الزمني؛ ودرجة الديناميكية، كما هو محدد في VBench.

كما هو مذكور سابقًا، المنافسين الأساسيين المغلقين كانوا Hailuo؛ Vidu 2.0؛ Kling (1.6)؛ وPika. كانت الإطارات المفتوحة المنافسة هي VACE وSkyReels-A2.

تقييم أداء النموذج بالمقارنة مع HunyuanCustom وأساليب تخصيص الفيديو الرائدة عبر اتساق الهوية (Face-Sim)، تشابه الموضوع (DINO-Sim)، محاذاة النص-الفيديو (CLIP-B-T)، اتساق زمني (Temp-Consis)، ودرجة الحركة (DD). النتائج المثالية والثانوية تظهر بالخط العريض والمُشطر، على التوالي.

تقييم أداء النموذج بالمقارنة مع HunyuanCustom وأساليب تخصيص الفيديو الرائدة عبر اتساق الهوية (Face-Sim)، تشابه الموضوع (DINO-Sim)، محاذاة النص-الفيديو (CLIP-B-T)، اتساق زمني (Temp-Consis)، ودرجة الحركة (DD). النتائج المثالية والثانوية تظهر بالخط العريض والمُشطر، على التوالي.

من بين هذه النتائج، يُشير المؤلفون إلى:

‘يحقق HunyuanCustom أفضل اتساق هويتي وثبات موضوعي. كما يحقق نتائج قابلة للمقارنة في اتباع الطلب والاتساق الزمني. [Hailuo] لديها أفضل نتيجة CLIP لأنها تتبع تعليمات النص جيدًا مع اتساق هويتي فقط، وتضحي بثبات الموضوعات غير البشرية (أسوأ DINO-Sim). فيما يتعلق بدرجة الديناميكية، [Vidu] و[VACE] يؤدّيان بشكل سيئ، مما قد يكون نتيجة لحجم النموذج الصغير.’

بالإضافة إلى ذلك، يُشير المؤلفون إلى أن:

‘[Pika] تؤدي بشكل سيئ فيما يتعلق بالاتساق الزمني، وتُدخل آثار عناوين فرعية (تأثيرات من سوء تنقية البيانات، حيث تم السماح للعناصر النصية في مقاطع الفيديو بالتأثير على المفاهيم الأساسية).’

في اختبارات متعددة المواضيع، تم اختبار HunyuanCustom ضد نفس المنافسين:

مقارنات باستخدام تخصيص فيديو متعدد المواضيع. يُرجى الرجوع إلى ملف PDF للحصول على تفاصيل وأحجام أفضل.

مقارنات باستخدام تخصيص فيديو متعدد المواضيع. يُرجى الرجوع إلى ملف PDF للحصول على تفاصيل وأحجام أفضل.

يُشير المؤلفون إلى أن:

‘[Pika] يمكن أن تُولّد المواضيع المُحددة، لكنها تُظهر عدم استقرار في إطارات الفيديو، مع حالات لرجل يختفي في سيناريو وامرأة تفشل في فتح باب كما هو موضح في الطلب. [Vidu] و[VACE] يلتقطان جزئيًا هوية الإنسان، لكنهما يفقدان تفاصيل مهمة للأشياء غير البشرية، مما يشير إلى محدودية تمثيل المواضيع غير البشرية.’

‘[SkyReels A2] يُختبر عدم استقرار إطار شديد، مع تغييرات ملحوظة في الشيبس وآثار كثيرة في السيناريو الأيمن. ‘

‘في المقابل، يلتقط HunyuanCustom بنجاح كل من الهويات البشرية وال非 بشرية، ويُولّد فيديوهات تُطيع الطلبات المُحددة، ويحافظ على جودة مرئية عالية وثبات.’

تم إجراء اختبار إضافي، وهو “إعلان بشري افتراضي”، حيث تم تكليف الإطارات بدمج منتج مع شخص:

من الجولة الاختبارية، أمثلة على وضع المنتجات العصبية. يُرجى الرجوع إلى ملف PDF للحصول على تفاصيل وأحجام أفضل.

من الجولة الاختبارية، أمثلة على وضع المنتجات العصبية. يُرجى الرجوع إلى ملف PDF للحصول على تفاصيل وأحجام أفضل.

في هذا السياق، يُشير المؤلفون إلى أن:

‘تُظهر النتائج أن HunyuanCustom يحافظ بشكل فعال على هوية الإنسان مع الحفاظ على تفاصيل المنتج المستهدف، بما في ذلك النص عليه. بالإضافة إلى ذلك، يبدو التفاعل بين الإنسان والمنتج طبيعيًا، والفيديو يُطيع الطلب المُحدد، مما يُظهر إمكانات كبيرة ل HunyuanCustom في توليد فيديوهات إعلانية.’

تم إجراء اختبار آخر، وهو استبدال الموضوع في وضع فيديو إلى فيديو:

اختبار استبدال الموضوع في وضع فيديو إلى فيديو. يُرجى الرجوع إلى ملف PDF للحصول على تفاصيل وأحجام أفضل.

اختبار استبدال الموضوع في وضع فيديو إلى فيديو. يُرجى الرجوع إلى ملف PDF للحصول على تفاصيل وأحجام أفضل.

في هذا الاختبار، يُشير المؤلفون إلى أن:

‘تُعاني VACE من آثار حدودية بسبب الالتزام الصارم بأقنعة المدخلات، مما يؤدي إلى أشكال موضوع غير طبيعية وتنقطع في استمرارية الحركة. [Kling]، من ناحية أخرى، يُظهر تأثير نسخ ولصق، حيث يتم وضع المواضيع مباشرة على الفيديو، مما يؤدي إلى تegrated سيئة مع الخلفية. ‘

‘في المقابل، يُ避ي HunyuanCustom آثار الحدود، ويتحقق من التكامل السلس مع خلفية الفيديو، ويحافظ على صيانة قوية للهوية – مما يُظهر أداءه الأفضل في مهام تحرير الفيديو.’

الختام

تُعتبر هذه إحدى الإصدارات المثيرة للاهتمام، لا سيما لأنها تُعالج شيء ما يشتكي منه هواة غير راضين في الآونة الأخيرة – عدم وجود تناغم الشفاه، بحيث يمكن أن تُضفي الواقعية المتزايدة القابلة للتحقيق في أنظمة مثل Hunyuan Video وWan 2.1 بعدًا جديدًا من الواقعية.

على الرغم من أن تخطيط معظم الأمثلة المقارنة على موقع المشروع يجعل من الصعب المقارنة بين HunyuanCustom وسبقها، يجب أن نلاحظ أن عددًا قليلاً من المشاريع في مجال توليد الفيديو لديها الشجاعة لمواجهة Kling، واجهة برمجة التطبيقات الشهيرة لتوليد الفيديو، التي ت

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai