زاوية Anderson

تقدم ملحوظ في فيديو الذكاء الاصطناعي الموجه من الإنسان

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Examples from the DreamActor project page.

ملاحظة: صفحة المشروع لهذا العمل تتضمن 33 فيديو عالي الدقة يلعب تلقائيًا يبلغ مجموع حجمه نصف غيغابايت ، مما أdestabilized نظامي عند التحميل. لهذا السبب ، لن أربط مباشرة. يمكن للقراء العثور على URL في ملخص الورقة أو ملف PDF إذا اختاروا.

أحد الأهداف الرئيسية في أبحاث合성 الفيديو الحالية هو توليد أداء فيديو كامل مدفوع بالذكاء الاصطناعي من صورة واحدة. هذا الأسبوع ، نشرت ورقة جديدة من Bytedance Intelligent Creation ما قد يكون النظام الأكثر شمولاً من هذا النوع حتى الآن ، قادرًا على إنتاج رسوم متحركة للجسم الكامل وشبه الجسم التي تجمع بين التفاصيل التعبيرية للوجه والدقة في الحركة الكبيرة ، بالإضافة إلى تحقيق توافق هوية محسّن – منطقة حيث غالبًا ما يفشل حتى الأنظمة التجارية الرائدة.

في المثال أدناه ، نرى أداءً مدفوعًا بممثل (أعلى اليسار) ومشتقًا من صورة واحدة (أعلى اليمين) ، الذي يقدم عرضًا مرنًا ومرناً للغاية ، دون أي من المشاكل المعتادة حول إنشاء حركات كبيرة أو “التنبؤ” بمناطق محجوبة (أي أجزاء من الملابس وزوايا الوجه التي يجب استنتاجها أو اختراعها لأنها غير مرئية في الصورة المصدر الوحيدة):

المحتوى الصوتي. انقر للتشغيل. يولد أداء من مصدرين ، بما في ذلك التزام الوشم ، الذي يعتبر عادةً حكرًا على الأنظمة المساعدة المخصصة. هذا هو إصدار مخفض من الموقع المصدر (انظر الملاحظة في بداية المقال – ينطبق على جميع الفيديوهات المضمنة هنا).

على الرغم من أننا نرى بعض التحديات المتعاظمة المتعلقة باستمرار الهوية مع تقدم كل مقطع ، إلا أن هذا هو أول نظام أراه يتفوق في الحفاظ على الهوية بشكل عام (على الرغم من عدم الحفاظ عليها دائمًا) لفترة مستدامة دون استخدام LoRAs:

المحتوى الصوتي. انقر للتشغيل. أمثلة أخرى من مشروع DreamActor.

النظام الجديد ، الذي يُسمى DreamActor ، يستخدم نظام تحكم هجين ثلاثي يُكرس اهتمامًا خاصًا للتعبير الوجهي و دوران الرأس وتصميم الهيكل العظمي الأساسي ، وبالتالي يتيح أداءً مدفوعًا بالذكاء الاصطناعي حيث لا يعاني التعبير الوجهي ولا الجسمي من الآخر – وهي قدرة نادرة ، يمكن القول إنها غير معروفة بين الأنظمة المماثلة.

فيما يلي ، نرى أحد هذه الجوانب ، دوران الرأس ، في العمل. الكرة الملونة في زاوية كل مصغرة إلى اليمين تشير إلى نوع من Gimbal الافتراضي الذي يحدد توجيه الرأس بشكل مستقل عن الحركة الوجهية والتعبير ، والتي يتم تشغيلها هنا بواسطة ممثل (أسفل اليسار).

انقر للتشغيل. تمثيل الكرة متعددة الألوان هنا يمثل محور دوران رأس.Avatar ، بينما يتم تشغيل التعبير بواسطة وحدة منفصلة ويتأثر بأداء الممثل (موجود هنا في أسفل اليسار).

واحدة من الوظائف الأكثر إثارة للاهتمام في المشروع ، والتي لا يتم تضمينها بشكل صحيح في اختبارات الورقة ، هي قدرته على استخراج حركة الوشم مباشرةً من الصوت – وهي قدرة تعمل بشكل غير عادي حتى بدون فيديو ممثل مدفوع.

الباحثون قد أخذوا على عاتقهم أفضل المتنافسين في هذا السعي ، بما في ذلك Runway Act-One و LivePortrait ، وreported أن DreamActor تمكنت من تحقيق نتائج كمية أفضل.

منذ أن يمكن للباحثين تحديد معاييرهم الخاصة ، فإن النتائج الكمية ليست بالضرورة معيارًا تجريبيًا ؛ لكن الاختبارات النوعية المرافقة تبدو أن تدعم استنتاجات المؤلفين.

لسوء الحظ ، هذا النظام لا يُقصد إطلاقه للجمهور ، والقيمة الوحيدة التي يمكن للجماعة استخراجها من العمل هي في إمكانية إعادة إنتاج المناهج المحددة في الورقة (كما تم القيام به لتحقيق تأثير كبير على Google Dreambooth في عام 2022 ).

تذكر الورقة*:

‘الرسوم المتحركة للصورة البشرية لها مخاطر اجتماعية محتملة ، مثل سوء استخدامها لإنشاء فيديوهات مزيفة. يمكن استخدام التكنولوجيا المقترحة لإنشاء فيديوهات مزيفة للأشخاص ، ولكن الأدوات الكاشفة الحالية [Demamba ، Dormant] يمكنها اكتشاف هذه الاكتشافات.

‘للتقليل من هذه المخاطر ، من الضروري وضع قواعد أخلاقية واضحة وتوجيهات استخدام مسؤول. سنقوم بتقيد الوصول إلى نماذجنا الأساسية ورموزنا لمنع سوء الاستخدام.’

من الطبيعي أن تكون الاعتبارات الأخلاقية من هذا القبيل مريحة من الناحية التجارية ، لأنها توفر مبررًا للوصول إلى نموذج API فقط ، والذي يمكن بعد ذلك تحويله إلى عملة. ByteDance قد فعلت ذلك بالفعل في عام 2025 ، من خلال جعل Omnihuman المتميز متاحًا مقابل رصيد مدفوع على موقع Dreamina. لذلك ، منذ أن DreamActor قد يكون منتجًا أقوى ، يبدو هذا هو النتيجة المحتملة. ما يبقى أن نرى هو مدى تأثير مبادئه ، بقدر ما يتم شرحها في الورقة ، على مجتمع المصدر المفتوح.

الورقة الجديدة الورقة الجديدة بعنوان DreamActor-M1: الرسوم المتحركة البشرية الشاملة والتعبيرية والمتينة مع التوجيه الهجين ، ويأتي من ستة باحثين من Bytedance.

الطريقة

يهدف نظام DreamActor المقترح في الورقة إلى توليد رسوم متحركة بشرية من صورة مرجعية و فيديو مدفوع ، باستخدام إطار Diffusion Transformer (DiT) المعدل للفضاء الlatent (يبدو أنه بعض نكهة Stable Diffusion ، على الرغم من أن الورقة تشير فقط إلى المنشور الرئيسي للعام 2022).

بدلاً من الاعتماد على الوحدات الخارجية لمعالجة الشرط المرجعي ، يدمج المؤلفون ميزات المظهر والحركة مباشرةً داخل هيكل DiT ، مما يسمح بالتفاعل عبر الفضاء والزمن من خلال الانتباه:

مخطط للنظام الجديد: DreamActor يコード وضع الجسم وحركة الوجه والمظهر في لاتنتات منفصلة ، ويجمعها مع لاتنتات فيديو ملوثة تنتجها 3D VAE. يتم دمج هذه الإشارات داخل Diffusion Transformer باستخدام الانتباه الذاتي والانتباه المتقاطع ، مع أوزان مشتركة عبر الفروع. يتم إشراف النموذج من خلال مقارنة الإخراجات المنقاة بالفيديوهات اللاتنتة النقية. المصدر: https://arxiv.org/pdf/2504.01724

مخطط للنظام الجديد: DreamActor يコード وضع الجسم وحركة الوجه والمظهر في لاتنتات منفصلة ، ويجمعها مع لاتنتات فيديو ملوثة تنتجها 3D VAE. يتم دمج هذه الإشارات داخل Diffusion Transformer باستخدام الانتباه الذاتي والانتباه المتقاطع ، مع أوزان مشتركة عبر الفروع. يتم إشراف النموذج من خلال مقارنة الإخراجات المنقاة بالفيديوهات اللاتنتة النقية. المصدر: https://arxiv.org/pdf/2504.01724

لفعل ذلك ، يستخدم النموذج محولًا مسبقًا متغيرًا ثلاثي الأبعاد لترميز كل من الفيديو الإدخالي والصورة المرجعية. يتم patchify هذه اللاتنتات ، وتركيبها ، وتمريرها إلى DiT ، الذي يعالجها بشكل مشترك.

هذه الهندسة تختلف عن الممارسة الشائعة لتركيب شبكة ثانوية لتحقiq الحقن المرجعي ، والتي كانت النهج المتبع في مشاريع Animate Anyone و Animate Anyone 2 المؤثرة.

بدلاً من ذلك ، يبني DreamActor الاندماج في النموذج الرئيسي نفسه ، مما يبسط التصميم ويحسن تدفق المعلومات بين إشارات المظهر والحركة. ثم يتم تدريب النموذج باستخدام flow matching بدلاً من الهدف القياسي للانتشار (يتم تدريب نماذج الانتشار باستخدام التنبؤ المباشر لحقول السرعة بين البيانات والضوضاء ، وتخطي تخمين الدرجة).

توجيه الحركة الهجين

يجمع نظام التوجيه الهجين للحركة الذي يخبر الرسوم المتحركة العصبية بين رموز الوضع المشتقة من هياكل الجسم ثلاثية الأبعاد وكرات الرأس ؛ تمثيلات الوجه الضمنية المستخرجة بواسطة محول الوجه المسبق ؛ ورموز المظهر المرجعية المأخوذة من الصورة المصدر.

تتم دمج هذه العناصر داخل Diffusion Transformer باستخدام آليات انتباه منفصلة ، مما يسمح للنظام بتنسيق الحركة العالمية والتعبير الوجهي والهوية البصرية على مدار عملية التوليد.

أولاً ، بدلاً من الاعتماد على معالم الوجه ، يستخدم DreamActor تمثيلات الوجه الضمنية لتوجيه توليد التعبير ، مما يبدو أنه يتيح التحكم الدقيق hơn في الديناميات الوجهية بينما يفصل الهوية ووضع الرأس عن التعبير.

لإنشاء هذه التمثيلات ، يتم أولاً كشف منطقة الوجه وتقليمها في كل إطار من فيديو التحكم ، وتحجيمها إلى 224×224. يتم معالجة الوجوه المقلمة بواسطة محول حركة الوجه المسبق على PD-FGC ، ثم يتم تشغيله بواسطة طبقة MLP.

PD-FGC ، المستخدم في DreamActor ، يولد رأسًا متكلمًا من صورة مرجعية مع سيطرة منفصلة على الوشم (من الصوت) ، ووضع الرأس ، وحركة العين ، والتعبير (من فيديوهات منفصلة) ، مما يسمح بتعديل دقيق ومستقل لكل منها. المصدر: https://arxiv.org/pdf/2211.14506

PD-FGC ، المستخدم في DreamActor ، يولد رأسًا متكلمًا من صورة مرجعية مع سيطرة منفصلة على الوشم (من الصوت) ، ووضع الرأس ، وحركة العين ، والتعبير (من فيديوهات منفصلة) ، مما يسمح بتعديل دقيق ومستقل لكل منها. المصدر: https://arxiv.org/pdf/2211.14506

النتيجة هي سلسلة من رموز حركة الوجه ، والتي يتم حقنها في Diffusion Transformer من خلال طبقة انتباه متقاطع.

نفس الإطار يدعم أيضًا متغيرًا مدفوعًا بالصوت ، حيث يتم تدريب محول منفصل الذي ي ánh الصوت مباشرةً إلى رموز حركة الوجه. هذا يجعل من الممكن توليد رسوم متحركة وجهية متزامنة – بما في ذلك حركات الشفاه – دون فيديو مدفوع.

المحتوى الصوتي. انقر للتشغيل. الوشم المشتق مباشرةً من الصوت ، دون فيديو مدفوع. المدخلات الوحيدة للشخصية هي الصورة الثابتة المرئية في الزاوية العلوية اليمنى.

ثانيًا ، لتحكم وضع الرأس بشكل مستقل عن التعبير الوجهي ، يقدم النظام تمثيلًا ثلاثي الأبعاد لكرة الرأس (انظر الفيديو المضمن في بداية هذا المقال) ، الذي يفصل الديناميات الوجهية عن الحركة العالمية ، مما يحسن الدقة والمرونة خلال الرسوم المتحركة.

تتم توليد كرات الرأس عن طريق استخراج معلمات الوجه ثلاثية الأبعاد – مثل الدوران ووضع الكاميرا – من فيديو التحكم باستخدام طريقة FaceVerse لتتبع الوجه.

مخطط لمشروع FaceVerse. المصدر: https://www.liuyebin.com/faceverse/faceverse.html

مخطط لمشروع FaceVerse. المصدر: https://www.liuyebin.com/faceverse/faceverse.html

تتم استخدام هذه المعلمات لتحويل كرة ملونة على مستوى الصورة ثنائية الأبعاد ، متوافقة مكانيًا مع رأس التحكم. حجم الكرة يتطابق مع رأس المرجعية ، ولونها يعكس توجيه الرأس. هذا التمثيل يقلل من تعقيد تعلم حركة الرأس ثلاثية الأبعاد ، مما يساعد على الحفاظ على أشكال الرأس المزخرفة أو المبالغ فيها في الشخصيات المرسومة من الرسوم المتحركة.

تجسيد الكرة التي تؤثر على توجيه الرأس.

تجسيد الكرة التي تؤثر على توجيه الرأس.

أخيرًا ، لتوجيه الحركة الكاملة للجسم ، يستخدم النظام هياكل جسمية ثلاثية الأبعاد مع معايرة طول العظام التكيفية. يتم تقدير معلمات الجسم واليد باستخدام 4DHumans و HaMeR ، كلاهما يعمل على SMPL-X نموذج الجسم.

SMPL-X يطبق شبكة معلمات على الجسم البشري الكامل في الصورة ، متوافقة مع وضع وتنبؤ التعبير ، مما يسمح بتعديل وضع الوجه باستخدام الشبكة كدليل حجمي. المصدر: https://arxiv.org/pdf/1904.05866

SMPL-X يطبق شبكة معلمات على الجسم البشري الكامل في الصورة ، متوافقة مع وضع وتنبؤ التعبير ، مما يسمح بتعديل وضع الوجه باستخدام الشبكة كدليل حجمي. المصدر: https://arxiv.org/pdf/1904.05866

من هذه الإخراج ، يتم اختيار مفاصل رئيسية ، وتحويلها إلى 2D ، وربطها في خرائط هيكلية خطية. على عكس الطرق مثل Champ ، التي ترسم شبكات جسمية كاملة ، هذا النهج يتجنب فرض مسبقات الشكل المحددة ، وبالاعتماد على الهيكل العظمي فقط ، يتم تشجيع النموذج على استنتاج شكل الجسم والمظهر مباشرةً من الصور المرجعية ، مما يقلل من انحيازًا إلى أنواع الجسم الثابتة ، ويتحسن التعميم عبر مجموعة من الأوضاع والبنيات.

خلال التدريب ، يتم ربط الهياكل العظمية ثلاثية الأبعاد مع كرات الرأس وتمريرها عبر محول وضع ، الذي يخرج ميزات يتم دمجها مع لاتنتات فيديو ملوثة لإنتاج رموز الضوضاء المستخدمة بواسطة Diffusion Transformer.

في وقت الاستدلال ، يتم تعديل الهياكل العظمية ثلاثية الأبعاد للاختلافات بين المواضيع من خلال معايرة طول العظام. النموذج المسبق SeedEdit لتعديل الصور يحول كل من الصور المرجعية والمدفوعة إلى تكوين قانوني معياري. ثم يتم استخدام RTMPose لاستخراج نسب الهيكل العظمي ، والتي يتم استخدامها لتعديل هيكل التحكم ليتوافق مع تشريح موضوع المرجعية.

<img class="size-full wp-image-215168" src="https://www.unite.ai/wp-content/uploads/2025/04/inference-pipeline.jpg" alt="مخطط لمخطط الاستدلال. يمكن توليد المراجع الزائفة لتعزيز إشارات المظهر ، بينما يتم استخراج إشارات التحكم الهجينة – الحركة الوجهية الضمنية والوضع الصريح من كرات الرأس والهياكل العظمية – من فيديو التحكم. ثم يتم إدخالها في نموذج DiT لإنتاج إخراج متحرك ، مع حركة الوجه مفصولة عن وضع الجسم ، مما يسمح باستخدام الصوت كمدفوع.

توجيه المظهر

لتحسين إخلاص المظهر ، خاصة في المناطق المحجوبة أو النادرة الظهور ، يتم تعزيز النظام الصورة المرجعية الرئيسية bằng صور مرجعية زائفة مستخرجة من فيديو الإدخال.

انقر للتشغيل. النظام يتوقع الحاجة إلى تقديم مناطق محجوبة بدقة وثبات. هذا هو أقرب ما رأيته ، في مشروع من هذا النوع ، إلى نهج النسيج البت مابي في CGI.

تتم اختيار هذه الإطارات الإضافية لتنوع الوضع باستخدام RTMPose ، وتمريرها باستخدام تشابه CLIP لضمان أنها تظل متوافقة مع هوية الموضوع.

تتم ترميز جميع إطارات المرجعية (الرئيسية والزائفة) بواسطة نفس المرمز البصري ودمجها من خلال آلية انتباه ذاتي ، مما يسمح للنموذج بالوصول إلى إشارات مظهر مكملة. هذا الإعداد يحسن تغطية تفاصيل مثل مناظير الوجه أو نصوص الأطراف. يتم استخدام المراجع الزائفة دائمًا خلال التدريب واختياريًا خلال الاستدلال.

التدريب

تم تدريب DreamActor في ثلاث مراحل لتقديم التعقيد وتحسين الاستقرار تدريجيًا.

في المرحلة الأولى ، تم استخدام هياكل الجسم ثلاثية الأبعاد وكرات الرأس فقط كإشارات تحكم ، مع استبعاد تمثيلات الوجه. هذا سمح بنموذج توليد الفيديو الأساسي ، الذي تم تطبيقه من MMDiT ، ليتكيف مع الرسوم المتحركة البشرية دون أن يُغرق بتحكم دقيق.

في المرحلة الثانية ، تمت إضافة تمثيلات الوجه الضمنية ، ولكن تم تجميد جميع المعلمات الأخرى مجمدة. تم تدريب فقط محول حركة الوجه وطبقات الانتباه الوجهية في هذه النقطة ، مما مكن النموذج من تعلم التفاصيل التعبيرية بشكل منفصل.

في المرحلة النهائية ، تم unfreezing جميع المعلمات لتحسين مشترك عبر المظهر والوضع والديناميات الوجهية.

البيانات والاختبارات

للفаза الاختبارية ، يتم 초기ته نموذج من نقطة تحكم مسبقة لنموذج DiT من الصورة إلى الفيديو ويدرب في ثلاث مراحل: 20,000 خطوة لكل من المرحلتين الأوليين و 30,000 خطوة للمرحلة الثالثة.

لتحسين التعميم عبر مدد وضبطات فيديو مختلفة ، تم عينة مقاطع فيديو بشكل عشوائي بأطوال بين 25 و 121 إطارًا. ثم تم تحجيمها إلى 960x640px ، مع الحفاظ على نسبة الجانب.

تم إجراء التدريب على ثمانية (موجهة الصين) من وحدات معالجة الرسومات H20 من NVIDIA ، كل منها مع 96GB من ذاكرة الوصول العشوائي ، باستخدام مثبط AdamW مع معدل تعلم (مستوى عالٍ بشكل معقول) من 5e−6.

في وقت الاستدلال ، تحتوي كل مقطع فيديو على 73 إطارًا. لتحافظ على الاتساق عبر المقاطع ، يتم إعادة استخدام اللاتنت النهائي من مقطع واحد كلاتنت أولي للمقطع التالي ، مما يسياق المهمة على أنها توليد صورة إلى فيديو متسلسل.

تم تطبيق توجيه تصنيف مجاني مع وزن 2.5 لكل من الصور المرجعية وإشارات التحكم في الحركة.

قام المؤلفون ببناء مجموعة بيانات تدريبية (لا يوجد مصدر مذكور في الورقة) تتألف من 500 ساعة من الفيديو من مجالات متنوعة ، وتampilkan أمثلة من (من بين أمور أخرى) الرقص والرياضة والسينما والخطابة العامة. تم تصميم مجموعة البيانات لتقديم طيفًا واسعًا من الحركة والتعابير البشرية ، مع توزيع متساوٍ بين لقطات الجسم الكامل والنصف.

لتحسين جودة合성 الوجه ، تم دمج Nersemble في عملية تحضير البيانات.

أمثلة من مجموعة بيانات Nersemble ، المستخدمة لتعزيز بيانات DreamActor. المصدر: https://www.youtube.com/watch?v=a-OAWqBzldU

أمثلة من مجموعة بيانات Nersemble ، المستخدمة لتعزيز بيانات DreamActor. المصدر: https://www.youtube.com/watch?v=a-OAWqBzldU

للتقييم ، استخدم الباحثون مجموعة بياناتهم أيضًا كمرجع لتقدير التعميم عبر سيناريوهات مختلفة.

تم قياس أداء النموذج باستخدام معايير قياسية من الأعمال السابقة: مسافة الفريتش للانCEPTION (FID)؛ مؤشر التشابه الهيكلي (SSIM)؛ تشابه الصور المكتسبة (LPIPS)؛ و نسبة الإشارة إلى الضوضاء القصوى (PSNR) لجودة الإطار. تم استخدام مسافة الفيديو الفريتش (FVD) لتقييم الاتساق الزمني وصدق الفيديو بشكل عام.

أجرى المؤلفون تجارب على مهام الرسوم المتحركة للجسم والصورة الشخصية ، جميعها تستخدم صورة مرجعية واحدة (الهدف).

للمهام المتحركة للجسم ، تم مقارنة DreamActor-M1 مع Animate Anyone و Champ و MimicMotion و DisPose.

المقارنات الكمية مع الإطارات المنافسة.

المقارنات الكمية مع الإطارات المنافسة.

على الرغم من أن PDF يوفر صورة ثابتة كمقارنة بصرية ، قد يبرز أحد مقاطع الفيديو من موقع المشروع الفرق بشكل أوضح:

المحتوى الصوتي. انقر للتشغيل. مقارنة بصرية عبر الإطارات المنافسة. الفيديو المحرك يظهر في الزاوية العلوية اليسرى ، ويتوافق استنتاج المؤلفين بأن DreamActor ينتج أفضل النتائج بشكل معقول.

للمهام المتحركة للصورة الشخصية ، تم تقييم النموذج ضد LivePortrait و X-Portrait و SkyReels-A1 و Act-One.

المقارنات الكمية لرسوم المتحركة للصورة الشخصية.

المقارنات الكمية لرسوم المتحركة للصورة الشخصية.

يشير المؤلفون إلى أن طريقةهم تفوز في الاختبارات الكمية ، ويدعون أنها تفوق أيضًا بشكل نوعي.

المحتوى الصوتي. انقر للتشغيل. أمثلة على مقارنات رسوم المتحركة للصورة الشخصية.

يمكن القول إن القطعة الثالثة والأخيرة من مقاطع الفيديو الموجودة في الفيديو أعلاه تظهر تزامنًا أقل اقناعًا مقارنة ببعض الإطارات المنافسة ، على الرغم من أن الجودة العامة هي عالية بشكل ملحوظ.

الاستنتاج

في توقع الحاجة إلى نصوص غير موجودة في الصورة المستهدفة ، قد تعاملت Bytedance مع واحدة من أكبر التحديات التي تواجه توليد الفيديو القائم على الانتشار – نصوص متسقة ومستدامة. الخطوة المنطقية التالية بعد تحسين هذا النهج سيكون إنشاء أطلس مرجعي من المقطع المتحرك المولود لاستخدامه في توليد لاحقة مختلفة ، للحفاظ على المظهر دون LoRAs.

على الرغم من أن هذا النهج سيكون بمثابة مرجع خارجي ، إلا أنه لا يختلف عن خريطة النسيج في تقنيات CGI التقليدية ، ودرجة الواقعية والمصداقية أعلى بكثير من تلك الأساليب القديمة.

قال إن الجانب الأكثر إثارة للإعجاب في DreamActor هو نظام التوجيه الهجين الثلاثي ، الذي يغلق الفجوة التقليدية بين合성 الوجه والجسم البشري بطريقة عبقرية.

ما يبقى أن نرى هو ما إذا كان بعض هذه المبادئ الأساسية يمكن استخلاصها في عروض أكثر سهولة الوصول؛ كما يبدو أن DreamActor يبدو أنه سيكون عرضًا آخر لتركيب الصور كخدمة ، مقيدًا بشدة بقيود الاستخدام ، وبالإمكانية غير العملية لتجربة معمقة معهندس تجاري.

* استبدالي للروابط بالمراجع؛ المراجع داخل النص

كما ذكرنا سابقًا ، لا يزال غير واضح ما النكهة من Stable Diffusion تم استخدامها في هذا المشروع.

نشر لأول مرة يوم الجمعة ، 4 أبريل 2025

كاتب في مجال التعلم الآلي، متخصص في مجال 合成 الصور البشرية. السابق رئيس محتوى البحث في Metaphysic.ai، حتى حلولها في Brahma.ai التابعة لشركة DNEG.
المنصة الشخصية: martinanderson.ai
التواصل: [email protected]