زاوية Anderson
تعديل الكائنات بمساعدة الذكاء الاصطناعي مع Imagic و Runway’s ‘Erase and Replace’

في هذا الأسبوع ، تم تقديم خوارزميتان جرافيكيتان جديدتان مدفوعتان بالذكاء الاصطناعي ، وتقدمان طرقًا جديدة للمستخدمين النهائيين لإجراء تغييرات دقيقة وفعالة على الكائنات في الصور.
الأولى هي Imagic ، من غوغل ريسيرتش ، بالاشتراك مع معهد إسرائيل للتكنولوجيا ومعهد وايزمان للعلوم. Imagic تقدم تحريرًا متقدمًا للكائنات عبر تعديل نماذج الانتشار.

غيّر ما تريد ، واترك الباقي – Imagic يpromis تحريرًا دقيقًا للكائنات فقط في الأجزاء التي تريد تغييرها. مصدر: https://arxiv.org/pdf/2210.09276.pdf
أي شخص قد حاول تغيير عنصر واحد فقط في إعادة عرض Stable Diffusion سيعرف جيدًا جدًا أن النظام سيتغير في خمسة أشياء التي كنت تحبها بالطريقة التي كانت عليها. هذا هو عيب يمتلكه حاليًا العديد من هواة Stable Diffusion الموهوبين ، الذين يتنقلون باستمرار بين Stable Diffusion و Photoshop لتصحيح هذا النوع من “الأضرار الجانبية”. من هذا المنظور وحده ، يبدو إنجاز Imagic ملحوظًا.
في وقت الكتابة ، Imagic لا يزال يفتقر حتى إلى فيديو تعريفي ، ونظرًا لموقف غوغل الحذر فيما يتعلق بإطلاق أدوات合成 الصور غير المقيدة ، فمن غير المؤكد إلى أي مدى ، إن كان ذلك ممكنًا ، سنحصل على فرصة لاختبار النظام.
العرض الثاني هو Runway ML’s Erase and Replace ، وهو ميزة جديدة في قسم “AI Magic Tools” من مجموعة أدوات التأثيرات البصرية القائمة على التعلم الآلي.

ميزة Erase and Replace من Runway ML ، والتي تم عرضها بالفعل في معاينة لنظام تحرير الفيديو النصي. مصدر: https://www.youtube.com/watch?v=41Qb58ZPO60
لنلق نظرة على Runway’s outing أولاً.
Erase and Replace
مثل Imagic ، تعامل Erase and Replace حصريًا مع الصور الثابتة ، على الرغم من أن Runway قد عرضت نفس الوظيفة في حل تحرير نصي-فيديو لم يتم إطلاقه بعد.

على الرغم من أن أي شخص يمكنه اختبار Erase and Replace الجديد على الصور ، إلا أن الإصدار الخاص بالفيديو لم يتم إطلاقه بعد. مصدر: https://twitter.com/runwayml/status/1568220303808991232
على الرغم من أن Runway ML لم تنشر تفاصيل حول التكنولوجيا التي تقف خلف Erase and Replace ، إلا أن السرعة التي يمكنك من خلالها استبدال نبات منزلي بتمثال معقول لرونالد ريغان تشير إلى أن نموذج الانتشار مثل Stable Diffusion (أو ، أقل احتمالًا ، DALL-E 2 المرخص) هو المحرك الذي يعيد اختراع الكائن الذي تختاره في Erase and Replace.

استبدال نبات منزلي بتمثال لرونالد ريغان ليس سريعًا كما هو موضح هنا ، ولكنه سريع جدًا. مصدر: https://app.runwayml.com/
النظام له بعض القيود من نوع DALL-E 2 – الصور أو النصوص التي تثير فلتر Erase and Replace سوف تؤدي إلى تحذير بشأن تعليق الحساب في حالة المزيد من الانتهاكات – بشكل praktisch مشابه لسياسات OpenAI الحالية ل DALL-E 2.
العديد من النتائج تفتقر إلى الحواف الخشنة النموذجية ل Stable Diffusion. Runway ML هي مستثمرة و شريك أبحاث في SD ، ومن المحتمل أنهم قد دربوا نموذجًا مملوكًا لهؤلاء الأشخاص يفوق النموذج المفتوح 1.4 الذي نتعامل معه حاليًا.

استبدال طاولة منزلي ب ‘طاولة من الجليد’ في Erase and Replace من Runway ML.
كما هو الحال مع Imagic (انظر أدناه) ، Erase and Replace هو “موجه للكائنات” – لا يمكنك مجرد محو “جزء فارغ” من الصورة وتصويره بنتيجة نصية; في هذا السيناريو ، سوف يتبع النظام الكائن الواضح على طول خط رؤية Маски (مثل جدار أو تلفزيون) ، وينفذ التحويل هناك.

كما يشير الاسم ، لا يمكنك حقن كائنات في الفضاء الفارغ في Erase and Replace. هنا ، محاولة لاستدعاء أشهر من الأسياد السيث يؤدي إلى لوحة جدارية غريبة ذات صلة بفادر على التلفزيون ، تقريبًا في المكان الذي تم رسم منطقة “استبدال” هناك.
من الصعب معرفة ما إذا كان Erase and Replace مترددًا فيما يتعلق bằng استخدام الصور المحمية بحقوق الطبع والنشر (التي لا تزال محظورة إلى حد كبير ، على الرغم من ذلك ، في DALL-E 2) ، أو إذا كان النموذج المستخدم في محرك العرض الخلفي ليس مُحسَّنًا لهذا النوع من الأشياء.

اللوحة الجدارية ‘نيكول كيدمان’ التي لا تصلح تمامًا للعرض العام تشير إلى أن النموذج القائم على الانتشار الموجود في الأيام يفتقر إلى رفض النظامي السابق ل DALL-E 2 لتحويل الوجوه الواقعية أو المحتوى المثير. في حين أن محاولات استدعاء الأعمال المحمية بحقوق الطبع والنشر تتراوح من الغامضة (‘xenomorph’) إلى المضحكة (‘عرش الحديد’). في الزاوية اليمنى السفلى ، الصورة الأصلية.
من المثير للاهتمام معرفة ما هي الطرق التي يستخدمها Erase and Replace لفصل الكائنات التي يمكن استبدالها. من المفترض أن يتم تشغيل الصورة عبر بعض مشتقات CLIP ، مع تمييز العناصر المنفصلة بواسطة تحديد الكائنات والتقسيم الدلالي اللاحق. لا تعمل هذه العمليات بأي شكل من الأشكال في تثبيت عادي من Stable Diffusion.
لكن لا شيء مثالي – أحيانًا يبدو أن النظام يمحو ولا يستبدل ، حتى عندما (كما رأينا في الصورة أعلاه) ، يدرك آليًا ما يعنيه نص البرومت.

نسخة أكثر رعبا من ‘أين والدو’ ، حيث يفشل Erase and Replace في إنتاج مخلوق غريب.
يبدو أن Erase and Replace نظام استبدال كائنات فعال ، مع تحرير داخلي ممتاز. ومع ذلك ، لا يمكنه تحرير الكائنات الموجودة ، بل فقط استبدالها. لتغيير المحتوى الحالي للصورة دون المساس بالمادة المحيطة به هو مهمة صعبة ، مرتبطة بجهود البحث في الرؤية الحاسوبية لتجزئة الكائنات في الفضاءات الكامنة للإطارات الشائعة.
Imagic
هذه هي المهمة التي يتعامل معها Imagic. الورقة الجديدة تقدم العديد من الأمثلة على التحريرات التي تغير بنجاح جوانب فردية من الصورة دون المساس بباقي الصورة.

في Imagic ، لا تعاني الصور المعدلة من الانطلاق والتحويل والتنبؤ بالحجاب النموذجي للدمى Deepfake ، والتي تستخدم معلومات أولية محدودة من صورة واحدة.
يستخدم النظام عملية ثلاثية – تحسين التضمين النصي; تعديل النموذج; وأخيرًا ، توليد الصورة المعدلة.

يضمن Imagic التضمين النصي المستهدف لاسترداد التضمين النصي الأولي ، ثم يضبط النتيجة للحصول على صورة الإدخال. بعد ذلك ، يتم تعديل النموذج التوليدي على صورة المصدر ، بإضافة مجموعة من المعلمات ، قبل خضوعه للتفريغ المطلوب.
ليس من المستغرب أن يكون الإطار مُستندًا إلى هندسة Imagen النصية-الفيديو من غوغل ، على الرغم من أن الباحثين يعلنون أن مبادئ النظام قابلة للتطبيق بشكل عام على نماذج الانتشار الكامنة.
تستخدم Imagen هندسة ثلاثية المستويات ، بدلاً من مجموعة المستويات السبعة المستخدمة في الإصدار الأخير من غوغل النصي-الفيديو للبرنامج. تتكون الوحدات الثلاث المتميزة من نموذج انتشار توليدي يعمل بدقة 64x64px; نموذج دقة فائقة يرفع هذا الإخراج إلى 256x256px; ونموذج دقة فائقة إضافي لرفع الإخراج إلى دقة 1024×1024.
ي介ّن Imagic في المرحلة الأولى من هذا العملية ، ويضبط التضمين النصي المطلوب في مرحلة 64px على محسّن Adam بسرعة تعلم ثابتة تبلغ 0.0001.

دورة ماستر في تجزئة الكائنات: أولئك المستخدمون الذين حاولوا تغيير شيء بسيط مثل لون كائن معروض في نموذج انتشار أو GAN أو NeRF سيعرفون مدى أهمية قدرة Imagic على أداء هذه التحويلات دون “تمزيق” الاتساق في بقية الصورة.
ثم يتم تعديل النموذج ل 1500 خطوة لكل صورة ، مشروطًا بالتضمين المعدّل. في الوقت نفسه ، يتم تحسين الطبقة الثانوية 64px>256px بالتوازي على الصورة المشروطة. يلاحظ الباحثون أن تحسينًا مماثلاً للطبقة النهائية 256px>1024px له “أثر ضئيل أو لا شيء” على النتائج النهائية ، وبالتالي لم يتم تنفيذه.
تذكر الورقة أن عملية التحسين تستغرق حوالي ثماني دقائق لكل صورة على شريحة TPUV4 المزدوجة. يتم إجراء العرض النهائي في Imagen الأساسي تحت مخطط عينة DDIM.
على غرار عمليات التعديل المماثلة ل DreamBooth من غوغل ، يمكن استخدام التضمينات الناتجة أيضًا لتشغيل التأثيرات والتحريرات الفوتوغرافية الواقعية التي تحتوي على معلومات مستمدة من قاعدة البيانات الكامنة الأكبر التي تعمل بها Imagen (منذ ، كما يظهر العمود الأول أدناه ، لا تحتوي الصور المصدر على أي المحتوى اللازم لأداء هذه التحويلات).

يمكن استدعاء حركات وتركيبات فوتوغرافية مرنة عبر Imagic ، بينما يمكن استخدام الشفرات المشتقة والمنفصلة المكتسبة في هذه العملية بسهولة لتحقيق مخرجات منمقة.
قارن الباحثون Imagic بالعديد من الأعمال السابقة ، مثل SDEdit ، وهو نهج قائم على GAN من عام 2021 ، وهو تعاون بين جامعة ستانفورد وجامعة كارنيجي ميلون; و Text2Live ، وهو تعاون من أبريل 2022 ، بين معهد وايزمان للعلوم و NVIDIA.

مقارنة بصرية بين Imagic و SDEdit و Text2Live.
من الواضح أن النهوج السابقة تكافح ، ولكن في الصف السفلي ، الذي يتضمن إدخال تغيير كبير في الموقف ، فشل المتسابقون تمامًا في إعادة تشكيل المادة المصدر ، مقارنة بنجاح ملحوظ من Imagic.
تجعل متطلبات الموارد ووقت التدريب لكل صورة Imagic غير مرجح أن يتم تضمينه في تطبيق تحرير الصور المحلي على أجهزة الكمبيوتر الشخصية – وليس من الواضح إلى أي مدى يمكن تقليل عملية التعديل إلى مستويات المستهلك.
كما هو الحال ، Imagic هو عرض مثير للإعجاب أكثر من أن يكون مناسبًا للواجهات البرمجية – بيئة قد تكون غوغل ريسيرتش ، التي تتهرب من الانتقادات المتعلقة بتعزيز Deepfaking ، أكثر راحة معها.
فيما يخص إلى أي مدى يمكن تقليل عملية التعديل إلى مستويات المستهلك. كما هو الحال ، Imagic هو عرض مثير للإعجاب أكثر من أن يكون مناسبًا للواجهات البرمجية – بيئة قد تكون غوغل ريسيرتش ، التي تتهرب من الانتقادات المتعلقة بتعزيز Deepfaking ، أكثر راحة معها.
نشر لأول مرة في 18 أكتوبر 2022.












