زاوية Anderson

تحرير الكائنات بمساعدة الذكاء الاصطناعي باستخدام Imagic من جوجل و’Erase and Replace’ من Runway

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

هذا الأسبوع، يقدم خوارزما رسوميّان جديدان، ولكنهما متناقضان، مدفوعان بالذكاء الاصطناعي، طرقًا مبتكرة للمستخدمين النهائيين لإجراء تغييرات دقيقة وفعّالة على الكائنات في الصور.

الأول هو Imagic، من Google Research، بالتعاون مع معهد إسرائيل للتكنولوجيا ومعهد وايزمان للعلوم. يوفّر Imagic تحريرًا مخصصًا للنص، ودقيقًا للكائنات عبر ضبط نماذج الانتشار.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

غيّر ما تريد، واترك الباقي – يَعِد Imagic بتحرير دقيق فقط للأجزاء التي تريد تغييرها. المصدر: https://arxiv.org/pdf/2210.09276.pdf

من جرّب تعديل عنصر واحد فقط في إعادة تصيير Stable Diffusion سيعرف جيدًا أن كل تعديل ناجح يُقابل تغييرات غير مرغوبة في خمسة عناصر أخرى كانت تُعجبك كما هي. هذه المشكلة تدفع العديد من المتحمسين لـ SD إلى التنقل باستمرار بين Stable Diffusion وPhotoshop لإصلاح ما يُسمّى «الأضرار الجانبية». من هذا المنظور وحده، تبدو إنجازات Imagic ملحوظة.

في وقت كتابة هذا المقال، لا يمتلك Imagic حتى فيديو ترويجي، وبالنظر إلى الموقف المتحفظ لجوجل بشأن إطلاق أدوات توليد الصور غير المقيدة، لا يُعرف إلى أي مدى، إن وجد، سيتاح لنا اختبار النظام.

العرض الثاني هو أداة Erase and Replace الأكثر سهولة من Runway ML، وهي ميزة جديدة في قسم «AI Magic Tools» ضمن مجموعة الأدوات البصرية القائمة على التعلم الآلي المتوفرة حصريًا على الإنترنت.

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

ميزة Erase and Replace من Runway ML، التي ظهرت مسبقًا في عرض تجريبي لنظام تحرير نص إلى فيديو.

لنلقِ نظرة أولًا على ما قدمته Runway.

Erase and Replace

مثل Imagic، يتعامل Erase and Replace حصريًا مع الصور الثابتة، رغم أن Runway عرضت مسبقًا نفس الوظيفة في حل تحرير نص إلى فيديو لم يُصدر بعد:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

يمكن لأي شخص تجربة Erase and Replace على الصور، لكن النسخة الفيديوية غير متاحة للجمهور بعد. المصدر: https://twitter.com/runwayml/status/1568220303808991232

على الرغم من أن Runway ML لم تكشف عن تفاصيل التقنية وراء Erase and Replace، فإن السرعة التي يمكن بها استبدال نبتة منزلية بتمثال مقنع إلى حد ما لروبرتون ريجن توحي بأن نموذج انتشار مثل Stable Diffusion (أو، على الأرجح الأقل احتمالًا، DALL‑E 2 مرخص) هو المحرك الذي يعيد إنشاء الكائن المختار في Erase and Replace.

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

استبدال نبتة منزلية بتمثال رونالد ريغان ليس سريعًا بهذا القدر، لكنه لا يزال سريعًا. المصدر: https://app.runwayml.com/

النظام يفرض بعض القيود المشابهة لتلك الموجودة في DALL‑E 2 – الصور أو النصوص التي تُثير مرشحات Erase and Replace ستؤدي إلى تحذير بشأن احتمال إيقاف الحساب في حال تكرار المخالفات – وهو ما يُعد نسخةً تقريبيةً من سياسات OpenAI المستمرة لـ DALL‑E 2.

العديد من النتائج تفتقر إلى الحواف الخشنة النموذجية لـ Stable Diffusion. Runway ML هم مستثمرون وشركاء بحثيين في SD، ومن الممكن أنهم درّبوا نموذجًا مملوكًا يتفوق على أوزان نقطة التفتيش المفتوحة المصدر 1.4 التي نتعامل معها جميعًا (كما تقوم مجموعات تطوير أخرى، هواة ومهنيون، بتدريب أو ضبط نماذج Stable Diffusion).

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

استبدال طاولة منزلية بـ «طاولة من الثلج» في Erase and Replace من Runway ML.

كما هو الحال مع Imagic (انظر أدناه)، فإن Erase and Replace يُعَد «موجهًا للكائنات» – لا يمكنك مسح جزء «فارغ» من الصورة وإعادة تعبئته بناءً على موجه نصي؛ ففي هذا السيناريو سيُحدد النظام أقرب كائن ظاهر على طول خط القناع (مثل جدار أو تلفاز) ويطبّق التحويل هناك.

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

كما يدل الاسم، لا يمكنك إدخال كائنات إلى مساحة فارغة في Erase and Replace. هنا، محاولة استدعاء أشهر سيث لورد تُنتج جدارية غريبة متعلقة بفادر على التلفاز، تقريبًا في المنطقة التي تم رسم «استبدال» فيها.

من الصعب تحديد ما إذا كان Erase and Replace يتجنّب استخدام الصور المحمية بحقوق النشر (التي لا يزال يُعقَب عنها إلى حد كبير في DALL‑E 2)، أو إذا كان النموذج المستخدم في محرك العرض الخلفي غير مُحسّن لهذا النوع من الاستخدام.

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

تشير «الجدارية غير الملائمة قليلًا» لنيكول كيدمان إلى أن النموذج القائم على الانتشار ربما يفتقر إلى آلية رفض DALL‑E 2 الصارمة للوجوه الواقعية أو المحتوى المثير، بينما تتراوح نتائج محاولات استنساخ أعمال محمية بين الغامض («إكسومورف») والسخيف («العرش الحديدي»). الصورة الأصلية في الزاوية السفلية اليمنى.

من المثير معرفة الأساليب التي يستخدمها Erase and Replace لعزل الكائنات القابلة للاستبدال. من المحتمل أن الصورة تُمرّر عبر نسخة من CLIP، حيث تُحدّد العناصر الفردية عبر التعرف على الكائنات ثم التقسيم الدلالي. لا تعمل أي من هذه العمليات بنفس الكفاءة في تثبيت عادي لـ Stable Diffusion.

لكن لا شيء مثالي – أحيانًا يبدو أن النظام يمسح دون استبدال، حتى عندما (كما رأينا في الصورة أعلاه) يعرف آلية العرض الأساسية ما يعنيه موجه النص. في هذه الحالة، يصبح من المستحيل تحويل طاولة قهوة إلى إكسومورف – فالطاولة تختفي ببساطة.

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

نسخة مخيفة أكثر من «أين والدو»، حيث يفشل Erase and Replace في إنتاج كائن فضائي.

يظهر Erase and Replace كنظام استبدال كائنات فعّال، مع تعبئة داخلية ممتازة. إلا أنه لا يستطيع تعديل الكائنات المُدركة حاليًا، بل يكتفي باستبدالها. تعديل محتوى الصورة الموجود دون الإضرار بالمواد المحيطة يُعد مهمة أصعب بكثير، مرتبطة بصراع طويل في مجال رؤية الحاسوب نحو فك الترابط في الفضاءات الكامنة للأطر الشائعة.

Imagic

هذا هو التحدي الذي يعالجه Imagic. الورقة الجديدة تقدم أمثلة عديدة لتعديلات تُعيد صياغة جوانب فردية من الصورة مع ترك باقي الصورة دون تغيير.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

في Imagic، لا تعاني الصور المعدّلة من التشويه والتمدد والافتراضات الخاطئة للانحسار التي تُميز الديب فايك المستند إلى صورة واحدة.

يعتمد النظام على عملية من ثلاث مراحل – تحسين تضمين النص؛ ضبط النموذج؛ وأخيرًا توليد الصورة المعدّلة.

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

يقوم Imagic بترميز موجه النص المستهدف لاسترجاع تضمين النص الأولي، ثم يحسّن النتيجة للحصول على الصورة المدخلة. بعد ذلك يُضبط النموذج التوليدي على الصورة الأصلية مع إضافة مجموعة من المعلمات، قبل تطبيق الاستيفاء المطلوب.

ليس من المستغرب أن الإطار مبني على بنية Imagen النص‑إلى‑فيديو من جوجل، رغم أن الباحثين يشيرون إلى أن مبادئ النظام قابلة للتطبيق على نماذج الانتشار الكامنة بشكل عام.

تستخدم Imagen بنية ثلاثية الطبقات، خلافًا لمصفوفة الطبقات السبع المستخدمة في النسخة الأحدث من برنامج الشركة النص‑إلى‑فيديو. تتكوّن الوحدات الثلاثة من نموذج انتشار توليدي يعمل بدقة 64×64 بكسل؛ نموذج رفع دقة يُحوّل الناتج إلى 256×256 بكسل؛ ونموذج رفع دقة إضافي يرفع الناتج إلى 1024×1024 بكسل.

يتدخل Imagic في المرحلة الأولى من هذه العملية، حيث يُحسّن تضمين النص المطلوب عند مرحلة 64 بكسل باستخدام مُحسّن آدم بمعدل تعلم ثابت قدره 0.0001.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

دورة متقدمة في فك الترابط: المستخدمون الذين حاولوا تغيير لون كائن مُولَّد في نموذج انتشار أو GAN أو NeRF يدركون أهمية قدرة Imagic على إجراء هذه التحولات دون «تمزيق» اتساق باقي الصورة.

يُجرى الضبط الدقيق على نموذج Imagen الأساسي، بمعدل 1500 خطوة لكل صورة مدخلة، مشروطًا بالتضمين المعدل. في الوقت نفسه، تُحسّن الطبقة الثانوية 64px → 256px بالتوازي على الصورة المشروطة. يلاحظ الباحثون أن تحسين الطبقة النهائية 256px → 1024px «ليس له تأثير ملحوظ» على النتائج النهائية، لذا لم يُطبقوا ذلك.

تشير الورقة إلى أن عملية التحسين تستغرق تقريبًا ثماني دقائق لكل صورة على شريحتين TPU V4. يُجرى العرض النهائي داخل نواة Imagen وفق مخطط العينة DDIM.

كما هو الحال مع عمليات الضبط الدقيق المشابهة في DreamBooth من جوجل، يمكن استخدام التضمينات الناتجة لتشغيل الت stylization، بالإضافة إلى تعديلات فوتورالية تستند إلى قاعدة البيانات الواسعة التي تُغذي Imagen (نظرًا لأن الصور المصدرية لا تحتوي على المحتوى الضروري لإجراء هذه التحولات).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

يمكن من خلال Imagic الحصول على حركات وتعديلات فوتورالية مرنة، بينما يمكن استخدام الشيفرات المستخرجة والمفككة في العملية لإنتاج مخرجات مُ stylized.

قارن الباحثون Imagic بالأعمال السابقة SDEdit، وهو نهج قائم على GAN من عام 2021، نتاج تعاون بين جامعة ستانفورد وجامعة كارنيجي ميلون؛ وText2Live، تعاون من أبريل 2022 بين معهد وايزمان للعلوم وNVIDIA.

A visual comparison between Imagic, SDEdit and Text2Live.

مقارنة بصرية بين Imagic وSDEdit وText2Live.

من الواضح أن الأساليب السابقة تواجه صعوبات، لكن في الصف السفلي، الذي يتضمن تغييرًا جذريًا في الوضعية، تفشل النماذج القائمة تمامًا في إعادة تشكيل المادة الأصلية، بينما يحقق Imagic نجاحًا ملحوظًا.

متطلبات موارد Imagic ووقت التدريب لكل صورة، رغم أنهما قصيران مقارنةً بالمعايير المعتادة، يجعلان من غير المرجح دمجه في تطبيق تحرير صور محلي على الحواسيب الشخصية – ولا يتضح إلى أي مدى يمكن تصغير عملية الضبط الدقيق لتصبح ملائمة للمستهلكين.

في الوقت الحالي، يُعد Imagic عرضًا مثيرًا يفضل أن يُستَخدم عبر واجهات برمجة التطبيقات (APIs) – وهو البيئة التي قد يشعر فيها Google Research، الحذر من الانتقادات المتعلقة بتسهيل إنشاء الديب فايك، بالراحة الأكبر.

 

نُشِر لأول مرة في 18 أكتوبر 2022.

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai