زاوية Anderson
تحرير الكائنات بمساعدة الذكاء الاصطناعي باستخدام Imagic من جوجل و’Erase and Replace’ من Runway

هذا الأسبوع، يقدم خوارزما رسوميّان جديدان، ولكنهما متناقضان، مدفوعان بالذكاء الاصطناعي، طرقًا مبتكرة للمستخدمين النهائيين لإجراء تغييرات دقيقة وفعّالة على الكائنات في الصور.
الأول هو Imagic، من Google Research، بالتعاون مع معهد إسرائيل للتكنولوجيا ومعهد وايزمان للعلوم. يوفّر Imagic تحريرًا مخصصًا للنص، ودقيقًا للكائنات عبر ضبط نماذج الانتشار.

غيّر ما تريد، واترك الباقي – يَعِد Imagic بتحرير دقيق فقط للأجزاء التي تريد تغييرها. المصدر: https://arxiv.org/pdf/2210.09276.pdf
من جرّب تعديل عنصر واحد فقط في إعادة تصيير Stable Diffusion سيعرف جيدًا أن كل تعديل ناجح يُقابل تغييرات غير مرغوبة في خمسة عناصر أخرى كانت تُعجبك كما هي. هذه المشكلة تدفع العديد من المتحمسين لـ SD إلى التنقل باستمرار بين Stable Diffusion وPhotoshop لإصلاح ما يُسمّى «الأضرار الجانبية». من هذا المنظور وحده، تبدو إنجازات Imagic ملحوظة.
في وقت كتابة هذا المقال، لا يمتلك Imagic حتى فيديو ترويجي، وبالنظر إلى الموقف المتحفظ لجوجل بشأن إطلاق أدوات توليد الصور غير المقيدة، لا يُعرف إلى أي مدى، إن وجد، سيتاح لنا اختبار النظام.
العرض الثاني هو أداة Erase and Replace الأكثر سهولة من Runway ML، وهي ميزة جديدة في قسم «AI Magic Tools» ضمن مجموعة الأدوات البصرية القائمة على التعلم الآلي المتوفرة حصريًا على الإنترنت.

ميزة Erase and Replace من Runway ML، التي ظهرت مسبقًا في عرض تجريبي لنظام تحرير نص إلى فيديو.
لنلقِ نظرة أولًا على ما قدمته Runway.
Erase and Replace
مثل Imagic، يتعامل Erase and Replace حصريًا مع الصور الثابتة، رغم أن Runway عرضت مسبقًا نفس الوظيفة في حل تحرير نص إلى فيديو لم يُصدر بعد:

يمكن لأي شخص تجربة Erase and Replace على الصور، لكن النسخة الفيديوية غير متاحة للجمهور بعد. المصدر: https://twitter.com/runwayml/status/1568220303808991232
على الرغم من أن Runway ML لم تكشف عن تفاصيل التقنية وراء Erase and Replace، فإن السرعة التي يمكن بها استبدال نبتة منزلية بتمثال مقنع إلى حد ما لروبرتون ريجن توحي بأن نموذج انتشار مثل Stable Diffusion (أو، على الأرجح الأقل احتمالًا، DALL‑E 2 مرخص) هو المحرك الذي يعيد إنشاء الكائن المختار في Erase and Replace.

استبدال نبتة منزلية بتمثال رونالد ريغان ليس سريعًا بهذا القدر، لكنه لا يزال سريعًا. المصدر: https://app.runwayml.com/
النظام يفرض بعض القيود المشابهة لتلك الموجودة في DALL‑E 2 – الصور أو النصوص التي تُثير مرشحات Erase and Replace ستؤدي إلى تحذير بشأن احتمال إيقاف الحساب في حال تكرار المخالفات – وهو ما يُعد نسخةً تقريبيةً من سياسات OpenAI المستمرة لـ DALL‑E 2.
العديد من النتائج تفتقر إلى الحواف الخشنة النموذجية لـ Stable Diffusion. Runway ML هم مستثمرون وشركاء بحثيين في SD، ومن الممكن أنهم درّبوا نموذجًا مملوكًا يتفوق على أوزان نقطة التفتيش المفتوحة المصدر 1.4 التي نتعامل معها جميعًا (كما تقوم مجموعات تطوير أخرى، هواة ومهنيون، بتدريب أو ضبط نماذج Stable Diffusion).
استبدال طاولة منزلية بـ «طاولة من الثلج» في Erase and Replace من Runway ML.
كما هو الحال مع Imagic (انظر أدناه)، فإن Erase and Replace يُعَد «موجهًا للكائنات» – لا يمكنك مسح جزء «فارغ» من الصورة وإعادة تعبئته بناءً على موجه نصي؛ ففي هذا السيناريو سيُحدد النظام أقرب كائن ظاهر على طول خط القناع (مثل جدار أو تلفاز) ويطبّق التحويل هناك.

كما يدل الاسم، لا يمكنك إدخال كائنات إلى مساحة فارغة في Erase and Replace. هنا، محاولة استدعاء أشهر سيث لورد تُنتج جدارية غريبة متعلقة بفادر على التلفاز، تقريبًا في المنطقة التي تم رسم «استبدال» فيها.
من الصعب تحديد ما إذا كان Erase and Replace يتجنّب استخدام الصور المحمية بحقوق النشر (التي لا يزال يُعقَب عنها إلى حد كبير في DALL‑E 2)، أو إذا كان النموذج المستخدم في محرك العرض الخلفي غير مُحسّن لهذا النوع من الاستخدام.

تشير «الجدارية غير الملائمة قليلًا» لنيكول كيدمان إلى أن النموذج القائم على الانتشار ربما يفتقر إلى آلية رفض DALL‑E 2 الصارمة للوجوه الواقعية أو المحتوى المثير، بينما تتراوح نتائج محاولات استنساخ أعمال محمية بين الغامض («إكسومورف») والسخيف («العرش الحديدي»). الصورة الأصلية في الزاوية السفلية اليمنى.
من المثير معرفة الأساليب التي يستخدمها Erase and Replace لعزل الكائنات القابلة للاستبدال. من المحتمل أن الصورة تُمرّر عبر نسخة من CLIP، حيث تُحدّد العناصر الفردية عبر التعرف على الكائنات ثم التقسيم الدلالي. لا تعمل أي من هذه العمليات بنفس الكفاءة في تثبيت عادي لـ Stable Diffusion.
لكن لا شيء مثالي – أحيانًا يبدو أن النظام يمسح دون استبدال، حتى عندما (كما رأينا في الصورة أعلاه) يعرف آلية العرض الأساسية ما يعنيه موجه النص. في هذه الحالة، يصبح من المستحيل تحويل طاولة قهوة إلى إكسومورف – فالطاولة تختفي ببساطة.
نسخة مخيفة أكثر من «أين والدو»، حيث يفشل Erase and Replace في إنتاج كائن فضائي.
يظهر Erase and Replace كنظام استبدال كائنات فعّال، مع تعبئة داخلية ممتازة. إلا أنه لا يستطيع تعديل الكائنات المُدركة حاليًا، بل يكتفي باستبدالها. تعديل محتوى الصورة الموجود دون الإضرار بالمواد المحيطة يُعد مهمة أصعب بكثير، مرتبطة بصراع طويل في مجال رؤية الحاسوب نحو فك الترابط في الفضاءات الكامنة للأطر الشائعة.
Imagic
هذا هو التحدي الذي يعالجه Imagic. الورقة الجديدة تقدم أمثلة عديدة لتعديلات تُعيد صياغة جوانب فردية من الصورة مع ترك باقي الصورة دون تغيير.
في Imagic، لا تعاني الصور المعدّلة من التشويه والتمدد والافتراضات الخاطئة للانحسار التي تُميز الديب فايك المستند إلى صورة واحدة.
يعتمد النظام على عملية من ثلاث مراحل – تحسين تضمين النص؛ ضبط النموذج؛ وأخيرًا توليد الصورة المعدّلة.

يقوم Imagic بترميز موجه النص المستهدف لاسترجاع تضمين النص الأولي، ثم يحسّن النتيجة للحصول على الصورة المدخلة. بعد ذلك يُضبط النموذج التوليدي على الصورة الأصلية مع إضافة مجموعة من المعلمات، قبل تطبيق الاستيفاء المطلوب.
ليس من المستغرب أن الإطار مبني على بنية Imagen النص‑إلى‑فيديو من جوجل، رغم أن الباحثين يشيرون إلى أن مبادئ النظام قابلة للتطبيق على نماذج الانتشار الكامنة بشكل عام.
تستخدم Imagen بنية ثلاثية الطبقات، خلافًا لمصفوفة الطبقات السبع المستخدمة في النسخة الأحدث من برنامج الشركة النص‑إلى‑فيديو. تتكوّن الوحدات الثلاثة من نموذج انتشار توليدي يعمل بدقة 64×64 بكسل؛ نموذج رفع دقة يُحوّل الناتج إلى 256×256 بكسل؛ ونموذج رفع دقة إضافي يرفع الناتج إلى 1024×1024 بكسل.
يتدخل Imagic في المرحلة الأولى من هذه العملية، حيث يُحسّن تضمين النص المطلوب عند مرحلة 64 بكسل باستخدام مُحسّن آدم بمعدل تعلم ثابت قدره 0.0001.
دورة متقدمة في فك الترابط: المستخدمون الذين حاولوا تغيير لون كائن مُولَّد في نموذج انتشار أو GAN أو NeRF يدركون أهمية قدرة Imagic على إجراء هذه التحولات دون «تمزيق» اتساق باقي الصورة.
يُجرى الضبط الدقيق على نموذج Imagen الأساسي، بمعدل 1500 خطوة لكل صورة مدخلة، مشروطًا بالتضمين المعدل. في الوقت نفسه، تُحسّن الطبقة الثانوية 64px → 256px بالتوازي على الصورة المشروطة. يلاحظ الباحثون أن تحسين الطبقة النهائية 256px → 1024px «ليس له تأثير ملحوظ» على النتائج النهائية، لذا لم يُطبقوا ذلك.
تشير الورقة إلى أن عملية التحسين تستغرق تقريبًا ثماني دقائق لكل صورة على شريحتين TPU V4. يُجرى العرض النهائي داخل نواة Imagen وفق مخطط العينة DDIM.
كما هو الحال مع عمليات الضبط الدقيق المشابهة في DreamBooth من جوجل، يمكن استخدام التضمينات الناتجة لتشغيل الت stylization، بالإضافة إلى تعديلات فوتورالية تستند إلى قاعدة البيانات الواسعة التي تُغذي Imagen (نظرًا لأن الصور المصدرية لا تحتوي على المحتوى الضروري لإجراء هذه التحولات).
يمكن من خلال Imagic الحصول على حركات وتعديلات فوتورالية مرنة، بينما يمكن استخدام الشيفرات المستخرجة والمفككة في العملية لإنتاج مخرجات مُ stylized.
قارن الباحثون Imagic بالأعمال السابقة SDEdit، وهو نهج قائم على GAN من عام 2021، نتاج تعاون بين جامعة ستانفورد وجامعة كارنيجي ميلون؛ وText2Live، تعاون من أبريل 2022 بين معهد وايزمان للعلوم وNVIDIA.
مقارنة بصرية بين Imagic وSDEdit وText2Live.
من الواضح أن الأساليب السابقة تواجه صعوبات، لكن في الصف السفلي، الذي يتضمن تغييرًا جذريًا في الوضعية، تفشل النماذج القائمة تمامًا في إعادة تشكيل المادة الأصلية، بينما يحقق Imagic نجاحًا ملحوظًا.
متطلبات موارد Imagic ووقت التدريب لكل صورة، رغم أنهما قصيران مقارنةً بالمعايير المعتادة، يجعلان من غير المرجح دمجه في تطبيق تحرير صور محلي على الحواسيب الشخصية – ولا يتضح إلى أي مدى يمكن تصغير عملية الضبط الدقيق لتصبح ملائمة للمستهلكين.
في الوقت الحالي، يُعد Imagic عرضًا مثيرًا يفضل أن يُستَخدم عبر واجهات برمجة التطبيقات (APIs) – وهو البيئة التي قد يشعر فيها Google Research، الحذر من الانتقادات المتعلقة بتسهيل إنشاء الديب فايك، بالراحة الأكبر.
نُشِر لأول مرة في 18 أكتوبر 2022.












