زاوية Anderson

تحرير مساحة-latent لGAN باستخدام ‘الكتلة’

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أدت الأبحاث الجديدة من جامعة كاليفورنيا بيركلي وشركة أدوبي إلى طريقة لمعالجة المحتوى المتحقق بشكل مباشر الذي يمكن إنشاؤه بواسطة شبكة معارضة توليدية (GAN) ، ولكن الذي لا يمكن عادة التحكم فيه أو تحريكه أو تعديله بحرية على النحو المألوف لمستخدمي برنامج أدوبي فوتوشوب وممارسين الرسومات الحاسوبية.

(ADBE )

تمت تسمية هذه الطريقة باسم BlobGAN ، وت涉ل إنشاء شبكة من “الكتلة” – الهياكل الرياضية التي تعادل مباشرة إلى المحتوى داخل مساحة-latent لشبكة GAN.

من خلال تحريك الكتلة ، يمكنك تحريك “الأجسام” في تمثيل المشهد ، بطريقة直관ية أقرب إلى أساليب الرسومات الحاسوبية والتصميم بمساعدة الحاسوب من العديد من المحاولات الحالية لتعيين وتحكم مساحة-latent لشبكة GAN:

تعديل المشهد باستخدام BlobGAN: حيث يتم تحريك الكتلة بواسطة المستخدم ، يتم تعديل موضع الكائنات والأنماط الكامنة في شبكة GAN بشكل متناسب. لمزيد من الأمثلة ، انظر الفيديو المصاحب للورقة ، المضمن في نهاية هذا المقال ، أو على https://www.youtube.com/watch?v=KpUv82VsU5k

تعديل المشهد باستخدام BlobGAN: حيث يتم تحريك الكتلة بواسطة المستخدم ، يتم تعديل موضع الكائنات والأنماط الكامنة في شبكة GAN بشكل متناسب. لمزيد من الأمثلة ، انظر الفيديو المصاحب للورقة ، المضمن في نهاية هذا المقال ، أو على https://www.youtube.com/watch?v=KpUv82VsU5k

منذ أن تعادل الكتلة مع “الأجسام” في المشهد المحدد في مساحة-latent لشبكة GAN ، يتم فصل جميع الأجسام بشكل مسبق ، مما يجعل من الممكن تعديلها بشكل فردي:

يمكن تعديل الأجسام وتقليل حجمها ونسخها وإزالتها ، من بين عمليات أخرى.

يمكن تعديل الأجسام وتقليل حجمها ونسخها وإزالتها ، من بين عمليات أخرى.

كما هو الحال مع أي كائن في برنامج تحرير الصور (أو حتى برنامج تحرير النص) ، يمكن نسخ الكتلة وتعديلها لاحقًا:

يمكن نسخ الكتلة في الواجهة ، وسيتم أيضًا نسخ تمثيلاتها الكامنة.

يمكن نسخ الكتلة في الواجهة ، وسيتم أيضًا نسخ تمثيلاتها الكامنة. المصدر: https://dave.ml/blobgan/#results

يمكن ل BlobGAN أيضًا تحليل الصور الجديدة والمحددة من قبل المستخدم إلى مساحة-latent:

باستخدام BlobGAN ، لا تحتاج إلى دمج الصور التي تريد تعديلها مباشرة في بيانات التدريب ثم البحث عن رموزها الكامنة ، ولكن يمكنك إدخال الصور المحددة في أي وقت وتعديلها. الصور التي يتم تعديلها هنا هي إدخال المستخدم بعد الحقائق. المصدر: https://dave.ml/blobgan/#results

باستخدام BlobGAN ، لا تحتاج إلى دمج الصور التي تريد تعديلها مباشرة في بيانات التدريب ثم البحث عن رموزها الكامنة ، ولكن يمكنك إدخال الصور المحددة في أي وقت وتعديلها. الصور التي يتم تعديلها هنا هي إدخال المستخدم بعد الحقائق. المصدر: https://dave.ml/blobgan/#results

يمكن رؤية المزيد من النتائج هنا ، وفي الفيديو المصاحب على يوتيوب (مضمن في نهاية هذا المقال). هناك أيضًا تجربة تفاعلية على كولاب ، ومتجر على جيت هاب.

قد يبدو هذا النوع من الأداة والمدى متأخرًا في عصر ما بعد برنامج أدوبي فوتوشوب ، وقد سمحت حزم البرامج المتعلم مثل سينما 4D وبلندر للمستخدمين بإنشاء وتعديل عوالم ثلاثية الأبعاد لعدة عقود؛ ومع ذلك ، فإنها تمثل نهجًا واعدًا لترويض الغرابة وطبيعة مساحة-latent في شبكة GAN ، من خلال استخدام كيانات وسيطة تم تعيينها إلى رموز كامنة.

يؤكد المؤلفون:

‘في مجموعة بيانات متعددة الفئات الصعبة للمشاهد الداخلية ، يتفوق BlobGAN على Style-GAN2 في جودة الصورة حسب مقياس FID.’

الورقة بعنوان BlobGAN: تمثيلات المشهد المحددة مكانيًا ، وتم كتابتها من قبل两个 باحثين من جامعة كاليفورنيا بيركلي ، مع ثلاثة من أبحاث أدوبي.

الواسطة

يحمل BlobGAN نموذجًا جديدًا لتركيب الصور بواسطة GAN. تشير الورقة الجديدة إلى أن النهج السابق لتوجيه الكيانات المنفصلة في مساحة-latent ، إما كان “من الأعلى إلى الأسفل” أو “من الأسفل إلى الأعلى”.

تعتمد الطريقة من الأعلى إلى الأسفل في شبكة GAN أو مصنف الصور على معالجة صور المشاهد كفئات ، مثل “غرفة نوم” ، “كنيسة” ، “وجه” ، إلخ. هذا النوع من تركيب النص والصورة يمنح جيلًا جديدًا من إطارات التركيب المتعددة.

تعتمد الطريقة من الأسفل إلى الأعلى ، بدلاً من ذلك ، على تعيين كل بكسل في الصورة إلى فئة أو تسمية أو فئة. تستخدم هذه الطرق تقنيات متنوعة ، على الرغم من أن التجزئة الدلالية هي مجال بحث شائع.

يقول المؤلفون:

‘يبدو أن كلا المسارين غير مرضيين لأن كلاهما لا يمكن أن يوفر وسائل سهلة للتفكير في أجزاء المشهد ككيانات. يتم دمج أجزاء المشهد في متجه كامن متشابك واحد (من الأعلى إلى الأسفل) ، أو يتعين جمعه من علامات البكسل الفردية (من الأسفل إلى الأعلى).’

بدلاً من ذلك ، يقدم BlobGAN تمثيلًا غير مُراقب من المستوى المتوسط ، أو إطار عمل وسيط للنماذج التوليدية.

يتم تعيين كيانات

يتم تعيين كيانات “الكتلة” المحلية (والمتحكم فيها) إلى رموز كامنة بواسطة شبكة التخطيط. تتكون الدوائر الملونة في الوسط من “خريطة الكتلة”. المصدر: https://arxiv.org/pdf/2205.02837.pdf

الكتلة الغاوسية (أي القائمة على الضوضاء) هي مرتبة حسب العمق ، وتعادل حجزًا في الهيكل الذي يعين تعيينًا لكل كيان ، مما يحل العائق الأكبر في تعديل محتوى GAN: الفصل (والذي也是 مشكلة للهياكل القائمة على المضغوطات).

الهيكل والبيانات

تتم تحويل الكيانات في خريطة الكتلة إلى صور بواسطة شبكة معدلة من StyleGAN2 ، في نهج يأخذ الإلهام من البحث السابق في NVIDIA (NVDA ).

شبكة StyleGAN 2 المعدلة من NVIDIA Research. تم تبني بعض المبادئ في هذا العمل أو تعديلها ل BlobGAN. المصدر: https://arxiv.org/pdf/1912.04958.pdf

شبكة StyleGAN 2 المعدلة من NVIDIA Research. تم تبني بعض المبادئ في هذا العمل أو تعديلها ل BlobGAN. المصدر: https://arxiv.org/pdf/1912.04958.pdf

تم تعديل StyleGAN 2 في BlobGAN لتقبل الإدخال من خريطة الكتلة بدلاً من متجه عالمي واحد ، كما هو الحال عادة.

سلسلة من التعديلات التي يمكن إجراؤها بواسطة BlobGAN ، بما في ذلك

سلسلة من التعديلات التي يمكن إجراؤها بواسطة BlobGAN ، بما في ذلك “إكمال” مشهد غرفة نوم ، وتقليل حجم العناصر وإعادة ترتيبها في الغرفة. في الصف 아래 ، نرى الأداة التي تمكن من ذلك – خريطة الكتلة.

بالمقارنة ، بدلاً من إنشاء مبنى كبير ومعقد (مساحة-latent) في البداية ، ثم البحث عن طرقه اللانهائية ، يرسل BlobGAN كتل المكونات في البداية ، ويتعرف دائمًا على موقعها. هذا الفصل بين المحتوى والموقع هو الابتكار الرئيسي في العمل.

* غير وظيفي في وقت الكتابة
** لم يتم نشر الكود في وقت الكتابة

نشر لأول مرة في 8 مايو 2022.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai