زاوية Anderson

إنشاء شبكة عصبونية توليدية معممة مخصصة باستخدام الرسومات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قام باحثون من جامعة كارنيجي ميلون ومعهد ماساتشوستس للتكنولوجيا بتطوير منهجية جديدة تسمح للمستخدمين بإنشاء أنظمة توليد صور مخصصة باستخدام الشبكات العصبونية التوليدية المعروفة باسم GANs، وذلك ببساطة عن طريق رسم رسومات توضيحية.

يمكن لنظام من هذا النوع أن يسمح للمستخدمين بإنشاء أنظمة قادرة على توليد صور محددة، مثل حيوانات معينة أو أنواع من المباني أو حتى أشخاص معينين. في الوقت الحالي، تنتج معظم أنظمة توليد GANs نتائج واسعة ومختلفة، مع القليل من القدرة على تحديد سمات معينة، مثل سلالة الحيوان أو أنواع الشعر في البشر أو أساليب الهندسة المعمارية أو الهويات الوجهية الفعلية.

تستخدم المناهج الجديدة واجهة رسومات مبتكرة كدالة “بحث” فعالة للعثور على الميزات والفئات في قواعد بيانات الصور المكتظة التي قد تحتوي على آلاف الأنواع من الكائنات، بما في ذلك العديد من الفئات الفرعية التي لا علاقة لها بنية المستخدم. ثم يتم تدريب الشبكة العصبونية على هذا الجزء الفرعي من الصور.

من خلال رسم الكائن المحدد الذي يرغب المستخدم في ضبط الشبكة العصبونية عليه، تصبح القدرات التوليدية للشبكة مخصصة لهذه الفئة. على سبيل المثال، إذا أراد المستخدم إنشاء إطار يولد نوعًا معينًا من القطط ( chứ ليس مجرد قطة قديمة، كما هو الحال مع This Cat Does Not Exist)، فإن رسوماته المدخلة تعمل كمرشح لحذف الفئات غير ذات الصلة من القطط.

 

المصدر: https://peterwang512.github.io/GANSketching/

المصدر: https://peterwang512.github.io/GANSketching/

يقود البحث شينج يو-وانج من جامعة كارنيجي ميلون، إلى جانب زميله جون-يان زو، وديفيد باو من مختبر علوم الحاسوب والذكاء الاصطناعي في معهد ماساتشوستس للتكنولوجيا.

تسمى الطريقة الجديدة “الرسومات GAN”، وتستخدم الرسومات المدخلة لتغيير أوزان نموذج GAN الإطار مباشرة لاستهداف المجال أو المجال الفرعي المحدد من خلال الخسارة المعارضة عبر المجالات.

تم استكشاف طرق تنظيم مختلفة لضمان أن تكون نتائج النموذج متنوعة مع الحفاظ على جودة صورة عالية. قام الباحثون بإنشاء تطبيقات عينة قادرة على استيفاء الفضاء الكامن وتشغيل إجراءات تحرير الصور.

هذا [$class] لا يوجد

أصبحت أنظمة توليد الصور التي تعتمد على الشبكات العصبونية التوليدية GANs موضة، إن لم تكن ميمًا، على مدار السنوات القليلة الماضية، مع انتشار مشاريع قادرة على توليد صور لأشياء غير موجودة، بما في ذلك أشخاص و شقق للإيجار ووجبات خفيفة وأقدام وخيول وسياسيين و حشرات، من بين أشياء أخرى كثيرة.

تُنشأ أنظمة توليد الصور التي تعتمد على الشبكات العصبونية التوليدية GANs عن طريق تجميع أو تحرير قواعد بيانات شاملة تحتوي على صور من المجال المستهدف، مثل الوجوه أو الخيول؛ و تدريب نماذج يمكنها تعميم مجموعة من الميزات عبر الصور في قاعدة البيانات؛ وتنفيذ وحدات مولد قادرة على إخراج أمثلة عشوائية بناءً على الميزات المكتسبة.

ناتج من الرسومات في DeepFacePencil، الذي يسمح للمستخدمين بإنشاء وجوه فوتوغرافية حقيقية من الرسومات. هناك العديد من المشاريع المشابهة لتحويل الرسومات إلى صور.

ناتج من الرسومات في DeepFacePencil، الذي يسمح للمستخدمين بإنشاء وجوه فوتوغرافية حقيقية من الرسومات. هناك العديد من المشاريع المشابهة لتحويل الرسومات إلى صور.

تُختزل الميزات عالية الأبعاد في البداية خلال عملية التدريب، وت相当 لفرشاة الفنان الأولى على لوحة الألوان. ستتطابق هذه الميزات عالية الأبعاد مع ميزات أكثر تفصيلاً (مثل لمعة العين ووبر الحاجب الحاد لقط، وليس مجرد كتلة بيج سائبة تمثل الرأس).

أنا أعرف ما تقصد…

من خلال رسم العلاقة بين هذه الأشكال الأولية والتفاسير المفصلة التي تم الحصول عليها في وقت لاحق من عملية التدريب، يمكن استنتاج العلاقات بين الصور “الغامضة” و “المحددة”، مما يسمح للمستخدمين بإنشاء صور معقدة و فوتوغرافية حقيقية من رسومات خشنة.

أصدرت NVIDIA مؤخرًا إصدارًا مكتبيًا من بحثها الطويل حول توليد المناظر الطبيعية باستخدام الشبكات العصبونية التوليدية GANs، والذي يثبت بسهولة هذا المبدأ:

الرسومات الخشنة تُترجم إلى صور مناظر طبيعية غنية من خلال NVIDIA's GauGAN، وتطبيق NVIDIA Canvas.

الرسومات الخشنة تُترجم إلى صور مناظر طبيعية غنية من خلال NVIDIA’s GauGAN، وتطبيق NVIDIA Canvas.

كما قام نظام DeepFacePencil بنفس المبدأ لإنشاء مولدات صور فوتوغرافية حقيقية من الرسومات لعدة مجالات.

هيكل DeepFacePencil.

هيكل DeepFacePencil.

تبسيط الرسومات إلى الصور

تسعى منهجية البحث الجديد إلى إزالة العبء الهائل لجمع البيانات وتنظيمها الذي ي伴ي عادة تطوير إطارات الصور التي تعتمد على الشبكات العصبونية التوليدية GANs، وذلك من خلال استخدام مدخلات المستخدم لتحديد الجزء الفرعي من الصور الذي يجب أن يتكون منه بيانات التدريب.

تم تصميم النظام ليتطلب فقط عددًا صغيرًا من الرسومات المدخلة لضبط الإطار. يعمل النظام بشكل فعال على عكس وظيفة PhotoSketch، وهي مبادرة بحثية مشتركة بين جامعة كارنيجي ميلون وشركة Adobe وشركة Uber ATG وشركة Argo AI في عام 2019، والتي تم دمجها في العمل الجديد. تم تصميم PhotoSketch لإنشاء رسومات فنية من الصور، وتمتلك بالفعل الخريطة الفعالة للعلاقات بين إنشاء صور “غامضة” و “محددة”.

对于 جزء التوليد من العملية، يتم تعديل أوزان StyleGAN2 فقط. منذ أن يتم استخدام بيانات الصور فقط كجزء من البيانات المتاحة، فإن تعديل شبكة الخريطة يحصل على نتائج مرغوبة.

تم تقييم الطريقة على عدد من المجالات الفرعية الشهيرة، بما في ذلك المجال الفرعي للخيول والكنائس والقطط.

تم استخدام مجموعة بيانات LSUN من جامعة برينستون في عام 2016 كالمادة الأساسية لاستخراج المجالات الفرعية المستهدفة. لإنشاء نظام خريطة رسومات قوي ضد لطخات مدخلات المستخدمين في العالم الحقيقي، يتم تدريب النظام على صور من مجموعة بيانات QuickDraw التي طورتها شركة مايكروسوفت بين عامي 2016 و 2021.

على الرغم من أن خريطة الرسومات بين PhotoSketch و QuickDraw مختلفة، وجد الباحثون أن إطارهم ينجح جيدًا في التغلب على هذه الاختلافات بسهولة على المواقف البسيطة، في حين أن المواقف الأكثر تعقيدًا (مثل القطط التي تستلقي) تثبت أنها تحدي أكبر، في حين أن المدخلات المستخدمة المجردة (مثل الرسومات الخشنة للغاية) تؤثر أيضًا على جودة النتائج.

فضاء الكائنات والتعديل الطبيعي للصور

قام الباحثون بتطوير تطبيقين بناءً على العمل الأساسي: تعديل فضاء الكائنات والتعديل الطبيعي للصور. يوفر تعديل فضاء الكائنات أدوات تحكم قابلة للتفسير تُسهل في وقت التدريب، وتسمح بمستوى واسع من التباين مع الحفاظ على الإيمان بالمجال المستهدف، والاتساق الممتع عبر التباين.

تخفيض فضاء الكائنات المحسنة مع نماذج GAN Sketching المخصصة.

تخفيض فضاء الكائنات المحسنة مع نماذج GAN Sketching المخصصة.

تم تشغيل مكون تعديل فضاء الكائنات بواسطة مشروع GANSpace في عام 2020، وهو مبادرة مشتركة بين جامعة آالتو وشركة Adobe وشركة NVIDIA.

يمكن أيضًا إطعام صورة واحدة إلى النموذج المخصص، مما يسهل تعديل الصور الطبيعية. في هذا التطبيق، تُروج صورة واحدة إلى GAN المخصص، مما يسمح ليس فقط بالتعديل المباشر، ولكن أيضًا بالحفاظ على تعديل فضاء الكائنات الأعلى، إذا تم استخدامها أيضًا.

هنا، تم استخدام صورة حقيقية كمدخل إلى GAN (نموذج القط)، الذي يعدل المدخل ليتوافق مع الرسومات المقدمة. هذا يسمح بالتعديل من خلال الرسومات.

هنا، تم استخدام صورة حقيقية كمدخل إلى GAN (نموذج القط)، الذي يعدل المدخل ليتوافق مع الرسومات المقدمة. هذا يسمح بالتعديل من خلال الرسومات.

على الرغم من أن النظام قابل للتخصيص، إلا أنه لا يُصمم للعمل في الوقت الفعلي، على الأقل فيما يتعلق بتدريب وضبط النظام. حاليًا، يتطلب GAN Sketching 30,000 تكرار للتدريب. يتطلب النظام أيضًا الوصول إلى بيانات التدريب الأصلية للنموذج الأصلي.

في الحالات التي يكون فيها مجموعة البيانات مفتوحة المصدر، وترخيص يسمح بنسخها محليًا، يمكن تلبية هذا من خلال تضمين بيانات المصدر في حزمة مثبتة محليًا، على الرغم من أن هذا سيستغرق مساحة قرص كبيرة؛ أو عن طريق الوصول إلى البيانات أو معالجتها عن بُعد، من خلال نهج سحابي، الذي يُقدم أعباء الشبكة و (في حالة حدوث المعالجة فعليًا على السحابة) ربما يُقدم اعتبارات التكلفة الحسابية.

تحويلات من نماذج FFHQ المخصصة التي تم تدريبها على 4 رسومات فقط من إنتاج الإنسان.

تحويلات من نماذج FFHQ المخصصة التي تم تدريبها على 4 رسومات فقط من إنتاج الإنسان.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai