زاوية Anderson
SofGAN: نظام توليد صور الوجه باستخدام الشبكات العصبية التي يقدم مستوى أعلى من التحكم

قام باحثون في شنغهاي والولايات المتحدة بتطوير نظام توليد صور الوجه باستخدام الشبكات العصبية التي تسمح للمستخدمين بإنشاء صور الوجه الجديدة مع مستوى غير مسبوق من التحكم في الجوانب الفردية مثل الشعر، والعين، والنظارات، والtextures، واللون.
لإظهار مرونة النظام، قدم المطورون واجهة مستوحاة من برنامج الفوتوشوب حيث يمكن للمستخدم رسم عناصر التجزئة الدلالية مباشرة والتي سيتم reinterpretها في صور واقعية، ويمكن حتى الحصول عليها عن طريق الرسم مباشرة على الصور الموجودة.
في المثال التالي، يتم استخدام صورة الممثل دانيال رادكليف كقالب تتبع (والهدف ليس إنتاج شبه له، ولكن صورة فوتوغرافية عامة). عندما يملأ المستخدم العناصر المختلفة، بما في ذلك الجوانب المنفصلة مثل النظارات، يتم تحديدها وتفسيرها في صورة الإخراج:

استخدام صورة واحدة كمواد تتبع لصورة الوجه التي تم إنشاؤها بواسطة SofGAN. مصدر: https://www.youtube.com/watch?v=xig8ZA3DVZ8
المقال المقال يحمل عنوان SofGAN: نظام توليد صور الوجه مع أسلوب ديناميكي، ويقوده Anpei Chen و Ruiyang Liu، إلى جانب باحثين آخرين من جامعة ShanghaiTech وواحد من جامعة كاليفورنيا في سان دييغو.
فك الخصائص
المساهمة الرئيسية في العمل ليست في تقديم واجهة مستخدم سهلة الاستخدام، ولكن في “فك” الخصائص مثل وضع و texture، مما يسمح ل SofGAN بإنشاء صور الوجه التي تكون في زوايا غير مباشرة للكاميرا.

غير عادي بين مولدات الصور الوجهية التي تعتمد على الشبكات العصبية التوليدية، SofGAN يمكن تغيير زاوية المشاهدة حسب الرغبة، في حدود مجموعة الزوايا الموجودة في بيانات التدريب. مصدر: https://arxiv.org/pdf/2007.03780.pdf
منذ أن تم فك الخصائص، يمكن تحرير الشكل و texture ككيانات منفصلة. في الواقع، هذا يسمح بتغيير العرق لصورة الوجه، وهي ممارسة فاضحة التي تمتلك الآن تطبيقا مفيدا محتملًا، لإنشاء مجموعات بيانات تعلم الآلة متوازنة عرقيا.

SofGAN يدعم أيضًا تقدم العمر الاصطناعي وتعديل الأسلوب المتسق مع السمات على مستوى دقيق غير مسبوق في أنظمة التجزئة إلى صورة مشابهة مثل NVIDIA’s GauGAN و Intel’s نظام العرض العصبي.

SofGAN يمكن تنفيذ تقدم العمر كأسلوب متكرر.
من خلال اختراق آخر في منهجية SofGAN، لا تتطلب التدريب زوجًا من التجزئة / الصور الحقيقية، ولكن يمكن تدريبه مباشرة على صور العالم الحقيقي غير المزاوجة.
يقول الباحثون إن هيكل “فك الخصائص” في SofGAN استوحى من أنظمة الت渲ير التقليدية، التي تفكك العناصر الفردية للصورة. في تدفقات العمل البصرية، يتم كسر عناصر التأليف إلى المكونات الأكثر دقة، مع اختصاصيين مخصصين لكل مكون.
حقل التجزئة الدلالية (SOF)
لتحقيق ذلك في إطار 합成 الصور باستخدام الشبكات العصبية، طور الباحثون حقل التجزئة الدلالية (SOF)، وهو امتداد لحقل التجزئة التقليدي الذي يفرق بين عناصر صور الوجه. تم تدريب SOF على خرائط التجزئة الدلالية متعددة الزوايا المحددة، ولكن بدون أي إشراف حقيقي.

تكرارات متعددة من خريطة التجزئة واحدة (الأسفل اليسار).
بالإضافة إلى ذلك، يتم الحصول على خرائط التجزئة ثنائية الأبعاد عن طريق تتبع الإخراج من SOF، قبل أن يتم تلوينها بواسطة مولد الشبكات العصبية. كما يتم ترميز خرائط التجزئة “الاصطناعية” في مساحة منخفضة الأبعاد عبر محول ثلاثي الطبقات لضمان استمرارية الإخراج عند تغيير زاوية المشاهدة.
خطة التدريب تخلط مكانيا بين نمطين عشوائيين لمنطقة دلالية كل واحدة:
يزعم الباحثون أن SofGAN يحقق مسافة فريتش إنسيبشن أقل (FID) من النهج الحالي البديل (SOTA)، وكذلك معامل تشابه الصورة المكتسبة (LPIPS) أعلى.
_approaches StyleGAN السابقة قد تم حظرها بشكل متكرر بسبب تشابك الخصائص، حيث يتم ربط العناصر التي تتكون منها الصورة بشكل لا يمكن فكها مع بعضها البعض، مما يسبب ظهور عناصر غير مرغوب فيها إلى جانب عنصر مرغوب.

تتبع الأشعة يتم استخدامه لحساب حجم خرائط التجزئة الدلالية، مما يسمح بزوايا مشاهدة متعددة.
مجموعات البيانات والتدريب
تم استخدام ثلاث مجموعات بيانات في تطوير تنفيذات مختلفة من SofGAN: CelebAMask-HQ، وهو مستودع يحتوي على 30,000 صورة عالية الدقة من مجموعة CelebA-HQ؛ NVIDIA’s Flickr-Faces-HQ (FFHQ)، الذي يحتوي على 70,000 صورة، حيث قام الباحثون بترميز الصور باستخدام محلل الوجه المسبق التدريب؛ ومجموعة من 122 مسحًا للصور مع مناطق دلالية تم تحديدها يدويا.
يتكون SOF من ثلاث وحدات قابلة للتدريب – الشبكة العليا، ومتابع الأشعة (انظر الصورة أعلاه)، والفئة. يتم تكوين مولد StyleGAN في المشروع بشكل مشابه لStyleGAN2 في بعض الجوانب. يتم تطبيق تعزيز البيانات من خلال التماثل العشوائي والقص، ويتضمن التدريب تطبيع المسار كل أربعة خطوات. استغرق إجراء التدريب الكامل 22 يومًا للوصول إلى 800,000 تكرار على أربعة بطاقات RTX 2080 Ti عبر CUDA 10.1.
لا يذكر المقال تكوين بطاقات 2080، والتي يمكن أن تستوعب بين 11GB-22GB من ذاكرة الوصول العشوائي كل واحدة، مما يعني أن إجمالي ذاكرة الوصول العشوائي المستخدمة لأفضل جزء من شهر للتدريب على SofGAN يتراوح بين 44GB و 88GB.
يشير الباحثون إلى أن النتائج العامة المقبولة начала تظهر في وقت مبكر من التدريب، عند 1500 تكرار، ثلاثة أيام من التدريب. تم أخذ باقي التدريب مع الصعود البطيء نحو الحصول على التفاصيل الدقيقة مثل الشعر وعيون.
SofGAN يحقق نتائج أكثر واقعية من خريطة التجزئة واحدة مقارنة بالأساليب المنافسة مثل NIVDIA’s SPADE و Pix2PixHD، و SEAN.
في الأسفل هو الفيديو الذي تم إصداره من قبل الباحثين. الفيديوهات المضيفة بشكل自ي موجودة في صفحة المشروع.














