زاوية Anderson
الت描绘 العصبي: كيف يمكن أن يكون الإدخال منخفضًا؟

昨天، بعض الأعمال الجديدة في الت合成 الصوري العصبي جذبت الانتباه والخيال على الإنترنت، حيث كشف باحثون في شركة Intel عن طريقة جديدة لتعزيز الواقعية في الصور الاصطناعية.
النظام، كما تم تجسيده في فيديو من Intel، يتدخل مباشرة في خط أنابيب الصورة للعبة الفيديو Grand Theft Auto V، ويعزز الصور تلقائيًا من خلال خوارزمية合成 الصورة المدربة على شبكة عصبية التلافيف (CNN)، باستخدام صور العالم الحقيقي من مجموعة Mapillary، وتبادل الإضاءة والنسيج الأقل واقعية لمحرك اللعبة.

المعلقون، في مجموعة واسعة من ردود الفعل في مجتمعات مثل Reddit وHacker News، يطرحون ليس فقط أن الت描绘 العصبي من هذا النوع يمكن أن يreplace الإخراج الأقل واقعية لمحركات الألعاب والcgi على مستوى VFX، ولكن أن هذا العملية يمكن أن تتحقق مع إدخال أساسي أكثر بساطة مما تم إظهاره في демонстрация Intel GTA5 — بشكل有效 لإنشاء إدخال وسيط مع خرج واقعي للغاية.
مجموعات البيانات المزدوجة
المبدأ قد تم توضيحه من قبل جيل جديد من أنظمة GAN و encoder/decoder خلال السنوات الثلاث الماضية، مثل GauGAN من NVIDIA ، الذي يولد صورًا واقعية من رسومات خشنة.
بصورة فعالة، هذا المبدأ يقلب الاستخدام التقليدى للتقسيم الدلالي في رؤية الكمبيوتر من طريقة سلبية تسمح لأنظمة الآلة بالتعرف على الأشياء المرئية وتعزيلها إلى إدخال خلاق، حيث يرسم المستخدم خريطة تقسيم دلالي وهمية ويولد النظام صورًا متوافقة مع العلاقات التي يفهمها من تصنيف وتنظيم مجال معين، مثل المناظر الطبيعية.

إطار عمل التعلم الآلي يطبق التقسيم الدلالي على مشاهد خارجية مختلفة، ويقدم نموذجًا معماريًا يسمح بتطوير أنظمة تفاعلية، حيث يرسم المستخدم كتلة تقسيم دلالي ويملأ النظام الكتلة بالصور المناسبة من مجموعة بيانات محددة بالمجال، مثل مجموعة Mapillary لمناظر الشارع في ألمانيا، المستخدمة في демонстрация Intel GTA5 للتعرف العصبي. مصدر: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
أنظمة合成 الصورة المزدوجة تعمل من خلال ربط العلامات الدلالية على مجموعتين من البيانات: مجموعة صور غنية ومتكاملة، إما من صور العالم الحقيقي (مثل مجموعة Mapillary المستخدمة في демонстрация Intel GTA5) أو من صور اصطناعية، مثل صور CGI.

أمثلة على مجموعة بيانات مزدوجة لنظام合ين الصورة المصمم لإنشاء شخصيات معالجة عصبيًا من رسومات خشنة. على اليسار، عينات من مجموعة CGI. في الوسط، عينات من مجموعة “الرسومات الخشنة”. على اليمين، صور معالجة عصبيًا التي ترجمت الرسومات الخشنة إلى صور عالية الجودة. مصدر: https://www.youtube.com/watch?v=miLIwQ7yPkA
البيئات الخارجية هي نسبيًا غير محددة عند إنشاء تحويلات مجموعة بيانات مزدوجة من هذا النوع، لأن البروزات عادة ما تكون محدودة، والطوبوغرافيا لها مجموعة محدودة من التباين التي يمكن التقاطها بشكل شامل في مجموعة بيانات، ولا نحتاج إلى التعامل مع إنشاء أشخاص اصطناعيين أو التفاوض على وادي الغريب (بعد).
إلغاء خرائط التقسيم
جوجل طورت نسخة متحركة من مخطط GauGAN، تسمى طبيعة لا نهائية، قادرة على التخيل المتعمد لمشاهد خيالية مستمرة ولامتناهية عن طريق ترجمة خرائط تقسيم دلالي وهمية إلى صور واقعية من خلال نظام التعبئة SPADE من NVIDIA:

مصدر: https://www.youtube.com/watch?v=oXUf6anNAtc
然而، نظام طبيعة لا نهائية يستخدم صورة واحدة كنقطة بداية و يستخدم نظام التعبئة SPADE فقط لملء الأقسام الناقصة في الإطارات المتعاقبة، بينما نظام التعبئة SPADE نفسه يخلق تحويلات الصورة مباشرة من خرائط التقسيم.
هذه القدرة يبدو أنها أثارت إعجاب معجبي نظام تعزيز الصورة من Intel – إمكانية الحصول على صور واقعية عالية الجودة، حتى في الوقت الفعلي (في النهاية)، من إدخال خشن للغاية.
استبدال النسيج والإضاءة بالتعرف العصبي
في حالة إدخال GTA5، تساءل بعض الناس عما إذا كان أي من النسيج والإضاءة الحاسوبية المكلفة من محرك اللعبة سيكون ضروريًا حقًا في أنظمة التعرف العصبي في المستقبل، أو ما إذا كان من الممكن تحويل إدخال منخفض الدقة إلى فيديو واقعي يتفوق على قدرات التظليل والنسيج والإضاءة لمحركات الألعاب، مما يخلق مشاهد واقعية فائقة من إدخال وسيط.
قد يبدو واضحًا أن جوانب اللعبة مثل الانعكاسات والنسيج والتفاصيل البيئية الأخرى هي مصادر معلومات أساسية لأنظمة التعرف العصبي من النوع الذي أظهره Intel. ومع ذلك، فقد مر بعض الوقت منذ أن أظهر نظام UNIT من NVIDIA أن المجال فقط هو المهم، وأن حتى جوانب مثل “الليل أو النهار” هي أساسًا قضايا يتعامل معها نظام النقل بالنمط:
من حيث الإدخال المطلوب، هذا يترك محرك اللعبة بحاجة فقط إلى توليد الهندسة الأساسية و симуляции الفيزياء، لأن نظام التعرف العصبي يمكن أن يغطي جميع الجوانب الأخرى عن طريق合ين الصور المرغوبة من مجموعة البيانات الملتقطة، باستخدام خرائط دلالية كطبقة تفسير.

عملية Intel ISL للتقسيم إلى صورة من عام 2017. مصدر: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
في الواقع، أن هذا المخطط الأصلي من عام 2017 تم تمديده فقط ليناسب إخراج GTA5 المُ렌ِدر بالكامل.
التعرف العصبي في التأثيرات البصرية
يبدو أن التعرف العصبي من خرائط التقسيم الاصطناعية هو تقنية واعدة للتأثيرات البصرية، مع إمكانية ترجمة فيديوغرامات أساسية مباشرة إلى مشاهد التأثيرات البصرية النهائية، عن طريق توليد مجموعات بيانات محددة بالمجال من نماذج أو صور CGI.


نظام تعرف عصبي وهمي، حيث يتم تجريد تغطية شاملة لكل كائن هدف إلى مجموعة بيانات مساهمة، ويتم استخدام خرائط تقسيم وهمية كأساس لخرج واقعي عالي الدقة. مصدر: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
سوف يؤدي تطوير واعتماد مثل هذه الأنظمة إلى تحويل مركز الجهد الفني من سير عمل تفسيري إلى سير عمل تمثيلي، ورفع جمع البيانات المحدد بالمجال من دور مساند إلى دور مركزي في الفنون البصرية.
المقالة محدثة في الساعة 4:55 مساءً لإضافة مواد عن بحث Intel ISL لعام 2017.














