زاوية Anderson

تقنية تلوين الصور بالذكاء الاصطناعي التي تفهم المشاهد

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في الوثائقي الإضافي الذي يرافق إصدار DVD عام 2003 لفيلم Alien3 (1992)، تذكر أسطورة التأثيرات البصرية ريتشارد إيدلوند بالرعب “مصارعة السومو” لاستخراج المات البصري الكيميائي الذي домين في عمل التأثيرات البصرية بين نهاية الثلاثينيات و نهاية الثمانينيات. وصف إيدلوند طبيعة العملية على أنها “مصارعة سومو”، بالمقارنة مع تقنيات الشاشة الخضراء/الزرقاء الرقمية التي أصبحت سائدة في بداية التسعينيات (وهو ما عاد إليه منذ ذلك الحين).

استخراج عنصر أمامي (مثل شخص أو نموذج سفينة فضائية) من خلفية، بحيث يمكن تكوين صورة القطع في لوحة خلفية، تم تحقيقه في الأصل عن طريق تصوير الكائن الأمامي ضد خلفية خضراء أو زرقاء موحدة.

عمليات استخراج كيميائية شاقة لصورة تأثيرات بصرية من إنتاج ILM لصالح 'Return of the Jedi' (1983). Source: https://www.youtube.com/watch?v=qwMLOjqPmbQ

عمليات استخراج كيميائية شاقة لصورة تأثيرات بصرية من إنتاج ILM لصالح ‘Return of the Jedi’ (1983). Source: https://www.youtube.com/watch?v=qwMLOjqPmbQ

في اللقطات الناتجة، يتم عزل لون الخلفية كيميائياً ويتم استخدامه كقالب لإعادة طباعة الكائن الأمامي (أو الشخص) في طابعة بصرية ككائن عائم في خلية فيلم شفافة.

كانت هذه العملية تسمى فصل الألوان العلوية (CSO) – على الرغم من أن هذا المصطلح أصبح فيما بعد مرتبطاً أكثر بتقنيات التأثيرات البصرية الخشنة ‘Chromakey’ في الإنتاج التلفزيوني منخفض الميزانية في السبعينيات والثمانينيات، والتي تم تحقيقها bằng وسائل تمثيلية وليس كيميائية أو رقمية.

تجربة لتقنية فصل الألوان العلوية في عام 1970 لبرنامج الأطفال البريطاني 'Blue Peter'. Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

تجربة لتقنية فصل الألوان العلوية في عام 1970 لبرنامج الأطفال البريطاني ‘Blue Peter’. Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

في أي حال، سواء كان لعناصر الفيلم أو الفيديو، يمكن بعد ذلك إدراج اللقطات المستخرجة في أي لقطات أخرى.

على الرغم من أن عملية الصوديوم البخارية الخاصة لشركة ديزني، والتي كانت أكثر تكلفة وملكية، (التي كانت تستخدم لون الأصفر على وجه الخصوص، وكانت مستخدمة أيضاً في فيلم الرعب عام 1963 لألفريد هيتشكوك The Birds) كانت تمنح تعريفاً أفضل وأحجاراً أكثر وضوحاً، إلا أن استخراج المات البصري الكيميائي بقي شاقاً وغير موثوق.

عملية استخراج الصوديوم البخارية الخاصة لشركة ديزني تتطلب خلفيات قريبة من الطرف الأصفر من الطيف. هنا، تُظهر أنجيلا لانسبيري معلقاً على أسلاك خلال إنتاج تسلسل تأثيرات بصرية لصالح 'Bedknobs and Broomsticks' (1971). Source

عملية استخراج الصوديوم البخارية الخاصة لشركة ديزني تتطلب خلفيات قريبة من الطرف الأصفر من الطيف. هنا، تُظهر أنجيلا لانسبيري معلقاً على أسلاك خلال إنتاج تسلسل تأثيرات بصرية لصالح ‘Bedknobs and Broomsticks’ (1971). Source

ما وراء التلوين الرقمي

في التسعينيات، قامت الثورة الرقمية بالتخلص من المواد الكيميائية، ولكن ليس من الحاجة إلى شاشات خضراء. أصبح من الممكن إزالة الخلفية الخضراء (أو أي لون) ببساطة عن طريق البحث عن البكسل داخل نطاق تحمل ذلك اللون، في برنامج تحرير البكسل مثل Photoshop، وبرامج تجميع الفيديو الجديدة التي يمكنها إزالة الخلفيات الملونة تلقائياً. في غضون ليلة، تم التخلص من ستين عاماً من صناعة الطابعة البصرية.

الأعوام العشر الماضية من البحث في الرؤية الحاسوبية المسرعة بواسطة وحدة معالجة الرسومات تؤدي إلى عصر جديد لاستخراج المات، حيث يُكلف الباحثون بتطوير أنظمة يمكنها استخراج ماتات عالية الجودة بدون الحاجة إلى شاشات خضراء. في Arxiv وحدها، تظهر الأوراق المتعلقة بالابتكارات في استخراج المقدمة القائمة على التعلم الآلي كخاصية أسبوعية.

وضعنا في الصورة

لقد أثرت نقطة الاهتمام الأكاديمي والصناعي في استخراج الذكاء الاصطناعي بالفعل على الفضاء الاستهلاكي: التطبيقات الخشنة ولكنها قابلة للعمل موجودة في شكل Zoom و Skype التي يمكنها استبدال خلفيات غرفنا بالجزر الاستوائية، وغيرها، في مكالمات الفيديو المؤتمرية.

ومع ذلك، فإن أفضل الماتات لا تزال تتطلب شاشة خضراء، كما أشار Zoom في الأسبوع الماضي.

الرجل على اليسار أمام شاشة خضراء، مع شعر مستخرج جيداً بواسطة ميزة الخلفية الافتراضية لبرنامج Zoom. المرأة على اليمين أمام خلفية مناظر طبيعية عادية، مع شعر مستخرج خوارزمياً، أقل دقة، ومتطلبات حسابية أعلى. Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

الرجل على اليسار أمام شاشة خضراء، مع شعر مستخرج جيداً بواسطة ميزة الخلفية الافتراضية لبرنامج Zoom. المرأة على اليمين أمام خلفية مناظر طبيعية عادية، مع شعر مستخرج خوارزمياً، أقل دقة، ومتطلبات حسابية أعلى. Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

مقالة أخرى على منصة دعم Zoom تنبه إلى أن استخراج غير شاشات الخضراء يتطلب أيضاً قوة حسابية أكبر في جهاز الاستقبال.

الحاجة إلى قصها

تحسينات الجودة والمنفعة والموارد لاستخراج المات “في البرية” (أي عزل الأشخاص بدون الحاجة إلى شاشات خضراء) لها صلة بالعديد من القطاعات والاهتمامات أكثر من مجرد مرشحات الفيديو المؤتمرية.

من أجل تطوير البيانات، يوفر تحسين التعارف الوجهي والرأس والجسم الكامل إمكانية ضمان عدم تداخل عناصر خلفية زائدة مع نماذج الرؤية الحاسوبية للأشخاص؛ سيكون التعرّف الدقيق أكثر تحسيناً لتقنيات التجزئة الدلالية المصممة لتمييز ودمج المجالات (أي ‘قطة’، ‘شخص’، ‘قارب’، إلخ)، وتحسين VAE و الشبكات العصبية المتحولة القائمة على توليد الصور مثل DALL-E 2 من OpenAI؛ كما أن خوارزميات استخراج أفضل ستقلل من الحاجة إلى الرotoscoping اليدوي المكلف في خطوط إنتاج التأثيرات البصرية.

في الواقع، فإن صعود المنهجيات المتعددة (عادة ما تكون نص/صورة) حيث يتم ترميز مجال مثل ‘قطة’ كصورة ومصاحبة بنص، قد بدأ بالفعل في اختراق معالجة الصور. أحد الأمثلة الأخيرة هو هيكل Text2Live، الذي يستخدم التدريب المتعدد (نص/صورة) لإنشاء مقاطع فيديو، من بين أمور أخرى، أبواق بلورية وغزلان زجاجية.

تلوين الذكاء الاصطناعي الموجه بالمشهد

ركزت الكثير من الأبحاث حول التلوين الآلي التلقائي على التعرف على الحدود وتقييم المجموعات القائمة على البكسل داخل صورة أو إطار فيديو. ومع ذلك، تقدم بحث جديد من الصين مسار استخراج يُحسّن التمييز وجودة المات من خلال الاستفادة من الوصف النصي للمشهد (منهج متعدد يكتسب زخماً في قطاع أبحاث الرؤية الحاسوبية خلال السنوات 3-4 الماضية)، ويزعم أنه تحسّن على الأساليب السابقة بعدة طرق.

مثال على استخراج SPG-IM (الصورة الأخيرة، الزاوية اليمنى السفلى)، مقارنة بالأساليب السابقة. Source: https://arxiv.org/pdf/2204.09276.pdf

مثال على استخراج SPG-IM (الصورة الأخيرة، الزاوية اليمنى السفلى)، مقارنة بالأساليب السابقة. Source: https://arxiv.org/pdf/2204.09276.pdf

التحدي المطروح على قطاع أبحاث الاستخراج هو إنتاج أنظمة لا تتطلب سوى الحد الأدنى من التعليقات اليدوية والتدخل البشري – افضلها لا شيء. بالإضافة إلى الآثار التكلفة، يلاحظ باحثو الورقة الجديدة أن التعليقات والتقسيمات اليدوية التي يقوم بها عمال الحشد في ثقافات مختلفة يمكن أن تسبب في تمييز الصور أو حتى تقسيمها بطرق مختلفة، مما يؤدي إلى خوارزميات غير متسقة وغير مرضية.

مثال على ذلك هو التفسير الذاتي لما يُعرَّف به كـ “كائن أمامي”:

من الورقة الجديدة: الأساليب السابقة LFM و MODNet ('GT' تعني الحقيقة الأرضية، وهي نتيجة مثالية غالباً ما تُحقق يدوياً أو bằng أساليب غير خوارزمية)، لها تفسيرات مختلفة وفعالية مختلفة لتعريف المحتوى الأمامي، في حين أن أسلوب SPG-IM الجديد يحدد أكثر فعالية 'المحتوى القريب' من خلال سياق المشهد.

من الورقة الجديدة: الأساليب السابقة LFM و MODNet (‘GT’ تعني الحقيقة الأرضية، وهي نتيجة مثالية غالباً ما تُحقق يدوياً أو bằng أساليب غير خوارزمية)، لها تفسيرات مختلفة وفعالية مختلفة لتعريف المحتوى الأمامي، في حين أن أسلوب SPG-IM الجديد يحدد أكثر فعالية ‘المحتوى القريب’ من خلال سياق المشهد.

为了解决 هذا، قام الباحثون بتطوير خط أنابيب من مرحلتين يسمى توجيه استخراج الصورة بواسطة الإدراك الحسي (SPG-IM). يتكون هيكل المُкодر/المُفكك من مرحلتين هما تقطير الإدراك الحسي (SPD) و توجيه استخراج المات بواسطة الإدراك الحسي (SPGM).

هيكل SPG-IM.

هيكل SPG-IM.

أولاً، يتم تدريب SPD على تحويلات الميزات البصرية إلى نصية، مما يولد عناوين مناسبة للصور المرتبطة بها. بعد ذلك، يتم تمكين التنبؤ بماسك الكائن الأمامي عن طريق ربط الخط الأنابيب بتقنية تنبؤ التمييز جديدة.

ثم يُخرج SPGM مات ألفا محسوبة بناءً على الإدخال الصورة الأصلية و الماسك المُحسَّن الذي تم الحصول عليه في الوحدة الأولى.

الهدف هو توجيه الإدراك الحسي، حيث يكون للنظام فهم سياقي لما تتكون منه الصورة، مما يسمح له بتحديد – على سبيل المثال – تحدي استخراج الشعر المعقد من خلفية ضد سمات معروفة لمثل هذا التحدي المحدد.

في المثال أدناه، يفهم SPG-IM أن الحبال هي جزء من 'مظلة'، حيث يفشل MODNet في الاحتفاظ بهذه التفاصيل وتحديدها. وبالمثل، يتم فقدان هيكل جهاز اللعب完全 في MODNet.

في المثال أدناه، يفهم SPG-IM أن الحبال هي جزء من ‘مظلة’، حيث يفشل MODNet في الاحتفاظ بهذه التفاصيل وتحديدها. وبالمثل، يتم فقدان هيكل جهاز اللعب完全 في MODNet.

الورقة الجديدة بعنوان توجيه استخراج الصورة بواسطة الإدراك الحسي، وهي من أبحاث معهد أبحاث OPPO و PicUp.ai و Xmotors.

الماتات الآلية الذكية

كما يقدم SPG-IM شبكة تحسين التحويل البؤري التكيفي (AFT) التي يمكنها معالجة التفاصيل المحلية والسياق العالمي بشكل منفصل، مما يُسهل ‘الماتات الذكية’.

فهم سياق المشهد، في هذه الحالة 'فتاة مع حصان'، يمكن أن يجعل استخراج الكائن الأمامي أسهل من الأساليب السابقة.

فهم سياق المشهد، في هذه الحالة ‘فتاة مع حصان’، يمكن أن يجعل استخراج الكائن الأمامي أسهل من الأساليب السابقة.

تنص الورقة على ما يلي:

‘نعتقد أن التمثيلات البصرية من مهمة النص إلى الصورة، على سبيل المثال، تعريف الصورة، تركز على إشارات أكثر شمولاً من الناحية الدلالية بين أ) الكائن إلى الكائن و ب) الكائن إلى البيئة المحيطة لتوليد وصفات يمكن أن تغطي كل المعلومات العالمية والمحلية. بالإضافة إلى ذلك، بالمقارنة مع تعليقات البكسل المكلفة لاستخراج المات، يمكن جمع العلامات النصية بكميات كبيرة بتكلفة منخفضة جداً.’

الفرع SPD من الهيكل يتم تدريبه بشكل مشترك مع محول النصي القائم على Transformer من جامعة ميشيغان VirTex، والذي يتعلم التمثيلات البصرية من العناوين الغنية семантиاً.

VirTex يتدرب بشكل مشترك على شبكة عصبية و Transformer عبر أزواج صورة-عنوان، وينقل المعرفة المكتسبة إلى مهام الرؤية الحاسوبية لاحقة مثل كشف الكائنات. Source: https://arxiv.org/pdf/2006.06666.pdf

VirTex يتدرب بشكل مشترك على شبكة عصبية و Transformer عبر أزواج صورة-عنوان، وينقل المعرفة المكتسبة إلى مهام الرؤية الحاسوبية لاحقة مثل كشف الكائنات. Source: https://arxiv.org/pdf/2006.06666.pdf

من بين الاختبارات والدراسات الأخرى، قام الباحثون بتحديد SPG-IM مقابل الأساليب القائمة على الخريطة ثلاثية الألوان مثل Deep Image Matting (DIM)، IndexNet، Context-Aware Image Matting (CAM)، Guided Contextual Attention (GCAFBA، و Semantic Image Mapping (SIM).

تم أيضًا اختبار إطارات سابقة مثل LFM و MODNet و HAttMatting. لتحقيق مقارنة عادلة، تم تعديل أساليب الاختبار بناءً على الأساليب المختلفة؛ حيث لم تكن هناك код، تم إعادة إنتاج تقنيات الورقة من الهيكل الموصوف.

تنص الورقة على ما يلي:

‘نعتقد أن تمثيلاتنا البصرية من مهمة النص إلى الصورة، على سبيل المثال، تعريف الصورة، تركز على إشارات أكثر شمولاً من الناحية الدلالية بين أ) الكائن إلى الكائن و ب) الكائن إلى البيئة المحيطة لتوليد وصفات يمكن أن تغطي كل المعلومات العالمية والمحلية. بالإضافة إلى ذلك، بالمقارنة مع تعليقات البكسل المكلفة لاستخراج المات، يمكن جمع العلامات النصية بكميات كبيرة بتكلفة منخفضة جداً. يتفوق SPG-IM على جميع الأساليب الخالية من الخريطة ثلاثية الألوان ([LFM] و [HAttMatting] و [MODNet]) بفارق كبير. بالإضافة إلى ذلك، يُظهر نموذجنا تفوقًا ملحوظًا على الأساليب القائمة على الخريطة ثلاثية الألوان وأساليب التوجيه بالخريطة في جميع الأربعة مقاييس عبر مجموعات البيانات العامة (أي Composition-1K و Distinction-646 و Human-2K) وبياناتنا الخاصة Multi-Object-1K.’

وتستمر:

‘يمكن ملاحظة بسهولة أن طريقةنا تحافظ على التفاصيل الدقيقة (مثل مواقع نهاية الشعر، والنسيج الشفاف، والحدود) بدون توجيه الخريطة ثلاثية الألوان. بالإضافة إلى ذلك، بالمقارنة مع الأساليب الخالية من الخريطة ثلاثية الألوان الأخرى، يمكن لطريقة SPG-IM الخاصة بنا الاحتفاظ أفضل بكامل السياق الدلالي العالمي.’

 

نُشر لأول مرة في 24 أبريل 2022.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai