زاوية Anderson

تصحيح فهم النماذج التخيلية المحدود لمirror و الانعكاسات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ChatGPT-4o and Adobe Firefly

منذ أن بدأ الذكاء الاصطناعي التوليدي يجذب اهتمام الجمهور، ازداد اهتمام أبحاث الرؤية الحاسوبية بتطوير نماذج تفهم القوانين الفيزيائية وتعيد إنتاجها. ومع ذلك ظل تعليم أنظمة التعلم الآلي محاكاة الجاذبية وديناميكيات السوائل وغيرها من الظواهر تحديًا مهمًا خلال السنوات الخمس الماضية على الأقل.

منذ هيمنة نماذج الانتشار الكامن على مشهد الذكاء الاصطناعي التوليدي عام 2022، ركز الباحثون بصورة متزايدة على قدرتها المحدودة على فهم الظواهر الفيزيائية وإعادة إنتاجها. واكتسبت المشكلة أهمية أكبر مع ظهور نموذج الفيديو Sora من OpenAI، ثم نماذج الفيديو مفتوحة المصدر Hunyuan Video وWan 2.1.

انعكاسات غير مقنعة

ركزت معظم الأبحاث الرامية إلى تحسين فهم نماذج الانتشار للفيزياء على محاكاة المشي وفيزياء الجسيمات والحركة النيوتونية. وتجذب هذه المجالات الاهتمام لأن أي خطأ في السلوك الفيزيائي الأساسي يقوض فورًا مصداقية الفيديو المولد بالذكاء الاصطناعي.

لكن مسارًا بحثيًا صغيرًا ومتناميًا يدرس إحدى أبرز نقاط ضعف نماذج الانتشار: عجزها النسبي عن إنتاج انعكاسات دقيقة.

أمثلة على فشل الانعكاس مقارنة بمنهج الباحثين في ورقة Reflecting Reality.
أمثلة على فشل الانعكاس مقارنة بمنهج الباحثين في ورقة Reflecting Reality.

كانت الانعكاسات تحديًا أيضًا في عصر الرسوم الحاسوبية، وما تزال كذلك في ألعاب الفيديو. تحاكي خوارزميات تتبع الأشعة مسار الضوء عند تفاعله مع الأسطح، وتحسب ارتداد الأشعة أو مرورها عبر الأجسام لتوليد انعكاسات وانكسارات وظلال واقعية.

غير أن كل ارتداد إضافي يرفع كلفة الحوسبة بشدة، لذلك توازن التطبيقات الآنية بين التأخير والدقة عبر تقييد عدد الارتدادات. فإظهار إبريق مطلي بالكروم أمام مرآة قد يؤدي إلى ارتداد الأشعة مرارًا بين السطحين في حلقة شبه لانهائية لا تضيف فائدة عملية كبيرة. وعمق انعكاس من ارتدادين أو ثلاثة يتجاوز غالبًا ما يستطيع المشاهد ملاحظته، بينما يؤدي ارتداد واحد إلى مرآة سوداء لأن الضوء يحتاج رحلتين على الأقل ليكوّن انعكاسًا مرئيًا.

تمثيل لمسار شعاع ضوئي محسوب في مشهد رسوم حاسوبية ثلاثي الأبعاد.
تمثيل لمسار شعاع ضوئي محسوب في مشهد رسوم حاسوبية ثلاثي الأبعاد.

كل ارتداد إضافي قد يضاعف زمن التصيير، ولذلك تعد معالجة الانعكاسات بسرعة أكبر من أهم فرص تحسين جودة التصيير بتتبع الأشعة.

وتظهر الانعكاسات الضرورية للواقعية في مشاهد أقل وضوحًا أيضًا: سطح شارع أو ساحة معركة بعد المطر، واجهة متجر أو باب زجاجي يعكسان الشارع المقابل، أو نظارات الشخصيات التي ينبغي أن تظهر فيها الأجسام والبيئة المحيطة.

انعكاس مزدوج محاكى بالتركيب التقليدي في فيلم The Matrix.
انعكاس مزدوج محاكى بالتركيب التقليدي في فيلم The Matrix.

مشكلات تمثيل الصور

لهذا السبب واجهت الأطر التي سبقت نماذج الانتشار، مثل حقول الإشعاع العصبية NeRF، وكذلك تقنيات أحدث مثل Gaussian Splatting، صعوبة مستمرة في تمثيل الانعكاسات طبيعيًا.

اقترح مشروع REF2-NeRF طريقة قائمة على NeRF لنمذجة المشاهد التي تحتوي صندوقًا زجاجيًا. ومثّل الانكسار والانعكاس بعناصر تعتمد على منظور المشاهد وأخرى مستقلة عنه، ما سمح بتقدير الأسطح التي يقع عندها الانكسار، ولا سيما الزجاج، وفصل مكونات الضوء المباشر والمنعكس ونمذجتها.

أمثلة من ورقة REF2-NeRF.
أمثلة من ورقة REF2-NeRF.

شملت حلول الانعكاس الموجهة إلى NeRF خلال السنوات الأخيرة NeRFReN وReflecting Reality ومشروع Meta لعام 2024 المسمى Planar Reflection-Aware Neural Radiance Fields. أما في Gaussian Splatting فقد اقترحت أوراق Mirror-3DGS وReflective Gaussian Splatting وRefGaussian حلولًا للمشكلة، كما قدم مشروع Nero عام 2023 طريقة مخصصة لإضافة الخصائص الانعكاسية إلى التمثيلات العصبية.

مشروع MirrorVerse

إجبار نموذج انتشار على احترام منطق الانعكاس أصعب على الأرجح من الأطر البنيوية غير الدلالية مثل NeRF وGaussian Splatting. ففي نموذج الانتشار لا تترسخ قاعدة كهذه على نحو موثوق إلا إذا احتوت بيانات التدريب أمثلة كثيرة ومتنوعة عبر نطاق واسع من السيناريوهات، ما يجعل النتيجة شديدة الاعتماد على توزيع مجموعة البيانات الأصلية وجودتها.

تضاف السلوكيات الخاصة عادة باستخدام LoRA أو الضبط الدقيق للنموذج الأساسي، لكن كلا الحلين غير مثالي. تميل LoRA إلى دفع المخرجات نحو بيانات تدريبها حتى من دون طلب صريح، بينما يمكن للضبط الدقيق، فضلًا عن كلفته، أن يفصل النموذج نهائيًا عن المسار الرئيسي وينشئ منظومة أدوات لا تعمل مع أي سلالة أخرى من النموذج، بما فيها النسخة الأصلية.

يتطلب تحسين نماذج الانتشار عمومًا اهتمامًا أكبر بفيزياء الانعكاس في بيانات التدريب، لكن مجالات كثيرة أخرى تحتاج الاهتمام نفسه. ومع مجموعات البيانات الهائلة، حيث التنظيم المخصص مكلف وصعب، يستحيل عمليًا معالجة كل نقطة ضعف بهذه الطريقة.

مع ذلك تظهر أحيانًا حلول جديدة لمشكلة الانعكاس. أحدها مشروع MirrorVerse من الهند، الذي يقدم مجموعة بيانات وطريقة تدريب محسنتين تدفعان مستوى الأداء في هذا التحدي إلى الأمام.

نتائج MirrorVerse مقارنة بأسلوبين سابقين.
نتائج MirrorVerse مقارنة بأسلوبين سابقين.

تحسن نتائج MirrorVerse بعض الأساليب الحديثة، لكنها بعيدة عن الكمال. ففي مثال تظهر الجرار الخزفية إلى يمين موضعها الصحيح، وفي مثال آخر أضيف انعكاس للكوب في الجانب الأيمن رغم أن هندسة المشهد تعني أنه لا ينبغي أن يظهر أصلًا.

لذلك تفيد الطريقة الجديدة أيضًا في توضيح مدى استعصاء المشكلة على نماذج الانتشار الكامن، للصور والفيديو معًا، لأن أمثلة الانعكاس في البيانات غالبًا ما تكون متشابكة مع أفعال وسياقات بعينها. وقد تظل هذه الوظيفة أقل موثوقية من NeRF وGaussian Splatting والرسوم الحاسوبية التقليدية.

عنوان الورقة الجديدة هو MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World، وأعدها ثلاثة باحثين من Vision and AI Lab وIISc Bangalore وSamsung R&D Institute في بنغالور. للبحث صفحة مشروع ومجموعة بيانات على Hugging Face، كما نشر الكود المصدري على GitHub.

المنهج

يشير الباحثون منذ البداية إلى صعوبة التزام نماذج مثل Stable Diffusion وFlux بطلبات الانعكاس، إذ تفشل النماذج الحديثة SD3.5 وFlux في إنشاء انعكاسات متسقة ودقيقة هندسيًا عند طلبها داخل المشهد.

صعوبة SD3.5 وFlux في إنتاج انعكاسات متسقة ودقيقة هندسيًا.
صعوبة SD3.5 وFlux في إنتاج انعكاسات متسقة ودقيقة هندسيًا.

طور الفريق MirrorFusion 2.0، وهو نموذج توليدي قائم على الانتشار يهدف إلى تحسين واقعية انعكاسات المرآة ودقتها الهندسية في الصور الاصطناعية. دُرب على مجموعة جديدة من تنظيم الباحثين تسمى MirrorGen2، وصممت لمعالجة ضعف التعميم في الأساليب السابقة.

يوسع MirrorGen2 المناهج السابقة بإضافة تموضع عشوائي للأجسام، ودوران عشوائي، وتثبيت صريح للأجسام على الأرض، بهدف إبقاء الانعكاسات منطقية عبر أوضاع ومسافات متنوعة بالنسبة إلى سطح المرآة.

مخطط توليد البيانات الاصطناعية في MirrorVerse مع تموضع ودوران وتثبيت عشوائي للأجسام.
مخطط توليد البيانات الاصطناعية في MirrorVerse مع تموضع ودوران وتثبيت عشوائي للأجسام.

ولتقوية التعامل مع الترتيبات المكانية المعقدة، تتضمن عملية MirrorGen2 مشاهد لأزواج أجسام، ما يحسن تمثيل الحجب والتفاعل بين عناصر متعددة في البيئات العاكسة. وتُقرن الفئات يدويًا لضمان الترابط الدلالي، مثل كرسي مع طاولة، ثم يوضع الجسم الثاني بحيث لا يتداخل مع الأول.

ضمن التثبيت الصريح، ضمن الباحثون أن تبدو الأجسام مرتبطة بالأرض في البيانات الاصطناعية بدل أن تطفو، وهي مشكلة قد تظهر عند توليد البيانات على نطاق واسع أو بطرق آلية جدًا.

البيانات والاختبارات

مجموعة SynMirrorV2

صممت مجموعة SynMirrorV2 لزيادة تنوع بيانات تدريب انعكاسات المرآة وواقعيتها. استخدمت أجسامًا ثلاثية الأبعاد من Objaverse وAmazon Berkeley Objects، ثم حسنت الاختيارات باستخدام OBJECT 3DIT وعملية التصفية من مشروع MirrorFusion الأول لاستبعاد الأصول الضعيفة، فانتهت إلى 66,062 جسمًا.

أمثلة من مجموعة Objaverse المستخدمة في إنشاء البيانات المنسقة.
أمثلة من مجموعة Objaverse المستخدمة في إنشاء البيانات المنسقة.

بُنيت المشاهد بوضع الأجسام على أرضيات مزخرفة من CC-Textures وخلفيات HDRI من مستودع PolyHaven، مع مرايا تغطي الجدار أو مرايا مستطيلة طويلة. وُحدت الإضاءة بمصدر مساحة فوق الأجسام وخلفها بزاوية 45 درجة. صغرت الأجسام لتناسب مكعبًا وحديًا ووضعت داخل تقاطع محسوب مسبقًا بين المرآة ومجال رؤية الكاميرا لضمان ظهورها.

طبقت دورانات عشوائية حول المحور الرأسي وتقنية تثبيت تمنع الأجسام الطافية. ولتمثيل مشاهد أعقد، رتبت المجموعة عدة أجسام في أزواج مترابطة دلاليًا استنادًا إلى فئات ABO، مع منع التداخل. نتج عن ذلك 3,140 مشهدًا متعدد الأجسام يعرض علاقات متنوعة للحجب والعمق.

مشاهد متعددة الأجسام مع تقسيم الأجسام وخرائط العمق.
مشاهد متعددة الأجسام مع تقسيم الأجسام وخرائط العمق.

عملية التدريب

لأن الواقعية الاصطناعية وحدها لا تكفي للتعميم على بيانات العالم الحقيقي، طور الباحثون منهجًا تدريجيًا من ثلاث مراحل لتدريب MirrorFusion 2.0.

في المرحلة الأولى بدأت أوزان فرعي التكييف والتوليد من نقطة Stable Diffusion v1.5، ثم ضُبط النموذج على قسم التدريب ذي الجسم الواحد من SynMirrorV2. وعلى خلاف مشروع Reflecting Reality لم يجمد الباحثون فرع التوليد، ودربوا النموذج 40,000 تكرار.

في المرحلة الثانية خضع النموذج لعشرة آلاف تكرار إضافي على قسم الأجسام المتعددة لتعلم الحجب والترتيبات المكانية المعقدة. وفي المرحلة الثالثة أجري عشرة آلاف تكرار أخرى باستخدام بيانات واقعية من MSD وخرائط عمق مولدة بمقدر Matterport3D أحادي الصورة.

أمثلة من مجموعة MSD مع خرائط العمق والتقسيم.
أمثلة من مجموعة MSD مع خرائط العمق والتقسيم.

حذفت المطالبات النصية خلال 20% من زمن التدريب لتشجيع النموذج على استغلال معلومات العمق المتاحة بأفضل صورة. استُخدمت أربع وحدات NVIDIA A100 في جميع المراحل، بمعدل تعلم 1e-5 وحجم دفعة أربعة لكل وحدة وتحت محسن AdamW.

رفع هذا المنهج صعوبة المهام تدريجيًا من المشاهد الاصطناعية البسيطة إلى التركيبات الأكثر تعقيدًا، بهدف تحسين الانتقال المتين إلى العالم الحقيقي.

التقييم

قارن الباحثون MirrorFusion 2.0 بسابقه MirrorFusion بوصفه خط الأساس، وأجروا التجارب على MirrorBenchV2 في مشاهد الجسم الواحد والمتعددة. كما نفذوا اختبارات نوعية على عينات من MSD وGoogle Scanned Objects.

استخدم التقييم 2,991 صورة لجسم واحد من فئات شوهدت وأخرى لم تشاهد أثناء التدريب، إضافة إلى 300 مشهد لجسمين من ABO. قيس الأداء بمؤشرات Peak Signal-to-Noise Ratio وStructural Similarity Index وLearned Perceptual Image Patch Similarity لتقييم جودة الانعكاس داخل منطقة المرآة المقنعة، كما استُخدم تشابه CLIP لقياس توافق النص مع المطالبات.

في الاختبارات الكمية ولد الباحثون أربع صور ببذور مختلفة لكل مطالبة، ثم اختاروا الصورة ذات أفضل قيمة SSIM. وأظهرت النتائج أن الطريقة الجديدة تفوقت على خط الأساس، وأن التدريب على أجسام متعددة حسن الأداء في المشاهد المعقدة.

النتائج الكمية لانعكاسات الجسم الواحد والأجسام المتعددة على MirrorBenchV2.
النتائج الكمية لانعكاسات الجسم الواحد والأجسام المتعددة على MirrorBenchV2.

ركزت معظم النتائج على التقييم النوعي. في MirrorBenchV2 فشل النموذج الأساسي في الحفاظ على اتجاه الأجسام والعلاقات المكانية داخل الانعكاس، وأنتج دورانًا خاطئًا وأجسامًا طافية. ويقول الباحثون إن MirrorFusion 2.0 المدرب على SynMirrorV2 حافظ على مواضع الأجسام واتجاهها في مشاهد الجسم الواحد والمتعددة، فقدم انعكاسات أكثر واقعية وترابطًا.

مقارنة MirrorFusion وMirrorFusion 2.0 على MirrorBenchV2.
مقارنة MirrorFusion وMirrorFusion 2.0 على MirrorBenchV2.

في مجموعة GSO أخطأ خط الأساس في بنية الأجسام وأنتج انعكاسات ناقصة ومشوهة، بينما حافظ MirrorFusion 2.0، بحسب المؤلفين، على السلامة المكانية والهندسة واللون والتفاصيل حتى مع أجسام خارج توزيع التدريب. ففي مثال انعكس مقبض الدرج بصورة صحيحة، وفي مثال الكوب الأبيض والأصفر حافظ النموذج الجديد على هندسة مقنعة بأقل قدر من التشوه.

مقارنة على مجموعة Google Scanned Objects.
مقارنة على مجموعة Google Scanned Objects.

أما الاختبار النوعي الأخير فاستخدم مشاهد MSD الواقعية. حقق MirrorFusion 2.0 أداء جيدًا في MirrorBenchV2 وGSO، لكنه واجه أولًا صعوبة في مشاهد MSD المعقدة. أدى الضبط الدقيق على جزء من MSD إلى تحسين التعامل مع البيئات المزدحمة والمرايا المتعددة، وإنتاج انعكاسات أكثر ترابطًا وتفصيلًا في قسم الاختبار المحجوب.

نتائج مشاهد واقعية تقارن MirrorFusion وإصدارات MirrorFusion 2.0.
نتائج مشاهد واقعية تقارن MirrorFusion وإصدارات MirrorFusion 2.0.

أجريت كذلك دراسة مستخدمين، وذُكر أن 84% من المشاركين فضلوا صور MirrorFusion 2.0 على صور خط الأساس. ووضعت تفاصيل الدراسة في ملحق الورقة.

نتائج دراسة المستخدمين.
نتائج دراسة المستخدمين.

المصادر والروابط المرجعية

الأبحاث والمشروعات والنماذج والمواد التقنية المذكورة في المقال:

الخلاصة

مع أن بعض النتائج تحسن لافت على أفضل ما كان متاحًا، فإن مستوى تقنيات انعكاس نماذج الانتشار متدنٍ إلى درجة أن حلًا مركبًا غير مقنع تمامًا يستطيع التفوق بجهد محدود. البنية الأساسية لنموذج الانتشار لا تلائم تعلم فيزياء متسقة وعرضها بموثوقية، ولذلك تبدو المشكلة سيئة الصياغة ولا تقود بسهولة إلى حل أنيق.

إضافة المزيد من البيانات إلى النماذج هي أصلًا الطريقة القياسية لمعالجة قصور نماذج الانتشار، مع كل العيوب المذكورة. ومن المعقول افتراض أن مجموعات البيانات الضخمة مستقبلًا، إذا أولت توزيع أمثلة الانعكاس وتعليقاتها اهتمامًا أكبر، ستنتج نماذج أفضل في هذا السيناريو.

لكن الأمر نفسه ينطبق على عيوب كثيرة أخرى في مخرجات نماذج الانتشار. ومن الصعب تحديد أيها يستحق أكثر الكلفة والجهد اللذين يتطلبهما نوع الحل المقترح في هذه الورقة.

نشر أول مرة يوم الاثنين 28 أبريل 2025. وفي الثلاثاء 29 أبريل أُجري تصحيح نحوي في الفقرات الأخيرة.

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai