نماذج ومنصات الذكاء الاصطناعي
كيفية عمل إعادة بناء ثلاثي الأبعاد من منظور واحد

تقليدًا على النماذج التقليدية لتركيب كائنات ثلاثية الأبعاد من منظور واحد والتي تعتمد على شبكات عصبونية متوهجة، أظهرت أداءً ممتازًا في مهام التركيب. في السنوات الأخيرة، ظهر إعادة بناء ثلاثي الأبعاد من منظور واحد كموضوع بحثي شائع في مجتمع الذكاء الاصطناعي. بغض النظر عن المنهجية المحددة المستخدمة، جميع نماذج إعادة بناء ثلاثي الأبعاد من منظور واحد تشترك في النهج الشائع لدمج شبكة معمولة-فكك في إطارها. هذه الشبكة تقوم بعملية استدلال معقدة حول الهيكل ثلاثي الأبعاد في فضاء الإخراج.
في هذه المقالة، سنستكشف كيفية عمل إعادة بناء ثلاثي الأبعاد من منظور واحد في الوقت الفعلي والتحديات الحالية التي تواجه هذه الإطارات. سنناقش المكونات الرئيسية والأساليب المستخدمة في نماذج إعادة بناء ثلاثي الأبعاد من منظور واحد وستقدم استراتيجيات لتحسين أداء هذه الإطارات. بالإضافة إلى ذلك، سنحلل النتائج التي تنتجها الإطارات الحديثة التي تستخدم أساليب معمولة-فكك. دعونا نبدأ.
إعادة بناء ثلاثي الأبعاد من منظور واحد
تتضمن إعادة بناء ثلاثي الأبعاد من منظور واحد إنشاء نموذج ثلاثي الأبعاد لكائن من منظور واحد، أو بمعنى أبسط، من صورة واحدة. على سبيل المثال، استنتاج الهيكل ثلاثي الأبعاد لكائن مثل دراجة نارية من صورة هي عملية معقدة. إنها تدمج معرفة بالترتيب الهيكلي للأجزاء، والدلالات الصورية منخفضة المستوى، والمعلومات الدلالية عالية المستوى. هذا الطيف يشمل两个 جانب رئيسي: إعادة البناء و التعرف. عملية إعادة البناء تكتشف الهيكل ثلاثي الأبعاد للصورة الإدخالية باستخدام دلالات مثل الظل، النسيج، والآثار البصرية. من ناحية أخرى، عملية التعرف تصنف الصورة الإدخالية وتنقذ نموذجًا ثلاثي الأبعاد مناسبًا من قاعدة بيانات.
نماذج إعادة بناء ثلاثي الأبعاد من منظور واحد الحالية قد تختلف في هيكلها، لكنها موحدة في تضمين هيكل معمولة-فكك في إطارها. في هذا الهيكل، يقوم المعمول بتحويل الصورة الإدخالية إلى تمثيل متداخل، بينما يقوم الفكك بعمليات استدلال معقدة حول الهيكل ثلاثي الأبعاد لفضاء الإخراج. لتنفيذ هذه المهمة بنجاح، يجب على الشبكة دمج المعلومات عالية المستوى ومنخفضة المستوى. بالإضافة إلى ذلك، تعتمد العديد من أساليب معمولة-فكك الحديثة على التعرف لتحقيق مهام إعادة بناء ثلاثي الأبعاد من منظور واحد، مما يحد من قدرات إعادة البناء. علاوة على ذلك، يمكن أن يتجاوز أداء الشبكات العصبونية المتوهجة الحديثة في إعادة بناء ثلاثي الأبعاد من منظور واحد بدون استنتاج صريح للهيكل ثلاثي الأبعاد للكائن. ومع ذلك، فإن هيمنة التعرف في شبكات إعادة بناء الكائنات من منظور واحد تتأثر بعوامل تجريبية مختلفة، بما في ذلك بروتوكولات التقييم وتركيبة القاعدة البيانية. هذه العوامل تمكن الإطار من العثور على حل قصير، في هذه الحالة، التعرف على الصور.
تقليدًا على الأساليب التقليدية لإعادة بناء ثلاثي الأبعاد من منظور واحد، تستخدم الإطارات تقنية الشكل من الظل، مع النسيج والتكيف كأدلة غير عادية لمهام إعادة البناء. منذ أن تستخدم هذه التقنيات دليل عمق واحد، فهي قادرة على تقديم استدلال حول الأجزاء المرئية من السطح. بالإضافة إلى ذلك، تستخدم العديد من إطارات إعادة بناء ثلاثي الأبعاد من منظور واحد أدلة متعددة جنبًا إلى جنب مع المعرفة الهيكلية لتقدير العمق من صورة أحادية العين، وهي مزيج يسمح لهذه الإطارات بتحديد عمق السطوح المرئية. بالإضافة إلى ذلك، تقوم إطارات تقدير العمق الحديثة بتشغيل هياكل شبكات عصبونية متوهجة لاستخراج العمق من صورة أحادية العين.
然而، من أجل إعادة بناء ثلاثي الأبعاد من منظور واحد فعالة، لا يجب على النماذج أن تفكر فقط في الهيكل ثلاثي الأبعاد للأجسام المرئية في الصورة، بل يجب أن تخمن الأجزاء غير المرئية في الصورة باستخدام بعض القواعد المكتسبة من البيانات. لتحقيق ذلك، يستخدم معظم النماذج حاليًا هياكل شبكات عصبونية متوهجة مدربة لتحويل الصور ثنائية الأبعاد إلى أشكال ثلاثية الأبعاد باستخدام إشراف ثلاثي الأبعاد مباشر، بينما يستخدم بعض الإطارات تمثيلات حجمية للشكل ثلاثي الأبعاد ويستخدم تمثيلًا متداخلًا لتح动生成 تحويلات ثلاثية الأبعاد. بعض الإطارات تقسم أيضًا فضاء الإخراج بشكل هرمي لتحسين الكفاءة الحاسوبية والذاكرة، مما يسمح للنموذج بتحديد أشكال ثلاثية الأبعاد بدقة أعلى. الأبحاث الحديثة تركز على استخدام أشكال أضعف من الإشراف لتحديد أشكال ثلاثية الأبعاد باستخدام شبكات عصبونية متوهجة، إما بمقارنة الأشكال المتوقعة مع التنبؤات الحقيقية لتدريب منظمي الشكل أو استخدام إشارات تعلم متعددة لتدريب أشكال متوسطة تساعد النموذج على التنبؤ بالتشوهات.
moving along، إعادة بناء ثلاثي الأبعاد من منظور واحد هو مهمة معقدة لأنها لا تفسر فقط البيانات البصرية بشكل هندسي، بل أيضًا بشكل دلالي. على الرغم من أنها ليست مختلفة بشكل كامل، إلا أنها تمتد على طيف يمتد من إعادة البناء الهندسي إلى التعرف الدلالي. مهام إعادة البناء تتطلب استدلال نقطة النقطة للهيكل ثلاثي الأبعاد للكائن في الصورة. لا تتطلب مهام إعادة البناء فهمًا دلاليًا للمحتوى الصوري، ويمكن تحقيق ذلك باستخدام دلالات صورية منخفضة المستوى مثل النسيج، اللون، الظل، الظلال، المنظور، والتركيز. من ناحية أخرى، التعرف هو حالة حدة لاستخدام معاني الصور الدلالية لأن مهام التعرف تستخدم كائنات كاملة وتقوم بتصنيف الكائن في الإدخال وتنقذ الشكل المقابل من قاعدة البيانات. على الرغم من أن مهام التعرف يمكن أن توفر استدلال قوي حول أجزاء الكائن غير المرئية في الصور، فإن الحل الدلالي ممكن فقط إذا كان يمكن تفسيره بواسطة كائن موجود في قاعدة البيانات.
على الرغم من أن مهام إعادة البناء والتعرف قد تختلف بشكل كبير، إلا أنها تتجاهل كلاهما المعلومات القيمة الموجودة في الصورة الإدخالية. من المستحسن استخدام كلا المهمتين معًا لتحقيق أفضل النتائج، وأشكال ثلاثية الأبعاد دقيقة لتركيب الكائن، أي لتحقيق إعادة بناء ثلاثي الأبعاد من منظور واحد مثالية، يجب على النموذج استخدام المعرفة الهيكلية، ودلالات الصورة منخفضة المستوى، والفهم الدلالي العالي للكائن.
إعادة بناء ثلاثي الأبعاد من منظور واحد: الإعداد التقليدي
لشرح الإعداد التقليدي وتحليل إعداد إطار إعادة بناء ثلاثي الأبعاد من منظور واحد، سنستخدم إعدادًا قياسيًا لتقدير الشكل ثلاثي الأبعاد باستخدام صورة واحدة أو صورة للكائن. قاعدة البيانات المستخدمة لأغراض التدريب هي قاعدة بيانات ShapeNet، وتقييم الأداء عبر 13 فئة يسمح للنموذج بفهم كيف يحدد عدد الفئات في قاعدة البيانات أداء تقدير الشكل.
تستخدم معظم الشبكات العصبونية المتوهجة الحديثة صورة واحدة لتنبؤ بنماذج ثلاثية الأبعاد بدقة عالية، ويمكن تصنيف هذه الإطارات بناءً على تمثيل الإخراج: خرائط العمق، سحب النقاط، وشبكات الفوكسيل. يستخدم النموذج OGN أو شبكات توليد الأوكتري كطريقة تمثيلية، والتي historiquement قد تفوقت على نهج شبكة الفوكسيل، و/أو يمكنها تغطية تمثيلات الإخراج السائدة. على عكس الأساليب الحالية التي تستخدم تمثيلات الإخراج، يسمح نهج OGN للنموذج بتحديد أشكال بدقة عالية، ويتضمن استخدام الأوكتري لتمثيل الفضاء المحتل بكفاءة.
الأساسيات
为了 تقييم النتائج، يستخدم النموذج两个 أساسيات يعتبران المشكلة كمهمة تعرف صرف. الأساس الأول يعتمد على التجميع، بينما يقوم الأساس الثاني بتحميل قاعدة البيانات.
التجميع
في أساس التجميع، يستخدم النموذج خوارزمية K-Means لتحويل أو تجميع أشكال التدريب إلى فئات فرعية K، ويعمل الخوارزمية على 32*32*32 فوكسيلات مسطحة إلى متجه. بعد تحديد تعيينات المجموعة، يعود النموذج إلى العمل مع نماذج ذات دقة أعلى. ثم يحسب النموذج الشكل المتوسط داخل كل مجموعة، ويعيد تحويل الأشكال المتوسطة حيث يتم حساب القيمة المثلى عن طريق تحسين متوسط IoU أو تقاطع الاتحاد على النماذج. منذ أن يعرف النموذج العلاقة بين الأشكال ثلاثية الأبعاد والصور في بيانات التدريب، يمكن للنموذج مطابقة الصورة مع مجموعةها المقابلة بسهولة.
الاسترجاع
يتم تعلم الأساس الاسترجاعي لتحويل الأشكال والصور في فضاء مشترك. يعتبر النموذج الشبهات الزوجية للأشكال ثلاثية الأبعاد في مجموعة التدريب لتشكيل فضاء التضمين. يحقق ذلك باستخدام نهج التوسيع المتعدد الأبعاد مع خريطة سامون لضغط كل صف في المصفوفة إلى واصف منخفض الأبعاد. بالإضافة إلى ذلك، لتحديد الشبهة بين شكلين عشوائيين، يستخدم النموذج واصف مجال الضوء. كما يتدرب النموذج على شبكة عصبونية متوهجة لتحويل الصور إلى واصف لتحويل الصور إلى الفضاء.
التحليل
نماذج إعادة بناء ثلاثي الأبعاد من منظور واحد تتبع استراتيجيات مختلفة، ونتيجة لذلك، تتفوق على نماذج أخرى في بعض المجالات بينما تفشل في مجالات أخرى. لمقارنة الإطارات المختلفة وتقييم أدائها، لدينا معايير مختلفة، واحدة منها هي متوسط درجة IoU.

كما هو موضح في الصورة أعلاه، على الرغم من اختلاف هيكلها، فإن نماذج إعادة بناء ثلاثي الأبعاد من منظور واحد الحالية توفر أداءً تقريبًا متساويًا. ومع ذلك، من المثير للاهتمام أن الأساس الاسترجاعي، على الرغم من كونه نهجًا صرفًا للاعتراف، يتفوق على نماذج أخرى فيما يتعلق بمتوسط ووسيط IoU. يُحقق إطار التجميع نتائج قوية، ويتفوق على إطارات AtlasNet وOGN وMatryoshka. ومع ذلك، فإن النتيجة الأكثر غرابة في هذا التحليل هي أن Oracle (ORCL ) NN يتفوق على جميع الطرق الأخرى، على الرغم من استخدامه هيكل استرجاع مثالي. على الرغم من أن حساب متوسط درجة IoU يساعد في المقارنة، إلا أنه لا يوفر صورة كاملة لأن تباين النتائج مرتفع بغض النظر عن النموذج.
معايير التقييم الشائعة
نماذج إعادة بناء ثلاثي الأبعاد من منظور واحد غالبًا ما تستخدم معايير تقييم مختلفة لتحليل أدائها على مجموعة واسعة من المهام. التالي بعض معايير التقييم الشائعة.
تقاطع الاتحاد
متوسط تقاطع الاتحاد هو معيار كمي شائع يستخدم كمرجع ل نماذج إعادة بناء ثلاثي الأبعاد من منظور واحد. على الرغم من أن IoU يوفر بعض الضوء حول أداء النموذج، إلا أنه لا يُعتبر معيارًا وحيدًا لتقييم طريقة ما، لأنه يشير إلى جودة الشكل المتوقع بواسطة النموذج فقط إذا كانت القيم كافية عالية مع وجود اختلاف كبير بين الدرجات المنخفضة والمتوسطة للشكلين المعطين.
مسافة شامفر
تم تعريف مسافة شامفر على سحب النقاط، وقد تم تصميمها لتنطبق على تمثيلات ثلاثية الأبعاد المختلفة بشكل مرض. ومع ذلك، فإن معيار تقييم مسافة شامفر حساس للغاية للنقاط الخارجة، مما يجعله مقياسًا مشكلا لتقييم أداء النموذج، حيث يحدد مسافة النقاط الخارجة من الشكل المرجعي بشكل كبير جودة التوليد.
مقياس F
مقياس F هو معيار تقييم شائع يستخدم على نطاق واسع في نماذج إعادة بناء ثلاثي الأبعاد متعددة المناظير. يُعرّف مقياس F على أنه الوسط الحرفي بين الاستدلال والدقة، ويقيم المسافة بين أسطح الأجسام بشكل صريح. تُعد الدقة نسبة النقاط المعاد بناؤها التي تقع ضمن مسافة محددة من الحقيقة الأرضية، وتقيس دقة إعادة البناء. من ناحية أخرى، يُعد الاستدلال نسبة النقاط على الحقيقة الأرضية التي تقع ضمن مسافة محددة من إعادة البناء، ويقيس إكمال إعادة البناء. بالإضافة إلى ذلك، يمكن للمطورين التحكم في صرامة مقياس F عن طريق تغيير عتبة المسافة.
تحليل لكل فئة
لا يمكن أن تكون التشابه في الأداء المقدم من الإطارات السابقة نتيجة لتشغيل الأساليب على مجموعة فرعية مختلفة من الفئات، والشكل التالي يظهر الأداء النسبي الثابت عبر الفئات المختلفة، مع تحقيق Oracle NN أفضل نتيجة، وجميع الأساليب تظهر تباينًا مرتفعًا في جميع الفئات.

علاوة على ذلك، قد يؤدي عدد العينات التدريبية المتاحة لفئة معينة إلى افتراض أنها تؤثر على أداء الفئة. ومع ذلك، كما هو موضح في الشكل التالي، لا يؤثر عدد العينات في الفئة على أداء الفئة، ولا يوجد علاقة بين عدد العينات في الفئة ومتوسط درجة IoU.

التحليل النوعي
تُدعم النتائج الكمية المذكورة في القسم أعلاه بالنتائج النوعية كما هو موضح في الصورة التالية.

对于 معظم الفئات، لا يوجد فرق كبير بين أساس التجميع والتنبؤات التي يقدمها الأساليب القائمة على الفكك. يفشل نهج التجميع في تقديم نتائج عندما يكون المسافة بين العينة وشكل المجموعة المتوسطة عالية، أو عندما لا يمكن أن يصف الشكل المتوسط المجموعة بشكل كاف. من ناحية أخرى، الإطارات التي تستخدم أساليب الفكك والهيكل الاسترجاعي تقدم نتائج أكثر دقة وجمالًا لأنها قادرة على تضمين تفاصيل دقيقة في النموذج ثلاثي الأبعاد المولدة.
إعادة بناء ثلاثي الأبعاد من منظور واحد: الأفكار الختامية
في هذه المقالة، تحدثنا عن إعادة بناء ثلاثي الأبعاد من منظور واحد، وكيفية عملها، وتحدثنا عن两个 أساس: الاسترجاع والتصنيف، مع تفوق أساس الاسترجاع على نماذج الحالة الحالية. أخيرًا، على الرغم من أن إعادة بناء ثلاثي الأبعاد من منظور واحد هي واحدة من المواضيع الأكثر سخونة والأكثر بحثًا في مجتمع الذكاء الاصطناعي، وعلى الرغم من تحقيق تقدم كبير في السنوات القليلة الماضية، فإن إعادة بناء ثلاثي الأبعاد من منظور واحد بعيدة عن الكمال، مع وجود عقبات كبيرة يجب التغلب عليها في السنوات القادمة.










