نماذج ومنصات الذكاء الاصطناعي
Paint3D : نموذج انتشار بدون إضاءة لإنشاء الصور
تطور النماذج التوليدية للذكاء الاصطناعي بسرعة، خاصة النماذج التوليدية العميقة، قد حسّن بشكل كبير القدرات في توليد اللغة الطبيعية وإنشاء الصور ثلاثية الأبعاد وتنمية الصوت. هذه النماذج قد غيرت الإنتاج ثلاثي الأبعاد عبر مختلف الصناعات. ومع ذلك، تواجه العديد من التحديات: الأسلاك المعقدة والشبكات المولدة غالبًا ما لا تتوافق مع خطوط الأنابيب التقليدية للتصيير مثل التصيير المبني على الفيزياء (PBR). النماذج القائمة على الانتشار، وخاصة تلك التي لا تحتوي على نصوص الإضاءة، تظهر نتائج مثيرة للإعجاب في توليد الأصول ثلاثية الأبعاد المتنوعة، مما يعزز الإطارات ثلاثية الأبعاد في صناعة الأفلام وألعاب الفيديو وواقع افتراضي ومكبر للواقع.
هذا المقال يقدم Paint3D، إطارًا جديدًا لإنشاء خرائط نصوص عالية الدقة 2K UV للشبكات ثلاثية الأبعاد غير الممسوحة، مشروطة على الإدخالات البصرية أو النصية. التحدي الرئيسي لبرنامج Paint3D هو إنشاء نصوص عالية الجودة بدون إضاءة متأصلة، مما يسمح للمستخدمين بإعادة تحرير أو إعادة إضاءة داخل خطوط الأنابيب الرسومية الحديثة. يستخدم إطار Paint3D نموذج انتشار ثنائي الأبعاد مسبق التدريب لمزج النصوص متعددة المناظير، مما يولد خرائط نصوص أولية خشنه. ومع ذلك، غالبًا ما تظهر هذه الخرائط شذوذات إضاءة ومناطق غير مكتملة بسبب قيود نموذج 2D في إيقاف تأثيرات الإضاءة وتمثيل الأشكال ثلاثية الأبعاد بشكل كامل.
Paint3D : مقدمة
القدرات المعروفة للنماذج التوليدية للذكاء الاصطناعي في توليد اللغة الطبيعية وإنشاء الصور ثلاثية الأبعاد ومهام合ezة الصور جيدة وممكنة في التطبيقات الواقعية، مما يغيّر صناعة إنشاء الصور ثلاثية الأبعاد. على الرغم من قدراتها المذهلة، فإن الإطارات التوليدية الحديثة للذكاء الاصطناعي تنتج شبكات ثلاثية الأبعاد مع أسلاك معقدة وخرائط إضاءة عشوائية غالبًا ما تكون غير متوافقة مع خطوط الأنابيب التقليدية للتصيير، بما في ذلك PBR أو التصيير المبني على الفيزياء. مثل النماذج التوليدية للذكاء الاصطناعي، فإن توليد النصوص قد تقدم بشكل سريع، خاصة في استخدام نماذج الانتشار ثنائية الأبعاد. تستخدم نماذج توليد النصوص نماذج انتشار مسبقة التدريب بنجاح لاستخدام الشروط النصية لإنشاء نصوص عالية الجودة. ومع ذلك، تواجه هذه المناهج صعوبات مع النصوص المسبقة الإضاءة التي يمكن أن تؤثر بشكل كبير على معالجات العرض النهائية ثلاثية الأبعاد وتقديم أخطاء إضاءة عند تغيير الإضاءة داخل سير العمل الشائع كما هو موضح في الصورة التالية.

كما يمكن ملاحظة ذلك، فإن خريطة النص مع الإضاءة الحرة تعمل بشكل متسق مع خطوط الأنابيب التقليدية للتصيير لتسليم نتائج دقيقة، بينما تحتوي خريطة النص مع الإضاءة المسبقة على ظلال غير مناسبة عند تطبيق إعادة الإضاءة. من ناحية أخرى، تقدم إطارات توليد النصوص المدرجة على بيانات ثلاثية الأبعاد نهجًا بديلًا حيث يولد الإطار النصوص عن طريق فهم هندسة كائن ثلاثي الأبعاد بالكامل. على الرغم من أنها قد تقدم نتائج أفضل، فإن إطارات توليد النصوص المدرجة على بيانات ثلاثية الأبعاد تفتقر إلى قدرات التعميم التي تعيق قدرتها على تطبيق النموذج على كائنات ثلاثية الأبعاد خارج بيانات التدريب.
تواجه نماذج توليد النصوص الحالية تحديين حرجين: استخدام توجيه الصورة أو الدعائم المتنوعة لتحقيق درجة أعلى من التعميم عبر كائنات مختلفة، والتحدي الثاني هو إزالة الإضاءة المترابطة من النتائج التي تم الحصول عليها من التدريب المسبق. يمكن أن تتداخل النصوص المسبقة الإضاءة بشكل محتمل مع النتائج النهائية للكائنات الممسوحة داخل محركات العرض، وبما أن نماذج الانتشار ثنائية الأبعاد المسبقة التدريب توفر نتائج فقط في مجال المنظر، فإنها تفتقر إلى فهم شامل للشكل مما يؤدي إلى عدم القدرة على الحفاظ على توافق المنظر لالكائنات ثلاثية الأبعاد.
بسبب التحديات المذكورة أعلاه، يحاول إطار Paint3D تطوير نموذج انتشار نصي ثنائي المراحل لالكائنات ثلاثية الأبعاد التي تتمتع بالتعميم لنمذج توليدي مسبق مختلفة وتحافظ على توافق المنظر أثناء تعلم توليد النصوص بدون إضاءة. إطار Paint3D هو نموذج توليدي ثنائي المراحل لإنشاء نصوص خشنه إلى دقيق، يهدف إلى الاستفادة من التوجيه القوي للدعائم وإنشاء الصور لنمذج الذكاء الاصطناعي المولدة مسبقًا لتوليد نصوص على الكائنات ثلاثية الأبعاد. في المرحلة الأولى، يبدأ إطار Paint3D بإنشاء نصوص خشنه لشبكات ثلاثية الأبعاد باستخدام نموذج انتشار ثنائي الأبعاد مدرب مسبقًا على الوعي بالعمق.

لتلخيص، إطار Paint3D هو نموذج توليدي جديد من الخشن إلى الدقيق يهدف إلى إنتاج نصوص متنوعة وخالية من الإضاءة وذات دقة عالية 2K UV لشبكات ثلاثية الأبعاد غير الممسوحة، لتحقيق أداء على مستوى الدولة في مساحات النصوص ثلاثية الأبعاد مع إدخالات مشروطة مختلفة، بما في ذلك النصوص والصور، ويوفر ميزة كبيرة لمهام الت合يف والتعديل الرسومي.
منهجية وعمارة
يولد إطار Paint3D ويعمل على تحسين خرائط النصوص بشكل تدريجي لإنشاء خرائط نصوص متنوعة وذات جودة عالية لنمذج ثلاثية الأبعاد باستخدام إدخالات مشروطة مختلفة، بما في ذلك الصور والدعائم، كما هو موضح في الصورة التالية.

في المرحلة الخشنه، يستخدم نموذج Paint3D نماذج انتشار ثنائية الأبعاد مدربة مسبقًا لتحديث الصور متعددة المناظير، ثم يخلق خرائط النصوص الأولية عن طريق إسقاط هذه الصور على سطح الشبكة. في المرحلة الثانية، أي مرحلة التطوير، يستخدم نموذج Paint3D عملية انتشار في مجال UV لتحسين خرائط النصوص الخشنه، وبالتالي تحقيق وظيفة عالية الجودة وملء الفجوات وخالية من الإضاءة، مما يضمن الجاذبية البصرية واكتمال النص النهائي.
المرحلة 1: توليد النصوص الخشنه التدريجي
في مرحلة توليد النصوص الخشنه التدريجية، يولد نموذج Paint3D خريطة نصوص خشنه UV لشبكات ثلاثية الأبعاد باستخدام نموذج انتشار ثنائي الأبعاد مدرب على الوعي بالعمق. بشكل أكثر تحديدًا، يستخدم النموذج مناظير كاميرا مختلفة لتصيير خريطة العمق، ثم يستخدم شروط العمق لتحديث صور من نموذج انتشار الصورة، ثم يُسقط هذه الصور على سطح الشبكة. يقوم الإطار بتنفيذ نهج التصيير والتحديث والإسقاط بشكل متبادل لتحسين اتساق نصوص الشبكة، مما يساعد في النهاية على توليد خريطة النص بشكل تدريجي.
يبدأ النموذج في توليد نص منطقة المرئية مع مناظير الكاميرا التي تركز على الشبكة ثلاثية الأبعاد، ويعيد تصيير الشبكة ثلاثية الأبعاد إلى خريطة عمق من المنظر الأول. ثم يُحَدِّث النموذج صورة نصية لشروط المظهر وشرط العمق. ثم يُسقط النموذج الصورة على الشبكة ثلاثية الأبعاد. بالنسبة لمناظير الكاميرا، ينفذ نموذج Paint3D نهجًا مشابهًا ولكن مع تغيير طفيف عن طريق أداء عملية عينة النص باستخدام نهج الرسم على الصورة. بالإضافة إلى ذلك، يأخذ النموذج المناطق الممسوحة من مناظير سابقة في الاعتبار، مما يسمح عملية التصيير ليس فقط بخرج صورة عمق، ولكن أيضًا صورة RGB جزئيًا ملونة مع قناع غير ملون في المنظر الحالي.
ثم يستخدم النموذج نموذج تلوين صور مدرب على الوعي بالعمق مع محول تلوين لملء المنطقة غير الملونة داخل صورة RGB. ثم يُحَدِّث النموذج خريطة النص من المنظر عن طريق إسقاط الصورة الملوَّنة على الشبكة ثلاثية الأبعاد في المنظر الحالي، مما يسمح للنموذج بتوليد خريطة النص بشكل تدريجي، وصولًا إلى الهيكل الخشن الكامل. أخيرًا، يوسع النموذج عملية عينة النص إلى مشهد أو كائن مع مناظير متعددة. بشكل أكثر تحديدًا، يستخدم النموذج زوجًا من الكاميرات لالتقاط خريطتي عمق خلال عملية عينة النص الأولية من مناظير متماثلة. ثم يدمج النموذج خريطتي العمق ويشكل شبكة عمق. ثم يستبدل النموذج صورة العمق المفردة بشبكة العمق لأداء عينة النص متعددة المناظير.
المرحلة 2: تعديل النص في مجال UV
على الرغم من منطقية مظهر خرائط النص الخشنه، إلا أنها تواجه بعض التحديات مثل ثقوب النص الناجمة أثناء عملية التصيير بسبب الإغلاق الذاتي أو ظلال الإضاءة بسبب استخدام نماذج انتشار الصور ثنائية الأبعاد. يهدف نموذج Paint3D إلى أداء عملية انتشار في مجال UV على أساس خريطة النص الخشنه، محاولًا التغلب على هذه القضايا وتحسين الجاذبية البصرية لخريطة النص بشكل أكبر خلال تعديل النص.
يعمل النموذج على تعديل خريطة النص في مجال UV عن طريق أداء عملية الانتشار تحت إرشاد معلومات مجاورة للنصوص. من المهم ملاحظة أن خريطة الموضع في مجال UV تمثل معلومات المجاورة ثلاثية الأبعاد للنصوص، حيث يعامل النموذج كل عنصر غير خلفي كإحداثي نقطة ثلاثية الأبعاد. خلال عملية الانتشار، يدمج النموذج معلومات المجاورة ثلاثية الأبعاد عن طريق إضافة محول موضع فردي إلى نموذج انتشار الصورة المسبق التدريب. ي似 محول جديد تصميم إطار ControlNet وله نفس الهيكل مثل المحول المطبق في نموذج انتشار الصورة مع طبقة التوصيل الصفري التي تربط بينهما.
ثم يستخدم النموذج موضع التشفير الشرطي والتشفيرات الأخرى لأداء مهام التعديل في مجال UV. في هذا الصدد، يمتلك النموذج قدرتين على التعديل: UVHD أو تعريف UV عالي الدقة و UV تلوين. طريقة UVHD مصممة لتعزيز الجاذبية البصرية وجمال خريطة النص. لتحقيق UVHD، يستخدم النموذج محول تعزيز الصورة ومحول الموضع مع نموذج الانتشار. يستخدم النموذج طريقة تلوين UV لملء ثقوب النص داخل مستوى UV التي قادرة على تجنب مشاكل الإغلاق الذاتي التي تُحدث أثناء التصيير. في مرحلة التعديل، يؤدي نموذج Paint3D أولًا تلوين UV ثم يؤدي UVHD لإنشاء خريطة النص المعدلة النهائية. من خلال دمج الطريقتين للتعديل، يمكن لإطار Paint3D إنتاج خرائط نصوص كاملة ومتعددة وذات دقة عالية وملء الفجوات.
Paint3D : التجارب والنتائج
يستخدم نموذج Paint3D نموذج الصورة إلى النص المستقر لتعزيز مهام توليد النص، بينما يستخدم مكون محول الصورة لمعالجة الشروط الصورية. لتعزيز السيطرة الشرطية مثل تلوين الصور وعمق الصور ووضوح الصور، يستخدم إطار Paint3D مشفرات المجال من ControlNet. يتم تنفيذ النموذج على إطار PyTorch، مع تنفيذ التصيير وإسقاط النص على Kaolin.
مقارنة النصوص إلى النصوص
لتحليل أدائه، نبدأ بتقدير تأثير توليد النص لبرنامج Paint3D عند شرط الدعائم النصية، ومقارنته بنماذج الدولة الحالية، بما في ذلك Text2Tex و TEXTure و LatentPaint. كما يمكن ملاحظته في الصورة التالية، يتفوق إطار Paint3D ليس فقط في توليد تفاصيل نصية عالية الجودة، ولكن أيضًا ي合ن خريطة نصية خالية من الإضاءة بشكل معقول.

في المقارنة، نموذج Latent-Paint يعتاد على توليد نصوص مُبهَمة تؤدي إلى تأثيرات بصرية دون المستوى الأمثل. من ناحية أخرى، على الرغم من أن نموذج TEXTure يولد نصوص واضحة، إلا أنه يفتقر إلى السلاسة ويظهر شقوقًا واضحة. أخيرًا، نموذج Text2Tex يولد نصوصًا سلسة بشكل ملحوظ، ولكنه يفشل في تكرار الأداء لإنشاء نصوص دقيقة مع تفاصيل دقيقة.
الصورة التالية تقارن إطار Paint3D بنماذج الدولة الحالية كميا.

كما يمكن ملاحظته، يتفوق إطار Paint3D على جميع النماذج الحالية، وبفارق كبير مع تحسين بنسبة 30٪ في قاعدة FID وتحسين بنسبة 40٪ في قاعدة KID. تحسينات قاعدة FID و KID تُظهر قدرة Paint3D على توليد نصوص عالية الجودة عبر كائنات وتصنيفات مختلفة.
مقارنة الصور إلى النصوص
لتحقيق القدرات التوليدية لبرنامج Paint3D باستخدام الدعائم البصرية، نستخدم نموذج TEXTure كقاعدة. كما ذكرنا سابقًا، يستخدم نموذج Paint3D محول صورة من نموذج الصورة إلى النص من نموذج الصورة إلى النص المستقر. كما هو موضح في الصورة التالية، يُحسن إطار Paint3D نصوصًا رائعة بشكل ملحوظ، ويمكنه الحفاظ على الإيمان العالي مع الشرط الصوري.

من ناحية أخرى، نموذج TEXTure يمكنه توليد نص مشابه لبرنامج Paint3D، ولكنه يفتقر إلى تمثيل تفاصيل النص في الشرط الصوري بدقة. بالإضافة إلى ذلك، كما هو موضح في الصورة التالية، يُحسن إطار Paint3D نتائج قاعدة FID و KID بشكل أفضل عند مقارنته بنموذج TEXTure، حيث ينخفض الأول من 40.83 إلى 26.86، بينما يظهر الأخير انخفاضًا من 9.76 إلى 4.94.

أفكار نهائية
في هذا المقال، تحدثنا عن Paint3D، إطار جديد قائم على المراحل الخشنه إلى الدقيق يمكنه إنتاج خرائط نصوص خالية من الإضاءة ومتعددة وذات دقة عالية 2K UV لشبكات ثلاثية الأبعاد غير الممسوحة، مشروطة على الإدخالات البصرية أو النصية. النقطة الرئيسية في إطار Paint3D هي أنه يمكنه توليد خرائط نصوص خالية من الإضاءة وذات دقة عالية 2K UV التي تتوافق семantically دون شرط الإدخالات الصورية أو النصية. بفضل نهج الخشن إلى الدقيق، يُحسن إطار Paint3D خرائط نصوص خالية من الإضاءة ومتعددة وذات دقة عالية، ويوفر أداء أفضل من نماذج الدولة الحالية.












