نماذج ومنصات الذكاء الاصطناعي
نظرة شخصية على اتجاهات الأدب في رؤية الكمبيوتر في عام 2024

لقد كنت أتابع باستمرار مشهد أبحاث رؤية الكمبيوتر (CV) وتركيب الصور في Arxiv و في أماكن أخرى لمدة خمس سنوات ، لذا يصبح من الواضح الاتجاهات مع مرور الوقت ، وتتغير في اتجاهات جديدة كل عام.
لذلك مع اقتراب عام 2024 من نهايته ، فكرت في النظر إلى بعض الخصائص الجديدة أو المتطورة في إرسال Arxiv في قسم رؤية الكمبيوتر و التعرف على الأنماط قسم. هذه الملاحظات ، على الرغم من أنها مستنيرة بعد مئات الساعات دراسة المشهد ، هي مجرد أنكدوتا.
استمرار صعود شرق آسيا
من خلال نهاية عام 2023 ، لاحظت أن الغالبية العظمى من الأدب في فئة “تركيب الصوت” كانت تأتي من الصين ومناطق أخرى في شرق آسيا. في نهاية عام 2024 ، يجب أن ألاحظ (من الناحية التاريخية) أن هذا ينطبق الآن أيضًا على مشهد تركيب الصور و أبحاث الفيديو.
هذا لا يعني أن الصين والبلدان المجاورة تنتج دائمًا أفضل الأعمال (في الواقع ، هناك بعض الادلة على العكس) ؛ ولا يعني ذلك أيضًا أنهم يأخذون في الاعتبار الاحتمال العالي في الصين (مثل الغرب) أن بعض الأنظمة الجديدة الأكثر إثارة و قوة لا تزال محظورة ، و مستثناة من الأدب.
لكن هذا يشير إلى أن شرق آسيا يفوز على الغرب من حيث الحجم. ما قيمته يعتمد على مدى اعتقادك في فعالية مثابرة إديسون ، والتي عادة ما تثبت عدم فعاليتها في مواجهة العقبات التي لا يمكن التغلب عليها.
هناك عقبات كثيرة في الذكاء الاصطناعي التوليدي ، ومن الصعب معرفة أيهما يمكن حلها عن طريق معالجة الهياكل الحالية ، وأيهما سيتعين إعادة النظر فيه من الصفر.
على الرغم من أن الباحثين من شرق آسيا يبدو أنهم ينتجون عددًا أكبر من أوراق رؤية الكمبيوتر ، لاحظت زيادة في تكرار مشاريع “فرانكنشتاين” – مبادرات تتكون من دمج الأعمال السابقة ، مع إضافة قليل من الابتكار المعماري (أو ربما فقط نوع مختلف من البيانات).
في هذا العام ، زادت عدد أكبر من المقالات الآسيوية (特别 الصينية أو التعاونات التي تشمل الصين) بشكل واضح بسبب الحاجة إلى الحفاظ على الحجم بدلاً من الجودة ، مما زاد بشكل كبير من نسبة الإشارة إلى الضوضاء في مجال مكتظب بالفعل.
في الوقت نفسه ، لقد لفتت انتباهي و إعجابي عدد أكبر من المقالات الآسيوية في عام 2024. إذا كان هذا كل لعبة أرقام ، فإنه لا يخيب آمالنا – ولكن لا يزال باهظًا.
زيادة حجم الإرسال
زيادة عدد الأوراق ، عبر جميع البلدان الأصلية ، واضحة في عام 2024.
يختلف يوم النشر الأكثر شعبية على مدار العام ؛ في الوقت الحالي ، إنه يوم الثلاثاء ، عندما يكون عدد الإرسالات إلى قسم رؤية الكمبيوتر و التعرف على الأنماط souvent حول 300-350 في يوم واحد ، في الفترات “الذروة” (مايو – أغسطس و أكتوبر – ديسمبر ، أي موسم المؤتمر و موسم “الحد الأقصى للرسوم” على التوالي).
خارج خبرتي الخاصة ، تقرير Arxiv نفسه رقمًا قياسيًا جديدًا للإرسالات الشهرية في أكتوبر 2024 ، مع 6000 إرسال جديد ، وقسم رؤية الكمبيوتر هو ثاني أكثر الأقسام إرسالًا بعد تعلم الآلة.
ومع ذلك ، منذ أن يتم استخدام قسم تعلم الآلة في Arxiv غالبًا كفئة “إضافية” أو فئة مجمعة ، فإنه يُشير إلى أن رؤية الكمبيوتر و التعرف على الأنماط هو في الواقع أكثر الفئات إرسالًا في Arxiv.
إحصائيات Arxiv الخاصة تظهر بالفعل أن علوم الحاسوب هي الزعيم الواضح في الإرسالات:

علوم الحاسوب (CS) تهيمن على إحصائيات الإرسال في Arxiv على مدار السنوات الخمس الماضية. مصدر: https://info.arxiv.org/about/reports/submission_category_by_year.html
كما يشير تقرير مؤشر الذكاء الاصطناعي في جامعة ستانفورد لعام 2024 ، على الرغم من عدم قدرته على الإبلاغ عن أحدث الإحصائيات بعد ، إلى الارتفاع الملحوظ في إرسال الأوراق الأكاديمية حول تعلم الآلة في السنوات الأخيرة:

مع الأرقام غير متاحة لعام 2024 ، يظهر تقرير ستانفورد زيادة ملحوطة في حجم الإرسالات لأوراق تعلم الآلة. مصدر: https://aiindex.stanford.edu/wp-content/uploads/2024/04/HAI_AI-Index-Report-2024_Chapter1.pdf
توسع إطارات Diffusion > Mesh
من الاتجاهات الواضحة الأخرى التي ظهرت لي هو زيادة كبيرة في الأوراق التي تتعامل مع الاستفادة من نماذج التبخر الكامن (LDMs) كمولدات لطرازات CGI التقليدية القائمة على الشبكات.
تشمل مشاريع من هذا النوع InstantMesh3D من تينسنت ، 3Dtopia ، Diffusion2 ، V3D ، MVEdit ، و GIMDiffusion ، من بين العديد من العروض المماثلة.

توليد الشبكة و تحسينها من خلال عملية التبخر في 3Dtopia. مصدر: https://arxiv.org/pdf/2403.02234
يمكن اعتبار هذا الخيط البحثي الناشئ كإعتراف ضمني بالصعوبات المستمرة للنظم التوليدية مثل نماذج التبخر ، والتي كانت من قبل عامين فقط تُعتبر بديلاً محتملاً لجميع النظم التي تحاول نماذج التبخر > الشبكة الآن ملئها ؛ و تقليص دور التبخر إلى أداة في التكنولوجيا و الأساليب التي تعود إلى ثلاثين عامًا أو أكثر.
أصدرت Stability.ai ، المبتكرة لنموذج التبخر المستقر المفتوح ، للتو Stable Zero123 ، الذي يمكنه ، من بين أشياء أخرى ، استخدام تفسير الحقول الشعاعية العصبية (NeRF) للصورة التي تم توليدها بواسطة الذكاء الاصطناعي كجسر لإنشاء نموذج CGI صريح و قائم على الشبكة يمكن استخدامه في منصات CGI مثل Unity ، في ألعاب الفيديو ، و الواقع المعزز ، و منصات أخرى تتطلب إحداثيات 3D صريحة ، على عكس الإحداثيات الضمنية (المخفية) للدوال المستمرة.
انقر للتشغيل. الصور التي تم توليدها في Stable Diffusion يمكن تحويلها إلى شبكات CGI معقولة. هنا نرى نتيجة سير عمل الصورة > CGI باستخدام Stable Zero 123. مصدر: https://www.youtube.com/watch?v=RxsssDD48Xc
دلالات 3D
يصنف مساحة الذكاء الاصطناعي التوليدية بين التطبيقات ثنائية و ثلاثية الأبعاد للرؤية و النظم التوليدية. على سبيل المثال ، إطارات التوجيه Facial ، على الرغم من تمثيل الكائنات ثلاثية الأبعاد (الوجوه) في جميع الحالات ، لا تتطلب جميعها بالضرورة حساب الإحداثيات ثلاثية الأبعاد القابلة للعنونة.
يمكن أن تستوعب نظام FANAlign الشهير ، الذي يتم استخدامه على نطاق واسع في عمليات deepfake في عام 2017 (من بين أمور أخرى) ، هذه المناهج:

في الأعلى ، يتم إنشاء معالم ثنائية الأبعاد بناءً على ملامح و سمات الوجه المعترف بها فقط. في الأسفل ، يتم تبريرها في مساحة 3D X / Y / Z. مصدر: https://github.com/1adrianb/face-alignment
لذلك ، كما أصبح مصطلح “deepfake” غامضًا و مصادرًا ، أصبح مصطلح “3D” أيضًا مصطلحًا غامضًا في أبحاث رؤية الكمبيوتر.
对于 المستهلكين ، عادة ما يشير إلى وسائط تعمل بالاستريو (مثل الأفلام التي يجب على المشاهد ارتداء نظارات خاصة) ؛对于 ممارسي التأثيرات البصرية و النماذج ، يوفر الفرق بين الفن ثنائي الأبعاد (مثل الرسومات المفاهيمية) و نماذج الشبكة التي يمكن操作ها في برنامج “3D” مثل Maya أو Cinema4D.
لكن في رؤية الكمبيوتر ، يعني ذلك ببساطة أن نظام الإحداثيات الديكارتي موجود في مكان ما في مساحة التبخر للنموذج – ليس أنه يمكنه بالضرورة أن يتم عنونة أو操作 مباشرة بواسطة المستخدم ؛ على الأقل ، ليس بدون أنظمة CGI تفسيرية ثالثة مثل 3DMM أو FLAME.
لذلك فإن مفهوم Diffusion > 3D غير دقيق ؛ لا يمكن استخدام أي نوع من الصور (بما في ذلك صورة فوتوغرافية حقيقية) كمدخل لإنشاء نموذج CGI توليدي ، ولكن المصطلح الأقل غموض هو “شبكة”.
ومع ذلك ، لتعقيد الغموض ، فإن التبخر مطلوب لتحويل الصورة المصدر إلى شبكة ، في معظم المشاريع الناشئة. لذلك ، قد يكون وصف أفضل هو صورة إلى شبكة ، بينما صورة > التبخر > شبكة هو وصف أكثر دقة.
لكن هذا بيع صعب في اجتماع مجلس الإدارة ، أو في إعلان دعائي مصمم لجذب المستثمرين.
دليل على الجمود المعماري
حتى بالمقارنة مع عام 2023 ، فإن المحاصيل الأخيرة من الأوراق تظهر يأسًا متزايدًا حول إزالة الحدود العملية الصعبة للتركيب القائم على التبخر.
العقبة الرئيسية لا تزال توليد فيديو متسق و متسلسل و متوافق ، و الحفاظ على مظهر متسق للشخصيات و الأشياء – ليس فقط عبر مقاطع فيديو مختلفة ، ولكن حتى عبر تشغيل مقطع فيديو توليدي واحد.
الابتكار الأخير الكبير في التركيب القائم على التبخر كان ظهور LoRA في عام 2022. بينما تحسنت أنظمة أحدث مثل Flux بعض مشاكل الحواف ، مثل عدم قدرة التبخر المستقر السابق على إعادة إنتاج المحتوى النصي داخل صورة توليدية ، و تحسنت جودة الصورة بشكل عام ، كانت معظم الأوراق التي درستها في عام 2024 مجرد تحريك الطعام على الطبق.
تكررت هذه الجمودات من قبل ، مع الشبكات التوليدية المعادية (GANs) و الحقول الشعاعية العصبية (NeRF) ، التي فشلت كلاهما في تحقيق إمكاناتهما الظاهرية الأولية – و كلاهما يتم استخدامه بشكل متزايد في أنظمة أكثر تقليدية (مثل استخدام NeRF في Stable Zero 123 ، انظر أعلاه). ويبدو أن هذا أيضًا يحدث مع نماذج التبخر.
تحول أبحاث Gaussian Splatting
بدا في نهاية عام 2023 أن طريقة التصفيف 3D Gaussian Splatting (3DGS) ، التي ظهرت لأول مرة كتقنية التصوير الطبي في بداية التسعينيات ، على وشك تجاوز نظم الترميز التلقائي لتحديات تركيب الصور البشرية (مثل محاكاة و إعادة إنشاء الوجه ، بالإضافة إلى نقل الهوية).
وعد ورقة ASH لعام 2023 بتقديم بشر كاملين من 3DGS ، بينما قدم Gaussian Avatars تفاصيل محسنة بشكل كبير (مقارنة بالطرق التوليدية الأخرى) ، جنبًا إلى جنب مع إعادة تمثيل متقاطعة مثيرة.
然而 ، هذا العام كان قصيرًا نسبيًا على أي لحظات كبرى من هذا القبيل لتركيب البشر من 3DGS ؛ كانت معظم الأوراق التي تناولت هذه المشكلة مشتقة من الأعمال المذكورة أعلاه ، أو فشلت في تجاوز قدراتها.
بدلاً من ذلك ، ركزت الاهتمام على 3DGS على تحسين جدواها المعمارية الأساسية ، مما أدى إلى Appearance of papers التي تقدم تحسينات في البيئات الخارجية ل 3DGS. الانتباه الخاص قد أُ Accorded إلى نهج SLAM 3DGS ، في مشاريع مثل Gaussian Splatting SLAM ، Splat-SLAM ، Gaussian-SLAM ، DROID-Splat ، من بين العديد من المشاريع الأخرى.
تضمنت المشاريع التي حاولت الاستمرار أو توسيع تركيب البشر القائم على 3DGS MIGS ، GEM ، EVA ، OccFusion ، FAGhead ، HumanSplat ، GGHead ، HGM ، و Topo4D. على الرغم من وجود آخرين ، لم تكن أي من هذه العروض تتناسب مع التأثير الأولي للأوراق التي ظهرت في نهاية عام 2023.
عصر “Weinstein” من عينات الاختبار في انحدار بطيء
الابحاث من جنوب شرق آسيا بشكل عام (والصين على وجه الخصوص) غالبًا ما تحتوي على أمثلة اختبار قد تكون مشكلة لاعادة نشرها في مقال استعراضي ، لأنها تحتوي على مواد قد تكون قليلا “ساخنة”.
سواء كان هذا بسبب أن علماء الأبحاث في تلك المنطقة من العالم يبحثون عن جذب الانتباه إلى مخرجاتهم هو موضع جدل ؛ ولكن خلال الأشهر الثمانية عشر الماضية ، زادت عدد كبير من الأوراق حول الذكاء الاصطناعي التوليدي (صورة و / أو فيديو) افتراض استخدام شابات وفتيات شبه عاريات في أمثلة المشروع. وتشمل الأمثلة الحدودية غير مناسبة لهذا النوع UniAnimate ، ControlNext ، وحتى أوراق جافة مثل تقييم الاتساق الحركي بواسطة مسافة الحركة الفيديوية Fréchet (FVMD).
هذا يتبع الاتجاهات العامة للمجتمعات التي تجمع حول نماذج التبخر الكامن (LDMs) ، حيث لا تزال القاعدة 34 سارية المفعول.
مواجهة المشاهير
تتضمن هذه الأمثلة غير المناسبة التعرّف المتزايد على أن عمليات الذكاء الاصطناعي لا ينبغي أن تستغل تعاريف المشاهير بشكل تعسفي – خاصة في الدراسات التي تستخدم أمثلة تضم مشاهير جذابة ، غالبًا من الإناث ، و توضع في سياقات مشكوك فيها.
تتضمن الأمثلة AnyDressing ، الذي يضم أيضًا شخصيات أنيمي شابة ، و يستخدم بحرية هويات مشاهير كلاسيكية مثل مارلين مونرو ، و مشاهير حاليين مثل آن هاثاواي (التي أدانت هذا النوع من الاستخدام بقوة).

استخدام تعسفي للمشاهير الحاليين و الكلاسيكيين لا يزال شائعًا في الأوراق من جنوب شرق آسيا ، على الرغم من أن هذه الممارسة في انحدار طفيف. مصدر: https://crayon-shinchan.github.io/AnyDressing/
في الأوراق “الغربية” ، انخفضت هذه الممارسة بشكل ملحوظ على مدار عام 2024 ، بقيادة الإصدارات الكبيرة من FAANG و هيئات أبحاث أخرى رائدة مثل OpenAI. و يبدو أن هذه الأطراف الكبيرة متزايدة الوعي بالتأثير المحتمل للتقاضي في المستقبل.
على الرغم من أن الأنظمة التي يخلقونها (مثل Imagen و Veo2) قادرة بوضوح على إنتاج مثل هذه الإخراج ، فإن الأمثلة من مشاريع الذكاء الاصطناعي التوليدي الغربية تتميل الآن نحو صور و فيديوهات “قبيحة” و “آمنة” للغاية.

على الرغم من الترويج لقدرة Imagen على إنشاء إخراج fotorealistic ، فإن العينات التي يروج لها بحث Google عادة ما تكون خيالية و “عائلية” – و يتم تجنب أو تقديم أمثلة بشرية fotorealistic بشكل دقيق. مصدر: https://imagen.research.google/
غسيل الوجه
في أدب رؤية الكمبيوتر “الغربي” ، يظهر هذا النهج غير الصادق بشكل خاص في أنظمة التخصيص – الطرق القادرة على إنشاء تشابهات متسقة لشخص معين عبر عدة أمثلة (أي مثل LoRA و DreamBooth الأقدم).
تتضمن الأمثلة التركيب البصري المتوازي ، LoRA-Composer ، InstructBooth من Google ، و العديد من الأمثلة الأخرى.

يحول InstructBooth من Google معامل القبول إلى 11 ، على الرغم من أن التاريخ يشير إلى أن المستخدمين أكثر اهتمامًا بإنشاء بشر fotorealistic أكثر من الشخصيات القبيحة أو الناعمة. مصدر: https://sites.google.com/view/instructbooth
然而 ، يظهر ارتفاع “الأمثلة القبيحة” في سلاسل أبحاث أخرى في رؤية الكمبيوتر و التركيب ، في مشاريع مثل Comp4D ، V3D ، DesignEdit ، UniEdit ، FaceChain (التي تتنازل عن التوقعات الواقعية للمستخدم على صفحتها على GitHub) ، و DPG-T2I ، من بين العديد من الأمثلة الأخرى.
سهولة إنشاء مثل هذه الأنظمة (مثل LoRAs) بواسطة مستخدمي المنازل مع عتاد معقول قد أدى إلى انفجار في النماذج القابلة للتحميل المجاني في مجال civit.ai و المجتمع. و يبقى استخدام غير مشروع ممكنًا من خلال إتاحة الهياكل المفتوحة مثل Stable Diffusion و Flux.
على الرغم من أنه غالبًا ما يكون من الممكن اختراق ميزات الأمان في أنظمة النص إلى الصورة (T2I) و النص إلى الفيديو (T2V) لإنشاء مواد محظورة بواسطة شروط الاستخدام المنصوص عليها في منصة ، فإن الفجوة بين القدرات المقيدة لأنظمة الأفضل (مثل RunwayML و Sora) ، و القدرات غير المقيدة لأنظمة الأداء (مثل Stable Video Diffusion ، CogVideo و التوزيعات المحلية من Hunyuan) لا يزال يبدو أنه لا يغلق ، كما يعتقد الكثيرون.
بدلاً من ذلك ، تهديد هذه الأنظمة المملوكة و المفتوحة ، على التوالي ، بأن تصبح متساوية في العجز ؛ قد تصبح أنظمة T2V باهظة الثمن و متعددة النطاقات مفرطة في التعقيد بسبب مخاوف التقاضي ، بينما قد تقفل نقص البنية التحتية للترخيص و إدارة مجموعات البيانات في الأنظمة المفتوحة هذه خارج السوق تمامًا مع اتخاذ لوائح أكثر صرامة.
نشر لأول مرة يوم الثلاثاء ، 24 ديسمبر 2024












