نماذج ومنصات الذكاء الاصطناعي
توجيه تعديل الصور عبر نماذج اللغة الكبيرة متعددة الوسائط
أدوات التصميم البصري ونمذجة اللغة البصرية لها تطبيقات واسعة في صناعة الوسائط المتعددة. على الرغم من التقدم الكبير في السنوات الأخيرة، لا تزال هناك حاجة إلى فهم قوي لتشغيل هذه الأدوات. لتحسين سهولة الوصول والتحكم، تعتمد صناعة الوسائط المتعددة بشكل متزايد تقنيات تعديل الصور القائمة على النص أو التوجيه. تستخدم هذه التقنيات أوامر اللغة الطبيعية بدلاً من أقنعة الإقليم التقليدية أو الوصف المفصل، مما يسمح بتعديل الصور أكثر مرونة وسيطرة. ومع ذلك، فإن الأساليب القائمة على التوجيه غالبًا ما توفر إرشادات موجزة قد يكون من الصعب على النماذج الحالية التقاطها وتطبيقها بالكامل.
علاوة على ذلك، أظهرت نماذج اللغة الكبيرة متعددة الوسائط أداءً مثيرًا للإعجاب في المهام التي تتضمن توليد استجابات بصرية وفهماً عبر الوسائط. يُعتبر تعديل الصور الموجه بواسطة نماذج اللغة الكبيرة متعددة الوسائط (MGIE) دراسة مستوحاة من نماذج اللغة الكبيرة متعددة الوسائط، وتحليل كيفية دعمها للتعديل من خلال النص أو التوجيه. يتضمن هذا النهج تعلم توفير توجيهات صريحة واشتقاق تعليمات تعبيرية. يفهم نموذج تعديل MGIE المعلومات البصرية ويقوم بالتعديلات من خلال التدريب من النهاية إلى النهاية.
تعديل الصور الموجه بواسطة نماذج اللغة الكبيرة متعددة الوسائط أو MGIE: مقدمة
نماذج اللغة الكبيرة متعددة الوسائط ونمذجة الانحلال هي两个 من الإطارات الأكثر استخدامًا في مجال الذكاء الاصطناعي والتعلم الآلي حاليًا، نظرًا لقدراتهما التوليدية المذهلة. من ناحية، لديك نماذج الانحلال، التي تشتهر بإنتاج صور واقعية وجميلة بصريًا، في حين أن نماذج اللغة الكبيرة متعددة الوسائط مشهورة بقدرتها الاستثنائية في توليد مجموعة واسعة من المحتوى، بما في ذلك النص واللغة والكلام والصور/الفيديوهات.
نماذج الانحلال تتかわم مع الخرائط العابرة للوسائط لت执行 التلاعب البصري الذي يعكس تغيير كبسة الغرض، ويمكنها أيضًا استخدام قناع توجيهي لتحرير منطقة محددة من الصورة. ولكن السبب الرئيسي لاستخدام نماذج الانحلال على نطاق واسع في التطبيقات المتعددة الوسائط هو أنها تستخدم نهج تعديل قائم على التوجيه، مما يسمح للمستخدمين بالتعبير عن كيفية تحرير الصورة مباشرةً باستخدام أوامر النص أو الأوامر.
نماذج اللغة الكبيرة لا تحتاج إلى مقدمة، لأنها أظهرت تقدمًا كبيرًا في مجموعة متنوعة من المهام اللغوية، بما في ذلك تلخيص النص والترجمة الآلية وتوليد النص والإجابة على الأسئلة. عادةً ما يتم تدريب نماذج اللغة الكبيرة على كمية كبيرة ومتنوعة من بيانات التدريب، مما يزويدها بالخلقية البصرية والمعرفة، وتمكنها من أداء مهام لغة بصرية متعددة.
MGIE: الهيكل والمنهجية
تقليدًا، تم استخدام نماذج اللغة الكبيرة في مهام التوليد اللغوي. ولكن منذ أن أصبحت نماذج اللغة الكبيرة متعددة الوسائط شائعة، تمت إمكانية نماذج اللغة الكبيرة لتزويد استجابات معقولة من خلال تصور الصور.
تعليمات موجزة وواضحة
تقليدًا، يمكن لنماذج اللغة الكبيرة متعددة الوسائط تقديم استجابات متعلقة بالرؤية مع إدراكها عبر الوسائط بفضل التوجيه والتنسيق.
تعديل الصور بالتخيل البصري
في الخطوة التالية، يستخدم إطار MGIE رأس التحرير لتحويل توجيه الصورة إلى توجيه بصرية حقيقية.
تعلم MGIE
يُظهر الشكل التالي خوارزمية عملية التعلم الخاصة بإطار MGIE.
MGIE: النتائج والتقييم
يستخدم إطار MGIE مجموعة بيانات IPr2Pr كبيانات التدريب الأساسية، والتي تحتوي على أكثر من مليون بيانات مرشحة بواسطة CLIP مع تعليمات مستخرجة من نموذج GPT-3 ونموذج Prompt-to-Prompt لتحليل الصور.
التحليل الكمي
يُظهر الشكل التالي نتائج التحرير في إعداد بدون توجيه مع نماذج مدربة فقط على مجموعة بيانات IPr2Pr.
النتائج النوعية
يُظهر الشكل التالي نتائج تحليل نوعية لإطار MGIE.
أفكار ختامية
في هذه المقالة، ناقشنا MGIE أو تعديل الصور الموجه بواسطة نماذج اللغة الكبيرة متعددة الوسائط، وهو دراسة مستوحاة من نماذج اللغة الكبيرة متعددة الوسائط، يهدف إلى تقييم نماذج اللغة الكبيرة متعددة الوسائط وتحليل كيفية دعمها للتعديل باستخدام النص أو التوجيه.












