نماذج ومنصات الذكاء الاصطناعي

SHOW-O: نموذج ترانسفورمر موحد للاستيعاب والتحليل متعدد الوسائط

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تحقق نموذج SHOW-O من تقدم كبير في مجال النماذج الكبيرة للغة، حيث يجمع بين فهم متعدد الوسائط وتوليد متعدد الوسائط في نموذج ترانسفورمر واحد. يعتمد SHOW-O على نموذج لغة مسبق التدريب ويمتد ليشمل تمثيلات الصور المنفصلة باستخدام معالج كمومي خالي من البحث. يتيح ذلك للنموذج التعامل مع مدخلات ومخرجات مختلفة ومختلطة من حيث الوسائط، ويدعم مجموعة واسعة من مهام رؤية-لغة، بما في ذلك الإجابة على الأسئلة البصرية وتوليد الصور النصية والتخفيض والإضافة النصية.

تم اختبار SHOW-O على مجموعة من البنود، بما في ذلك الإجابة على الأسئلة البصرية وتوليد الصور النصية. وقد أظهر أداءً قابلاً للمقارنة أو أفضل من النماذج الفردية مع عدد معادل أو أكبر من المعلمات، مما يبرز إمكاناته كنموذج أساسي للجيل التالي.

في هذا المقال، سنناقش SHOW-O، وهو نموذج ترانسفورمر موحد يدمج فهمًا متعدد الوسائط وتوليدًا متعدد الوسائط. على عكس النماذج الكاملة التوليدية، يجمع SHOW-O بين التوليد التوليدي والتخفيض الاختلافي لتعامل مع مدخلات ومخرجات مختلفة ومختلطة من حيث الوسائط.

يستند SHOW-O إلى نموذج لغة مسبق التدريب ويمتد ليشمل تمثيلات الصور المنفصلة باستخدام معالج كمومي خالي من البحث. يتيح ذلك للنموذج التعامل مع مدخلات ومخرجات مختلفة ومختلطة من حيث الوسائط، ويدعم مجموعة واسعة من مهام رؤية-لغة، بما في ذلك الإجابة على الأسئلة البصرية وتوليد الصور النصية والتخفيض والإضافة النصية.

SHOW-O: نموذج ترانسفورمر موحد للاستيعاب والتحليل متعدد الوسائط

في السنوات الأخيرة، ظهرت العديد من الدراسات حول نماذج اللغة الكبيرة متعددة الوسائط القادرة على الفهم والتوليد. بعض هذه الجهود تستخدم تمثيلات متواصلة مع توكنات نصية لتوليد الصور. ي提ق SHOW-O نموذجًا موحدًا وقابلًا للتطبيق لتعامل مع مهام الفهم والتوليد متعددة الوسائط.

يستخدم SHOW-O معالج كمومي خالي من البحث لتمثيل الصور، ويجمع بين التوليد التوليدي والتخفيض الاختلافي لتعامل مع مدخلات ومخرجات مختلفة ومختلطة من حيث الوسائط. يتيح ذلك للنموذج التعامل مع مدخلات ومخرجات مختلفة ومختلطة من حيث الوسائط، ويدعم مجموعة واسعة من مهام رؤية-لغة، بما في ذلك الإجابة على الأسئلة البصرية وتوليد الصور النصية والتخفيض والإضافة النصية.

تم اختبار SHOW-O على مجموعة من البنود، بما في ذلك الإجابة على الأسئلة البصرية وتوليد الصور النصية. وقد أظهر أداءً قابلاً للمقارنة أو أفضل من النماذج الفردية مع عدد معادل أو أكبر من المعلمات، مما يبرز إمكاناته كنموذج أساسي للجيل التالي.

SHOW-O: منهجية وهيكل

الهدف الرئيسي من إطار SHOW-O هو تطوير نموذج موحد يدمج التوليد التوليدي والتخفيض الاختلافي لتعامل مع مدخلات ومخرجات مختلفة ومختلطة من حيث الوسائط. يتناول SHOW-O هذه التحديات من خلال الحلول التالية:

  • SHOW-O يبني مساحة المدخلات والمخرجات عن طريق تمثيل النص والصورة في توكنات منفصلة.
  • SHOW-O يقدم هيكلاً افتراضيًا و استراتيجية تحفيز موحدة لتنسيق بيانات المدخلات والوسائط.
  • SHOW-O يظهر كيفية دمج التوليد التوليدي والتخفيض الاختلافي في نموذج ترانسفورمر واحد.
  • SHOW-O يقدم خط أنابيب تدريب ثلاثي المراحل لتدريب النموذج الموحد بشكل فعال.

التمثيل

نظرًا لأن SHOW-O مبني على نموذج لغة مسبق التدريب، فمن الطبيعي أن يتم التعلم الموحد في الفضاء المنفصل. من خلال الحفاظ على مفكرة موحدة تشمل توكنات نصية وصور منفصلة، يُكلف SHOW-O بنفس هدف التعلم: التنبؤ بالتوكنات المنفصلة.

تمثيل النص

SHOW-O مبني على نموذج لغة مسبق التدريب، ويتخدم نفس المعالج للنص بدون أي تعديلات.

تمثيل الصورة

يتبع SHOW-O MAGVIT-v2 لتدريب معالج كمومي خالي من البحث باستخدام حوالي 35 مليون بيانات صورة. يحتفظ المعالج بكتالوج بحجم 8192 ويكون الصور بدقة 256×256 في توكنات منفصلة 16×16. تم اختيار MAGVIT-v2 لسهولة تعديله، مما يجعله مناسبًا كمعالج فيديو بقدرة الضغط الزمني، وهو جانب يعتزم SHOW-O استكشافه في المستقبل.

الهيكل

ي继承 SHOW-O هيكل النماذج اللغوية الحالية بدون أي تعديلات هيكلية، باستثناء إضافة عملية QK-Norm إلى كل طبقة انتباه. يُشغل SHOW-O بأوزان نموذج لغة مسبق التدريب ويتوسع حجم طبقة التضمين ليشمل 8192 تضمينًا جديدًا قابلًا للتعلم لتوكنات الصور المنفصلة.

التحفيز الموحد

为了进行 التعلم الموحد على فهم و توليد متعدد الوسائط، يستخدم SHOW-O استراتيجية تحفيز موحدة لتنسيق مختلف أنواع بيانات المدخلات والوسائط.

آلية الانتباه الشاملة

على عكس الأعمال الحالية التي تُamodel السلاسل بشكل متسلسل فقط، يقدم SHOW-O آلية انتباه شاملة، مما يسمح له بتمثيل أنواع مختلفة من الإشارات بطرق مختلفة.

SHOW-O: التجارب والنتائج

تم اختبار SHOW-O على مجموعة من البنود، بما في ذلك الإجابة على الأسئلة البصرية وتوليد الصور النصية. وقد أظهر أداءً قابلاً للمقارنة أو أفضل من النماذج الفردية مع عدد معادل أو أكبر من المعلمات، مما يبرز إمكاناته كنموذج أساسي للجيل التالي.

المقارنات النوعية

تم تقديم المقارنات النوعية مع نماذج أخرى، بما في ذلك SDv1.5 و SDXL و LlamaGen.

التخفيض والإضافة النصية

يدعم SHOW-O التخفيض والإضافة النصية بشكل طبيعي بدون الحاجة إلى تعديل.

الافكار الختامية

في هذا المقال، ناقشنا SHOW-O، وهو نموذج ترانسفورمر موحد يدمج فهمًا متعدد الوسائط وتوليدًا متعدد الوسائط. على عكس النماذج الكاملة التوليدية، يجمع SHOW-O بين التوليد التوليدي والتخفيض الاختلافي لتعامل مع مدخلات ومخرجات مختلفة ومختلطة من حيث الوسائط.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.