نماذج ومنصات الذكاء الاصطناعي

نسر: استكشاف تصميم الفضاء لنموذج لغة كبير متعدد الوسائط باستخدام مزيج من المشفرات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

القدرة على تفسير المعلومات البصرية المعقدة بدقة هي محور رئيسي لنموذج لغة كبير متعدد الوسائط (MLLMs). أظهر العمل الحديث أن تحسين الإدراك البصري يقلل بشكل كبير من الهلوسة وتحسين الأداء على المهام الحساسة للقرار، مثل التعرف الضوئي على الحروف والتحليل الوثائقي. تحقق العديد من MLLMs الحديثة من هذا باستخدام مزيج من مشفرات الرؤية. على الرغم من نجاحها، هناك نقص في المقارنات النظامية والدراسات التخفيضية التفصيلية التي تتعامل مع الجوانب الحاسمة، مثل اختيار الخبراء ودمج خبراء الرؤية المتعددين. توفر هذه المقالة استكشافًا موسعًا لتصميم الفضاء لنموذج لغة كبير متعدد الوسائط باستخدام مزيج من مشفرات الرؤية والتصاميم، وإطار نسر الذي يحاول استكشاف تصميم الفضاء لنموذج لغة كبير متعدد الوسائط باستخدام مزيج من المشفرات. تظهر النتائج مبدأً أساسيًا مشتركًا للعديد من الاستراتيجيات الحالية، مما يؤدي إلى نهج تصميم مبسط وفعال. يكتشف نسر أن ببساطة إضافة الرموز البصرية من مجموعة من مشفرات الرؤية المكملة هي فعالة مثل هياكل الخلط أو الاستراتيجيات الأكثر تعقيدًا. بالإضافة إلى ذلك، يقدم نسر ما قبل التوجيه لجسر الفجوة بين مشفرات الرؤية المتخصصة في اللغة والرموز اللغوية، مما يعزز انسجام النموذج. يتجاوز عائلة نسر من MLLMs النماذج المفتوحة الرائدة الأخرى على معايير MLLM الرئيسية.

عمل نسر يتعلق بتصميم الهيكل العام لنموذج لغة كبير متعدد الوسائط (MLLMs). بالإضافة إلى خط البحث المفتوح المذكور سابقًا، تشمل عائلات MLLMs الأخرى الملحوظة، على سبيل المثال لا الحصر، MiniGPT-4 وLynx وOtter وQwenVL وCogVLM وVILA وGPT-4V وGemini وLlama 3.1. يعتمد تصنيف MLLMs على كيفية دمج إشارات الرؤية في نموذج اللغة، يمكن تصنيفها على نطاق واسع إلى نماذج “انتباه متقاطع” و”تعديل بادئة”. تعتبر الأولى إشارات بصرية إلى طبقات مختلفة من LLMs باستخدام انتباه متقاطع، بينما تعامل الأخيرة الرموز البصرية كجزء من تسلسل الرموز اللغوية ويتم إضافتها مباشرة مع التضمين اللغوي. ينتمي نموذج نسر إلى عائلة تعديل البادئة باتباع هيكل متعدد الوسائط على الطراز LLaVA.

يعمل نسر على تحسين تصميم مشفرات الرؤية لنموذج لغة كبير متعدد الوسائط. عادةً ما اعتمدت الأعمال المبكرة مشفرات الرؤية المسبقة على مهام محاذاة اللغة والرؤية مثل CLIP وEVA-CLIP. تم اقتراح مشفرات الرؤية الأقوى، مثل SigLIP وInternVL، لتعزيز مهام اللغة والرؤية بتصاميم أفضل وأحجام نموذج أكبر ووصفات تدريب أكثر فعالية. نظرًا لأن النماذج غالبًا ما يتم تدريبها على صور منخفضة الدقة ويمكن أن تفتقر إلى القدرة على ترميز التفاصيل الدقيقة، يتم تنفيذ التكيف مع دقة أعلى بشكل متكرر لزيادة دقة إدخال MLLM.

نسر: استخدام مزيج من المشفرات لاستكشاف تصميم الفضاء لنموذج لغة كبير متعدد الوسائط

نجاح نموذج لغة كبير (LLM) أثار اهتمامًا كبيرًا في تمكين قدرات الإدراك البصري، مما يسمح لهم بالرؤية والفهم والاستدلال في العالم الحقيقي. في قلب هذه النماذج من نموذج لغة كبير متعدد الوسائط (MLLMs) يوجد تصميم نموذجي حيث يتم تحويل الصور إلى سلسلة من الرموز البصرية بواسطة مشفرات الرؤية وإضافتها إلى التضمين اللغوي. غالبًا ما يتم اختيار CLIP كمشفر للرؤية لأن تمثيله البصري يتم محاذاته مع الفضاء اللغوي من خلال التدريب المسبق على أزواج الصورة والنص.

على سبيل المثال، يمكن أن تدمج نماذج مثل Mousi وBrave الرموز البصرية من مشفرات الرؤية المختلفة عن طريق إضافتها على طول الاتجاه القنوي أو الرموز. يقدم RADIO طريقة التبخير المتعدد للمعلمين لتوحيد قدرات مختلفة لمشفرات الرؤية في نموذج واحد. يستخدم MoAI وIVE وPrismer مخرجات خبراء الرؤية، مثل OCR أو الكشف أو تقدير العمق، لتعزيز معلومات إضافية لتنميط MLLMs.

أظهرت الدراسات الحديثة أن تصميمات مشفرات الرؤية الأقوى مهمة لتقليل هلوسة MLLM وتحسين الأداء على المهام الحساسة للقرار مثل التعرف الضوئي على الحروف. تركز العديد من الأعمال على تعزيز قدرة مشفر الرؤية، إما عن طريق توسيع بيانات التدريب ومتغيرات النموذج أو تقسيم الصور إلى قطع منخفضة الدقة.

نسر: منهجية وهيكل

على عكس الطرق السابقة التي تركز على استراتيجيات الدمج الجديدة أو الهياكل بين مشفرات الرؤية، يهدف نسر إلى تحديد تصميم معماري مبسط لدمج مشفرات الرؤية المختلفة، مدعومًا bằng الدراسات التخفيضية التفصيلية وإزالة أي مكونات غير ضرورية.

مشفر CLIP الأقوى

يبدأ نسر بالاستكشاف مع نموذج CLIP، لأنه أصبح الخيار الرئيسي للعديد من MLLMs. في حين أن نماذج CLIP معروفة بتعزيز المهام متعددة الوسائط، تم توثيق قيودها أيضًا.

نسر: التجارب والنتائج

مهام الإجابة على الأسئلة البصرية

يقارن نسر سلسلة النماذج عبر ثلاثة معايير للاستجواب البصري، بما في ذلك GQA وVQAv2 وVizWiz.

مهام التعرف الضوئي على الحروف وفهم الرسوم البيانية

للتقييم القدرات على التعرف الضوئي على الحروف والوثائق والرسوم البيانية لنسر، يتم اختبار النموذج على OCRBench وTextVQA وChartQA.

التقييم البenchmark متعدد الوسائط

يتم تقييم نسر على سبعة معايير لنموذج لغة كبير متعدد الوسائط لتحديد قدراته من مختلف الزوايا.

أفكار ختامية

في هذه المقالة، تحدثنا عن نسر، وهو تحليل عميق لتصميم الفضاء لدمج مشفرات الرؤية في نموذج لغة كبير متعدد الوسائط. على عكس الأعمال السابقة التي تركز على تصميم أنماط دمج جديدة، يجد نسر أن الخيارات التصميمية النظامية مهمة ويكتشف سلسلة من التقنيات المفيدة. خطوة خطوة، يُحسّن نسر وصفة التدريب لفرد مشفرات الرؤية، ويحدد طريقة دمج فعالة ومتوسعة، ويدمج تدريجياً مشفرات الرؤية مع معرفة مجال مختلفة. تسلط النتائج الضوء على الأهمية الحاسمة للconsiderations الفضاء التصميمي الأساسية.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.