نماذج ومنصات الذكاء الاصطناعي
فريت: أداء متفوق في مهام الإحالة والتعريف
تمكين فهم المجال في نماذج التعلم اللغة-الرؤية يبقى تحديًا أساسيًا في البحث. هذا الفهم يؤسس ل两个 khả năng حاسمة: الإحالة والتعريف. الإحالة تمكن النموذج من تفسير الدلالات الدقيقة للمناطق المحددة، بينما التعريف يتضمن استخدام الوصف الدلالي لتحديد هذه المناطق.
قد قدم المطورون فريت، نموذج لغة كبير متعدد الوسائط (MLLM) ، قادر على فهم الإحالة المكانية عبر أي دقة أو شكل في الصورة وتحديد الوصف الدلالي المفتوح للفئات. يستخدم فريت تمثيلًا هجينًا جديدًا يجمع بين الميزات المستمرة والتنسيق المنفصل لتمثيل مناطق الصورة. يمكن لمعرف الصورة المكاني في فريت التعامل مع تنوع في الكثافة في الأشكال، مما يسمح له بمعالجة مدخلات منطقة متنوعة مثل الأشكال الحرة والصندوق والنقاط.
يتمكن نموذج فريت من التميز في مهام الإحالة والتعريف الكلاسيكية وتجاوز نماذج MLLM الأخرى في مهام الاتصال المتعددة الوسائط التي تتطلب تحديد الموقع. هذا المقال يغوص في هيكل فريت وطريقة عمله، مع إبراز أدائه المثير للإعجاب في مهام لغة متعددة الوسائط المختلفة. دعونا نستكشف هذا أكثر.
فريت: أداء متفوق في مهام الإحالة والتعريف
الإحالة في النموذج هي khả năng تسمح للنموذج بفهم الدلالات الدقيقة للمناطق المحددة، بينما التعريف يجعل من الضروري للنموذج استخدام الوصف الدلالي لتحديد المناطق. على الرغم من أن لديهم مهام مختلفة، فإن الإحالة والتعريف لديهما نفس المفهوم الأساسي: محاذاة الدلالات المكانية والمعلومات. ومع ذلك، على الرغم من مشاركتهما نفس المفهوم، فإن النماذج الحالية تتعلم التعريف والإحالة بشكل فردي. و尽管 هذه الطريقة تعمل، إلا أنها تطرح عقبة في تحقيق القدرات البشرية المماثلة، حيث يمكن للبشر تعلم مهام واحدة وتطبيقها بسهولة على مهام أخرى، ودمج khả năng التعريف والإحالة مع التفكير والحوار اليومي بسهولة. يأخذ إطار فريت الإلهام من الفجوة المذكورة في إطارات MLLM الحالية ويدرس ثلاثة أسئلة رئيسية:
- كيفية توحيد khả năng التعريف والإحالة في الإطار، وكيف ستفيد كل منهما الآخر؟
- كيف يمكن تمثيل المناطق المتعددة مثل الصندوق والنقطة والخطوط الحرة التي يستخدمها البشر للإحالة؟
- كيف يمكن جعل التعريف والإحالة متابعة للتعليمات، وقوية، ومفتوحة، وهي أمور حاسمة للتطبيقات العملية والزمنية الحقيقية؟
إطار فريت هو نموذج لغة كبير متعدد الوسائط جديد يحاول استهداف هذه الأسئلة. يختار إطار فريت نموذج لغة كبير متعدد الوسائط كأساس له، نظرًا لقدراته الرائعة في رؤية اللغة العالمية وفهمها. بالإضافة إلى ذلك، لتوحيد khả năng التعريف والإحالة، يrepresent إطار فريت إحداثيات المناطق في شكل رقمي طبيعي. ومع ذلك، في الممارسة، من غير الكفاءة استخدام إحداثيات الصندوق أو حتى النقاط لتمثيل أشكال مناطق متعددة مثل الخطوط الحرة أو الأشكال المعقدة، لأن هذه الأشكال حاسمة لتحسين الدقة والتفاعل البشري-النموذج الأكثر عالمية. لمواجهة هذه المشكلة، يستخدم إطار فريت معرضًا مرئيًا مكانيًا يكتسب المناطق المرئية للمناطق بغض النظر عن الشكل، ويتعامل مع تباين الكثافة في هذه الأشكال. ثم يجمع الإطار الميزات المرئية المستمرة مع الإحداثيات المنفصلة لتمثيل المناطق المرئية في المدخلات، مما يؤدي إلى إنشاء تمثيل منطقة هجين في فريت.
يستخدم إطار فريت الطرق المذكورة أعلاه لحل المدخلات التي تختلط بين النص الحر والمناطق المشار إليها، وقادر على توليد إحداثيات لكل كائن قابل للتعريف مع توليد نص لتعريف الكائنات المذكورة في الإخراج. من خلال القيام بذلك، يصبح فريت أول إطار يمكنه معالجة مدخلات المناطق الحرة الشكل في نماذج اللغة الكبيرة المتعددة الوسائط.
فريت: منهجية وهيكل
تمثيلات المنطقة الهجينة
النقطة والصندوق والأشكال الحرة هي ثلاثة صيغ سائدة يستخدمها نموذج اللغة عند الإحالة إلى مناطق محددة. من ناحية، يمكن تمثيل النقطة والصندوق بدقة بواسطة الإحداثيات، مما يجعل من الصعب تمثيل الأشكال الحرة لأنها متعددة. يمكن للأشكال الحرة أن تشمل مجموعة واسعة من المناطق، بما في ذلك Masks والpolygons والخطوط. استخدام الإحداثيات لتمثيل الأشكال الحرة هو مهمة معقدة وغالبًا ما تكون باهظة التكلفة ومبهمة.
لمواجهة هذه المشكلة، يقترح إطار فريت تمثيلًا هجينًا للمنطقة يجمع بين الميزات المرئية المستمرة والإحداثيات المنفصلة لتمثيل منطقة معينة.
الهيكل
يتكون هيكل نموذج فريت من ثلاثة مكونات رئيسية:
- مُشفر الصورة لاستخراج مُضمنات الصورة.
- عينة مرئية مكانية لاستخراج الميزات المستمرة للمناطق.
- نموذج لغة كبير لنمذجة النص والصورة والمنطقة بشكل مشترك.
تتم تغذية الصورة أولاً إلى مشفر الصورة المُسبق للتدريب لاستخراج مُضمنات الصورة. بالنسبة للمدخلات النصية، يستخدم الإطار أولاً مشفر نموذج اللغة الكبير المُسبق للتدريب لتحويل تسلسل النص إلى رموز، ثم يعرض هذه الرموز إلى مُضمنات النص.对于 المناطق المشار إليها، ي追加 فريت رمزًا خاصًا وإحداثيات كمكانة للميزات المستمرة بعد اسم المنطقة. إذا كان اسم المنطقة غير معروف أو معقد لوصفه بسبب وجود عدة كائنات، يستخدم الإطار فقط المنطقة أو اسم المنطقة.
توليد البيانات المرئية بمساعدة GPT
بيانات تعليم التعليمات الحساسة للتعليمات هي أمر بالغ الأهمية لنماذج اللغة الكبيرة المتعددة الوسائط. هذه البيانات لا تساعد فقط في تحويل مجموعات البيانات الحالية بواسطة قوالب، ولكنها تساعد أيضًا النموذج على فهم النية البشرية وتوليد استجابات مناسبة. يستخدم معظم نماذج MLLM طريقة التهييج القليلة للحصول على بيانات تعليم التعليمات، حيث يقدم النموذج وصفًا نصيًا للمشاهد في الصورة جنبًا إلى جنب مع حوارات بشرية مُحسنة كتهييجات قليلة.
然而، فإن طرق تعليم التعليمات الحالية تركز بشكل رئيسي على وصف الصورة كاملة دون تحديد المعلومات المكانية بشكل صريح. يؤكد إطار فريت على المعرفة القائمة على المنطقة لجمع بيانات تعليم الإحالة والتعريف في ثلاث خطوات:
- بالإضافة إلى استخدام العناوين العالمية والكائنات، يوفر الإطار وصفًا رمزيًا للمشهد يصف العلاقة الفيزيائية بين عناوين المنطقة والكائنات، بالإضافة إلى إحداثياتها.
- 对于 الحوارات المُحسنة من البشر، يضيف الإطار إحداثيات بعد كائنات أو مناطق قابلة للتعريف في المدخلات أو الإخراج أو كليهما، مع التركيز على المناطق المحددة التي تساعد في تحفيز النموذج اللغوي بشكل غير صريح لمتابعة الأنماط المماثلة لتوليد حوارات جديدة.
- قد يكون من الممكن أن الحوارات التي يولدها الإطار لا تتبع القواعد والأنماط كما هو موضح في الأمثلة القليلة والتحفيزات. لمواجهة هذه المشكلة، يستخدم الإطار مرة أخرى نموذج اللغة لتطوير الحوارات التي يولدها النموذج في البداية.
تعدين سالب مكاني
أظهر البحث السابق أن نماذج اللغة الكبيرة المتعددة الوسائط لها احتمال كبير للخداع عند الاستجابة لأسئلة نعم أو لا. لضمان أن نموذج فريت لا يخدع في ظروف مماثلة، يستخدم الإطار نهج تعدين سالب مكاني مع تحديد موقع الفئة المشروطة بالصورة وتحديد موقع الفئة المشروطة بالدلالات. كلاهما يسأل النموذج عن تحديد فئات كائنات معينة، مما يسمح للنموذج بالتعرف على غياب كائنات معينة في الصورة.
فريت: نتائج وتجارب
为了 تحليل أدائه، يتم تقييم إطار فريت على معايير التأسيس التقليدية للإحالة والتعريف، ثم يتم تقييمه في مهمة محادثة متعددة الوسائط أكثر تعقيدًا واختبار khả năng الإحالة والتعريف.
يتم تقييم khả năng الإحالة للنموذج من خلال دقة فهمه للدلالات للمنطقة المشار إليها في الصورة أو السؤال. Để قياس دقة النموذج، يتم النظر إلى الكائنات، وهو المعنى الأساسي، أولاً لأنها ليست فقط أساسية ولكن أيضًا سهلة التعريف. Để محاكاة المرونة البشرية، يستبدل الإطار موقع الكائن داخل الصورة بشكل حر، صندوق، ونقطة.对于 الشكل الحر، يولد النموذج عشوائيًا خطوطًا داخل الكائن الحقيقي للتحاكي.对于 الصندوق، يستخدم إطار فريت صندوق التحديد الحقيقي المحدد بواسطة مكون LVIS. وأخيرًا، بالنسبة للنقطة، ي chọn النموذج عشوائيًا نقطة داخل الكائن الحقيقي بالقرب من حدود الكائن الحقيقي. يتم عرض النتائج على ثلاثة أنواع من الإحالة في الصورة التالية.
يظهر إطار فريت أداءً ممتازًا في مهام الحوار الإحالي، مما يفتح المجال لدمجها مع مهام التعلم المرئي المختلفة، خاصة تلك التي تنتج تعريفات مكانية.Để تقييم khả năng التعريف، يخضع إطار فريت أولاً لمهام التأسيس المرئي مع نموذج توليد. ثم يتم تقييم khả năngه على مهام التعريف المحدد لقياس محاذاة المناطق والكلمات.
في مهام التأسيس المرئي، يهدف الإطار إلى ربط استفسارات اللغة مع مناطق محددة في الصورة، كما يمكن رؤية أدائه الممتاز عبر جميع المعايير، وأدائه مشابه لأداء الطرق المتخصصة المحددة.
对于 مهام التعريف المحدد، يحتاج النموذج إلى توليد تعريف، ثم ربط تعبيرات الاسم المحددة بالمناطق في الصورة. يتكون التنبؤ النهائي للنموذج من ثلاثة مكونات: مناطق مرئية كأ砂وق، نصوص تعريفية، وترابطات ربط بين الصندوق والكلمات. يتم عرض النتائج في الصورة التالية، ويمكن ملاحظة أن الإطار يوفر أداءً مشابهًا لأفضل الطرق الحالية.
أخيرًا، المحادثة المتعددة الوسائط هي واحدة من القدرات الأكثر رغبة في نماذج اللغة الكبيرة المتعددة الوسائط. يتم تقييم khả năng الإحالة والتعريف في مهام المحادثة المتعددة الوسائط من خلال ثلاثة أسئلة قائمة على المنطقة. يتم عرض النتائج في الصورة التالية.
أفكار ختامية
في هذه المقالة، تحدثنا عن فريت، نموذج لغة كبير متعدد الوسائط يظهر أداءً ممتازًا في khả năng التعريف والإحالة. يمكن لإطار فريت الإحالة إلى مناطق الصورة بغض النظر عن شكلها، ويمكنه تحديد التعريف تلقائيًا. يستخدم فريت معرضًا مرئيًا مكانيًا يمكنه التعامل مع تباين الكثافة في الأشكال المختلفة، مما يسمح له بمعالجة مدخلات منطقة متنوعة مثل الأشكال الحرة والصندوق والنقاط.












