نماذج ومنصات الذكاء الاصطناعي
LLaVA-UHD: يستوعب الصور بفعالية في أي نسبة عرض إلى ارتفاع وبدقة عالية
قد شهدت التطورات الحديثة في مجال النماذج اللغة الكبيرة زيادة كبيرة في قدرات التفكير والفهم والتفاعل بين اللغة والرؤية. وتحقق الإطارات الحديثة ذلك من خلال إسقاط الإشارات البصرية إلى النماذج اللغة الكبيرة لتمكينها من تفسير العالم بصريًا، ومجموعة من السيناريوهات التي تعتمد على استراتيجيات الترميز البصري. ومع ذلك، فإن الصور في العالم الحقيقي لا تحتوي فقط على مجموعة من السيناريوهات، ولكنها تختلف أيضًا بشكل كبير فيما يتعلق بالدقة والنسبة العرضية، مما يطرح تحديات كبيرة للنماذج اللغة الكبيرة عبر مختلف المجالات والمهام. لمواجهة التباين الكبير الذي تطرحه الصور في العالم الحقيقي، تعمل النماذج اللغة الكبيرة الحديثة على استيعاب الصور بدقة منخفضة (على سبيل المثال، 224×224) ونسبة عرضية ثابتة (1:1) لتوفير الصور في التطبيقات الحقيقية. ومع ذلك، فإن هذا الاختزال يؤدي غالبًا إلى تقليل وضوح الصورة وتشويه الشكل، مما يؤثر على قدرات النماذج الكبيرة متعددة الوضعية، خاصة تلك المُحسنة لمهام دقيقة مثل التعرف على الحروف البصرية وفهم الأجسام الصغيرة. منذ أن يتم تحديد الدقة والنسبة العرضية مسبقًا، يمكن للنماذج أن تتخيل فقط الصور المُبهمة، مما يؤدي إلى هلوسة النموذج، حيث تنتج النموذج استجابات نصية لا تُعتمد على الحقائق في الصور.
في هذا المقال، سنناقش LLaVA-UHD، وهي نهج جديد يأخذ الإطارات LLaVA-1.5 وGPT-4V كمثالين تمثيليين، ويتصرف لمواجهة العيوب النظامية الجذرة في استراتيجية الترميز البصري الخاصة بهم. إطار LLaVA-UHD، وهو نموذج متعدد الوضعية، يحاول مواجهة التحديات. يمكن لإطار LLaVA-UHD استيعاب الصور بدقة عالية وبدقة عرضية متغيرة. يتكون إطار LLaVA-UHD من ثلاثة مكونات رئيسية. أولًا، استراتيجية ترميز بصرية مُجزئة تقسم الصور بدقة الأصل إلى شرائح متغيرة الحجم لتعزيز الكفاءة وتوسيع الترميز. ثانيًا، وحدة ضغط تُكثف الرموز البصرية التي تنتجها المُشفرات البصرية إلى طول معتدل، مما يؤدي إلى تقليل الحسابات بشكل كبير. أخيرًا، مخطط مكاني يُنسق الرموز الشريحية للنماذج اللغة الكبيرة. تشير التجارب الشاملة إلى أن إطار LLaVA-UHD يمكنه تحقيق أداء أفضل من النماذج اللغة الكبيرة الحالية في 9 معايير. بالإضافة إلى ذلك، باستخدام فقط 94% من حسابات الاستدلال، يمكن لإطار LLaVA-UHD دعم الصور بدقة 6 مرات أكبر (672×1088).
LLaVA-UHD: يستوعب الصور بفعالية في أي نسبة عرض إلى ارتفاع وبدقة عالية
قد شهدت التطورات الحديثة في مجال النماذج اللغة الكبيرة زيادة كبيرة في قدرات التفكير والفهم والتفاعل بين اللغة والرؤية. وتحقق الإطارات الحديثة ذلك من خلال إسقاط الإشارات البصرية إلى النماذج اللغة الكبيرة لتمكينها من تفسير العالم بصريًا، ومجموعة من السيناريوهات التي تعتمد على استراتيجيات الترميز البصري. ومع ذلك، فإن الصور في العالم الحقيقي لا تحتوي فقط على مجموعة من السيناريوهات، ولكنها تختلف أيضًا بشكل كبير فيما يتعلق بالدقة والنسبة العرضية، مما يطرح تحديات كبيرة للنماذج اللغة الكبيرة عبر مختلف المجالات والمهام.
هناك两个 سبب رئيسي لعدم قدرة النماذج اللغة الكبيرة على استيعاب الصور بدقة عالية وبدقة عرضية متغيرة. أولًا، نظرًا لأن المُشفرات البصرية مُتدربة على دقة ثابتة، فمن الصعب على النموذج والمُشفر التعامل مع الصور بدقة عرضية متغيرة، مما يؤثر بشكل كبير على مرونة النموذج. ثانيًا، فإن ترميز الصور بدقة عالية مباشرةً باستخدام المُحول البصري يتطلب تكلفة حسابية كبيرة، وتؤدي مشاكل خارج التوزيع إلى تدهور الأداء.
للمواجهة هذه التحديات، يأخذ إطار LLaVA-UHD الإطارات LLaVA-1.5 وGPT-4V كمثالين تمثيليين، ويتصرف لمواجهة العيوب النظامية الجذرة في استراتيجية الترميز البصري الخاصة بهم.

في صورة أعلاه، تظهر نتائج تجربة GPT-4V في تحديد عدد الأجسام في الصورة. يتكون إطار LLaVA-UHD من ثلاثة مكونات رئيسية. أولًا، استراتيجية ترميز بصرية مُجزئة تقسم الصور بدقة الأصل إلى شرائح متغيرة الحجم لتعزيز الكفاءة وتوسيع الترميز. ثانيًا، وحدة ضغط تُكثف الرموز البصرية التي تنتجها المُشفرات البصرية إلى طول معتدل، مما يؤدي إلى تقليل الحسابات بشكل كبير. أخيرًا، مخطط مكاني يُنسق الرموز الشريحية للنماذج اللغة الكبيرة.
LLaVA-UHD: منهجية وعمارة
بناءً على دروس من بعض التجارب الطيارية لدراسة الإطارات الحالية، بما في ذلك GPT-4V وLLaVA-1.5، يطبق إطار LLaVA-UHD هيكلًا مكونًا من ثلاثة مكونات كما هو موضح في الصورة التالية.

أولًا، استراتيجية ترميز بصرية مُجزئة تقسم الصور بدقة الأصل إلى شرائح متغيرة الحجم لتعزيز الكفاءة وتوسيع الترميز. ثانيًا، وحدة ضغط تُكثف الرموز البصرية التي تنتجها المُشفرات البصرية إلى طول معتدل. أخيرًا، مخطط مكاني يُنسق الرموز الشريحية للنماذج اللغة الكبيرة.
ترميز بصرية مُجزئة
من الطرق الشائعة للتعامل مع الصور بدقة عالية وبدقة عرضية متغيرة هي تحويل التضمين المكاني للتحويل البصري أو ViT إلى الشكل المستهدف لترميز مباشر ككل. ومع ذلك، فإن تنفيذ هذا النهج غالبًا ما يرافقه تكاليف حسابية عالية، وتؤدي مشاكل خارج التوزيع إلى تدهور الأداء.
للمواجهة هذا التحدي، يقدم إطار LLaVA-UHD استراتيجية ترميز بصرية مُجزئة تهدف إلى تقسيم الصور بدقة الأصل إلى شرائح متغيرة الحجم. نظرًا لاستخدام شرائح متغيرة الحجم، يمكن لإطار LLaVA-UHD تحقيق مرونة كاملة للصور بدقة الأصل دون تنفيذ أي تحويل تشويهي أو حشو.
طبقة الضغط
من المشاكل الشائعة التي تواجه النماذج اللغة الكبيرة عند معالجة الصور بدقة عالية هو أن عدد الرموز البصرية التي يجب معالجتها كبير للغاية (على سبيل المثال، ينتج إطار LLaVA-1.5 حوالي 3500 رمز بصرية عند معالجة صورة واحدة بدقة 672×1008).
للمواجهة هذا التحدي، يطبق إطار LLaVA-UHD طبقة مُشاركة لمُعاود الت_sampling لضغط الرموز البصرية لكل شريحة صورة.
مخطط مكاني للشرائح الصورية
من الضروري إبلاغ النموذج اللغة الكبيرة بتنظيم الشرائح الصورية بشكل مكاني، نظرًا لأن تقسيم الصور ديناميكي عبر الصور المختلفة.
LLaVA-UDH: التجارب والنتائج
تم تقييم إطار LLaVA-UHD مقابل 9 معايير شائعة، بما في ذلك معايير الأسئلة البصرية العامة، والأسئلة البصرية القائمة على الحروف، ومعيار الهلوسة، والمعايير الشاملة.
تم تلخيص أداء إطار LLaVA-UHD على 9 معايير شائعة، ومقارنته بمعايير شائعة في الجدول التالي.

بناءً على الأداء السابق، يمكن الاستنتاج أن إطار LLaVA-UHD يمكنه تحقيق أداء أفضل من النماذج القوية في المعايير الشائعة، بما في ذلك النماذج القوية المُدرجة على كمية كبيرة من البيانات، بالإضافة إلى تحقيق نتائج أفضل من إطار LLaVA-1.5.


أفكار ختامية
في هذا المقال، ناقشنا إطار LLaVA-UHD، وهو نهج جديد يأخذ الإطارات LLaVA-1.5 وGPT-4V كمثالين تمثيليين، ويتصرف لمواجهة العيوب النظامية الجذرة في استراتيجية الترميز البصري الخاصة بهم.












