زاوية Anderson
حل فريد لـ DALL-E 2 لمعاني الكلمات المزدوجة

من يتعلم الإيطالية يتعلم في وقت مبكر أن ي chú ý إلى السياق عند وصف مكنسة ، لأن الكلمة الإيطالية لهذا العنصر المنزلي المعتاد لها معنى ثاني غير لائق للغاية كفعل *. على الرغم من أننا نتعلم في وقت مبكر كيفية فصل الخريطة الدلالية والملاءمة للمفاهيم ذات المعاني المتعددة ، إلا أن هذا ليس مهارة سهلة النقل إلى أنظمة合성 الصور الهائلة مثل DALL-E 2 و Stable Diffusion ، لأنها تعتمد على وحدة OpenAI للتدريب المتناقض للغة والصورة ( CLIP ) ، والتي تعامل الكائنات وخصائصها بشكل أكثر مرونة (ومع ذلك ، فهي تكتسب أرضًا متزايدة في فضاء合성 الصور والفيديو اللاتنتي)
دراسة هذا النقص ، تقدم تعاون بحثي جديد من جامعة بار إيلان ومعهد الذكاء الاصطناعي ألين دراسة شاملة حول مدى تميل DALL-E 2 إلى هذه الأخطاء الدلالية:

معاني مزدوجة منفصلة إلى تفسيرات متعددة في DALL-E 2 – على الرغم من أن أي نظام انتشار لاتنتي يمكن إنتاج مثل هذه الأمثلة. في الصورة العلوية اليمنى ، يغير إزالة ‘الذهب’ من العبارة نوع السمكة ، بينما في حالة ‘عبور الزبرا’ ، من الضروري تحديد سطح الطريق بشكل صريح لإزالة الارتباط المكرر. مصدر: https://export.arxiv.org/pdf/2210.10606
وجد المؤلفون أن هذه النزعة إلى تفسير الكلمات والعبارات بشكل مزدوج لا تبدو مشتركة بين جميع نماذج الانتشار التي توجيهها CLIP ، وأنها تزداد سوءًا随ًا مع زيادة كمية البيانات التي يتم تدريب النماذج عليها. وتشير الورقة إلى أن ‘الإصدارات المخفضة’ من نماذج الصورة إلى النص ، بما في ذلك DALL-E Mini (الآن Craiyon) ، تنتج هذه الأخطاء بنسبة أقل ، وأن Stable Diffusion أيضًا يخطئ بنسبة أقل – على الرغم من أنه في كثير من الأحيان ، لا يتبع العبارة على الإطلاق ، وهو نوع آخر من الأخطاء.
… (translation continues)












