زاوية Anderson

هل يعتبر DALL-E 2 مجرد “لصق الأشياء معًا” دون فهم علاقاتها؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

يقترح بحث جديد من جامعة هارفارد أن إطار عمل DALL-E 2 من OpenAI ، الذي يعتبر الأكثر شهرة ، يعاني من صعوبات ملحوظة في إعادة إنتاج العلاقات حتى على مستوى الطفل بين العناصر التي يجمعها في الصور الم 합نثة ، على الرغم من تعقيد العديد من الإخراجات المذهلة.

أجرى الباحثون دراسة مع 169 مشاركًا من مصادر جماعية ، الذين تم تقديم لهم صور DALL-E 2 بناءً على مبادئ أساسية للبشر في معاني العلاقات ، إلى جانب نصوص الدعوة التي أنشأوها. عندما سُئلوا عما إذا كانت الدعوات والصور متعلقة ، كانت أقل من 22٪ من الصور تُعتبر ذات صلة بالدعوات المرتبطة بها ، من حيث العلاقات البسيطة جدًا التي طُلب من DALL-E 2 تجسيد haar.

لقطة شاشة من التجارب التي أجريت للورقة الجديدة. تم تكليف المشاركين باختيار جميع الصور التي تطابق الدعوة. على الرغم من الإشعار في الجزء السفلي من الواجهة ، في جميع الحالات ، كانت الصور ، دون علم المشاركين ، تم إنشاؤها من الدعوة المرتبطة المعروضة.

لقطة شاشة من التجارب التي أجريت للورقة الجديدة. Source: https://arxiv.org/pdf/2208.00005.pdf

تشير النتائج أيضًا إلى أن قدرة DALL-E 2 على ربط عناصر منفصلة قد تتناقص随ًا مع انخفاض احتمال حدوث هذه العناصر في بيانات التدريب الفعلية التي تعمل بها.

على سبيل المثال ، حصلت الصور للدعوة “طفل يلمس وعاء” على نسبة موافقة 87٪ (أي أن المشاركين نقروا على معظم الصور كونها ذات صلة بالدعوة) ، في حين أن التصورات الفوتوغرافية المتطابقة ل “قرد يلمس إغوانا” حققت نسبة موافقة 11٪ فقط:

يعاني DALL-E من描绘 الحدث غير المحتمل لـ

يعاني DALL-E من描绘 الحدث غير المحتمل لـ “قرد يلمس إغوانا”.

في المثال الثاني ، غالبًا ما يخطئ DALL-E 2 في الحجم و حتى النوع ، على الأرجح بسبب نقص الصور الحقيقية التي تصور هذا الحدث. من ناحية أخرى ، من المعقول توقع عدد كبير من الصور التدريبية المتعلقة بالأطفال والغذاء ، و أن هذا النطاق / الفئة قد تم تطويره جيدًا.

يُظهر صعوبة DALL-E في الجمع بين عناصر الصورة المتضادة بشدة أن الجمهور目前 متأثر جدًا بقدرات النظام الفوتوغرافية والتفسيرية الواسعة النطاق ، بحيث لم يطور عينًا نقدية لcases حيثシステム قد “لصق” ببساطة عنصرًا واحدًا بشكل صارخ على آخر ، كما هو الحال في هذه الأمثلة من الموقع الرسمي DALL-E 2:

تركيب合成 ، من الأمثلة الرسمية لـ DALL-E 2. Source: https://openai.com/dall-e-2/

تركيب合成 ، من الأمثلة الرسمية لـ DALL-E 2. Source: https://openai.com/dall-e-2/

ما وراء الانتقادات المبكرة

في تعليق على “حيلة السحر” وراء واقعية وصحة إخراج DALL-E 2 ، يشير المؤلفون إلى أعمال سابقة وجدت عيوبًا في أنظمة الصور التوليدية من نوع DALL-E.

في يونيو من هذا العام ، أشار جامعة كاليفورنيا ، بيركلي ، إلى صعوبة DALL-E في التعامل مع الانعكاسات والظلال ؛ في نفس الشهر ، قامت دراسة من كوريا بالتحقيق في “الunicity” وأصالة إخراج DALL-E 2 بنظرة نقدية ؛ وتحليل أولي لصور DALL-E 2 ، بعد إطلاقه ، من جامعة نيويورك وجامعة تكساس ، وجدت مشاكل مختلفة مع التركيبية و其他 عوامل أساسية في صور DALL-E 2 ؛ وأخيرًا ، في الشهر الماضي ، قدمت عمل مشترك بين جامعة إلينوي ومعهد ماساتشوستس للتكنولوجيا اقتراحات لتحسينات معمارية ل这样的 أنظمة من حيث التركيبية.

يشير الباحثون أيضًا إلى أن أضواء DALL-E مثل Aditya Ramesh قد اعترفوا بمشاكل الإطار في الربط ، والحجم النسبي ، والنص ، والمحاور الأخرى.

كما اقترح مطورو نظام合成 الصور المنافس لجوجل ، Imagen ، نظامًا جديدًا للمقارنة يسمى DrawBench ، الذي يقيس دقة الصورة عبر الإطارات بمقاييس متنوعة.

بدلاً من ذلك ، يشير مؤلفو الورقة الجديدة إلى أن النتيجة قد تكون أفضل إذا ما تم الحكم على تقديرات البشر – بدلاً من المقاييس الخوارزمية الداخلية – ضد الصور الناتجة ، لتحديد أين تكمن الضعف ، وما يمكن القيام به للتخفيف منها.

الدراسة

بهذا المعنى ، يعتمد مشروع جديد على مبادئ نفسية ، ويتطلع إلى التراجع عن الاهتمام الحالي ب “هندسة الدعوة” (التي تعتبر في الواقع اعترافًا بضعف DALL-E 2 ، أو أي نظام مقارن) ، للتحقيق في القيود التي تجعل من هذا النوع من “الحيل” ضروريًا.

تُشير الورقة إلى:

‘يركز العمل الحالي على مجموعة من 15 علاقة أساسية سابقة وصفها أو فحصها أو اقترحها الأدب الإدراكي أو التطوري أو اللغوي. تحتوي المجموعة على علاقات فضائية محددة (مثل “X على Y”) وعلاقات وكلية أكثر تجريدًا (مثل “X يساعد Y”).

‘الدعوات متعمدة البساطة ، بدون تعقيد الصفات أو التوسيع. أي أننا نستخدم “صندوق على سكين” بدلاً من دعوة مثل “حمار وحش وثعبان يلعبون لعبة. الحمار يحمل حبلًا من طرف واحد ، والثعبان يholds حبلًا من الطرف الآخر. الحمار يحمل الحبل في فمه. القطط تقفز فوق الحبل”.’

لدراستهم ، استأجر المؤلفون 169 مشاركًا من Prolific ، جميعهم من الولايات المتحدة الأمريكية ، بمتوسط ​​عمر 33 عامًا ، و 59٪ من الإناث.

تم عرض 18 صورة للمشاركين ، منظمة في شبكة 3×6 مع الدعوة في الجزء العلوي ، و إشعار في الجزء السفلي يذكر أن جميع الصور أو بعضها أو لا شيء منها قد تم إنشاؤها من الدعوة المعروضة ، وتمت مطالبتها باختيار الصور التي يعتقدون أنها متعلقة بهذه الطريقة.

تم تقديم الصور للمشاركين بناءً على الأدب اللغوي والتنموي والإدراكي ، وتألفت من مجموعة من ثماني علاقات فيزيائية وسبع علاقات “وكيلية” (سوف ي trở nên واضح في لحظة).

العلاقات الفيزيائية
داخل ، على ، تحت ، تغطية ، بالقرب من ، مغطى بواسطة ، معلق فوق ، و مرتبط به.

العلاقات الوكيلية
دفع ، سحب ، لمس ، ضرب ، ركل ، مساعدة ، و عقاب.

تم استخلاص جميع هذه العلاقات من مجالات الدراسة غير CS المذكورة أعلاه.

تم اشتقاق 12 كيانًا للاستخدام في الدعوات ، مع ستة أشياء وستة وكلاء:

الأشياء
صندوق ، أسطوانة ، بطانية ، وعاء ، كوب شاي ، و سكين.

الوكلاء
رجل ، امرأة ، طفل ، روبوت ، قرد ، و إغوانا.

للعلاقة كلها ، تم إنشاء خمس دعوات مختلفة عن طريق أخذ عينة عشوائية من كيانين خمس مرات ، مما أدى إلى 75 دعوة إجمالية ، تم تقديم كل منها إلى DALL-E 2 ، وتم استخدام الصور 18 الأولية لكل منها ، بدون أي تغييرات أو فرص ثانية.

النتائج

تشير الورقة إلى:

‘أبلغ المشاركون في المتوسط عن نسبة منخفضة من الاتفاق بين صور DALL-E 2 والدعوات المستخدمة لإنشائها ، بنسبة средية 22.2٪ [18.3 ، 26.6] عبر 75 دعوة منفصلة.

‘الدعوات الوكيلية ، بنسبة средية 28.4٪ [22.8 ، 34.2] عبر 35 دعوة ، أنتجت اتفاقًا أعلى من الدعوات الفيزيائية ، بنسبة средية 16.9٪ [11.9 ، 23.0] عبر 40 دعوة.’

نتائج الدراسة. النقاط السوداء تشير إلى جميع الدعوات ، مع كل نقطة تمثل دعوة فردية ، واللون يفصل بين ما إذا كان موضوع الدعوة وكيلية أو فيزيائية (أي كائن).

نتائج الدراسة.

للمقارنة بين الإدراك البشري والخوارزمي للصور ، قام الباحثون بتشغيل صورهم من خلال إطار CLIP مفتوح المصدر من OpenAI:

أظهرت النتائج متوسطًا معتدلاً بين النتائج.

رجل يضرب تي ركس

مع توسع نطاق وصول OpenAI إلى عدد أكبر من المستخدمين بعد تحويل DALL-E 2 إلى نظام بيتا مدفوع ، و منذ أن أصبح عليك دفع المال مقابل معظم العمليات ، قد تصبح عيوب DALL-E 2 في فهم العلاقات أكثر وضوحًا مع كل محاولة “فاشلة” لها وزن مالي ، و لا تتوفر استردادات.

من الصعب جدًا الحصول على ديناصور يطارد شخصًا في DALL-E 2 ، على الرغم من أن مفهوم “المطاردة” لا يبدو أنه في نظام رقابة DALL-E 2 ، و على الرغم من أن تاريخ أفلام الديناصورات الطويل يجب أن يوفر أمثلة تدريبية وافرة (على الأقل في شكل مقاطع دعائية) لهذا اللقاء المستحيل بين الأنواع.

أنا وجدت أن الصور أعلاه هي نموذجية للتنوعات على تصميم الدعوة “[الديناصور] يطارد [شخص]” ، و أن لا مجال لتحسين الدعوة يمكن أن يجعل التي ركس يطارد حقًا.

قد يكون ذلك لأن البيانات التدريبية الوحيدة التي يمكن لـ DALL-E 2 الوصول إليها كانت على خط “رجل يقاتل ديناصور” ، من لقطات الدعاية لأفلام قديمة مثل “مليون سنة قبل الميلاد” (1966) ، و أن هروب جيف غولدبلوم الشهير من ملك المفترسين هو ببساطة حالات نادرة في تلك الشريحة الصغيرة من البيانات.

نشرت لأول مرة في 4 أغسطس 2022.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai