มุมมองของ Anderson
DALL-E 2 เป็นเพียง ‘การรวมสิ่งของเข้าด้วยกัน’ โดยไม่เข้าใจความสัมพันธ์ของพวกมันหรือไม่?

งานวิจัยใหม่จากมหาวิทยาลัยฮาร์วาร์ดชี้ให้เห็นว่า DALL-E 2 ซึ่งเป็นเฟรมเวิร์กการสร้างภาพจากข้อความของ OpenAI ที่น่าประทับใจ มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่ถูกสร้างขึ้นในภาพที่สังเคราะห์ แม้ว่าผลลัพธ์จะน่าประทับใจ แต่ก็มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น
นักวิจัยได้ทำการศึกษาโดยใช้ผู้เข้าร่วม 169 คนจาก Prolific ซึ่งถูกนำเสนอภาพที่สร้างโดย DALL-E 2 ตามหลักการของความสัมพันธ์ระหว่างองค์ประกอบ และข้อความที่ใช้ในการสร้างภาพเหล่านั้น เมื่อถามว่าภาพและข้อความที่ใช้ในการสร้างภาพนั้นมีความสัมพันธ์กันหรือไม่ น้อยกว่า 22% ของภาพที่ถูกสร้างขึ้นถูกมองว่ามีความสัมพันธ์กับข้อความที่ใช้ในการสร้างภาพ

ภาพหน้าจอจากการทดลองที่ทำสำหรับบทความใหม่ ผู้เข้าร่วมถูกขอให้เลือกภาพที่ตรงกับข้อความที่ใช้ในการสร้างภาพ Source: https://arxiv.org/pdf/2208.00005.pdf
ผลการวิจัยยังชี้ให้เห็นว่าความสามารถของ DALL-E ในการรวมองค์ประกอบที่แตกต่างกันอาจลดลงเมื่อองค์ประกอบเหล่านั้นไม่น่าจะเกิดขึ้นในข้อมูลการฝึกอบรมที่ใช้ในการสร้างระบบ
ตัวอย่างเช่น ภาพที่สร้างจากข้อความ “เด็กสัมผัสถ้วย” ได้รับการตกลงรับจากผู้เข้าร่วม 87% ในขณะที่ภาพที่สร้างจากข้อความ “ลิงสัมผัสอิกัวนา” ได้รับการตกลงรับจากผู้เข้าร่วมเพียง 11% เท่านั้น
ในตัวอย่างที่สอง DALL-E 2 มักจะสร้างภาพที่มีขนาดและสายพันธุ์ที่ไม่ถูกต้อง เนื่องจากไม่มีข้อมูลการฝึกอบรมที่เพียงพอ
ความยากลำบากของ DALL-E ในการรวมองค์ประกอบที่แตกต่างกันทำให้เห็นว่าผู้ใช้กำลังถูกดึงดูดโดยความสามารถในการสร้างภาพที่มีความสมจริงและกว้างขวาง แต่ไม่ได้พัฒนาความเข้าใจที่มีวิจารณญาณสำหรับกรณีที่ระบบมีความยากลำบาก
บทความใหม่ระบุว่า*:
‘ความเข้าใจความสัมพันธ์เป็นส่วนประกอบพื้นฐานของความฉลาดของมนุษย์ ซึ่งปรากฏตัวตั้งแต่ช่วงแรกของการพัฒนา และถูกคำนวณอย่างรวดเร็วและอัตโนมัติในการรับรู้
‘ความยากลำบากของ DALL-E 2 ในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกันทำให้เห็นว่าระบบนี้ยังไม่ได้เรียนรู้การแสดงออกที่ช่วยให้สามารถสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้นได้
‘การวิเคราะห์โดยตรงของความยากลำบากนี้คือระบบอย่าง DALL-E 2 ยังไม่มีการสร้างความสัมพันธ์ระหว่างองค์ประกอบ
ผู้เขียนแนะนำว่าระบบการสร้างภาพจากข้อความอย่าง DALL-E 2 อาจได้รับประโยชน์จากการใช้แอลกอริทึมที่พบในหุ่นยนต์ ซึ่งสามารถสร้างความสัมพันธ์ระหว่างองค์ประกอบได้ เนื่องจากต้องการให้ระบบสามารถโต้ตอบกับสภาพแวดล้อมได้จริง
หนึ่งในวิธีการที่เรียกว่า CLIPort ใช้กลไก CLIP ซึ่งเป็นส่วนหนึ่งของ DALL-E 2

CLIPort เป็นผลงานร่วมกันระหว่างมหาวิทยาลัยวอชิงตันและ NVIDIA ในปี 2021 ซึ่งใช้ CLIP ในบริบทที่เป็นไปได้มากที่สุด Source: https://arxiv.org/pdf/2109.12098.pdf
ผู้เขียนแนะนำว่าการปรับปรุงอีกวิธีหนึ่งอาจเป็นการรวมผลกระทบการคูณในระดับเดียวของการคำนวณ ซึ่งช่วยให้สามารถคำนวณความสัมพันธ์ระหว่างองค์ประกอบได้โดยใช้ความสามารถในการประมวลผลข้อมูลของระบบชีวภาพ
บทความใหม่นี้มีชื่อเรื่องว่า การทดสอบความเข้าใจความสัมพันธ์ในระบบการสร้างภาพจากข้อความ และมาจาก Colin Conwell และ Tomer D. Ullman จากภาควิชาจิตวิทยา มหาวิทยาลัยฮาร์วาร์ด
eyond Early Criticism
ผู้เขียนบทความนี้ให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น
The Study
ผู้เขียนบทความนี้ได้ทำการศึกษาโดยใช้ผู้เข้าร่วม 169 คนจาก Prolific ซึ่งถูกนำเสนอภาพที่สร้างโดย DALL-E 2 ตามหลักการของความสัมพันธ์ระหว่างองค์ประกอบ และข้อความที่ใช้ในการสร้างภาพเหล่านั้น
ผู้เข้าร่วมถูกขอให้เลือกภาพที่ตรงกับข้อความที่ใช้ในการสร้างภาพ และผลการวิจัยชี้ให้เห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน
Results
ผลการวิจัยชี้ให้เห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และผู้เขียนบทความนี้แนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น
Man Bites T-Rex
ผู้เขียนบทความนี้ให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น
ผู้เขียนบทความนี้ยังให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างภาพที่มีความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น
ผู้เขียนบทความนี้ยังให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างภาพที่มีความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น















