มุมมองของ Anderson

DALL-E 2 เป็นเพียง ‘การรวมสิ่งของเข้าด้วยกัน’ โดยไม่เข้าใจความสัมพันธ์ของพวกมันหรือไม่?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

งานวิจัยใหม่จากมหาวิทยาลัยฮาร์วาร์ดชี้ให้เห็นว่า DALL-E 2 ซึ่งเป็นเฟรมเวิร์กการสร้างภาพจากข้อความของ OpenAI ที่น่าประทับใจ มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่ถูกสร้างขึ้นในภาพที่สังเคราะห์ แม้ว่าผลลัพธ์จะน่าประทับใจ แต่ก็มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น

นักวิจัยได้ทำการศึกษาโดยใช้ผู้เข้าร่วม 169 คนจาก Prolific ซึ่งถูกนำเสนอภาพที่สร้างโดย DALL-E 2 ตามหลักการของความสัมพันธ์ระหว่างองค์ประกอบ และข้อความที่ใช้ในการสร้างภาพเหล่านั้น เมื่อถามว่าภาพและข้อความที่ใช้ในการสร้างภาพนั้นมีความสัมพันธ์กันหรือไม่ น้อยกว่า 22% ของภาพที่ถูกสร้างขึ้นถูกมองว่ามีความสัมพันธ์กับข้อความที่ใช้ในการสร้างภาพ

ภาพหน้าจอจากการทดลองที่ทำสำหรับบทความใหม่ ผู้เข้าร่วมถูกขอให้เลือกภาพที่ตรงกับข้อความที่ใช้ในการสร้างภาพ

ภาพหน้าจอจากการทดลองที่ทำสำหรับบทความใหม่ ผู้เข้าร่วมถูกขอให้เลือกภาพที่ตรงกับข้อความที่ใช้ในการสร้างภาพ Source: https://arxiv.org/pdf/2208.00005.pdf

ผลการวิจัยยังชี้ให้เห็นว่าความสามารถของ DALL-E ในการรวมองค์ประกอบที่แตกต่างกันอาจลดลงเมื่อองค์ประกอบเหล่านั้นไม่น่าจะเกิดขึ้นในข้อมูลการฝึกอบรมที่ใช้ในการสร้างระบบ

ตัวอย่างเช่น ภาพที่สร้างจากข้อความ “เด็กสัมผัสถ้วย” ได้รับการตกลงรับจากผู้เข้าร่วม 87% ในขณะที่ภาพที่สร้างจากข้อความ “ลิงสัมผัสอิกัวนา” ได้รับการตกลงรับจากผู้เข้าร่วมเพียง 11% เท่านั้น

DALL-E มีความยากลำบากในการสร้างภาพของลิงที่สัมผัสอิกัวนา เนื่องจากไม่มีข้อมูลการฝึกอบรมที่เพียงพอ

DALL-E มีความยากลำบากในการสร้างภาพของลิงที่สัมผัสอิกัวนา เนื่องจากไม่มีข้อมูลการฝึกอบรมที่เพียงพอ

ในตัวอย่างที่สอง DALL-E 2 มักจะสร้างภาพที่มีขนาดและสายพันธุ์ที่ไม่ถูกต้อง เนื่องจากไม่มีข้อมูลการฝึกอบรมที่เพียงพอ

ความยากลำบากของ DALL-E ในการรวมองค์ประกอบที่แตกต่างกันทำให้เห็นว่าผู้ใช้กำลังถูกดึงดูดโดยความสามารถในการสร้างภาพที่มีความสมจริงและกว้างขวาง แต่ไม่ได้พัฒนาความเข้าใจที่มีวิจารณญาณสำหรับกรณีที่ระบบมีความยากลำบาก

การสร้างภาพโดยใช้ DALL-E 2 จากตัวอย่างอย่างเป็นทางการ

การสร้างภาพโดยใช้ DALL-E 2 จากตัวอย่างอย่างเป็นทางการ Source: https://openai.com/dall-e-2/

บทความใหม่ระบุว่า*:

‘ความเข้าใจความสัมพันธ์เป็นส่วนประกอบพื้นฐานของความฉลาดของมนุษย์ ซึ่งปรากฏตัวตั้งแต่ช่วงแรกของการพัฒนา และถูกคำนวณอย่างรวดเร็วและอัตโนมัติในการรับรู้

‘ความยากลำบากของ DALL-E 2 ในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกันทำให้เห็นว่าระบบนี้ยังไม่ได้เรียนรู้การแสดงออกที่ช่วยให้สามารถสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้นได้

‘การวิเคราะห์โดยตรงของความยากลำบากนี้คือระบบอย่าง DALL-E 2 ยังไม่มีการสร้างความสัมพันธ์ระหว่างองค์ประกอบ

ผู้เขียนแนะนำว่าระบบการสร้างภาพจากข้อความอย่าง DALL-E 2 อาจได้รับประโยชน์จากการใช้แอลกอริทึมที่พบในหุ่นยนต์ ซึ่งสามารถสร้างความสัมพันธ์ระหว่างองค์ประกอบได้ เนื่องจากต้องการให้ระบบสามารถโต้ตอบกับสภาพแวดล้อมได้จริง

หนึ่งในวิธีการที่เรียกว่า CLIPort ใช้กลไก CLIP ซึ่งเป็นส่วนหนึ่งของ DALL-E 2

CLIPort เป็นผลงานร่วมกันระหว่างมหาวิทยาลัยวอชิงตันและ NVIDIA ในปี 2021 ซึ่งใช้ CLIP ในบริบทที่เป็นไปได้มากที่สุด

CLIPort เป็นผลงานร่วมกันระหว่างมหาวิทยาลัยวอชิงตันและ NVIDIA ในปี 2021 ซึ่งใช้ CLIP ในบริบทที่เป็นไปได้มากที่สุด Source: https://arxiv.org/pdf/2109.12098.pdf

ผู้เขียนแนะนำว่าการปรับปรุงอีกวิธีหนึ่งอาจเป็นการรวมผลกระทบการคูณในระดับเดียวของการคำนวณ ซึ่งช่วยให้สามารถคำนวณความสัมพันธ์ระหว่างองค์ประกอบได้โดยใช้ความสามารถในการประมวลผลข้อมูลของระบบชีวภาพ

บทความใหม่นี้มีชื่อเรื่องว่า การทดสอบความเข้าใจความสัมพันธ์ในระบบการสร้างภาพจากข้อความ และมาจาก Colin Conwell และ Tomer D. Ullman จากภาควิชาจิตวิทยา มหาวิทยาลัยฮาร์วาร์ด

eyond Early Criticism

ผู้เขียนบทความนี้ให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น

The Study

ผู้เขียนบทความนี้ได้ทำการศึกษาโดยใช้ผู้เข้าร่วม 169 คนจาก Prolific ซึ่งถูกนำเสนอภาพที่สร้างโดย DALL-E 2 ตามหลักการของความสัมพันธ์ระหว่างองค์ประกอบ และข้อความที่ใช้ในการสร้างภาพเหล่านั้น

ผู้เข้าร่วมถูกขอให้เลือกภาพที่ตรงกับข้อความที่ใช้ในการสร้างภาพ และผลการวิจัยชี้ให้เห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน

Results

ผลการวิจัยชี้ให้เห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และผู้เขียนบทความนี้แนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น

Man Bites T-Rex

ผู้เขียนบทความนี้ให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น

ผู้เขียนบทความนี้ยังให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างภาพที่มีความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น

ผู้เขียนบทความนี้ยังให้ความเห็นว่า DALL-E 2 มีความยากลำบากในการสร้างภาพที่มีความสัมพันธ์ระหว่างองค์ประกอบที่แตกต่างกัน และแนะนำว่าระบบนี้ยังไม่ได้เรียนรู้การสร้างความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai