มุมมองของ Anderson
โมเดลการเรียนรู้เชิงลึกอาจต้องดิ้นรนในการรับรู้ภาพที่สร้างโดย AI

ผลการวิจัยจากหนังสือวิจัยฉบับใหม่บ่งชี้ว่า AI รุ่นล่าสุดมีความสามารถในการรับรู้และตีความภาพที่สร้างโดย AI น้อยกว่ามนุษย์ ซึ่งอาจเป็นปัญหาในอนาคตที่โมเดลการเรียนรู้เชิงลึกจะถูกฝึกฝนบนข้อมูลสังเคราะห์ และไม่จำเป็นต้องรู้ว่าข้อมูลนั้นเป็น “จริง” หรือไม่

ที่นี่เราเห็นโมเดลการคาดการณ์ resnext101_32x8d_wsl ที่มีปัญหาในการจำแนกประเภท ‘เบเกิล’ ในการทดสอบ ถือว่าการล้มเหลวในการรับรู้เกิดขึ้นหากคำหลัก (ในกรณีนี้ ‘เบเกิล’) ไม่อยู่ในห้าผลลัพธ์ที่คาดการณ์ไว้ Source: https://arxiv.org/pdf/2208.10760.pdf
การวิจัยใหม่นี้ได้ทดสอบสองประเภทของเฟรมเวิร์กการรับรู้ภาพคอมพิวเตอร์: การรับรู้วัตถุ และการถามคำถามภาพ (VQA).

ทางซ้ายคือความสำเร็จและความล้มเหลวของระบบการรับรู้วัตถุ ทางขวาคืองาน VQA ที่ออกแบบมาเพื่อทดสอบความเข้าใจของ AI เกี่ยวกับฉากและภาพในลักษณะที่สำรวจและสำคัญยิ่ง Sources: https://arxiv.org/pdf/2105.05312.pdf และ https://arxiv.org/pdf/1505.00468.pdf
จากทั้งหมด 10 โมเดลที่ทดสอบบนชุดข้อมูลที่สร้างโดยเฟรมเวิร์กสังเคราะห์ภาพ DALL-E 2 และ Midjourney โมเดลที่มีประสิทธิภาพสูงสุดสามารถทำได้เพียง 60% และ 80% ในการทดสอบสองประเภทนี้ ในขณะที่ ImageNet ที่ฝึกฝนบนข้อมูลจริงสามารถทำได้ 91% และ 99% ในประเภทเดียวกัน ในขณะที่ประสิทธิภาพของมนุษย์โดยทั่วไปสูงกว่าอย่างเห็นได้ชัด
… (เนื้อหาที่เหลือจะถูกแปลต่อไป)
ข้อมูล
การวิจัยนี้เกิดขึ้นก่อนการเปิดตัว Stable Diffusion และการทดสอบใช้ข้อมูลที่สร้างโดย DALL-E 2 และ Midjourney ใน 17 ประเภท รวมถึง ช้าง, เห็ด, พิซซ่า, เพรทเซล, แทรกเตอร์ และ กระต่าย。… (เนื้อหาที่เหลือจะถูกแปลต่อไป)
การทดสอบการรับรู้วัตถุ
สำหรับการทดสอบการรับรู้วัตถุ โมเดล 10 โมเดลที่ฝึกฝนบน ImageNet ถูกทดสอบ: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit และ ResNext_WSL…. (เนื้อหาที่เหลือจะถูกแปลต่อไป)
การทดสอบการถามคำถามภาพ
ต่อไป ผู้วิจัยได้ทดสอบโมเดล VQA บนคำถามที่เปิดและแบบอิสระ โดยใช้คำถามทวินาม (คำถามที่คำตอบสามารถเป็น “ใช่” หรือ “ไม่” เท่านั้น)… (เนื้อหาที่เหลือจะถูกแปลต่อไป)
LSD ในกระแสข้อมูล?
ความคิดเห็น
การแพร่กระจายของภาพสังเคราะห์ที่สร้างโดย AI ซึ่งสามารถนำเสนอการเชื่อมต่อและความเป็นนามธรรมของแนวคิดหลักๆ ที่ไม่มีอยู่ในธรรมชาติ และซึ่งจะใช้เวลานานในการผลิตโดยวิธีการแบบดั้งเดิม อาจเป็นปัญหาเฉพาะสำหรับระบบการรวบรวมข้อมูลที่ไม่ได้รับการดูแล ซึ่งอาจไม่สามารถล้มเหลวได้อย่างมีประสิทธิภาพ… (เนื้อหาที่เหลือจะถูกแปลต่อไป)












