มุมมองของ Anderson

โมเดลการเรียนรู้เชิงลึกอาจต้องดิ้นรนในการรับรู้ภาพที่สร้างโดย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ผลการวิจัยจากหนังสือวิจัยฉบับใหม่บ่งชี้ว่า AI รุ่นล่าสุดมีความสามารถในการรับรู้และตีความภาพที่สร้างโดย AI น้อยกว่ามนุษย์ ซึ่งอาจเป็นปัญหาในอนาคตที่โมเดลการเรียนรู้เชิงลึกจะถูกฝึกฝนบนข้อมูลสังเคราะห์ และไม่จำเป็นต้องรู้ว่าข้อมูลนั้นเป็น “จริง” หรือไม่

ที่นี่เราเห็นโมเดลการคาดการณ์ resnext101_32x8d_wsl ที่มีปัญหาในการจำแนกประเภท 'เบเกิล' ในการทดสอบ ถือว่าการล้มเหลวในการรับรู้เกิดขึ้นหากคำหลัก (ในกรณีนี้ 'เบเกิล') ไม่อยู่ในห้าผลลัพธ์ที่คาดการณ์ไว้

ที่นี่เราเห็นโมเดลการคาดการณ์ resnext101_32x8d_wsl ที่มีปัญหาในการจำแนกประเภท ‘เบเกิล’ ในการทดสอบ ถือว่าการล้มเหลวในการรับรู้เกิดขึ้นหากคำหลัก (ในกรณีนี้ ‘เบเกิล’) ไม่อยู่ในห้าผลลัพธ์ที่คาดการณ์ไว้ Source: https://arxiv.org/pdf/2208.10760.pdf

การวิจัยใหม่นี้ได้ทดสอบสองประเภทของเฟรมเวิร์กการรับรู้ภาพคอมพิวเตอร์: การรับรู้วัตถุ และการถามคำถามภาพ (VQA).

ทางซ้ายคือความสำเร็จและความล้มเหลวของระบบการรับรู้วัตถุ ทางขวาคืองาน VQA ที่ออกแบบมาเพื่อทดสอบความเข้าใจของ AI เกี่ยวกับฉากและภาพในลักษณะที่สำรวจและสำคัญยิ่ง

ทางซ้ายคือความสำเร็จและความล้มเหลวของระบบการรับรู้วัตถุ ทางขวาคืองาน VQA ที่ออกแบบมาเพื่อทดสอบความเข้าใจของ AI เกี่ยวกับฉากและภาพในลักษณะที่สำรวจและสำคัญยิ่ง Sources: https://arxiv.org/pdf/2105.05312.pdf และ https://arxiv.org/pdf/1505.00468.pdf

จากทั้งหมด 10 โมเดลที่ทดสอบบนชุดข้อมูลที่สร้างโดยเฟรมเวิร์กสังเคราะห์ภาพ DALL-E 2 และ Midjourney โมเดลที่มีประสิทธิภาพสูงสุดสามารถทำได้เพียง 60% และ 80% ในการทดสอบสองประเภทนี้ ในขณะที่ ImageNet ที่ฝึกฝนบนข้อมูลจริงสามารถทำได้ 91% และ 99% ในประเภทเดียวกัน ในขณะที่ประสิทธิภาพของมนุษย์โดยทั่วไปสูงกว่าอย่างเห็นได้ชัด

… (เนื้อหาที่เหลือจะถูกแปลต่อไป)

ข้อมูล

การวิจัยนี้เกิดขึ้นก่อนการเปิดตัว Stable Diffusion และการทดสอบใช้ข้อมูลที่สร้างโดย DALL-E 2 และ Midjourney ใน 17 ประเภท รวมถึง ช้าง, เห็ด, พิซซ่า, เพรทเซล, แทรกเตอร์ และ กระต่าย。… (เนื้อหาที่เหลือจะถูกแปลต่อไป)

การทดสอบการรับรู้วัตถุ

สำหรับการทดสอบการรับรู้วัตถุ โมเดล 10 โมเดลที่ฝึกฝนบน ImageNet ถูกทดสอบ: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit และ ResNext_WSL…. (เนื้อหาที่เหลือจะถูกแปลต่อไป)

การทดสอบการถามคำถามภาพ

ต่อไป ผู้วิจัยได้ทดสอบโมเดล VQA บนคำถามที่เปิดและแบบอิสระ โดยใช้คำถามทวินาม (คำถามที่คำตอบสามารถเป็น “ใช่” หรือ “ไม่” เท่านั้น)… (เนื้อหาที่เหลือจะถูกแปลต่อไป)

LSD ในกระแสข้อมูล?

ความคิดเห็น

การแพร่กระจายของภาพสังเคราะห์ที่สร้างโดย AI ซึ่งสามารถนำเสนอการเชื่อมต่อและความเป็นนามธรรมของแนวคิดหลักๆ ที่ไม่มีอยู่ในธรรมชาติ และซึ่งจะใช้เวลานานในการผลิตโดยวิธีการแบบดั้งเดิม อาจเป็นปัญหาเฉพาะสำหรับระบบการรวบรวมข้อมูลที่ไม่ได้รับการดูแล ซึ่งอาจไม่สามารถล้มเหลวได้อย่างมีประสิทธิภาพ… (เนื้อหาที่เหลือจะถูกแปลต่อไป)

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai