มุมมองของ Anderson

การใช้ฮัลลูซิเนชันของ AI เพื่อประเมินความสมจริงของภาพ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
A selection of images from the WHOOPS! dataset (https://huggingface.co/datasets/nlphuji/whoops), behind central images from the paper 'Don’t Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts' (https://arxiv.org/pdf/2503.15948).

การวิจัยใหม่จากประเทศรัสเซียเสนอวิธีการที่ไม่ธรรมดาในการตรวจจับภาพที่สร้างโดย AI ที่ไม่สมจริง – ไม่ใช่โดยการปรับปรุงความแม่นยำของโมเดลภาษาและภาพที่มีขนาดใหญ่ (LVLMs) แต่โดยการนำข้อบกพร่องของโมเดลเหล่านี้มาใช้

วิธีการใหม่นี้จะถอดรหัส ‘ข้อเท็จจริงเชิงอะตอม’ หลายข้อเกี่ยวกับภาพโดยใช้ LVLMs จากนั้นใช้ การอนุมานภาษาธรรมชาติ (NLI) เพื่อวัดความขัดแย้งระหว่างข้อความเหล่านี้อย่างเป็นระบบ – ทำให้ข้อบกพร่องของโมเดลกลายเป็นเครื่องมือวินิจฉัยสำหรับการตรวจจับภาพที่ขัดแย้งกับความสมเหตุสมผล

สองภาพจากชุดข้อมูล WHOOPS! พร้อมคำอธิบายที่สร้างโดยโมเดล LVLM ภาพทางซ้ายมือเป็นภาพที่สมจริง ทำให้ได้คำอธิบายที่สอดคล้องกัน ในขณะที่ภาพทางขวามือไม่ธรรมดา ทำให้โมเดลเกิดฮัลลูซิเนชันและสร้างคำอธิบายที่ขัดแย้งหรือไม่ถูกต้อง Source: https://arxiv.org/pdf/2503.15948

สองภาพจากชุดข้อมูล WHOOPS! พร้อมคำอธิบายที่สร้างโดยโมเดล LVLM ภาพทางซ้ายมือเป็นภาพที่สมจริง ทำให้ได้คำอธิบายที่สอดคล้องกัน ในขณะที่ภาพทางขวามือไม่ธรรมดา ทำให้โมเดลเกิดฮัลลูซิเนชันและสร้างคำอธิบายที่ขัดแย้งหรือไม่ถูกต้อง Source: https://arxiv.org/pdf/2503.15948

เมื่อถูกขอให้ประเมินความสมจริงของภาพที่สอง โมเดล LVLM สามารถเห็นว่ามีบางสิ่งที่ผิดปกติ เนื่องจากภาพแสดงให้เห็นจมูกสามจมูก ซึ่งไม่พบในธรรมชาติ

อย่างไรก็ตาม โมเดล LVLM ขัดแย้งกันระหว่าง “>2 จมูก” และ “>2 สัตว์” เนื่องจากเป็นวิธีเดียวที่คุณจะเห็นสามจมูกใน “ภาพจมูก” โมเดลจึงเกิดฮัลลูซิเนชันและสร้างสิ่งที่ไม่น่าเชื่อถือมากกว่าสามจมูก (เช่น “สองหัว”) และไม่ได้อธิบายสิ่งที่ดูเหมือนจะทำให้เกิดความสงสัย – จมูกที่ไม่น่าเชื่อถือ

การประเมินแบบเปิด

ความสำคัญของวิธีการนี้ คือ สามารถใช้งานได้กับ เฟรมเวิร์กที่เปิดกว้าง ในขณะที่โมเดลที่มีการลงทุนสูง เช่น ChatGPT อาจให้ผลลัพธ์ที่ดีกว่าในงานนี้ แต่คุณค่าของวรรณกรรมสำหรับคนส่วนใหญ่ (และ đặc biệtสำหรับชุมชน VFX และนักศึกษา) คือความเป็นไปได้ในการรวมและพัฒนาการพัฒนาที่ไม่เหมือนใครในระดับพื้นที่

งานวิจัยใหม่ ใหม่ มีชื่อเรื่องว่า อย่าต่อสู้กับฮัลลูซิเนชัน ใช้มัน: การประเมินความสมจริงของภาพโดยใช้ NLI บนข้อเท็จจริงเชิงอะตอม และมาจากนักวิจัยห้าคนจาก Skolkovo Institute of Science and Technology (Skoltech), Moscow Institute of Physics and Technology, และบริษัท MTS AI และ AIRI ของรัสเซีย งานนี้มี หน้า GitHub ที่เกี่ยวข้อง

วิธีการ

ผู้วิจัยใช้ชุดข้อมูล WHOOPS! ของอิสราเอล/สหรัฐอเมริกา สำหรับโครงการนี้

ตัวอย่างภาพที่เป็นไปไม่ได้จากชุดข้อมูล WHOOPS! สิ่งที่น่าสังเกตคือภาพเหล่านี้ประกอบด้วยองค์ประกอบที่สมเหตุสมผล และความไม่สมจริงต้องคำนวณจากการรวมองค์ประกอบที่ไม่เข้ากันเหล่านี้ Source: https://whoops-benchmark.github.io/

ตัวอย่างภาพที่เป็นไปไม่ได้จากชุดข้อมูล WHOOPS! สิ่งที่น่าสังเกตคือภาพเหล่านี้ประกอบด้วยองค์ประกอบที่สมเหตุสมผล และความไม่สมจริงต้องคำนวณจากการรวมองค์ประกอบที่ไม่เข้ากันเหล่านี้ Source: https://whoops-benchmark.github.io/

ชุดข้อมูลประกอบด้วยภาพสังเคราะห์ 500 ภาพและคำอธิบายมากกว่า 10,874 รายการ ซึ่งออกแบบมาเพื่อทดสอบความสามารถในการให้เหตุผลและความเข้าใจเชิงประกอบของโมเดล AI

ข้อมูลและการทดสอบ

ผู้วิจัยทดสอบระบบของตนบนชุดข้อมูล WHOOPS! โดยใช้การแบ่งข้อมูลทดสอบแบบหมุน (cross-validation) และพบว่าระบบสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง

ผลลัพธ์แสดงให้เห็นว่าระบบสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

สรุป

ผู้วิจัยยอมรับว่างานของตนได้รับอิทธิพลจากงาน FaithScore ในปี 2024 ซึ่งเป็นความร่วมมือระหว่างมหาวิทยาลัยเท็กซัสที่ดัลลัสและมหาวิทยาลัยจอนส์ฮอปกินส์

งานใหม่นี้ใช้ฮัลลูซิเนชันของโมเดล AI เพื่อตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง

งานนี้ยังแสดงให้เห็นว่าฮัลลูซิเนชันของโมเดล AI สามารถใช้ประโยชน์ได้ในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

ผู้วิจัยพบว่าระบบสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

งานนี้แสดงให้เห็นว่าฮัลลูซิเนชันของโมเดล AI สามารถใช้ประโยชน์ได้ในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

งานนี้ยังแสดงให้เห็นว่าฮัลลูซิเนชันของโมเดล AI สามารถใช้ประโยชน์ได้ในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

ผู้วิจัยพบว่าระบบสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

งานนี้แสดงให้เห็นว่าฮัลลูซิเนชันของโมเดล AI สามารถใช้ประโยชน์ได้ในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

ผู้วิจัยยังพบว่าระบบสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

งานนี้แสดงให้เห็นว่าฮัลลูซิเนชันของโมเดล AI สามารถใช้ประโยชน์ได้ในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

ผู้วิจัยพบว่าระบบสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

งานนี้แสดงให้เห็นว่าฮัลลูซิเนชันของโมเดล AI สามารถใช้ประโยชน์ได้ในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

ผู้วิจัยยังพบว่าระบบสามารถทำงานได้ดีในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

งานนี้แสดงให้เห็นว่าฮัลลูซิเนชันของโมเดล AI สามารถใช้ประโยชน์ได้ในการตรวจจับภาพที่ไม่สมจริง และสามารถทำงานได้ดีกว่าโมเดล AI อื่นๆ ที่ไม่ได้ถูกฝึกฝนมาเพื่องานนี้

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai