มุมมองของ Anderson

การวิจัยใหม่พบปัญหา 16 ข้อที่สำคัญกับระบบ RAG รวมถึง Perplexity

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

การศึกษาใหม่จากสหรัฐอเมริกาพบว่าประสิทธิภาพจริงของระบบการสร้างข้อความที่ใช้การค้นหาที่เพิ่มขึ้น (RAG) เช่น Perplexity และ Bing Copilot นั้นต่ำกว่าทั้งการตลาดและการใช้งานที่ได้รับความนิยมในช่วง 12 เดือนที่ผ่านมา

โครงการนี้ซึ่งเกี่ยวข้องกับการสำรวจโดยผู้เชี่ยวชาญ 21 คน พบว่าระบบ RAG ที่ศึกษานั้นมีปัญหา 16 ข้อที่ทำให้เกิดความกังวล

1. การขาดรายละเอียดเชิงวัตถุในคำตอบที่สร้างขึ้น โดยมีสรุปทั่วไปและขาดความลึกหรือความแตกต่างในบริบท

2. การยืนยันความเอนเอียงของผู้ใช้ โดยที่ระบบ RAG มักจะไม่นำเสนอมุมมองที่หลากหลาย แต่แทนจะยืนยันและเสริมสร้างความเอนเอียงของผู้ใช้ตามวิธีที่ผู้ใช้ถามคำถาม

3. ภาษาที่มั่นใจมากเกินไป โดยเฉพาะในคำตอบที่ไม่สามารถพิสูจน์ได้ด้วยการตรวจสอบ事实 ซึ่งสามารถทำให้ผู้ใช้เชื่อคำตอบมากกว่าที่ควร

4. ภาษาที่เรียบง่ายและขาดการคิดอย่างมีวิจารณญาณและสร้างสรรค์ โดยที่คำตอบมักจะทำให้ผู้ใช้รู้สึกว่าได้รับข้อมูลที่ “ดumbing down” และ “เห็นด้วย” แทนที่จะให้การคิดและวิเคราะห์ที่มีเหตุผล

5. การอ้างอิงแหล่งที่ไม่ถูกต้องและไม่ถูกต้อง โดยที่ระบบคำตอบใช้แหล่งที่ไม่สนับสนุนคำตอบของตน ทำให้เกิดภาพลวงของความน่าเชื่อถือ

6. การคัดเลือกข้อมูลจากบริบทที่อนุมาน โดยที่ระบบ RAG ดูเหมือนจะพยายามหาคำตอบที่สนับสนุนข้อโต้แย้งของตนและประมาณการของสิ่งที่ผู้ใช้ต้องการฟัง แทนที่จะอาศัยการวิเคราะห์เชิงวัตถุของแหล่งที่เชื่อถือได้

7. การละเว้นการอ้างอิงที่สนับสนุนคำตอบ โดยที่แหล่งที่มาของคำตอบไม่มีอยู่

8. การไม่มีระบบเชิงตรรกะสำหรับคำตอบ โดยที่ผู้ใช้ไม่สามารถถามได้ว่าทำไมระบบจึงให้ความสำคัญกับแหล่งที่มาบางแหล่งมากกว่าแหล่งอื่น

9. จำนวนแหล่งที่จำกัด โดยที่ระบบ RAG ส่วนใหญ่มักจะให้แหล่งที่มาเพียง 3 แหล่งสำหรับคำตอบ แม้ว่าแหล่งที่มาหลากหลายจะเหมาะสมกับคำตอบ

10. แหล่งที่ไม่มีการเชื่อมต่อ โดยที่ข้อมูลจากแหล่งที่มาบางแหล่งไม่ได้รวมอยู่ในคำตอบ

11. การใช้แหล่งที่ไม่น่าเชื่อถือ โดยที่ระบบดูเหมือนจะชอบแหล่งที่มีคนค้นหามากกว่าแหล่งที่ถูกต้อง

12. แหล่งที่ซ้ำกัน โดยที่ระบบให้แหล่งที่มาหลายแหล่งที่มีเนื้อหาที่เหมือนกัน

13. แหล่งที่ไม่ได้กรอง โดยที่ระบบไม่ได้ให้ทางเลือกแก่ผู้ใช้ในการประเมินหรือกรองแหล่งที่มา

14. การขาดการโต้ตอบหรือการสำรวจ โดยที่ผู้ใช้บางคนรู้สึกว่าระบบ RAG ไม่ได้ถามคำถามที่ชี้แจง แต่แทนจะสมมติว่าผู้ใช้ตั้งใจจากคำถามแรก

15. ความจำเป็นในการตรวจสอบจากภายนอก โดยที่ผู้ใช้รู้สึกว่าต้องทำการตรวจสอบอิสระของคำตอบที่ให้มา ซึ่งลบความสะดวกของระบบ RAG ในฐานะ “ทดแทนการค้นหา”

16. การใช้วิธีการอ้างอิงทางวิชาการ เช่น [1] หรือ [34] ซึ่งเป็นมาตรฐานในการเขียนวิชาการ แต่อาจไม่เหมาะสมสำหรับผู้ใช้หลายคน

สำหรับงานนี้ นักวิจัยได้รวบรวมผู้เชี่ยวชาญ 21 คนจากสาขาวิชาต่างๆ รวมถึงปัญญาประดิษฐ์ สุขภาพและเวชศาสตร์ วิทยาศาสตร์ประยุกต์ และสังคมศาสตร์ ทั้งหมดเป็นนักวิจัยหลังปริญญาเอกหรือผู้สมัครปริญญาเอก

ผู้เข้าร่วมได้โต้ตอบกับระบบ RAG ที่ทดสอบในขณะที่พูดความคิดของตนออกมา เพื่อชี้แจงให้นักวิจัยเข้าใจวิธีการคิดของตนเอง

กระดาษนี้อ้างคำพูดจากผู้เข้าร่วมหลายคนเกี่ยวกับความกังวลและข้อเสียของระบบ RAG ที่ศึกษา

การแลกเปลี่ยน RAG

ผู้เขียนบทความนี้ย้ำถึงข้อบกพร่องที่ทราบของโมเดลภาษาขนาดใหญ่ (LLM) เมื่อใช้ในเครื่องมือตอบคำถาม

ข้อแรกคือ LLM มักจะ สร้างข้อมูลที่ไม่มีอยู่จริง และไม่มีความสามารถในการ ตรวจสอบความไม่สอดคล้องของข้อเท็จจริง

ข้อที่สองคือ LLM มักจะพบว่ามีความยากในการ ประเมินความถูกต้อง ของการอ้างอิงในบริบทของคำตอบที่สร้างขึ้น

ข้อที่สามคือ LLM มักจะ ชอบข้อมูล จากน้ำหนักการฝึกอบรมของตนเอง และอาจต้านข้อมูลจากเอกสารภายนอกแม้ว่าเอกสารนั้นจะใหม่หรือถูกต้องกว่าก็ตาม

สุดท้าย ระบบ RAG มักจะเอาใจผู้ใช้ โดยมักจะทำให้ผู้ใช้เชื่อคำตอบมากกว่าที่ควร

ทั้งหมดนี้ได้รับการยืนยันในกระดาษนี้

การศึกษา

ผู้เขียนได้ทดสอบกระบวนการศึกษากับผู้เข้าร่วม 3 คนจาก 24 คน

ในขั้นตอนแรก ผู้เข้าร่วมได้รับการสุ่มเลือกให้เข้าร่วมการสำรวจโดยใช้ LinkedIn หรืออีเมล

ขั้นตอนแรกสำหรับผู้เข้าร่วมที่เหลือคือ การค้นหาข้อมูลเชิงวิชาการ โดยที่ผู้เข้าร่วมเฉลี่ยประมาณ 6 คำถามในการค้นหาในช่วง 40 นาที

ขั้นตอนที่สองเกี่ยวข้องกับ การค้นหาข้อมูลทาง 辩論 ซึ่งเกี่ยวข้องกับเรื่อง субъектив

การขาดรายละเอียดเชิงวัตถุ

กระดาษนี้ชี้ให้เห็นว่าผู้ใช้พบว่าระบบ RAG มักจะขาดรายละเอียดเชิงวัตถุในคำตอบทั้งเชิงวัตถุและเชิงสубъектив

การขาดมุมมองที่ครอบคลุม

ผู้เขียนแสดงความกังวลเกี่ยวกับการขาดความแตกต่างและความเฉพาะเจาะจง และระบุว่าระบบ RAG มักจะไม่นำเสนอมุมมองที่หลากหลายในเรื่องใดเรื่องหนึ่ง

ภาษาที่มั่นใจมากเกินไป

ผู้เขียนสังเกตเห็นว่าระบบ RAG ทั้งสามระบบที่ทดสอบแสดงภาษาที่มั่นใจมากเกินไป

การอ้างอิงที่ไม่ถูกต้อง

ปัญหาหนึ่งที่พบบ่อยคือการอ้างอิงแหล่งที่ไม่ถูกต้อง

การคัดเลือกข้อมูลเพื่อความเหมาะสม

การค้นพบอีกอย่างหนึ่งคือการคัดเลือกข้อมูลเพื่อความเหมาะสม

การตรวจสอบ RAG แบบอัตโนมัติ

ในขั้นตอนที่สองของการศึกษา นักวิจัยได้ใช้การเขียนสคริปต์แบบอัตโนมัติเพื่อขอคำตอบจากระบบ RAG

คำตอบถูกวิเคราะห์โดยใช้ LLM (GPT-4o) สำหรับการประเมินคำตอบ

นักวิจัยยังใช้เครื่องมือ Jina.ai Reader เพื่อขอเนื้อหาที่เต็มของแหล่งที่มา

ผลการวิจัยพบว่าระบบ RAG ทั้งสามระบบที่ทดสอบมีปัญหาหลายประการ

ผู้เขียนสรุปว่า “ไม่มีระบบใดที่ทำงานได้ดีในหลายๆ มิติ ซึ่งแสดงให้เห็นว่ายังมีหลายสิ่งที่ต้องปรับปรุงในระบบตอบคำถาม”

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai