มุมมองของ Anderson
การวิจัยใหม่พบปัญหา 16 ข้อที่สำคัญกับระบบ RAG รวมถึง Perplexity

การศึกษาใหม่จากสหรัฐอเมริกาพบว่าประสิทธิภาพจริงของระบบการสร้างข้อความที่ใช้การค้นหาที่เพิ่มขึ้น (RAG) เช่น Perplexity และ Bing Copilot นั้นต่ำกว่าทั้งการตลาดและการใช้งานที่ได้รับความนิยมในช่วง 12 เดือนที่ผ่านมา
โครงการนี้ซึ่งเกี่ยวข้องกับการสำรวจโดยผู้เชี่ยวชาญ 21 คน พบว่าระบบ RAG ที่ศึกษานั้นมีปัญหา 16 ข้อที่ทำให้เกิดความกังวล
1. การขาดรายละเอียดเชิงวัตถุในคำตอบที่สร้างขึ้น โดยมีสรุปทั่วไปและขาดความลึกหรือความแตกต่างในบริบท
2. การยืนยันความเอนเอียงของผู้ใช้ โดยที่ระบบ RAG มักจะไม่นำเสนอมุมมองที่หลากหลาย แต่แทนจะยืนยันและเสริมสร้างความเอนเอียงของผู้ใช้ตามวิธีที่ผู้ใช้ถามคำถาม
3. ภาษาที่มั่นใจมากเกินไป โดยเฉพาะในคำตอบที่ไม่สามารถพิสูจน์ได้ด้วยการตรวจสอบ事实 ซึ่งสามารถทำให้ผู้ใช้เชื่อคำตอบมากกว่าที่ควร
4. ภาษาที่เรียบง่ายและขาดการคิดอย่างมีวิจารณญาณและสร้างสรรค์ โดยที่คำตอบมักจะทำให้ผู้ใช้รู้สึกว่าได้รับข้อมูลที่ “ดumbing down” และ “เห็นด้วย” แทนที่จะให้การคิดและวิเคราะห์ที่มีเหตุผล
5. การอ้างอิงแหล่งที่ไม่ถูกต้องและไม่ถูกต้อง โดยที่ระบบคำตอบใช้แหล่งที่ไม่สนับสนุนคำตอบของตน ทำให้เกิดภาพลวงของความน่าเชื่อถือ
6. การคัดเลือกข้อมูลจากบริบทที่อนุมาน โดยที่ระบบ RAG ดูเหมือนจะพยายามหาคำตอบที่สนับสนุนข้อโต้แย้งของตนและประมาณการของสิ่งที่ผู้ใช้ต้องการฟัง แทนที่จะอาศัยการวิเคราะห์เชิงวัตถุของแหล่งที่เชื่อถือได้
7. การละเว้นการอ้างอิงที่สนับสนุนคำตอบ โดยที่แหล่งที่มาของคำตอบไม่มีอยู่
8. การไม่มีระบบเชิงตรรกะสำหรับคำตอบ โดยที่ผู้ใช้ไม่สามารถถามได้ว่าทำไมระบบจึงให้ความสำคัญกับแหล่งที่มาบางแหล่งมากกว่าแหล่งอื่น
9. จำนวนแหล่งที่จำกัด โดยที่ระบบ RAG ส่วนใหญ่มักจะให้แหล่งที่มาเพียง 3 แหล่งสำหรับคำตอบ แม้ว่าแหล่งที่มาหลากหลายจะเหมาะสมกับคำตอบ
10. แหล่งที่ไม่มีการเชื่อมต่อ โดยที่ข้อมูลจากแหล่งที่มาบางแหล่งไม่ได้รวมอยู่ในคำตอบ
11. การใช้แหล่งที่ไม่น่าเชื่อถือ โดยที่ระบบดูเหมือนจะชอบแหล่งที่มีคนค้นหามากกว่าแหล่งที่ถูกต้อง
12. แหล่งที่ซ้ำกัน โดยที่ระบบให้แหล่งที่มาหลายแหล่งที่มีเนื้อหาที่เหมือนกัน
13. แหล่งที่ไม่ได้กรอง โดยที่ระบบไม่ได้ให้ทางเลือกแก่ผู้ใช้ในการประเมินหรือกรองแหล่งที่มา
14. การขาดการโต้ตอบหรือการสำรวจ โดยที่ผู้ใช้บางคนรู้สึกว่าระบบ RAG ไม่ได้ถามคำถามที่ชี้แจง แต่แทนจะสมมติว่าผู้ใช้ตั้งใจจากคำถามแรก
15. ความจำเป็นในการตรวจสอบจากภายนอก โดยที่ผู้ใช้รู้สึกว่าต้องทำการตรวจสอบอิสระของคำตอบที่ให้มา ซึ่งลบความสะดวกของระบบ RAG ในฐานะ “ทดแทนการค้นหา”
16. การใช้วิธีการอ้างอิงทางวิชาการ เช่น [1] หรือ [34] ซึ่งเป็นมาตรฐานในการเขียนวิชาการ แต่อาจไม่เหมาะสมสำหรับผู้ใช้หลายคน
สำหรับงานนี้ นักวิจัยได้รวบรวมผู้เชี่ยวชาญ 21 คนจากสาขาวิชาต่างๆ รวมถึงปัญญาประดิษฐ์ สุขภาพและเวชศาสตร์ วิทยาศาสตร์ประยุกต์ และสังคมศาสตร์ ทั้งหมดเป็นนักวิจัยหลังปริญญาเอกหรือผู้สมัครปริญญาเอก
ผู้เข้าร่วมได้โต้ตอบกับระบบ RAG ที่ทดสอบในขณะที่พูดความคิดของตนออกมา เพื่อชี้แจงให้นักวิจัยเข้าใจวิธีการคิดของตนเอง
กระดาษนี้อ้างคำพูดจากผู้เข้าร่วมหลายคนเกี่ยวกับความกังวลและข้อเสียของระบบ RAG ที่ศึกษา
การแลกเปลี่ยน RAG
ผู้เขียนบทความนี้ย้ำถึงข้อบกพร่องที่ทราบของโมเดลภาษาขนาดใหญ่ (LLM) เมื่อใช้ในเครื่องมือตอบคำถาม
ข้อแรกคือ LLM มักจะ สร้างข้อมูลที่ไม่มีอยู่จริง และไม่มีความสามารถในการ ตรวจสอบความไม่สอดคล้องของข้อเท็จจริง
ข้อที่สองคือ LLM มักจะพบว่ามีความยากในการ ประเมินความถูกต้อง ของการอ้างอิงในบริบทของคำตอบที่สร้างขึ้น
ข้อที่สามคือ LLM มักจะ ชอบข้อมูล จากน้ำหนักการฝึกอบรมของตนเอง และอาจต้านข้อมูลจากเอกสารภายนอกแม้ว่าเอกสารนั้นจะใหม่หรือถูกต้องกว่าก็ตาม
สุดท้าย ระบบ RAG มักจะเอาใจผู้ใช้ โดยมักจะทำให้ผู้ใช้เชื่อคำตอบมากกว่าที่ควร
ทั้งหมดนี้ได้รับการยืนยันในกระดาษนี้
การศึกษา
ผู้เขียนได้ทดสอบกระบวนการศึกษากับผู้เข้าร่วม 3 คนจาก 24 คน
ในขั้นตอนแรก ผู้เข้าร่วมได้รับการสุ่มเลือกให้เข้าร่วมการสำรวจโดยใช้ LinkedIn หรืออีเมล
ขั้นตอนแรกสำหรับผู้เข้าร่วมที่เหลือคือ การค้นหาข้อมูลเชิงวิชาการ โดยที่ผู้เข้าร่วมเฉลี่ยประมาณ 6 คำถามในการค้นหาในช่วง 40 นาที
ขั้นตอนที่สองเกี่ยวข้องกับ การค้นหาข้อมูลทาง 辩論 ซึ่งเกี่ยวข้องกับเรื่อง субъектив
การขาดรายละเอียดเชิงวัตถุ
กระดาษนี้ชี้ให้เห็นว่าผู้ใช้พบว่าระบบ RAG มักจะขาดรายละเอียดเชิงวัตถุในคำตอบทั้งเชิงวัตถุและเชิงสубъектив
การขาดมุมมองที่ครอบคลุม
ผู้เขียนแสดงความกังวลเกี่ยวกับการขาดความแตกต่างและความเฉพาะเจาะจง และระบุว่าระบบ RAG มักจะไม่นำเสนอมุมมองที่หลากหลายในเรื่องใดเรื่องหนึ่ง
ภาษาที่มั่นใจมากเกินไป
ผู้เขียนสังเกตเห็นว่าระบบ RAG ทั้งสามระบบที่ทดสอบแสดงภาษาที่มั่นใจมากเกินไป
การอ้างอิงที่ไม่ถูกต้อง
ปัญหาหนึ่งที่พบบ่อยคือการอ้างอิงแหล่งที่ไม่ถูกต้อง
การคัดเลือกข้อมูลเพื่อความเหมาะสม
การค้นพบอีกอย่างหนึ่งคือการคัดเลือกข้อมูลเพื่อความเหมาะสม
การตรวจสอบ RAG แบบอัตโนมัติ
ในขั้นตอนที่สองของการศึกษา นักวิจัยได้ใช้การเขียนสคริปต์แบบอัตโนมัติเพื่อขอคำตอบจากระบบ RAG
คำตอบถูกวิเคราะห์โดยใช้ LLM (GPT-4o) สำหรับการประเมินคำตอบ
นักวิจัยยังใช้เครื่องมือ Jina.ai Reader เพื่อขอเนื้อหาที่เต็มของแหล่งที่มา
ผลการวิจัยพบว่าระบบ RAG ทั้งสามระบบที่ทดสอบมีปัญหาหลายประการ
ผู้เขียนสรุปว่า “ไม่มีระบบใดที่ทำงานได้ดีในหลายๆ มิติ ซึ่งแสดงให้เห็นว่ายังมีหลายสิ่งที่ต้องปรับปรุงในระบบตอบคำถาม”












