มุมมองของ Anderson

ChatGPT-5 และ Gemini 2.5 มีการหลอกลวงใน 40% ของคำถามที่ทดสอบในห้องข่าว

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
A robot journalist in a retro newsroom. SDXL, Flux Kontext Pro, Firefly 3, et al.

การศึกษาใหม่พบว่า ChatGPT-5 และ Google Gemini มีการหลอกลวงใน 40% ของคำถามที่ทดสอบในห้องข่าว โดยมักจะสร้างข้อความที่มั่นใจ แต่ไม่มีหลักฐานจากข้อเท็จจริงที่ตรวจสอบได้ Google’s NotebookLM มีการหลอกลวงในอัตราที่ต่ำกว่า คือ 13% – อัตราที่จะทำให้นักข่าวใดๆ ในโลกถูกไล่ออก การศึกษาพบว่าโมเดลเหล่านี้บิดเบือนแหล่งข้อมูลโดยการเปลี่ยนความคิดเห็นเป็นข้อเท็จจริง และการลบการอ้างอิง ทำให้พวกมันเป็นเครื่องมือที่มีความเสี่ยงสำหรับการสื่อสาร

 

โมเดลภาษาขนาดใหญ่ได้รับการนำมาใช้ในวงการหนังสือพิมพ์อย่างรวดเร็วในระยะหลัง ในสภาพแวดล้อมการทำงานที่ได้ลดค่าใช้จ่าย งบประมาณ และพนักงานตั้งแต่การเข้าสู่ยุคดิจิทัล ทำลายสองศตวรรษของประเพณี ในกระบวนการที่ไม่สามารถหยุดยั้งได้ ซึ่งเริ่มต้นในต้นปี 2000

ในความเป็นจริง สภาพแวดล้อมการทำงานก็พร้อมแล้ว เนื่องจากสื่อได้ปรับตัวเข้ากับการลดงานผ่าน ‘นวัตกรรม’ มาตั้งแต่การ แนะนำระบบการวางกระดาษดิจิทัล ในทศวรรษ 1980 รวมทั้งความท้าทายจาก การมาถึงของวิทยุ และ โทรทัศน์

การนำ AI เข้าสู่ห้องข่าวและองค์กรสื่อไม่ได้ไร้ปัญหา อย่างไรก็ตาม ในบริบทที่ 55% ของบริษัทต่างๆ ต้องเสียใจ ที่แทนที่คนด้วย AI และ Gartner คาดการณ์ ว่าองค์กรต่างๆ จะลดการนำ AI มาใช้อย่างมากภายในสองปี องค์กรสื่อหลายแห่งได้ เรียกคืน นักข่าวที่ถูกแทนที่ด้วย AI เมื่อข้อบกพร่องที่รุนแรงและน่าอายของตัวเลือกการเรียนรู้ของเครื่องจักรกลายเป็นที่ชัดเจน

ความผิดพลาดไม่ใช่แค่ของมนุษย์

แม้ว่า การหลอกลวง จะเป็นปัญหาใหญ่สำหรับสาขาที่ต้องการการอ้างอิงที่แม่นยำ (ด้วยความสนใจสาธารณะที่มีต่อกรณีการล้มเหลวของ AI ในสาขา กฎหมาย, การวิจัย และ สื่อสาร) การศึกษาใหม่ในประเทศสหรัฐฯ พบว่าโมเดลภาษาขนาดใหญ่ในวงการหนังสือพิมพ์ต้องเผชิญกับความท้าทายที่กว้างกว่าที่คาดไว้

ผู้เขียนศึกษาวิจัย ChatGPT, Google Gemini และ NotebookLM ในงานที่มีลักษณะการรายงาน: โดยใช้เอกสาร 300 ฉบับที่มีเนื้อหาที่เกี่ยวข้องกับการดำเนินคดีและนโยบายของ TikTok ในสหรัฐฯ

นักวิจัยเปลี่ยนแปลงความเฉพาะเจาะจงของคำสั่งและจำนวนเอกสารที่ให้ จากนั้นวิเคราะห์ผลลัพธ์โดยใช้ระบบการจำแนกประเภทที่ออกแบบมาเพื่อจับประเภทและความรุนแรงของการหลอกลวง

ทั่วทั้งผลลัพธ์ 30% มีการหลอกลวงอย่างน้อยหนึ่งครั้ง ในขณะที่ ChatGPT และ Gemini มีอัตราการหลอกลวง 40% – สูงกว่าอัตราการหลอกลวง 13% ของ NotebookLM ถึงสามเท่า

แทนการสร้างข้อเท็จจริงหรือหน่วยงานใหม่ๆ โมเดลเหล่านี้มักแสดงให้เห็นถึง ความมั่นใจในการตีความ โดยการเพิ่มลักษณะที่ไม่ได้รับการสนับสนุนและเปลี่ยนความคิดเห็นที่มีการอ้างอิงเป็นข้อความทั่วไป:

‘โดยคุณภาพ ส่วนใหญ่ของข้อผิดพลาดไม่ได้เกี่ยวข้องกับการสร้างหน่วยงานหรือตัวเลขใหม่ๆ แต่เราได้สังเกตเห็นความมั่นใจในการตีความ – โมเดลเหล่านี้เพิ่มลักษณะที่ไม่ได้รับการสนับสนุนของแหล่งข้อมูลและเปลี่ยนความคิดเห็นที่มีการอ้างอิงเป็นข้อความทั่วไป’

‘รูปแบบเหล่านี้เปิดเผยถึงความไม่ตรงกันทางญาณวิทยา – ในขณะที่การสื่อสารต้องมีการอ้างอิงที่ชัดเจนสำหรับทุกข้อความ โมเดลภาษาขนาดใหญ่จะสร้างข้อความที่มีลักษณะเป็นทางการโดยไม่คำนึงถึงหลักฐาน’

‘เราขอแนะนำให้มีการขยายระบบการจำแนกประเภทของการหลอกลวงที่มีอยู่แล้วสำหรับการใช้งานในสื่อ และเรายังแย้งว่าเครื่องมือที่มีประสิทธิภาพสำหรับห้องข่าวต้องมีสถาปัตยกรรมที่บังคับให้มีการอ้างอิงที่แม่นยำมากกว่าการเพิ่มความคล่องตัว’

ทฤษฎีและวิธีการ

สาเหตุที่แท้จริงของการหลอกลวงยังคงเป็นเรื่องที่ถกเถียงกันอยู่ แต่ทฤษฎีส่วนใหญ่เห็นด้วยว่าคุณภาพและ/หรือการกระจายตัวของข้อมูลเป็น ปัจจัยที่มีส่วนช่วย ในช่วงการฝึกอบรม และมีการเสนอแนะว่า 100% ของผลลัพธ์ของโมเดลภาษาขนาดใหญ่ เป็นเพียงการหลอกลวง (ยกเว้นว่าบางส่วนของการหลอกลวงเหล่านั้นตรงกับ现実)

Tik Tok

เพื่อหาวิธีการที่มีประโยชน์สำหรับนักข่าว การศึกษานี้ได้ทำการประเมินโดยใช้กระบวนการทำงานที่เหมือนกับในห้องข่าว

โมเดลที่มีประสิทธิภาพสูงสุดถูกทดสอบโดยใช้กลยุทธ์การสั่งงานทั่วไปและการตั้งค่าเอกสาร โดยที่สามารถวัดความถี่และประเภทของข้อผิดพลาดการหลอกลวงได้

การวิเคราะห์เน้นไปที่การค้นหาด้วยเอกสารที่เป็นแบบฉบับในงานสื่อสารและงานสืบสวน

เอกสารถูกเก็บจาก Washington Post, New York Times, ProQuest และ Westlaw ซึ่งนำไปสู่การรวบรวมเอกสาร 300 ฉบับ ประกอบด้วยวิทยานิพนธ์ 5 ฉบับ บทความข่าว 150 ฉบับ และเอกสารทางกฎหมาย 145 ฉบับ

ผู้เข้าแข่งขัน

มีการทดสอบเครื่องมือ 3 ชิ้น แต่ละชิ้นแสดงถึงวิธีการที่แตกต่างกันในการค้นหาด้วยเอกสาร

ChatGPT-5 ถูกประเมินโดยใช้ ฟังก์ชัน Projects ซึ่งจำกัดการอัปโหลดเอกสารไว้ที่ 100 ฉบับ

ข้อมูลและการทดสอบ

ในการทดสอบเบื้องต้นสำหรับการ การหลอกลวง พบว่า 12 ใน 40 ผลลัพธ์ของโมเดลมีการหลอกลวงอย่างน้อยหนึ่งครั้ง

ChatGPT และ Gemini มีการหลอกลวงใน 40% ของผลลัพธ์ ในขณะที่ NotebookLM มีการหลอกลวงใน 13% ของกรณี

สรุป

ใครก็ตามที่ได้ทดลองใช้โมเดลทั้งสามที่ศึกษาในงานวิจัยใหม่นี้จะทราบว่าแต่ละโมเดลมีข้อดีและข้อเสีย

แม้ว่า NotebookLM จะทำงานได้ดีกว่า ChatGPT และ Gemini ในด้านการอ้างอิง แต่ก็ยังมีอัตราการหลอกลวงที่จะทำให้นักข่าวส่วนใหญ่ถูกไล่ออก

สำหรับสาขาที่ต้องการมาตรฐานการอ้างอิงและหลักฐานที่ชัดเจน เช่น กฎหมาย สื่อสาร และการวิจัยทางวิทยาศาสตร์ ดูเหมือนว่าไม่มีเครื่องมือที่มีประสิทธิภาพในการจัดการข้อมูลที่ผู้ใช้สั่งให้ทำ

ในขณะที่ทุกสิ่งที่ระบบเหล่านี้ผลิตสำหรับภาคส่วนเหล่านี้ยังคงต้องการการตรวจสอบจากมนุษย์

* Google Cloud มีการวิเคราะห์หัวข้อนี้อย่างละเอียดและน่าสนใจ ที่นี่

การแปลงการอ้างอิงภายในของนักเขียนให้เป็นลิงก์

เผยแพร่ครั้งแรกวันพุธที่ 1 ตุลาคม 2025 แก้ไขวันพฤหัสบดีที่ 2 ตุลาคมเพื่อแก้ไขข้อผิดพลาดใน TL:DR และแก้ไขข้อผิดพลาดด้านรูปแบบในประโยคแรก

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai