มุมมองของ Anderson

วิธีการหลบหลีกการตรวจสอบวิทยาศาสตร์เท็จผ่านผู้ตรวจสอบ AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
An industrial robot at an AI paper mill, stamping 'ACCEPTED' onto spurious and impossible academic research papers, including papers on perpetual motion and alchemy. ChatGPT-4o; Adobe Firefly V3; et al.

การวิจัยใหม่แสดงให้เห็นว่าระบบ AI สามารถเขียนเอกสารวิทยาศาสตร์เท็จที่ AI อื่นยอมรับเป็นเรื่องจริงได้ โดยหลบหลีกการตรวจสอบที่เคยใช้ได้ผล และเปิดเผยว่าโลกการวิจัยอาจล่มสลายได้ง่ายๆ โดยการหลอกลวง AI ที่หลอกลวง AI

 

ภาควิชาวิจัยทางวิชาการ ซึ่งเป็นแนวหน้าของนวัตกรรม AI อยู่ในสถานการณ์ความเชื่อมั่นที่ถูกขัดขวางโดย AI ซึ่งมีผลกระทบต่อการวิจัย การส่งผลงาน และการตรวจสอบอย่างมาก ตั้งแต่เมื่อผลกระทบของ AI ต่อการวิจัยเริ่มชัดเจนเมื่อประมาณ 4 ปีที่แล้ว โดยมีการโต้เถียงเรื่องการสร้างเอกสารวิจัยที่มีคุณภาพต่ำจำนวนมาก

ภาควิชาวิชาการส่วนใหญ่ รวมทั้งภาควิชาวิจัย ได้เข้าสู่สงครามเย็นระหว่าง AI ที่สร้างข้อความ เช่น ChatGPT และ Claude ซีรีส์ และ AI รุ่นใหม่ที่สามารถตรวจจับข้อความที่สร้างโดย AI ได้ โดยไม่ต้องมีการตรวจสอบที่ไม่จำเป็น

ความตึงเครียดเหล่านี้มีแนวโน้มที่จะเพิ่มขึ้นพร้อมกับจำนวนการยื่นเอกสารวิจัย ซึ่งเพิ่มขึ้นอย่างรวดเร็ว โดยได้รับแรงหนุนจากระบบและเฟรมเวิร์กที่ได้รับการช่วยเหลือจาก AI และต้องการการตรวจสอบอุตสาหกรรมที่ขับเคลื่อนด้วย AI เพื่อกรองเอกสารที่สร้างโดย AI เพียงอย่างเดียว

การเข้าถึงความรู้เท็จ

การวิจัยใหม่ระหว่างสหรัฐอเมริกาและซาอุดีอาระเบียได้ตรวจสอบว่า “ไฟร์วอลล์” ของการตรวจจับ AI สามารถถูกเจาะจงโดยเอกสารการยื่นแบบ AI ทั้งหมดได้หรือไม่ เมื่อเอกสารเหล่านั้นใช้เทคนิคที่น่าเชื่อถือเพิ่มเติม

ในการทดสอบ ระบบใหม่ที่เรียกว่า BadScientist สามารถบรรลุอัตราการยอมรับได้สูงถึง 82% จากระบบ LLM ที่ใช้ตรวจจับข้อความที่สร้างโดย AI ในเอกสารวิจัย

ระบบ BadScientist ใช้ตัวแทน AI หนึ่งรายในการสร้างเอกสารวิจัยเท็จและอีกตัวในการตรวจสอบโดยใช้โมเดลภาษาในปัจจุบัน Source: https://arxiv.org/pdf/2510.18003

ระบบ BadScientist ใช้ตัวแทน AI หนึ่งรายในการสร้างเอกสารวิจัยเท็จและอีกตัวในการตรวจสอบโดยใช้โมเดลภาษาในปัจจุบัน Source: https://arxiv.org/pdf/2510.18003

เอกสารเท็จถูกสร้างขึ้นโดยใช้หัวข้อการประชุม AI ที่แท้จริงและกลยุทธ์ที่หลอกลวง จากนั้นจะถูกตรวจสอบโดยโมเดลที่ปรับให้เหมาะสมกับข้อมูลการตรวจสอบโดยผู้ทรงคุณวุฒิ รวมถึง GPT-5 สำหรับการตรวจสอบความซื่อสัตย์

การเปิดตัวเอกสารนี้เกิดขึ้นพร้อมกับการประชุม Open Conference of AI Agents for Science 2025 ที่ Stanford ซึ่งผู้เข้าร่วมและผู้พูดเป็นมนุษย์ แต่เอกสารทั้งหมดถูกเขียนและตรวจสอบโดยระบบ AI ที่หลากหลาย

BadScientist ระบบใหม่นี้อธิบายว่าใช้กลยุทธ์หลอกลวงทางวิชาการและวรรณกรรมที่หลากหลายเพื่อเปลี่ยนเอกสารให้ห่างจากสิ่งที่ระบบตรวจจับ AI สามารถตรวจจับได้

ผู้เขียนเน้นย้ำว่าแม้ว่าระบบตรวจจับจะตรวจจับข้อความ AI ในเอกสารเท็จ แต่ก็มักจะอนุญาตให้เอกสารนั้นผ่านไปได้อย่างไร้เหตุผล และเพิ่มเติมว่าความพยายามของตนเองในการเสริมสร้างระบบป้องกันใหม่นี้ไม่ได้ให้ผลลัพธ์ที่ดีขึ้นมากนัก

เอกสารระบุว่า:

‘เอกสารเท็จบรรลุอัตราการยอมรับสูง โดยผู้ตรวจสอบมักแสดงความขัดแย้งระหว่างความกังวลและความยอมรับ—การระบุประเด็นความซื่อสัตย์ แต่ยังคงแนะนำให้ยอมรับอย่างไร้เหตุผล นี่เป็นการล่มสลายของระบบตรวจจับ AI ที่ทำงานมากกว่าการประเมินอย่างมีวิจารณญาณ’

‘[…] การขอให้ผู้ตรวจสอบ LLM “ระมัดระวัง” นั้นไม่เพียงพอ ความกังวลของชุมชนวิทยาศาสตร์คือการเผชิญกับการเลือกที่เร่งด่วนในการนำระบบป้องกันระดับลึกมาใช้ รวมถึงการตรวจสอบความซื่อสัตย์ การให้คะแนนตามความซื่อสัตย์ และการตรวจสอบของมนุษย์เป็นข้อบังคับ—หากไม่ดำเนินการเหล่านี้ เราอาจเผชิญกับวงจรการเผยแพร่ AI เท่านั้นที่ซึ่งการปลอมแปลงที่ซับซ้อนจะท่วมท้นความสามารถของเราในการแยกแยะระหว่างการวิจัยที่แท้จริงและเอกสารเท็จที่น่าเชื่อถือ’

‘ความซื่อสัตย์ของความรู้ทางวิทยาศาสตร์เองก็อยู่ในความเสี่ยง’

วิธีการ

เฟรมเวิร์กการสร้างเอกสารที่ใช้ในการวิจัยนี้เป็นการปรับปรุงระบบ AI-Scientist ในปี 2024 โดยผู้เขียนเน้นย้ำว่าระบบทั้งหมดได้รับการออกแบบใหม่

โครงสร้างทั้งหมดมีจุดมุ่งหมายเพื่อให้ AI สามารถสร้างเอกสารเท็จที่น่าเชื่อถือได้โดยไม่ต้องทำการทดลองหรือใช้ข้อมูลที่แท้จริง

การเตรียมการนี้อธิบายว่าระบบหลีกเลี่ยงการมีส่วนร่วมของมนุษย์ การโจมตีแบบพรอมต์ หรือการสมรู้ร่วมคิดระหว่างตัวแทนผู้เขียนและผู้ตรวจสอบ

กลยุทธ์ “อะตอม” ที่ใช้ในการสร้างเอกสารเท็จเป็นกลยุทธ์แบบโมดูลาร์ที่สามารถใช้ได้โดยลำพังหรือร่วมกัน

ข้อมูลและการทดสอบ

ในการทดสอบ ผู้เขียนใช้ GPT-5 เพื่อสร้างหัวข้อการวิจัยในพื้นที่สำคัญของ AI โดยใช้โดเมน ปัญญาประดิษฐ์, การเรียนรู้ของเครื่อง, การประมวลผลภาษา自然, การประมวลผลภาพ, หุ่นยนต์, ระบบ และ ความปลอดภัย

หมวดหมู่เหล่านี้กลายเป็นหัวข้อสำหรับเอกสารเท็จ โดยแต่ละหัวข้อขยายออกเป็น 4 версииที่แตกต่างกัน โดยใช้กลยุทธ์ที่กล่าวถึงข้างต้น

เอกสารเท็จถูกเขียนโดย GPT-5 ทั้งหมด เพื่อตรวจสอบเอกสารเหล่านี้ ผู้เขียนใช้ GPT-4.1, o4-mini และ o3

เพื่อให้คะแนนการตรวจสอบมีความหมาย ระบบถูกปรับให้เหมาะสมโดยใช้การยื่นผลงานจริง 200 รายการจาก ICLR 2025 OpenReview ซึ่งเป็นคอลเลกชันสาธารณะของเอกสารวิจัยที่แท้จริง

การบรรเทา

สองวิธีที่อาจช่วยให้โมเดลการตรวจสอบในอนาคตหลีกเลี่ยงวิธีการโจมตีใหม่เหล่านี้

วิธีแรก การตรวจสอบพร้อมการตรวจจับ (ReD) เพิ่มขั้นตอนการตรวจสอบความซื่อสัตย์เข้าไปในกระบวนการตรวจสอบมาตรฐาน โดยที่โมเดลจะระบุเนื้อหาที่สร้างโดย AI และอ้างอิงหลักฐาน

วิธีที่สอง การตรวจจับเท่านั้น (DetOnly) ข้ามการตรวจสอบเต็มรูปแบบและขอให้โมเดลจำแนกเอกสารว่าเป็นของแท้หรือปลอม

โดยรวมแล้ว ReD มีความระมัดระวังมากกว่า ในขณะที่ DetOnly มีการเรียกคืนมากกว่า แต่มีผลบวกลวงมากกว่า

สรุป

หนึ่งในความท้าทายที่ยิ่งใหญ่ที่สุดสำหรับการตรวจจับข้อความ AI ในอนาคตอันใกล้น่าจะเป็นความเป็นไปได้ที่จะเกิดการบรรจบกันระหว่างมาตรฐานการเขียนมาตรฐานและมาตรฐานข้อความ AI ที่สร้างขึ้น (ซึ่งถูกกำหนดไว้ในปัจจุบันโดยคุณลักษณะที่บอกเป็นนัย เช่น คำที่มีอำนาจเหนือ และ รูปแบบไวยกรณ์)

หากภาษาและภาษา AI มาบรรจบกันในมาตรฐานทั่วไป การตรวจจับในอนาคตที่อาศัยการตรวจสอบผลลัพธ์เท่านั้นอาจยากต่อการนำไปใช้

นอกจากนี้ เมื่อ LLM มีความสามารถมากขึ้น และ “ตells” ที่ลดลง (ไม่ว่าจะผ่านการออกแบบโครงสร้างหรือการกรอง API ระดับ) พวกมันจะกลายเป็นนักเขียนที่ดีขึ้น ดังนั้นภาษาของมนุษย์และ AI จึงมีแนวโน้มที่จะพบกันกลางๆ และรวมกัน

เมื่อนั้น การตรวจจับ AI สำหรับภาษาน่าจะไปถึงจุดเดียวกับที่ AI การสร้างภาพและ (ในระดับที่น้อยกว่า) AI การสร้างวิดีโอมาถึง: ความจำเป็นในการใช้ระบบยืนยันความถูกต้องที่สอง เช่น Content Authenticity Initiative ที่นำโดย Adobe หรือการตรวจสอบยืนยันความถูกต้องที่ใช้บล็อกเชน/เลดจ์

 

เผยแพร่ครั้งแรกวันพุธที่ 22 ตุลาคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai