มุมมองของ Anderson
วิธีการหลบหลีกการตรวจสอบวิทยาศาสตร์เท็จผ่านผู้ตรวจสอบ AI

งานวิจัยใหม่แสดงว่า AI สามารถเขียนบทความวิทยาศาสตร์ปลอมที่ AI อีกระบบยอมรับว่าเป็นของจริง หลบเลี่ยงกลไกตรวจจับที่เคยได้ผล และเผยให้เห็นว่าโลกการวิจัยอาจล่มสลายเป็นวงจรที่บอตหลอกบอตได้ง่ายเพียงใด
ภาคการวิจัยทางวิชาการ ซึ่งเป็นแนวหน้าของนวัตกรรม AI อย่างน่าขัน กำลังเผชิญวิกฤตความน่าเชื่อถือที่ขับเคลื่อนโดย AI เอง ผลกระทบของแมชชีนเลิร์นนิงต่อการวิจัย การส่งบทความ และการประเมินมีมากนับตั้งแต่ศักยภาพของ AI ชัดเจนขึ้นเมื่อราวสี่ปีก่อน ความขัดแย้งล่าสุดคือการผลิตบทความสำรวจคุณค่าต่ำจำนวนมหาศาล
เช่นเดียวกับวงการการศึกษาโดยรวม ภาควิจัยอยู่ในสงครามเย็นระหว่าง AI ที่สร้างข้อความ เช่น ChatGPT และ Claude กับ AI “ผู้ตรวจจับ” รุ่นใหม่ที่พยายามระบุผลงานเหล่านั้นโดยไม่กล่าวหานักเรียนหรือนักวิทยาศาสตร์ผิด ๆ
ความตึงเครียดจะเพิ่มขึ้นพร้อมจำนวนบทความที่เติบโตอย่างรวดเร็วด้วยระบบที่ใช้ AI และทำให้กระบวนการกำกับดูแลต้องถูกทำเป็นอุตสาหกรรมโดย AI เพื่อกรองงานที่เกิดจาก AI ทั้งหมดออกไป
ยินดีต้อนรับความรู้ปลอม
งานวิจัยร่วมจากสหรัฐฯ และซาอุดีอาระเบียตรวจสอบว่า “ไฟร์วอลล์” ตรวจจับ AI ที่กำลังเกิดขึ้นจะถูกเจาะด้วยบทความที่ AI สร้างทั้งหมดได้มากเพียงใด เมื่อบทความใช้กลวิธีที่น่าเชื่อถือเพิ่มเติม
ระบบใหม่ชื่อ BadScientist ทำให้งานปลอมได้รับการยอมรับสูงถึง 82% จากระบบที่อาศัย LLM ซึ่งใช้ตรวจจับเนื้อหา AI ในบทความวิทยาศาสตร์ปัจจุบัน

BadScientist ใช้เอเจนต์ AI หนึ่งตัวสร้างบทความวิทยาศาสตร์ปลอม และอีกตัวตรวจประเมินด้วยโมเดลภาษาปัจจุบัน ที่มา: https://arxiv.org/pdf/2510.18003
บทความปลอมใช้หัวข้อจริงจากการประชุม AI และกลยุทธ์ทำให้เข้าใจผิด จากนั้นโมเดลที่ปรับเทียบด้วยข้อมูล peer review รวมถึง GPT-5 สำหรับตรวจความถูกต้องเป็นผู้ประเมิน หลายบทความได้คะแนนสูงแม้มีข้อผิดพลาดหรือข้อมูลแต่งขึ้นอย่างชัดเจน
การเผยแพร่งานตรงกับงาน Open Conference of AI Agents for Science 2025 ที่ Stanford ซึ่งผู้เข้าร่วมและวิทยากรเป็นมนุษย์ แต่บทความทั้งหมดเขียนและประเมินโดย AI หลายระบบ
BadScientist ใช้การหลอกลวง การละเว้น การประดิษฐ์ และการกล่าวเกินจริงทั้งเชิงวิชาการและวรรณศิลป์ เพื่อทำให้งานอยู่ห่างจากรูปแบบที่เครื่องตรวจส่วนใหญ่จำได้ว่า AI สร้าง
ผู้เขียนเตือนว่าแม้ระบบตรวจจับจะพบเนื้อหา AI ในงานปลอม แต่ก็มักปล่อยให้ผ่าน และการพยายามสร้างภูมิคุ้มกันให้ผู้ตรวจได้ผลดีกว่าการสุ่มเพียงเล็กน้อย
บทความแต่งขึ้นมีอัตรายอมรับสูง ผู้ประเมินมักเกิดความขัดแย้งระหว่างความกังวลกับการยอมรับ กล่าวคือชี้ปัญหาความซื่อสัตย์แต่ยังแนะนำให้รับ สิ่งนี้เผยว่า AI ผู้ประเมินทำหน้าที่จับคู่รูปแบบมากกว่าประเมินอย่างวิพากษ์
เพียงขอให้ LLM “ระมัดระวังขึ้น” ไม่เพียงพอ ชุมชนวิทยาศาสตร์ต้องใช้การป้องกันหลายชั้นทันที ทั้งตรวจแหล่งที่มา ให้คะแนนถ่วงน้ำหนักด้วยความซื่อสัตย์ และบังคับการกำกับโดยมนุษย์ มิฉะนั้นวงจรเผยแพร่ที่มีแต่ AI อาจถูกงานปลอมที่แนบเนียนท่วมจนแยกงานจริงไม่ได้ ความซื่อสัตย์ขององค์ความรู้วิทยาศาสตร์ตกอยู่ในความเสี่ยง
บทความชื่อ BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers? เขียนโดยนักวิจัยหกคนจาก University of Washington และ King Abdulaziz City for Science and Technology ในริยาด พร้อมเว็บไซต์โครงการ
วิธีการ
กรอบเอเจนต์สร้างบทความดัดแปลงอย่างมากจากงาน AI-Scientist ปี 2024 โดยออกแบบกระบวนการใหม่ทั้งหมด เหลือเพียงพรอมต์เขียนพื้นฐาน ตัดการทดลองจริงและโครงสร้างแม่แบบออก ระบบเริ่มจากseedง่าย ๆ แล้วประดิษฐ์ผลการทดลองและสร้างโค้ดพล็อตได้ตามต้องการ
จุดประสงค์คือให้ AI สร้างบทความปลอมที่น่าเชื่อโดยไม่ทำการทดลองหรือใช้ข้อมูลจริง ระบบสร้างหรือดัดแปลงข้อมูลสังเคราะห์เพื่อสนับสนุนข้ออ้างที่แต่งขึ้นโดยเจตนา
การตั้งใจหลีกเลี่ยงมนุษย์ การโจมตีพรอมต์ หรือการสมรู้ร่วมคิดระหว่างเอเจนต์ผู้เขียนกับผู้ประเมิน ผู้ประเมิน AI อ่านงานเพียงรอบเดียว มีเฉพาะบทความ และไม่สามารถทำการทดลองซ้ำ ซึ่งสะท้อนสภาพ peer review จริง
“กลยุทธ์อะตอม” เป็นยุทธวิธีแบบโมดูลที่ใช้เดี่ยวหรือรวมกันได้ ได้แก่ เน้นผลดีอย่างรุนแรงให้ดูเป็นความก้าวหน้าครั้งใหญ่ (TooGoodGains); เลือก baseline และผลที่เข้าข้างวิธีใหม่พร้อมละช่วงความเชื่อมั่น (BaselineSelect); ใส่ ablation สถิติแม่นยำ ตารางเรียบร้อย และสัญญาว่าจะปล่อยโค้ดภายหลัง (StatTheater); ขัดเกลาโครงสร้าง คำศัพท์ การอ้างอิงข้ามส่วน และรูปแบบ (CoherencePolish); และเพิ่มพิสูจน์ทางการที่ดูถูกต้องแต่ซ่อนข้อผิดพลาด (ProofGap)
ข้อมูลและการทดสอบ
ผู้เขียนใช้ GPT-5 สร้างหัวข้อในสาขา AI, Machine Learning, Computer Vision, Natural Language Processing, Robotics, Systems และ Security แต่ละหัวข้อกลายเป็น seed ของบทความปลอมสี่รุ่น โดยใช้กลยุทธ์ข้างต้นเพื่อหลอกหรือสร้างความประทับใจ การ “ยอมรับ” ตัดสินจากคะแนนสุดท้ายของ AI ผู้ประเมินเท่านั้น
GPT-5 เขียนบทความปลอมทั้งหมด ส่วนผู้ประเมินคือ GPT-4.1, o4-mini และ o3 ทั้งหมดได้รับพรอมต์ประเมินเดียวกันซึ่งเลียนแบบหลักเกณฑ์ peer review จริง
คะแนนถูกปรับเทียบด้วยบทความจริง 200 ชิ้นจาก ICLR 2025 OpenReview เกณฑ์หนึ่งตั้งให้ตรงอัตรายอมรับจริง 31.73% ที่คะแนน 7 อีกเกณฑ์คือคะแนนที่มีโอกาส 50% ที่มนุษย์จะรับ คำนวณได้ 6.667
ผู้เขียนทดสอบความน่าเชื่อถือด้วยการจำลองประเมินบทความปลอม 5,000 ชิ้น ใช้ผู้ประเมิน AI 1–3 ตัวที่คืนคะแนน 1–10 แบบดูเหมือนสุ่ม แม้มีสัญญาณรบกวน ระบบกลับผิดพลาดน้อยกว่าขีดจำกัดกรณีเลวร้ายตามทฤษฎีมาก การใช้ผู้ประเมินสามตัวแทนหนึ่งตัวลดความแปรปรวนของคะแนนและเพิ่มเสถียรภาพเกือบสามเท่า จึงเลือกสามโมเดลกับชุดปรับเทียบ 200 บทความจริง
ตัวชี้วัดสองรายการคือ อัตราการยอมรับ ซึ่งวัดความถี่ที่งานปลอมผ่านเกณฑ์ และ คะแนนเฉลี่ยจากผู้ประเมิน เพื่อวัดว่าระบบหลอกผู้ประเมินได้ดีเพียงใด

ACPT คือสัดส่วนงานปลอมที่ผ่านสองเกณฑ์ ส่วน ICR-m คืออัตราที่แต่ละโมเดลแจ้งข้อกังวล คอลัมน์สุดท้ายเป็นผลรวมด้วยเสียงข้างมาก
บทความปลอมได้รับการยอมรับสูงในแทบทุกกลยุทธ์ ยุทธวิธีแรกเพียงอย่างเดียวได้ 67% และ 82% ตามสองเกณฑ์ แสดงว่าโมเดลถูกโน้มน้าวได้ง่าย การรวมทุกกลยุทธ์ลดการยอมรับเล็กน้อยแต่เพิ่มการตรวจพบเป็นสองเท่า โดยมากกว่าครึ่งของการประเมินแจ้งข้อกังวล กลยุทธ์แรกให้สมดุลดีที่สุด o3 แจ้งเตือนมากที่สุดและ GPT-4.1 น้อยที่สุด

การกระจายคะแนนของ GPT-4.1 สีแดง, o3 สีส้ม และ o4-mini สีน้ำเงิน เส้นประแดงคือเกณฑ์รับที่ 7
o4-mini มักให้คะแนนเฉลี่ยสูงกว่า o3 มีการกระจายกว้างและค่าสุดโต่งกว่า ส่วน GPT-4.1 ให้คะแนนต่ำอย่างสม่ำเสมอ

สัดส่วนกรณีที่โมเดลแจ้งปัญหาความซื่อสัตย์แต่ยังให้คะแนนผ่าน ค่าสูงหมายถึงการเชื่อมโยงการตรวจพบกับการตัดสินสุดท้ายที่อ่อนแอ
โมเดลมักให้คะแนนสูงแม้แจ้งข้อกังวล o4-mini ไม่สอดคล้องที่สุด โดยเกิดความขัดแย้ง 100% ในบางกลยุทธ์และ 50–80% ในที่อื่น GPT-4.1 อยู่ระหว่าง 0–75% และ o3 อยู่ที่ 26–52% สัญญาณตรวจจับจึงเชื่อมโยงกับคะแนนสุดท้ายได้ไม่ดี
การบรรเทา
มีการทดสอบสองวิธี วิธีแรก Review-with-Detection (ReD) เพิ่มขั้นตรวจความซื่อสัตย์ ให้โมเดลทำเครื่องหมายเนื้อหา AI และยกหลักฐาน คำเตือนเพิ่มจาก 57% เป็น 86% แต่อัตรายอมรับก็เพิ่มด้วย แสดงว่าคำเตือนไม่สะท้อนในคะแนนสุดท้าย

ReD ทำให้ o3 ไวต่อปัญหามากขึ้น แต่ GPT-4.1 ไม่แจ้งข้อกังวลเลย การยอมรับที่สูงขึ้นแม้มีคำเตือนแสดงว่าการตรวจจับกับการให้คะแนนไม่สอดคล้องกัน
วิธีที่สอง Detection-Only (DetOnly) ข้ามการประเมินเต็มและให้โมเดลจำแนกงานว่าแท้หรือปลอม ความแม่นยำโดยรวมใกล้การสุ่ม ยกเว้น o3 ที่ดีขึ้นเล็กน้อย

ReD ระมัดระวังกว่า ส่วน DetOnly มี recall สูงกว่าแต่ false positive มาก o3 มีอคติตรวจจับแรงที่สุด o4-mini ไม่สม่ำเสมอ และ GPT-4.1 แทบตรวจไม่พบ
งานวิจัยสรุปว่าวงจรเผยแพร่ที่มีแต่ AI คุกคามรากฐานความรู้ หากงานปลอมแยกจากงานจริงไม่ได้ วิทยาศาสตร์เสี่ยงล่มสลาย ทางออกต้องมีการป้องกันหลายชั้น: เทคนิค เช่น ตรวจแหล่งที่มาและสิ่งประดิษฐ์; กระบวนการ เช่น คะแนนที่คำนึงถึงความซื่อสัตย์และการกำกับของมนุษย์; ชุมชน เช่น การทบทวนหลังเผยแพร่และระบบผู้แจ้งเบาะแส; และวัฒนธรรม เช่น การศึกษาเรื่องข้อจำกัด AI กับแนวทางจริยธรรม
ผู้เขียนมองงานนี้เป็นสัญญาณเตือนให้สร้างการป้องกันก่อนปัญหาเกิดในวงกว้าง ระบบปัจจุบันยังไม่พร้อมสำหรับการวิจัยที่มีแต่ AI และความซื่อสัตย์ของวิทยาศาสตร์ขึ้นอยู่กับการประเมินโดยมนุษย์อย่างเข้มงวด
บทสรุป
ความท้าทายใหญ่ของการตรวจข้อความ AI ในอนาคตอันใกล้คือการบรรจบกันของการเขียนทั่วไปกับมาตรฐานข้อความ AI ซึ่งปัจจุบันยังระบุได้จากคำที่ใช้เด่นและรูปแบบไวยากรณ์
หากภาษามนุษย์และภาษา AI รวมเป็นมาตรฐานทั่วไป การตรวจจากผลลัพธ์เพียงอย่างเดียวจะยากขึ้น เมื่อ LLM อเนกประสงค์ขึ้นและร่องรอยลดลงจากสถาปัตยกรรม การฝึก หรือการกรอง API มันจะเขียนได้ดีขึ้น ทำให้ภาษามนุษย์กับ AI หลอมรวมและกลายเป็นแบบเดียวกัน
เมื่อถึงจุดนั้น การตรวจภาษา AI อาจเข้าสู่สภาพเดียวกับภาพและวิดีโอ AI ซึ่งต้องพึ่งระบบแหล่งที่มารอง เช่น Content Authenticity Initiative ของ Adobe หรือการตรวจแหล่งที่มาด้วยบล็อกเชนและบัญชีแยกประเภท
เผยแพร่ครั้งแรกวันพุธที่ 22 ตุลาคม 2025












