มุมมองของ Anderson
วิธี ‘เซน’ ในการหยุดการหลอกลวงของโมเดลภาษา

การบอก ChatGPT ให้ตรวจสอบคำตอบสุ่มก่อนแก้ปัญหาจริงจะทำให้โมเดลคิดอย่างหนักและได้คำตอบที่ถูกต้องบ่อยขึ้น แม้ว่าคำตอบสุ่มก่อนหน้านี้จะไม่เกี่ยวข้องกับคำถามจริงของคุณ
หนึ่งงานวิจัยใหม่จากจีนได้พัฒนาแนวทางที่มีต้นทุนต่ำในการหยุดการหลอกลวงของโมเดลภาษา เช่น ChatGPT และเพิ่มคุณภาพของคำตอบ: ให้โมเดลตรวจสอบคำตอบของคำถามที่ไม่เกี่ยวข้องก่อน

ตัวอย่างคำถามที่ไม่เกี่ยวข้องที่สามารถ ‘ปลดปล่อยจิตใจ’ ของโมเดลภาษาและช่วยให้โฟกัสกับคำถามที่แท้จริงได้
การกระตุ้น ‘เซน’ นี้เป็นวิธีการที่มีต้นทุนต่ำในการปรับปรุงประสิทธิภาพ เมื่อเทียบกับวิธีการอื่นๆ เช่น การปรับแต่งแบบละเอียด การสร้างคำสั่ง และการวิเคราะห์ข้อมูลแบบขนาน และมันทำงานได้กับโมเดลที่เปิดและปิดที่มีแหล่งที่มาเหมือนกัน ซึ่งบ่งชี้ว่ามีลักษณะพื้นฐานที่พบในหลายสถาปัตยกรรมของโมเดลภาษา
ผู้วิจัยอธิบายถึงการประหยัดต้นทุนที่เป็นไปได้โดยการปรับปรุงผลลัพธ์แบบง่ายๆ:
‘ในการใช้งานจริง VF ต้องการให้คำตอบสุ่มหรือไม่สำคัญในคำสั่ง การตรวจสอบมักจะมีโทเค็นเอาต์พุตน้อยกว่าเส้นทาง CoT ปกติ และบางครั้งไม่มีกระบวนการตรวจสอบอย่างชัดเจน ดังนั้นจึงต้องมีการคำนวณเพิ่มเติมน้อยมากในขณะทดสอบ’
ในการทดสอบ การใช้วิธีนี้ซึ่งเรียกว่า Verification-First (VF) สามารถปรับปรุงคำตอบได้ในหลายงาน รวมถึงการให้เหตุผลทางคณิตศาสตร์ ทั้งบนแพลตฟอร์มที่เปิดและเชิงพาณิชย์
ส่วนหนึ่งของเหตุผลที่วิธีนี้ทำงานอาจมาจากวิธีที่โมเดลภาษาเรียนรู้และใช้แนวโน้มในจิตวิทยา củaมนุษย์ ดังนั้นคำถามโดยตรงอาจทำให้โมเดล ‘ตั้งรับ’ และ ‘กังวล’ ในขณะที่การขอให้ตรวจสอบงานของคนอื่นไม่กระตุ้น ‘สัญชาตญาณการอยู่รอด’ เหล่านี้
ความคิดหลักคือการตรวจสอบคำตอบ ต้องใช้ความพยายามน้อยกว่า การสร้างคำตอบจากศูนย์ และสามารถกระตุ้นเส้นทางการให้เหตุผลที่แตกต่างซึ่งเสริมการให้เหตุผลแบบมาตรฐาน
การกระตุ้นโมเดลให้วิจารณ์คำตอบที่กำหนด (เช่น คำตอบที่โมเดลไม่ได้สร้างขึ้น) อาจกระตุ้นการคิดอย่างมีวิจารณญาณที่ช่วยหลีกเลี่ยงความมั่นใจมากเกินไปในความเข้าใจแรกของโมเดล
งานวิจัยนี้อธิบายกระบวนการในแง่ของ เส้นทางการให้เหตุผลย้อนกลับ:

การเริ่มต้นจากคำตอบที่เสนอและให้เหตุผลย้อนกลับไปหาคำถามสามารถเปิดเผยทางลัดหรือข้อมูลเชิงลึกที่ยากต่อการค้นหาเมื่อใช้เหตุผลไปข้างหน้า
นักวิจัยได้สร้างแนวคิดหลักเป็น Iter-VF ซึ่งเป็นวิธีการที่ใช้เวลาในการทดสอบแบบลำดับซึ่งปรับปรุงคำตอบอย่างต่อเนื่องโดยหลีกเลี่ยงปัญหาการสะสมข้อผิดพลาดที่พบในกลยุทธ์การแก้ไขตนเองของ LLM
งานวิจัยใหม่นี้มีชื่อว่า การขอให้ LLMs ตรวจสอบก่อนเป็นอาหารกลางวันที่แทบจะไม่มีค่าใช้จ่าย และมาจากนักวิจัยสองคนจากภาควิชาวิศวกรรมอิเล็กทรอนิกส์ มหาวิทยาลัยสิงหวา ที่ปักกิ่ง
วิธีการ
ความคิดหลักของงานวิจัยใหม่นี้คือการพลิกกระบวนการให้เหตุผลในโมเดลภาษา โดยไม่ขอให้โมเดลแก้ปัญหาจากศูนย์ แต่ให้คำตอบที่เป็นไปได้ (มักจะไม่ถูกต้องหรือสุ่ม) และขอให้ตรวจสอบว่าคำตอบนั้นมีเหตุผลหรือไม่
การกระตุ้นนี้ทำให้โมเดล ให้เหตุผลย้อนกลับ โดยทำงานย้อนกลับจากคำตอบที่เสนอไปหาคำถาม เมื่อการตรวจสอบเสร็จสิ้น โมเดลจะแก้ปัญหาเดิมตามปกติ
การพลิกกลับนี้ทำให้โมเดลลดข้อผิดพลาดและกระตุ้นให้เกิดการให้เหตุผลที่มีการคิดอย่างมีวิจารณญาณมากขึ้น ช่วยให้โมเดลภาษาค้นพบโครงสร้างที่ซ่อนอยู่และหลีกเลี่ยงสมมติฐานที่ทำให้เข้าใจผิด
ดังที่เห็นในตัวอย่างด้านล่าง การกระตุ้นโมเดลให้ตรวจสอบคำตอบที่ไม่ถูกต้องอย่างเห็นได้ชัด เช่น ’10’ สามารถช่วยให้โมเดลฟื้นตัวจากตรรกะที่มีข้อผิดพลาดและทำงานได้ดีกว่าการให้เหตุผลแบบมาตรฐาน:

การกระตุ้นโมเดลให้ตรวจสอบคำตอบที่สุ่มก่อนช่วยให้โมเดลตรวจสอบความไม่สอดคล้องและจัดการกับปัญหาอย่างระมัดระวัง
ในหลายปัญหาในโลกแห่งความเป็นจริง ไม่ใช่เรื่องง่ายที่จะให้คำตอบที่จะตรวจสอบ โดยเฉพาะอย่างยิ่งเมื่อปัญหาเปิดกว้าง เช่น การเขียนโค้ดหรือการเรียก API ดังนั้นเพื่อให้เหมาะสมยิ่งขึ้น วิธีการนี้จะให้คำตอบที่ดีที่สุดตามปกติก่อน แล้วจึงส่งคำตอบนั้นกลับเข้าไปในรูปแบบ Verification-First โดยที่โมเดลจะตรวจสอบและปรับปรุงผลลัพธ์ของตนเอง:

เมื่อโมเดลถูกขอให้ตรวจสอบผลลัพธ์ก่อนหน้าของตนเอง มันจับข้อผิดพลาดในตรรกะและเขียนคำตอบใหม่ให้ถูกต้อง การกระตุ้น Verification-First ช่วยให้โมเดลโฟกัสไปที่ข้อผิดพลาดเฉพาะแทนที่จะทำซ้ำข้อผิดพลาดเดิม
การเข้าใกล้นี้ประกอบเป็น Iter-VF ที่กล่าวถึงก่อนหน้านี้ โมเดลจะทำซ้ำวงจรนี้ โดยปรับปรุงคำตอบทุกครั้ง โดยไม่ต้องมีการฝึกอบรมใหม่หรือเครื่องมือพิเศษ
ข้อมูลและการทดสอบ
ผู้วิจัยประเมินวิธีการนี้ใน bốnโดเมน: งานให้เหตุผลทั่วไป โดยที่ VF ได้รับคำตอบสุ่ม; งานที่ต้องใช้เวลา โดยที่ Iter-VF เทียบกับวิธีการปรับขนาดที่เป็นคู่แข่ง; ปัญหาแบบเปิด เช่น การเขียนโค้ดและเรียก API โดยที่ VF ใช้คำตอบก่อนหน้าของโมเดล; และ โมเดล LLM เชิงพาณิชย์ที่ปิด โดยที่ขั้นตอนการให้เหตุผลภายในไม่สามารถเข้าถึงได้
ในการทดสอบ ผู้วิจัยใช้สามมาตรฐานการให้เหตุผล: GSM8K และ MATH500 สำหรับปัญหาเลขคณิต; และ GPQA-Diamond สำหรับคำถามวิทยาศาสตร์ระดับบัณฑิตศึกษา
ในแต่ละกรณี โมเดลได้รับคำตอบสุ่ม เช่น ‘1’ สำหรับคำตอบตัวเลข; หรือตัวเลือกแบบสุ่มสำหรับคำถามแบบ多ตัวเลือกเป็นจุดเริ่มต้นสำหรับการตรวจสอบ ไม่มีการปรับแต่งหรือความรู้ก่อนหน้าที่ถูกเพิ่ม และมาตรฐานสำหรับการเปรียบเทียบคือการให้เหตุผลแบบมาตรฐานแบบ zero-shot
การทดสอบดำเนินไปทั่วทั้ง Qwen2.5 และ Llama3 ที่ปรับแต่งสำหรับการสอน โดยมีขนาดตั้งแต่ 1B ถึง 72B (พารามิเตอร์) Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct และ Qwen2.5-72B-Instruct เป็นต้น
การปรับปรุงที่ได้รับจากการกระตุ้น Verification-First ยังคงเสถียรทั่วทั้งขนาดโมเดล โดยมีการปรับปรุงที่ชัดเจนเห็นได้แม้กระทั่งที่ 1B พารามิเตอร์และดำเนินต่อไปจนถึง 72B:

ทั่วทั้งขนาดโมเดลในตระกูล Qwen2.5 และ Llama3 การกระตุ้น Verification-First ประสบความสำเร็จมากกว่าการให้เหตุผลแบบมาตรฐานใน GSM8K, MATH500 และ GPQA
ผลกระทบสูงสุดอยู่ที่การประเมินผลคณิตศาสตร์ที่หนักหน่วง เช่น GSM8K และ MATH500 โดยที่การตรวจสอบคำตอบที่ไม่ถูกต้องกระตุ้นให้เกิดการให้เหตุผลที่ดีกว่าการพยายามแก้ปัญหาจากศูนย์ ใน GPQA-Diamond ซึ่งพึ่งพาความรู้ที่เก็บไว้มากกว่าโครงสร้างการให้เหตุผล ผลกระทบเล็กน้อยแต่สอดคล้องกัน
ต้นทุนการคำนวณของ Verification-First คือความสมดุล: ในตารางด้านล่าง เราจะเห็นว่าการสร้างขั้นตอนการตรวจสอบเพิ่มโทเค็นเอาต์พุตประมาณ 20-50% เมื่อเทียบกับการให้เหตุผลแบบมาตรฐาน:

จำนวนโทเค็นเอาต์พุตเฉลี่ยที่สร้างขึ้นภายใต้วิธีการกระตุ้นที่แตกต่างกัน ทั่วทั้งมาตรฐาน GSM8K, MATH500 และ GPQA
尽管มีต้นทุนเพิ่มขึ้น แต่ก็ยังคงต่ำกว่าวิธีการที่ต้องใช้การสร้างหลายครั้งหรือการวางแผนแบบเรียกซ้ำ
ในกราฟด้านล่าง เราจะเห็นว่าวิธีการนี้ไวต่อคุณภาพของคำตอบที่สุ่มอย่างไร น่าประหลาดใจที่แม้ว่าคำตอบสุ่มจะไม่ถูกต้อง (‘1’) หรือไม่สมเหตุสมผล (‘2025’) หรือเป็นตัวเลือกแบบสุ่ม การกระตุ้น Verification-First ยังคงทำงานได้ดีกว่าการให้เหตุผลแบบมาตรฐาน:

การเพิ่มความแม่นยำจาก Verification-First เมื่อโมเดลได้รับคำตอบที่จะตรวจสอบทั่วทั้ง GSM8K, MATH500 และ GPQA
ตามที่คาดไว้ ความแม่นยำจะสูงขึ้นเมื่อคำตอบที่สุ่มเป็นคำตอบที่ถูกต้อง แต่วิธีการนี้ทำงานได้ดีโดยไม่ขึ้นกับคุณภาพของคำตอบที่สุ่ม
Iter-VF ยังถูกเปรียบเทียบกับกลยุทธ์การปรับขนาดที่ไม่ต้องฝึกอบรมหรือปรับแต่งสำหรับงาน โดยที่ การแก้ไขตนเอง โมเดลถูกกระตุ้นให้แก้ไขคำตอบโดยการสะท้อนถึงขั้นตอนการให้เหตุผลก่อนหน้า; ใน PHP คำตอบก่อนหน้าถูกเพิ่มเข้าไปในข้อมูลนำเข้าเป็นคำใบ้ แต่ไม่มีการสอนวิธีการใช้
นอกจากนี้ ใน ความสอดคล้องในตนเอง โมเดลจะให้เส้นทางการให้เหตุผลหลายเส้นทางและเลือกคำตอบสุดท้ายโดยการลงคะแนนเสียงส่วนใหญ่; และในที่สุด ใน Best-of-N โมเดลจะสร้างเอาต์พุตหลายรายการและจัดอันดับโดยใช้คำสั่งผู้ตรวจสอบ โดยที่คำตอบที่มีคะแนนสูงสุดจะถูกเลือก
สองรูปแบบของ Iter-VF ถูกนำมาใช้: หนึ่งเริ่มต้นด้วยคำตอบสุ่ม (‘1’); และอีกอันหนึ่งเริ่มต้นด้วยเอาต์พุตมาตรฐาน CoT:

ความแม่นยำและประสิทธิภาพโทเค็นบน MATH500 ภายใต้งบการทำงานที่เพิ่มขึ้น โดยแสดงให้เห็นว่าทั้งสองรูปแบบของ Iter-VF มีประสิทธิภาพมากกว่าฐานรูปแบบทั้งหมดในทุกขนาดโมเดล
Iter-VF ให้ผลลัพธ์ที่ดีกว่าวิธีการอื่นๆ เมื่อการคำนวณที่มีอยู่มีจำกัด ซึ่งผู้วิจัยให้เครดิตกับการตรวจสอบคำตอบ ไม่ใช่คุณภาพของคำตอบเริ่มต้น (เนื่องจากทั้งVFและCoTบรรลุความแม่นยำที่คล้ายกันอย่างรวดเร็ว)
PHP มีประสิทธิภาพต่ำกว่า แม้ว่าจะใช้คำตอบก่อนหน้าเป็นคำใบ้ แต่โมเดลภาษาไม่ได้ใช้คำใบ้เหล่านั้นอย่างมีประสิทธิภาพ
ในทางตรงกันข้ามกับ PHP และการแก้ไขตนเอง Iter-VF พิจารณาเฉพาะคำตอบล่าสุดในแต่ละขั้นตอน ซึ่งช่วยหลีกเลี่ยงการสะสมความสับสนของการให้เหตุผลแบบขนานยาว
วิธีการขนานแบบอื่นๆ เช่น ความสอดคล้องในตนเองและ Best-of-N หลีกเลี่ยงปัญหานี้ แต่การปรับปรุงของพวกมันช้าและไม่มาก
(หมายเหตุ: ส่วนผลลัพธ์ แม้ว่าจะมีการครอบคลุมอย่างละเอียด แต่ก็เป็นการอ่านอย่างไม่เป็นมิตรและยืดเยื้อ และเราต้องตัดทอนส่วนใหญ่ของการรายงานที่เหลือ และอ้างอิงผู้อ่านไปยังเอกสารต้นฉบับสำหรับรายละเอียดเพิ่มเติม)
เมื่อทดสอบบน GPT-5 Nano และ GPT-5 Mini ซึ่งเป็นโมเดลเชิงพาณิชย์ที่ปิดซึ่งซ่อนการให้เหตุผลที่สมบูรณ์และส่งกลับเฉพาะคำตอบสุดท้าย Iter-VF ปรับปรุงประสิทธิภาพโดยไม่พึ่งพาเอาต์พุตระหว่างกัน:

ความแม่นยำบน MATH500 และ GPQA เมื่อ Iter-VF ถูกนำไปใช้กับโมเดล GPT-5 ที่มีการให้เหตุผลที่ซ่อนอยู่
สรุป
แม้ว่าเอกสารใหม่นี้จะเปลี่ยนเป็นความไม่โปร่งใสหลังส่วนผลลัพธ์ แต่การค้นพบลักษณะที่ครอบคลุมในโมเดล AI นี้ก็ยังคงเป็นการพัฒนาที่น่าสนใจ
หนึ่งในปัญหาที่ยิ่งใหญ่ที่สุดในการใช้งานและอัปเดต หน้าต่างบริบท ในโมเดลภาษาคือการสร้างสมดุลระหว่างการรักษาความก้าวหน้าและความสามารถในการเดินหน้าในทิศทางใหม่ๆ โดยไม่ตกไปในภาพหลอกลวงหรือเอาต์พุตที่ไม่เกี่ยวข้อง ในกรณีที่นำเสนอโดยเอกสารใหม่นี้ เราจะเห็นตัวอย่างของ ‘การปลุก’ ที่อ่อนโยนแต่แน่วแน่ที่ดูเหมือนจะรีเซ็ตและโฟกัสโมเดลภาษาโดยไม่สูญเสียบริบท
จะน่าสนใจที่จะเห็นว่าโครงการในอนาคตจะปรับและพัฒนาวิธีการนี้ต่อไป
ผู้วิจัยเน้นย้ำถึงเศรษฐกิจของวิธีการใหม่นี้ ซึ่งเป็นการพิจารณาที่จะมีน้ำหนักมากขึ้นเมื่อไม่นานมานี้
วิธีการนี้สามารถนำไปใช้ได้จริงและเป็นวิธีการที่มีประสิทธิภาพในการปรับปรุงประสิทธิภาพของโมเดลภาษาโดยไม่ต้องมีการฝึกอบรมหรือปรับแต่งเพิ่มเติม
เผยแพร่ครั้งแรกวันพฤหัสบดี 4 ธันวาคม 2025












