มุมมองของ Anderson

วิธี ‘เซน’ ในการหยุดการหลอกลวงของโมเดลภาษา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image: A robot sits in front of a laptop and a 'Eureka!' light-bulb lights up over its head. Z-Image, Qwen Edit (509), and Firefly V3

การบอก ChatGPT ให้ตรวจสอบคำตอบสุ่มก่อนแก้ปัญหาจริงจะทำให้โมเดลคิดอย่างหนักและได้คำตอบที่ถูกต้องบ่อยขึ้น แม้ว่าคำตอบสุ่มก่อนหน้านี้จะไม่เกี่ยวข้องกับคำถามจริงของคุณ

 

หนึ่งงานวิจัยใหม่จากจีนได้พัฒนาแนวทางที่มีต้นทุนต่ำในการหยุดการหลอกลวงของโมเดลภาษา เช่น ChatGPT และเพิ่มคุณภาพของคำตอบ: ให้โมเดลตรวจสอบคำตอบของคำถามที่ไม่เกี่ยวข้องก่อน

ตัวอย่างคำถามที่ไม่เกี่ยวข้องที่สามารถ 'ปลดปล่อยจิตใจ' ของโมเดลภาษาและช่วยให้โฟกัสกับคำถามที่แท้จริงได้

ตัวอย่างคำถามที่ไม่เกี่ยวข้องที่สามารถ ‘ปลดปล่อยจิตใจ’ ของโมเดลภาษาและช่วยให้โฟกัสกับคำถามที่แท้จริงได้

การกระตุ้น ‘เซน’ นี้เป็นวิธีการที่มีต้นทุนต่ำในการปรับปรุงประสิทธิภาพ เมื่อเทียบกับวิธีการอื่นๆ เช่น การปรับแต่งแบบละเอียด การสร้างคำสั่ง และการวิเคราะห์ข้อมูลแบบขนาน และมันทำงานได้กับโมเดลที่เปิดและปิดที่มีแหล่งที่มาเหมือนกัน ซึ่งบ่งชี้ว่ามีลักษณะพื้นฐานที่พบในหลายสถาปัตยกรรมของโมเดลภาษา

ผู้วิจัยอธิบายถึงการประหยัดต้นทุนที่เป็นไปได้โดยการปรับปรุงผลลัพธ์แบบง่ายๆ:

‘ในการใช้งานจริง VF ต้องการให้คำตอบสุ่มหรือไม่สำคัญในคำสั่ง การตรวจสอบมักจะมีโทเค็นเอาต์พุตน้อยกว่าเส้นทาง CoT ปกติ และบางครั้งไม่มีกระบวนการตรวจสอบอย่างชัดเจน ดังนั้นจึงต้องมีการคำนวณเพิ่มเติมน้อยมากในขณะทดสอบ’

ในการทดสอบ การใช้วิธีนี้ซึ่งเรียกว่า Verification-First (VF) สามารถปรับปรุงคำตอบได้ในหลายงาน รวมถึงการให้เหตุผลทางคณิตศาสตร์ ทั้งบนแพลตฟอร์มที่เปิดและเชิงพาณิชย์

ส่วนหนึ่งของเหตุผลที่วิธีนี้ทำงานอาจมาจากวิธีที่โมเดลภาษาเรียนรู้และใช้แนวโน้มในจิตวิทยา củaมนุษย์ ดังนั้นคำถามโดยตรงอาจทำให้โมเดล ‘ตั้งรับ’ และ ‘กังวล’ ในขณะที่การขอให้ตรวจสอบงานของคนอื่นไม่กระตุ้น ‘สัญชาตญาณการอยู่รอด’ เหล่านี้

ความคิดหลักคือการตรวจสอบคำตอบ ต้องใช้ความพยายามน้อยกว่า การสร้างคำตอบจากศูนย์ และสามารถกระตุ้นเส้นทางการให้เหตุผลที่แตกต่างซึ่งเสริมการให้เหตุผลแบบมาตรฐาน

การกระตุ้นโมเดลให้วิจารณ์คำตอบที่กำหนด (เช่น คำตอบที่โมเดลไม่ได้สร้างขึ้น) อาจกระตุ้นการคิดอย่างมีวิจารณญาณที่ช่วยหลีกเลี่ยงความมั่นใจมากเกินไปในความเข้าใจแรกของโมเดล

งานวิจัยนี้อธิบายกระบวนการในแง่ของ เส้นทางการให้เหตุผลย้อนกลับ:

การเริ่มต้นจากคำตอบที่เสนอและให้เหตุผลย้อนกลับไปหาคำถามสามารถเปิดเผยทางลัดหรือข้อมูลเชิงลึกที่ยากต่อการค้นหาเมื่อใช้เหตุผลไปข้างหน้า

การเริ่มต้นจากคำตอบที่เสนอและให้เหตุผลย้อนกลับไปหาคำถามสามารถเปิดเผยทางลัดหรือข้อมูลเชิงลึกที่ยากต่อการค้นหาเมื่อใช้เหตุผลไปข้างหน้า

นักวิจัยได้สร้างแนวคิดหลักเป็น Iter-VF ซึ่งเป็นวิธีการที่ใช้เวลาในการทดสอบแบบลำดับซึ่งปรับปรุงคำตอบอย่างต่อเนื่องโดยหลีกเลี่ยงปัญหาการสะสมข้อผิดพลาดที่พบในกลยุทธ์การแก้ไขตนเองของ LLM

งานวิจัยใหม่นี้มีชื่อว่า การขอให้ LLMs ตรวจสอบก่อนเป็นอาหารกลางวันที่แทบจะไม่มีค่าใช้จ่าย และมาจากนักวิจัยสองคนจากภาควิชาวิศวกรรมอิเล็กทรอนิกส์ มหาวิทยาลัยสิงหวา ที่ปักกิ่ง

วิธีการ

ความคิดหลักของงานวิจัยใหม่นี้คือการพลิกกระบวนการให้เหตุผลในโมเดลภาษา โดยไม่ขอให้โมเดลแก้ปัญหาจากศูนย์ แต่ให้คำตอบที่เป็นไปได้ (มักจะไม่ถูกต้องหรือสุ่ม) และขอให้ตรวจสอบว่าคำตอบนั้นมีเหตุผลหรือไม่

การกระตุ้นนี้ทำให้โมเดล ให้เหตุผลย้อนกลับ โดยทำงานย้อนกลับจากคำตอบที่เสนอไปหาคำถาม เมื่อการตรวจสอบเสร็จสิ้น โมเดลจะแก้ปัญหาเดิมตามปกติ

การพลิกกลับนี้ทำให้โมเดลลดข้อผิดพลาดและกระตุ้นให้เกิดการให้เหตุผลที่มีการคิดอย่างมีวิจารณญาณมากขึ้น ช่วยให้โมเดลภาษาค้นพบโครงสร้างที่ซ่อนอยู่และหลีกเลี่ยงสมมติฐานที่ทำให้เข้าใจผิด

ดังที่เห็นในตัวอย่างด้านล่าง การกระตุ้นโมเดลให้ตรวจสอบคำตอบที่ไม่ถูกต้องอย่างเห็นได้ชัด เช่น ’10’ สามารถช่วยให้โมเดลฟื้นตัวจากตรรกะที่มีข้อผิดพลาดและทำงานได้ดีกว่าการให้เหตุผลแบบมาตรฐาน:

การกระตุ้นโมเดลให้ตรวจสอบคำตอบที่สุ่มก่อนช่วยให้โมเดลตรวจสอบความไม่สอดคล้องและจัดการกับปัญหาอย่างระมัดระวัง

การกระตุ้นโมเดลให้ตรวจสอบคำตอบที่สุ่มก่อนช่วยให้โมเดลตรวจสอบความไม่สอดคล้องและจัดการกับปัญหาอย่างระมัดระวัง

ในหลายปัญหาในโลกแห่งความเป็นจริง ไม่ใช่เรื่องง่ายที่จะให้คำตอบที่จะตรวจสอบ โดยเฉพาะอย่างยิ่งเมื่อปัญหาเปิดกว้าง เช่น การเขียนโค้ดหรือการเรียก API ดังนั้นเพื่อให้เหมาะสมยิ่งขึ้น วิธีการนี้จะให้คำตอบที่ดีที่สุดตามปกติก่อน แล้วจึงส่งคำตอบนั้นกลับเข้าไปในรูปแบบ Verification-First โดยที่โมเดลจะตรวจสอบและปรับปรุงผลลัพธ์ของตนเอง:

เมื่อโมเดลถูกขอให้ตรวจสอบผลลัพธ์ก่อนหน้าของตนเอง มันจับข้อผิดพลาดในตรรกะและเขียนคำตอบใหม่ให้ถูกต้อง การกระตุ้น Verification-First ช่วยให้โมเดลโฟกัสไปที่ข้อผิดพลาดเฉพาะแทนที่จะทำซ้ำข้อผิดพลาดเดิม

เมื่อโมเดลถูกขอให้ตรวจสอบผลลัพธ์ก่อนหน้าของตนเอง มันจับข้อผิดพลาดในตรรกะและเขียนคำตอบใหม่ให้ถูกต้อง การกระตุ้น Verification-First ช่วยให้โมเดลโฟกัสไปที่ข้อผิดพลาดเฉพาะแทนที่จะทำซ้ำข้อผิดพลาดเดิม

การเข้าใกล้นี้ประกอบเป็น Iter-VF ที่กล่าวถึงก่อนหน้านี้ โมเดลจะทำซ้ำวงจรนี้ โดยปรับปรุงคำตอบทุกครั้ง โดยไม่ต้องมีการฝึกอบรมใหม่หรือเครื่องมือพิเศษ

ข้อมูลและการทดสอบ

ผู้วิจัยประเมินวิธีการนี้ใน bốnโดเมน: งานให้เหตุผลทั่วไป โดยที่ VF ได้รับคำตอบสุ่ม; งานที่ต้องใช้เวลา โดยที่ Iter-VF เทียบกับวิธีการปรับขนาดที่เป็นคู่แข่ง; ปัญหาแบบเปิด เช่น การเขียนโค้ดและเรียก API โดยที่ VF ใช้คำตอบก่อนหน้าของโมเดล; และ โมเดล LLM เชิงพาณิชย์ที่ปิด โดยที่ขั้นตอนการให้เหตุผลภายในไม่สามารถเข้าถึงได้

ในการทดสอบ ผู้วิจัยใช้สามมาตรฐานการให้เหตุผล: GSM8K และ MATH500 สำหรับปัญหาเลขคณิต; และ GPQA-Diamond สำหรับคำถามวิทยาศาสตร์ระดับบัณฑิตศึกษา

ในแต่ละกรณี โมเดลได้รับคำตอบสุ่ม เช่น ‘1’ สำหรับคำตอบตัวเลข; หรือตัวเลือกแบบสุ่มสำหรับคำถามแบบ多ตัวเลือกเป็นจุดเริ่มต้นสำหรับการตรวจสอบ ไม่มีการปรับแต่งหรือความรู้ก่อนหน้าที่ถูกเพิ่ม และมาตรฐานสำหรับการเปรียบเทียบคือการให้เหตุผลแบบมาตรฐานแบบ zero-shot

การทดสอบดำเนินไปทั่วทั้ง Qwen2.5 และ Llama3 ที่ปรับแต่งสำหรับการสอน โดยมีขนาดตั้งแต่ 1B ถึง 72B (พารามิเตอร์) Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct และ Qwen2.5-72B-Instruct เป็นต้น

การปรับปรุงที่ได้รับจากการกระตุ้น Verification-First ยังคงเสถียรทั่วทั้งขนาดโมเดล โดยมีการปรับปรุงที่ชัดเจนเห็นได้แม้กระทั่งที่ 1B พารามิเตอร์และดำเนินต่อไปจนถึง 72B:

ทั่วทั้งขนาดโมเดลในตระกูล Qwen2.5 และ Llama3 การกระตุ้น Verification-First ประสบความสำเร็จมากกว่าการให้เหตุผลแบบมาตรฐานใน GSM8K, MATH500 และ GPQA

ทั่วทั้งขนาดโมเดลในตระกูล Qwen2.5 และ Llama3 การกระตุ้น Verification-First ประสบความสำเร็จมากกว่าการให้เหตุผลแบบมาตรฐานใน GSM8K, MATH500 และ GPQA

ผลกระทบสูงสุดอยู่ที่การประเมินผลคณิตศาสตร์ที่หนักหน่วง เช่น GSM8K และ MATH500 โดยที่การตรวจสอบคำตอบที่ไม่ถูกต้องกระตุ้นให้เกิดการให้เหตุผลที่ดีกว่าการพยายามแก้ปัญหาจากศูนย์ ใน GPQA-Diamond ซึ่งพึ่งพาความรู้ที่เก็บไว้มากกว่าโครงสร้างการให้เหตุผล ผลกระทบเล็กน้อยแต่สอดคล้องกัน

ต้นทุนการคำนวณของ Verification-First คือความสมดุล: ในตารางด้านล่าง เราจะเห็นว่าการสร้างขั้นตอนการตรวจสอบเพิ่มโทเค็นเอาต์พุตประมาณ 20-50% เมื่อเทียบกับการให้เหตุผลแบบมาตรฐาน:

จำนวนโทเค็นเอาต์พุตเฉลี่ยที่สร้างขึ้นภายใต้วิธีการกระตุ้นที่แตกต่างกัน ทั่วทั้งมาตรฐาน GSM8K, MATH500 และ GPQA

จำนวนโทเค็นเอาต์พุตเฉลี่ยที่สร้างขึ้นภายใต้วิธีการกระตุ้นที่แตกต่างกัน ทั่วทั้งมาตรฐาน GSM8K, MATH500 และ GPQA

尽管มีต้นทุนเพิ่มขึ้น แต่ก็ยังคงต่ำกว่าวิธีการที่ต้องใช้การสร้างหลายครั้งหรือการวางแผนแบบเรียกซ้ำ

ในกราฟด้านล่าง เราจะเห็นว่าวิธีการนี้ไวต่อคุณภาพของคำตอบที่สุ่มอย่างไร น่าประหลาดใจที่แม้ว่าคำตอบสุ่มจะไม่ถูกต้อง (‘1’) หรือไม่สมเหตุสมผล (‘2025’) หรือเป็นตัวเลือกแบบสุ่ม การกระตุ้น Verification-First ยังคงทำงานได้ดีกว่าการให้เหตุผลแบบมาตรฐาน:

การเพิ่มความแม่นยำจาก Verification-First เมื่อโมเดลได้รับคำตอบที่จะตรวจสอบทั่วทั้ง GSM8K, MATH500 และ GPQA

การเพิ่มความแม่นยำจาก Verification-First เมื่อโมเดลได้รับคำตอบที่จะตรวจสอบทั่วทั้ง GSM8K, MATH500 และ GPQA

ตามที่คาดไว้ ความแม่นยำจะสูงขึ้นเมื่อคำตอบที่สุ่มเป็นคำตอบที่ถูกต้อง แต่วิธีการนี้ทำงานได้ดีโดยไม่ขึ้นกับคุณภาพของคำตอบที่สุ่ม

Iter-VF ยังถูกเปรียบเทียบกับกลยุทธ์การปรับขนาดที่ไม่ต้องฝึกอบรมหรือปรับแต่งสำหรับงาน โดยที่ การแก้ไขตนเอง โมเดลถูกกระตุ้นให้แก้ไขคำตอบโดยการสะท้อนถึงขั้นตอนการให้เหตุผลก่อนหน้า; ใน PHP คำตอบก่อนหน้าถูกเพิ่มเข้าไปในข้อมูลนำเข้าเป็นคำใบ้ แต่ไม่มีการสอนวิธีการใช้

นอกจากนี้ ใน ความสอดคล้องในตนเอง โมเดลจะให้เส้นทางการให้เหตุผลหลายเส้นทางและเลือกคำตอบสุดท้ายโดยการลงคะแนนเสียงส่วนใหญ่; และในที่สุด ใน Best-of-N โมเดลจะสร้างเอาต์พุตหลายรายการและจัดอันดับโดยใช้คำสั่งผู้ตรวจสอบ โดยที่คำตอบที่มีคะแนนสูงสุดจะถูกเลือก

สองรูปแบบของ Iter-VF ถูกนำมาใช้: หนึ่งเริ่มต้นด้วยคำตอบสุ่ม (‘1’); และอีกอันหนึ่งเริ่มต้นด้วยเอาต์พุตมาตรฐาน CoT:

ความแม่นยำและประสิทธิภาพโทเค็นบน MATH500 ภายใต้งบการทำงานที่เพิ่มขึ้น โดยแสดงให้เห็นว่าทั้งสองรูปแบบของ Iter-VF มีประสิทธิภาพมากกว่าฐานรูปแบบทั้งหมดในทุกขนาดโมเดล

ความแม่นยำและประสิทธิภาพโทเค็นบน MATH500 ภายใต้งบการทำงานที่เพิ่มขึ้น โดยแสดงให้เห็นว่าทั้งสองรูปแบบของ Iter-VF มีประสิทธิภาพมากกว่าฐานรูปแบบทั้งหมดในทุกขนาดโมเดล

Iter-VF ให้ผลลัพธ์ที่ดีกว่าวิธีการอื่นๆ เมื่อการคำนวณที่มีอยู่มีจำกัด ซึ่งผู้วิจัยให้เครดิตกับการตรวจสอบคำตอบ ไม่ใช่คุณภาพของคำตอบเริ่มต้น (เนื่องจากทั้งVFและCoTบรรลุความแม่นยำที่คล้ายกันอย่างรวดเร็ว)

PHP มีประสิทธิภาพต่ำกว่า แม้ว่าจะใช้คำตอบก่อนหน้าเป็นคำใบ้ แต่โมเดลภาษาไม่ได้ใช้คำใบ้เหล่านั้นอย่างมีประสิทธิภาพ

ในทางตรงกันข้ามกับ PHP และการแก้ไขตนเอง Iter-VF พิจารณาเฉพาะคำตอบล่าสุดในแต่ละขั้นตอน ซึ่งช่วยหลีกเลี่ยงการสะสมความสับสนของการให้เหตุผลแบบขนานยาว

วิธีการขนานแบบอื่นๆ เช่น ความสอดคล้องในตนเองและ Best-of-N หลีกเลี่ยงปัญหานี้ แต่การปรับปรุงของพวกมันช้าและไม่มาก

(หมายเหตุ: ส่วนผลลัพธ์ แม้ว่าจะมีการครอบคลุมอย่างละเอียด แต่ก็เป็นการอ่านอย่างไม่เป็นมิตรและยืดเยื้อ และเราต้องตัดทอนส่วนใหญ่ของการรายงานที่เหลือ และอ้างอิงผู้อ่านไปยังเอกสารต้นฉบับสำหรับรายละเอียดเพิ่มเติม)

เมื่อทดสอบบน GPT-5 Nano และ GPT-5 Mini ซึ่งเป็นโมเดลเชิงพาณิชย์ที่ปิดซึ่งซ่อนการให้เหตุผลที่สมบูรณ์และส่งกลับเฉพาะคำตอบสุดท้าย Iter-VF ปรับปรุงประสิทธิภาพโดยไม่พึ่งพาเอาต์พุตระหว่างกัน:

ความแม่นยำบน MATH500 และ GPQA เมื่อ Iter-VF ถูกนำไปใช้กับโมเดล GPT-5 ที่มีการให้เหตุผลที่ซ่อนอยู่

ความแม่นยำบน MATH500 และ GPQA เมื่อ Iter-VF ถูกนำไปใช้กับโมเดล GPT-5 ที่มีการให้เหตุผลที่ซ่อนอยู่

สรุป

แม้ว่าเอกสารใหม่นี้จะเปลี่ยนเป็นความไม่โปร่งใสหลังส่วนผลลัพธ์ แต่การค้นพบลักษณะที่ครอบคลุมในโมเดล AI นี้ก็ยังคงเป็นการพัฒนาที่น่าสนใจ

หนึ่งในปัญหาที่ยิ่งใหญ่ที่สุดในการใช้งานและอัปเดต หน้าต่างบริบท ในโมเดลภาษาคือการสร้างสมดุลระหว่างการรักษาความก้าวหน้าและความสามารถในการเดินหน้าในทิศทางใหม่ๆ โดยไม่ตกไปในภาพหลอกลวงหรือเอาต์พุตที่ไม่เกี่ยวข้อง ในกรณีที่นำเสนอโดยเอกสารใหม่นี้ เราจะเห็นตัวอย่างของ ‘การปลุก’ ที่อ่อนโยนแต่แน่วแน่ที่ดูเหมือนจะรีเซ็ตและโฟกัสโมเดลภาษาโดยไม่สูญเสียบริบท

จะน่าสนใจที่จะเห็นว่าโครงการในอนาคตจะปรับและพัฒนาวิธีการนี้ต่อไป

ผู้วิจัยเน้นย้ำถึงเศรษฐกิจของวิธีการใหม่นี้ ซึ่งเป็นการพิจารณาที่จะมีน้ำหนักมากขึ้นเมื่อไม่นานมานี้

วิธีการนี้สามารถนำไปใช้ได้จริงและเป็นวิธีการที่มีประสิทธิภาพในการปรับปรุงประสิทธิภาพของโมเดลภาษาโดยไม่ต้องมีการฝึกอบรมหรือปรับแต่งเพิ่มเติม

เผยแพร่ครั้งแรกวันพฤหัสบดี 4 ธันวาคม 2025

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai