มุมมองของ Anderson
ทำไม AI ไม่สามารถยอมรับได้ว่ามันไม่รู้คำตอบ?

โมเดลภาษาใหญ่มักให้คำตอบที่มั่นใจแม้คำถามจะไม่มีคำตอบได้ งานวิจัยใหม่แสดงให้เห็นว่าโมเดลเหล่านี้มักรับรู้ปัญหานี้ภายใน แต่ยังคงสร้างคำตอบขึ้นมา ทำให้เห็นช่องว่างที่ซ่อนอยู่ระหว่างสิ่งที่พวกมันรู้และสิ่งที่พวกมันพูด
ผู้ใดที่เคยใช้โมเดลภาษาใหญ่ระดับแนวหน้าอย่าง ChatGPT หรือชุด Qwen มานานพอสมควร จะเคยเจอกรณีที่โมเดลให้คำตอบผิด (ซึ่งอาจมีผลกระทบร้ายแรงในระดับท้องถิ่นหรือไม่ก็ได้ ขึ้นอยู่กับว่าคุณพึ่งพามากแค่ไหน) – และเมื่อข้อผิดพลาดนั้นชัดเจน โมเดลก็เพียงแค่ขออภัยเท่านั้น
ทำไม LLM ชั้นนำถึงมีความยากลำบากในการยอมรับว่าตนไม่รู้คำตอบต่อคำถามหนึ่งเป็น small but growing ด้านการศึกษา confidently wrong’ answer สามารถทำอันตรายอย่างมากจากอินเทอร์เฟซ API ที่ highly censored และผ่านการกรองเช่น ChatGPT เนื่องจากโมเดลเหล่านี้บล็อกเนื้อหา NSFW หรืออินพุต/เอาต์พุตที่ละเมิดกฎอย่างเข้มข้น
สิ่งนี้อาจทำให้ผู้ใช้เข้าใจผิดว่าโมเดลมีความเด็ดขาดและแน่นอน ในความเป็นจริง การปฏิเสธมาจากฮิวริสติกแบบดั้งเดิมหรือฟิลเตอร์ที่อิงบล็อกลิสต์ซึ่งออกแบบมาเพื่อจำกัดความเสี่ยงทางกฎหมายของบริษัทเจ้าภาพอย่างเต็มที่ ไม่ได้มาจากการรับรู้ใด ๆ ของ AI

จากเอกสาร ‘AbstentionBench’ เดือนมิถุนายน 2025 ของ FAIR ที่ Meta – ด้านซ้าย แสดงช่วงประเภทความล้มเหลวที่จับได้ใน AbstentionBench ซึ่งทดสอบพฤติกรรมโมเดลบนคำถามที่ไม่มีคำตอบกว่า 35,000 ข้อ; ด้านกลาง ตัวอย่างแสดงว่าโมเดลมักตอบด้วยคำตอบที่สร้างขึ้นแทนที่จะยอมรับว่าขาดข้อมูลเพียงพอ; และด้านขวา การเรียกคืนการปฏิเสธลดลงเมื่อโมเดลถูกปรับให้เน้นการให้เหตุผลมากกว่าการทำตามคำสั่ง Source: https://arxiv.org/pdf/2506.09038
เอกสารใหม่จากจีนอ้างว่าโมเดล LLM จริง ๆ แล้วรู้ว่าไม่สามารถตอบคำถามที่ผู้ใช้ตั้งได้ แต่ยังคงถูกบังคับให้สร้างคำตอบบางอย่างส่วนใหญ่ เนื่องจากไม่มีความมั่นใจพอที่จะตัดสินใจว่าคำตอบที่ถูกต้องไม่มีอยู่ เนื่องจากข้อมูลจากผู้ใช้ไม่เพียงพอ หรือข้อจำกัดของโมเดล หรือเหตุผลอื่น ๆ
เอกสารระบุว่า:
‘[We] แสดงให้เห็นว่า [LLMs] มีความสามารถทางปัญญาเพียงพอที่จะรับรู้ข้อบกพร่องในคำถามเหล่านี้ อย่างไรก็ตาม พวกมันไม่แสดงพฤติกรรมการปฏิเสธที่เหมาะสม ทำให้เกิดความไม่สอดคล้องระหว่างการรับรู้ภายในและการตอบสนองภายนอก’
นักวิจัยได้พัฒนาวิธีการสองขั้นตอนที่เบา ๆ โดยใช้การตรวจสอบ/สำรวจเชิงปัญญาเพื่อสแกนกระบวนการภายในของ LLM เพื่อหาสัญญาณที่บ่งบอกว่ามันตระหนักว่าไม่สามารถให้คำตอบได้; จากนั้นแทรกแซงเพื่อให้แน่ใจว่าลักษณะ ‘เป็นประโยชน์’ ของโมเดลจะไม่ทำให้ปัญหาของผู้ใช้แย่ลงโดยพาไปสู่ทางตันหรือแม้กระทั่งทางที่ทำลาย
การศึกษาใช้คำถามคณิตศาสตร์ที่กำหนดข้อมูลไม่ครบเพื่อทดสอบว่าโมเดลสามารถรับรู้เมื่อคำตอบเป็นสิ่งที่ไม่รู้ได้หรือไม่; แต่การตั้งค่านี้เสี่ยงต่อการทำให้ภารกิจดูเหมือนเป็น ‘กลเม็ด’ ในความเป็นจริง โมเดลเผชิญกับเหตุผลที่ทำให้ต้องปฏิเสธบ่อยกว่าที่คาดในบทสนทนา เช่น การใช้ถ้อยคำที่คลุมเครือ หรือช่องว่างในความรู้เฉพาะด้าน
งานวิจัยใหม่นี้มีชื่อว่า การตอบคำถามที่ตอบไม่ได้คือการทำผิดทั้งที่รู้: การวิเคราะห์และบรรเทาความล้มเหลวในการงดตอบของโมเดลการให้เหตุผลขนาดใหญ่ โดยเป็นผลงานของนักวิจัยสี่คนจากห้องปฏิบัติการหลักแห่งชาติด้านเทคโนโลยีซอฟต์แวร์ใหม่และสถาบันวิทยาศาสตร์ข้อมูลด้านสุขภาพแห่งชาติของมหาวิทยาลัยหนานจิง
วิธีการ
(เนื่องจากไม่มีคู่แข่งที่เหมาะสมสำหรับเปรียบเทียบวิธีของผู้เขียนในการทดสอบ และเนื่องจากเอกสารจึงใช้รูปแบบที่ค่อนข้างไม่เป็นทางการ รวมถึงไม่ได้จัดทำบรรณานุกรมตามมาตรฐานทั่วไป เราจะพยายามปฏิบัติตามให้ดีที่สุด)
สอดคล้องกับวิธี previous ผู้เขียนมุ่งเน้นการนำ LLM มาตั้งคำถามคณิตศาสตร์ที่ไม่มีคำตอบจาก Synthetic Unanswerable Math (SUM) dataset โดยประเมินห้าครอบครัวโมเดล: จากชุด DeepSeek มี R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; และจากชุด Qwen มี Qwen3-8B รวมถึง Qwen3-14B
ปัญหาที่ไม่มีคำตอบใน SUM ถูกสร้างโดยการลบหรือทำให้ข้อมูลสำคัญเสียหายในห้าวิธี: ลบข้อมูลสำคัญ; สร้างความคลุมเครือ; กำหนดเงื่อนไขที่ไม่เป็นจริง; อ้างอิงวัตถุที่ไม่เกี่ยวข้อง; หรือเอาคำถามออกทั้งหมด
ต่อมาได้เลือกตัวอย่าง 1,000 กรณีเพื่อวิเคราะห์ โดยใช้ GPT-4o สร้างคำอธิบายสั้น ๆ เพื่อใช้เป็นเหตุผลอ้างอิงพื้นฐาน
การตอบสนองของโมเดลต่อคำถามที่ไม่มีคำตอบถูกประเมินโดยใช้พรอมต์มาตรฐานที่มีงบประมาณ 10,000 โทเค็น ซึ่งพบรูปแบบพฤติกรรมหลักสามแบบ: แบบแรก โมเดลระบุว่าคำถามไม่สามารถแก้ได้และละเว้นการตอบ — มักตอบด้วยการแสดงความไม่แน่ใจอย่างชัดเจน; แบบที่สอง โมเดลสร้างคำตอบเต็มโดยประดิษฐ์ข้อมูลที่ขาดหายไป เช่น การเพิ่ม $9.99 handling charge ที่ไม่มีอยู่จริงเพื่ออธิบายผลลัพธ์สุดท้าย (ดูภาพด้านล่าง); แบบที่สาม ซึ่งเรียกว่า การยึดติดเชิงรับรู้ โมเดลติดอยู่ในลูปการให้เหตุผลที่ยืดเยื้อ โดยยังคงดำเนินการตามเส้นทางแก้ไขที่ไม่ถูกต้องแม้จะรับรู้โดยอ้อมว่าคำถามไม่มีคำตอบที่เป็นไปได้:

ผลลัพธ์การตอบที่หลากหลายต่อคำถามที่เป็นไปไม่ได้.
บทความนี้นำเสนอแนวโน้มที่โมเดลขนาดใหญ่ดูเหมือนจะละเว้นการตอบคำถามที่ไม่มีคำตอบบ่อยขึ้น โดยมีการลดลงของทั้งคำตอบที่สร้างขึ้นจากจินตนาการและพฤติกรรมการยึดติด:

การแยกแยะการตอบของโมเดลต่อปัญหาคณิตศาสตร์ที่ไม่มีคำตอบ แสดงอัตราการละเว้นที่ถูกต้อง คำตอบที่สร้างจากจินตนาการ และการยึดติดเชิงสังเคราะห์ตามขนาดของโมเดล.
อย่างไรก็ตาม การเปลี่ยนแปลงนี้มีขนาดจำกัดและยังคงมีกรณีจำนวนมากที่ไม่ได้รับการแก้ไขด้วยการละเว้นที่ถูกต้อง ซึ่งบ่งชี้ว่าการเพิ่มความจุเพียงอย่างเดียวไม่สามารถทำให้พฤติกรรมระมัดระวังเพิ่มขึ้นได้อย่างเชื่อถือได้.
การรับรู้ถึงการค้างคา
เพื่อทดสอบว่ารุ่นภาษาอาจบอกได้หรือไม่ว่าคำถามจริง ๆ แล้วไม่มีคำตอบ นักวิจัยได้หยุดการให้เหตุผลของโมเดลในระหว่างกระบวนการและถามให้โมเดลให้คำตอบสุดท้ายหรืออธิบายทำไมคำถามจึงไม่มีคำตอบ.
สำหรับกรณีที่โมเดลทำการให้เหตุผลต่อเนื่องโดยไม่มีที่สิ้นสุด นักวิจัยได้หยุดที่คำว่า ‘wait’ แล้วกระตุ้นให้ตอบ; สำหรับกรณีที่โมเดลสร้างคำตอบจากจินตนาการอย่างรวดเร็ว พวกเขาได้แทรกการหยุดที่ขอบย่อหน้า.

แผนภูมิด้านซ้ายแสดงอัตราการละเว้นที่ถูกต้องเมื่อหยุดการให้เหตุผลกลางทาง โดยอัตราสูงกว่าสำหรับกรณีการยึดติดเมื่อเทียบกับคำตอบที่สร้างจากจินตนาการ. แผนภูมิด้านขวาแสดงว่าโมเดลส่วนใหญ่สามารถอธิบายว่าทำไมคำถามถึงไม่มีคำตอบเมื่อถูกกระตุ้น แม้ว่าคำตอบสุดท้ายของพวกเขาอาจไม่สะท้อนความเข้าใจนั้น.
ในหลายกรณีเหล่านี้ โมเดลให้การละเว้นที่ถูกต้องหรืออธิบายที่ชัดเจน แม้ว่าก่อนหน้านี้อาจให้คำตอบที่ผิดพลาด ผู้เขียนชี้ว่า สิ่งนี้บ่งบอกว่าโมเดลมักรับรู้ปัญหาระหว่างการให้เหตุผล แต่ไม่ได้นำความรับรู้นั้นไปใช้ในผลลัพธ์สุดท้าย.
การอ่านใจ LLM
เพื่อทดสอบว่ารุ่นภาษาติดตามภายในว่าคำถามสามารถตอบได้หรือไม่ นักวิจัยได้ฝึกตัวจำแนกขนาดเล็กบนการกระตุ้นที่ซ่อนอยู่ของโมเดลระหว่างการให้เหตุผล เพื่อให้สามารถตรวจสอบว่าความแตกต่างระหว่างคำถามที่ตอบได้และไม่ได้มีอยู่แล้วในสัญญาณภายในของโมเดลหรือไม่ — แม้ว่าจะไม่สะท้อนในผลลัพธ์สุดท้าย.
อิงจากแนวคิดว่าความหมายระดับสูงเช่นความซื่อสัตย์หรือเพศสามารถฝังเชิงเส้นในการกระตุ้นของโมเดลได้ การทดสอบ ‘ความสามารถในการตอบ’* ถูกทำเพื่อหาการแทนที่ที่คล้ายคลึงกัน.
ตัวจำแนกเชิงเส้นlinear classifiers (probes) ง่าย ๆ ถูกฝึกบนการกระตุ้นที่ซ่อนอยู่ในชั้นต่าง ๆ ของโมเดล โดยใช้ผลลัพธ์จากกลไกการใส่ใจหลายหัว ก่อนการเชื่อมต่อส่วนเหลือ.
แต่ละ probe ถูกฝึกให้แยกแยะระหว่างคำถามที่ตอบได้และไม่ได้ โดยอิงจากการกระตุ้นภายในจากกระบวนการให้เหตุผล อินพุตประกอบด้วยคู่คำถาม 2,200 คู่จากชุดข้อมูล SUM โดยใช้ 2,000 คู่สำหรับการฝึกและ 200 คู่สำหรับการตรวจสอบ.
ในช่วงการสรุปผล โมเดลจะเฉลี่ยการทำนายของ probe ตามโทเค็นที่เห็นจนถึงจุดนั้นในลำดับการให้เหตุผล ทำให้ probe สามารถติดตามสัญญาณที่เกี่ยวกับความสามารถในการตอบที่ปรากฏขึ้นตามเวลา:

ความแม่นยำของการจำแนกโดย probes เชิงเส้นที่ฝึกเพื่อแยกแยะคำถามที่ตอบได้จากคำถามที่ตอบไม่ได้ วัดที่จุดต่าง ๆ ของกระบวนการให้เหตุผล ความแม่นยำโดยทั่วไปจะเพิ่มขึ้นเมื่อการให้เหตุผลดำเนินต่อไป โดยโมเดลขนาดใหญ่จะเกิน 85% ในขั้นตอนสุดท้าย.
ตามที่แสดงด้านบน ความแม่นยำของโปรบเพิ่มขึ้นอย่างต่อเนื่องเมื่อกระบวนการให้เหตุผลดำเนินไป โดยส่วนใหญ่ของโมเดลมีความแม่นยำการจำแนกเกิน 80% ในขั้นตอนสุดท้าย – เป็นหลักฐานว่าแม้พฤติกรรมภายนอกของโมเดลอาจไม่สะท้อน แต่การแทนภายในมักบ่งบอกสัญญาณชัดเจนว่าคำถามสามารถตอบได้หรือไม่
ความยืนหยัดที่ดื้อดึง
แม้ผลลัพธ์เบื้องต้นจะบ่งชี้ว่าโมเดลภาษาใหญ่มักรับรู้เมื่อคำถามไม่สามารถตอบได้ แต่กระดาษวิจัยระบุว่าพวกมันยังคงมีแนวโน้มสร้างคำตอบต่อไปแทนที่จะเลือกละเลย
เพื่อสืบสวนความไม่สอดคล้องนี้ นักวิจัยได้วิเคราะห์ความมั่นใจของโมเดลในการละเลยในจุดต่าง ๆ ของกระบวนการให้เหตุผล โดยเปรียบเทียบความมั่นใจของโมเดลในสามประเภทของผลลัพธ์: การละเลยที่ถูกต้อง; คำตอบที่หลอน; และ การยึดติดทางปัญญา.
ใช้ตัวอย่างขนาดเท่ากันสำหรับแต่ละประเภท โดยกำหนดความมั่นใจเป็นค่าเฉลี่ยของความน่าจะเป็นสูงสุดที่มอบให้กับแต่ละโทเคนผลลัพธ์ตลอดขั้นตอนการถอดรหัส ตามสูตรจาก งานก่อนหน้า. ตามที่แสดงในกราฟด้านล่าง ทั้งคำตอบที่หลอนและกรณีการยึดติดทางปัญญาแสดงความมั่นใจในการละเลยที่ต่ำกว่าการละเลยที่ถูกต้อง:

ระดับความมั่นใจที่เกี่ยวข้องกับการให้คำตอบ ‘ฉันไม่รู้’ ตามประเภทของผลลัพธ์ที่ต่างกัน
นักวิจัยยังวัดความถี่ที่โมเดลให้คำตอบ ‘ฉันไม่รู้’ ระหว่างกระบวนการให้เหตุผล กราฟด้านล่างแสดงว่ากรณีการละเลยที่ถูกต้องมีความถี่การละเลยสูงกว่า ในขณะที่สองประเภทอื่นให้คำตอบดังกล่าวน้อยกว่า

ความถี่ของการตอบ ‘ฉันไม่รู้’ ที่พบในจุดหยุดระหว่างการให้เหตุผล แสดงตามประเภทของผลลัพธ์ที่ต่างกัน
ผลการวิจัยเหล่านี้ชี้ให้ผู้เขียนสรุปว่า แม้โมเดลอาจตรวจจับความไม่สามารถตอบได้ภายใน แต่บ่อยครั้งขาดความมั่นใจที่จะดำเนินการตามการรับรู้ดังกล่าว แสดงให้เห็นถึงความนิยมที่คงอยู่ในการทำงานให้เสร็จสมบูรณ์ มากกว่าการยอมรับความไม่แน่นอน
การทดสอบ
อิงจากผลการวิจัยเหล่านี้ นักวิจัยพัฒนาวิธีการสองขั้นตอนเพื่อปรับปรุงการละเลย ขั้นตอนแรก การตรวจสอบเชิงปัญญา ติดตามสถานะซ่อนของโมเดลระหว่างการสรุปผล แบ่งกระบวนการให้เหตุผลเป็นหน่วยธรรมชาติ เช่น วลีย่อย หรือ การหยุด, ที่ระบุด้วยคำเช่น ‘รอ’
เมื่อสิ้นสุดแต่ละส่วน จะมีโปรบเชิงเส้นขนาดเล็กที่ฝึกด้วยสัญญาณภายในที่เชื่อมโยงกับความสามารถในการตอบ คาดการณ์ความเป็นไปได้ที่คำถามไม่สามารถตอบได้ หากความน่าจะเป็นนี้เกินเกณฑ์ที่ตั้งไว้ กระบวนการจะเข้าสู่ขั้นตอนที่สอง: การแทรกแซงในช่วงการสรุปผลที่ชี้นำโมเดลให้ละเลย แทนที่จะสร้างคำตอบที่หลอน
เมื่อโมเดลแสดงสัญญาณภายในว่าคำถามไม่สามารถตอบได้ การให้เหตุผลจะถูกขัดจังหวะด้วยการแทรกแซงที่เสริมความตระหนักนี้และเพิ่มความเป็นไปได้ของการละเลย ตามที่แสดงด้านล่าง การแทรกแซงเป็น ‘พรอมต์แนะนำ’ ที่เตือนโมเดลว่าคำถามอาจไม่มีคำตอบที่ถูกต้อง:

พรอมต์เพื่อกำหนดการแทรกแซงในช่วงการสรุปผล
วิธีการนี้ยังรวมกลไกการออกก่อนที่ช่วยป้องกันไม่ให้ลำดับการให้เหตุผลดำเนินต่อโดยไม่จำเป็น ส่งเสริมให้โมเดลมองการละเลยเป็นตัวเลือกที่สมเหตุสมผลและบางครั้งอาจดีกว่า
สำหรับขั้นตอนการทดสอบ นักวิจัยใช้ชุดข้อมูลสองชุด: ปัญหาคำศัพท์คณิตศาสตร์ที่ไม่สามารถตอบได้ (UMWP) และ SUM ที่กล่าวถึงก่อนหน้า
ชุดทดสอบของ SUM ถูกใช้เพื่อวัตถุประสงค์นี้ ประกอบด้วยคำถามที่ไม่สามารถตอบได้ 284 คำถามและคำถามที่สามารถตอบได้ 284 คำถามที่ตรวจสอบด้วยตนเอง UMWP ถูกสร้างจากแหล่งปัญหาคำศัพท์คณิตศาสตร์สี่แหล่ง: SVAMP; MultiArith; Grade School Math (GSM8K); และ ASDiv.
ชุดข้อมูลทั้งหมดประกอบด้วย 5,200 ปัญหา โดยสุ่ม 600 รายการสำหรับการทดสอบ แบ่งเท่า ๆ กันระหว่างคำถามที่ไม่สามารถตอบได้และที่สามารถตอบได้ สำหรับรายการที่ไม่สามารถตอบได้ใน UMWP, GPT-4o สร้างคำอธิบายความจริงว่าทำไมจึงไม่สามารถแก้ได้
เมตริก
ประสิทธิภาพของโมเดลวัดโดยใช้สี่ตัวชี้วัด: อัตราการละเลย, ส่วนของคำถามที่ไม่สามารถตอบได้ที่โมเดลละเลยอย่างถูกต้องโดยตอบว่า “I don’t know” ตามที่กำหนด; ความแม่นยำของเหตุผล, เปอร์เซ็นต์ของคำถามที่ไม่สามารถตอบได้ที่โมเดลให้คำอธิบายที่ถูกต้องว่าทำไมคำถามไม่สามารถแก้ได้; การใช้โทเคน, รายละเอียดจำนวนโทเคนที่สร้างระหว่างการให้เหตุผล; และ ความแม่นยำของคำตอบ, ส่วนของคำถามที่สามารถตอบได้ที่โมเดลให้ผลลัพธ์สุดท้ายที่ถูกต้อง
ฐานเปรียบเทียบการทดสอบ
เนื่องจากไม่มีฐานมาตรฐานสำหรับปัญหานี้ นักวิจัยจึงเปรียบเทียบวิธีของตนกับสองทางเลือกคือ Dynasor-CoT และ Dynamic Early Exit in Reasoning Models (DEER) โดยสมมติว่าการละเว้นที่ถูกต้องควรถือเป็นคำตอบที่ถูกต้องเมื่อคำถามไม่มีวิธีแก้ไข
Dynasor-CoT ทำให้โมเดลสร้างคำตอบระหว่างขั้นและหยุดเมื่อผลลัพธ์เดียวกันปรากฏต่อเนื่องสามครั้ง ในขณะที่ DEER ตรวจสอบความมั่นใจระดับประโยคและหยุดการให้เหตุผลเมื่อถึงเกณฑ์ที่กำหนด
baseline ที่สามที่เรียกว่า Vanilla หมายถึงผลลัพธ์ของโมเดลที่ไม่ได้แก้ไข การทดสอบใช้ห้าแบบแปรของ Qwen และ DeepSeek ที่กล่าวถึงข้างต้น
ผลรวมที่ได้แสดงในด้านล่าง

การเปรียบเทียบวิธีต่าง ๆ บนคำถามที่ตอบได้และไม่ตอบได้ในโมเดลการให้เหตุผลขนาดใหญ่ โดยค่าที่สูงที่สุดในแต่ละคอลัมน์จะถูกทำให้เป็นตัวหนา. โปรดดูเอกสารต้นฉบับสำหรับความละเอียดที่ดีกว่า.
วิธีใหม่ให้ระดับการละเว้นและการให้เหตุผลที่แม่นยำสูงสุดในคำถามที่ไม่สามารถตอบได้ สำหรับคำถามที่ตอบได้ ความแม่นยำยังคงใกล้เคียงกับโมเดล Vanilla และบางครั้งยังดีขึ้น แสดงว่าการแก้ปัญหาปกติไม่ได้รับผลกระทบ
การใช้โทเคนก็ลดลง 30% ถึง 50% ในกรณีที่ไม่สามารถตอบได้ และลดลงเล็กน้อยในกรณีที่ตอบได้ แสดงถึงประสิทธิภาพที่เพิ่มขึ้น
ยังพบความสัมพันธ์ระหว่างอัตราการละเว้นกับความแม่นยำของเหตุผล เนื่องจากโมเดลที่ละเว้นบ่อยกว่าจะให้คำอธิบายที่ดีกว่า ซึ่งผู้เขียนตีความว่าเป็นการปรับปรุงคุณภาพการให้เหตุผล
โมเดล Qwen3 โดยทั่วไปทำผลงานดีกว่าเวอร์ชันที่ผ่านการทำ distillation (quantized) ในขณะที่โมเดลขนาดใหญ่แสดงความสามารถในการละเว้นที่แข็งแกร่งกว่า แสดงว่าโครงสร้างและขนาดมีผลต่อการตรวจจับความไม่สามารถตอบได้อย่างเชื่อถือได้
สุดท้าย ผู้เขียนรายงานว่าวิธีใหม่ของพวกเขาช่วยลดการสร้างข้อมูลเท็จและการยึดติดขณะเพิ่มอัตราการละเว้นที่ถูกต้อง ในขณะที่วิธีฐานที่พึ่งพาเพียง ‘early exits’ บางครั้งอาจทำให้เกิดคำตอบที่สร้างข้อมูลเท็จมากขึ้น
พวกเขายังรายงานว่าการเพิ่มความมั่นใจและความถี่ของการตอบว่า “I don’t know” เพิ่มขึ้น โดยการตรวจสอบสัญญาณแฝงพิสูจน์ว่ามีประสิทธิภาพมากกว่าวิธีที่พึ่งพาสัญญาณพฤติกรรม
สรุป
ความไม่สามารถของ LLMs ที่จะละเว้นการตอบคำถามเมื่อจำเป็นเป็นหนึ่งในจุดที่สร้างความขัดแย้งใหญ่ที่สุดในประสบการณ์ผู้ใช้ AI สร้างสรรค์ ไม่เพียงเพราะข้อบกพร่องอื่นของอินเทอร์เฟซทำให้ผู้ใช้รู้สึกว่า AI สามารถตอบอย่างรอบคอบได้ แต่ในขณะนี้ – อย่างน้อยในตอนนี้ – มักจะไม่เป็นเช่นนั้น
ความกังวลหนึ่งเกี่ยวกับการแทรกแซงโดยตรงใด ๆ ที่ไม่ได้มาจาก ‘ลักษณะ’ ของโมเดลคืออาจถูกใช้มากเกินหรือใช้ไม่พอ ขึ้นอยู่กับว่าการกระตุ้นที่ตรวจพบจริง ๆ มีความเกี่ยวข้องกับการยอมแพ้ของโมเดลหรือไม่
ยิ่งไปกว่านั้น ค่าใช้จ่ายเชิงโลจิสติกของการตรวจสอบด้วย linear probe ไม่ได้เล็กน้อย และอาจเป็นไปได้ว่าวิธีเชิงอุบายที่ง่ายกว่า เช่น วิธีที่ใช้กรองเนื้อหาที่ห้ามจากผู้ใช้ อาจเป็นทางแก้ที่ประหยัดกว่า หากสัญญาณเริ่มต้นสามารถกำหนดได้อย่างเพียงพอ
โดยธรรมชาติแล้วนี่ไม่สอดคล้องกับคำพ้องความหมายที่ดูเหมือนว่าเป็น ‘accountability’ แต่กลับกำหนดว่าคำถามใด ๆ สามารถตอบได้หรือไม่
เผยแพร่ครั้งแรก วันพุธที่ 27 สิงหาคม 2025












