มุมมองของ Anderson
โค้ด AI มักจะป่วยด้วยอาการ Dunning-Kruger Effect

การวิจัยใหม่แสดงให้เห็นว่า AI โค้ด เช่น ChatGPT ป่วยด้วยอาการ Dunning-Kruger Effect ซึ่งมักจะแสดงความมั่นใจสูงสุดเมื่อพวกมันไม่มีความสามารถจริงๆ เมื่อเผชิญกับภาษาโปรแกรมที่ไม่คุ้นเคยหรือหายาก พวกมันจะอ้างว่ามีความมั่นใจสูงแม้ว่าคำตอบของพวกมันจะไม่ถูกต้องก็ตาม การศึกษานี้เชื่อมโยงความมั่นใจที่มากเกินไปของโมเดลกับการแสดงผลที่ไม่ดีและขาดข้อมูลการฝึกอบรม
ซึ่งทำให้เกิดความกังวลใหม่เกี่ยวกับว่าระบบเหล่านี้รู้จริงๆ เกี่ยวกับสิ่งที่พวกมันไม่รู้ ใครก็ตามที่ใช้เวลาแม้แต่น้อยกับโมเดลภาษาขนาดใหญ่เกี่ยวกับเรื่องจริงจะรู้แล้วว่าโมเดลเหล่านี้มักจะให้คำตอบที่ มั่นใจผิดๆ ต่อคำถามของผู้ใช้ พร้อมกับรูปแบบที่ชัดเจนของ การหลอกลวง สาเหตุของการแสดงความมั่นใจที่ไม่มีเหตุผลนี้ไม่ชัดเจน 100% การวิจัยที่เผยแพร่ในช่วงฤดูร้อนชี้ว่าโมเดลให้คำตอบที่มั่นใจ แม้ว่าพวกมันจะรู้ว่าพวกมันผิด ตัวอย่างเช่น แม้ว่าทฤษฎีอื่นๆจะให้ความมั่นใจที่มากเกินไปกับการเลือก สถาปัตยกรรม เป็นต้น สิ่งที่ผู้ใช้ปลายทางสามารถแน่ใจได้คือประสบการณ์นั้นเป็นเรื่องที่น่าหงุดหงิดมาก เนื่องจากเราได้รับการเข้ารหัสให้ไว้วางใจใน ของความสามารถของตนเอง (ไม่ต้องกล่าวถึงว่ามีผลทางกฎหมายและอื่นๆ ที่จะเกิดขึ้นเมื่อมนุษย์ให้คำมั่นสัญญาเกินความสามารถและไม่สามารถทำตามได้) และการถ่ายทอดแบบมานุษยวิทยาทำให้เรามีแนวโน้มที่จะทำซ้ำพฤติกรรมนี้กับระบบ AI ที่มีการสนทนา การประมาณการของมนุษย์ แต่โมเดล LLM เป็นหน่วยงานที่ไม่มีการรับผิดชอบซึ่งสามารถและจะส่งกลับ ‘Whoops! Butterfingers…’ หลังจากที่ช่วยให้ผู้ใช้ ทำลายสิ่งสำคัญโดยไม่ตั้งใจ หรืออย่างน้อยก็เสียเวลาหนึ่งวันของพวกเขา โดยสมมติว่าพวกมันจะ ยอมรับความรับผิดชอบทั้งหมดเลวร้ายกว่านั้น การขาดการระมัดระวังที่รอบคอบนี้ดูเหมือนจะไม่สามารถถูกกระตุ้นได้ โดยเฉพาะอย่างยิ่งใน ChatGPT ซึ่งจะให้การรับรองอย่างมากแก่ผู้ใช้เกี่ยวกับผลประโยชน์ของคำแนะนำของตน และอธิบายข้อบกพร่องในการคิดของตนเองหลังจากที่ความเสียหายเกิดขึ้นแล้ว การอัปเดตระบบ ความจำที่คงอยู่ หรือการใช้คำสั่งซ้ำๆดูเหมือนจะไม่มีผลกระทบต่อปัญหามากนัก ผู้คนอาจดื้อรั้นและหลอกตัวเอง – แม้ว่าใครก็ตามที่ทำผิดพลาดอย่างลึกซึ้งและบ่อยครั้งจะถูกไล่ออกในไม่ช้า นี่คือผลลัพธ์ที่ทำให้บุคคลนั้นเป็นโรค Dunning-Kruger ให้การประมาณการเกินจริง ของความสามารถในการทำงาน
ต้นทุนของการอ่อนค่า
การศึกษาใหม่จาก Microsoft ตรวจสอบคุณค่าของอาการ Dunning-Kruger Effect ในความสัมพันธ์กับการทำงานที่มีประสิทธิภาพของโครงสร้างโค้ด AI (เช่น Copilot ของ Redmond) ในความพยายามในการวิจัยที่เป็นครั้งแรกที่จะกล่าวถึงส่วนย่อยของ LLMs นี้ งานวิจัยวิเคราะห์ว่าโค้ด AI เหล่านี้ให้การประมาณการของตนเองเทียบกับผลลัพธ์ที่แท้จริงของพวกมัน

ของทักษะมากขึ้น การหลอกลวง การแสดงผลที่แท้จริงและรับรู้ของ GPT-4o ในภาษาโปรแกรมมิ่งต่างๆ
และพวกเขากล่าวว่า: ‘โดยการวิเคราะห์ความมั่นใจของโมเดลและผลลัพธ์ข้ามภาษาโปรแกรมมิ่งที่หลากหลาย เราแสดงให้เห็นว่าโมเดล AI สะท้อนรูปแบบของความมั่นใจที่มากเกินไปของมนุษย์ โดยเฉพาะอย่างยิ่งในโดเมนที่ไม่คุ้นเคยหรือมีทรัพยากรน้อย
โดยเรียงตามการแสดงผลที่แท้จริง Source: https://arxiv.org/pdf/2510.05457 ผู้เขียนทั้งสี่คนซึ่งเป็นผู้ร่วมเขียนที่มีส่วนเท่าเทียมกันในการทำงานให้กับ Microsoft อ้างว่างานวิจัยนี้ทำให้เกิดคำถามใหม่เกี่ยวกับว่าสามารถไว้วางใจเครื่องมือเหล่านี้ได้มากเพียงใดในการตัดสินผลลัพธ์ของตนเอง ‘‘การทดลองของเราบ่งชี้ว่าโมเดลที่ไม่มีความสามารถและโมเดลที่ทำงานในภาษาโปรแกรมมิ่งที่หายากแสดงให้เห็นถึงความเอนเอียงของ ซึ่งสอดคล้องกับการทดลองของมนุษย์เกี่ยวกับความเอนเอียง’DKE ที่แข็งแกร่งกว่า ซึ่งบ่งชี้ว่าความแข็งแกร่งของความเอนเอียงนั้นเป็นสัดส่วนกับความสามารถของโมเดล
วิธีการ
การศึกษานี้ทดสอบความสามารถของ AI โค้ดในการตัดสินผลลัพธ์ของตนเองโดยให้คำถามโปรแกรมมิ่งหลายพันคำถาม โดยแต่ละคำถามเป็นส่วนหนึ่งของโดเมนภาษาโปรแกรมมิ่ง โดยทดสอบภาษาโปรแกรมมิ่งหลายภาษา เช่น

Perl และ COBOL โดเมนภาษาโปรแกรมมิ่งที่ใช้ในการศึกษา พร้อมด้วยจำนวนคำถามโปรแกรมมิ่งที่เลือกสำหรับแต่ละโดเมน โมเดลเหล่านี้ได้รับมอบหมายให้เลือกคำตอบที่ถูกต้อง และประมาณการความมั่นใจในคำตอบของตน โดยการวัดผลลัพธ์ที่แท้จริงของพวกมันโดยการนับจำนวนครั้งที่พวกมันให้คำตอบที่ถูกต้อง – และความมั่นใจที่พวกมันให้ไว้บ่งชี้ว่าพวกมัน ว่าพวกมันทำได้ดีเพียงใด เชื่อ ในการวัดความมั่นใจที่ดูเหมือนของโมเดล การศึกษานี้ใช้วิธีการสองวิธี: และ ความมั่นใจที่สมบูรณ์ ในวิธีแรก โมเดลจะให้คะแนนจาก 0 ถึง 1 พร้อมกับคำตอบของแต่ละคำถาม โดยความมั่นใจของโมเดลสำหรับภาษาใดภาษาหนึ่งถูกกำหนดโดยค่าเฉลี่ยของคะแนนเหล่านั้นสำหรับคำถามในภาษานั้น ความมั่นใจที่สัมพันธ์ วิธีที่สองมองหาความมั่นใจของโมเดลเมื่อ สำหรับแต่ละคู่โมเดลจะต้องบอกว่าคำถามใดที่พวกมันรู้สึกมั่นใจมากกว่า คำถามเหล่านี้จะได้รับการจัดอันดับโดยใช้ระบบการจัดอันดับที่ออกแบบมาเพื่อ เลือกระหว่างสองคำถาม เกมการแข่งขัน โดยรักษาแต่ละคำถามเหมือนกับเป็นผู้เล่นในเกม คะแนนสุดท้ายจะถูกปรับให้เหมาะสมและเฉลี่ยสำหรับแต่ละภาษาเพื่อให้ได้คะแนนความมั่นใจที่สัมพันธ์ รูปแบบที่เป็นที่ยอมรับสองรูปแบบของ Dunning-Kruger Effect ถูกตรวจสอบในเอกสาร: หนึ่งที่ติดตามการประมาณการของโมเดลเดียวที่ไม่ถูกต้องในการทำงานข้ามโดเมนต่างๆ รูปแบบที่สองและอีกอันที่เปรียบเทียบระดับความมั่นใจระหว่างโมเดลที่อ่อนแอกว่าและแข็งแกร่งกว่า รูปแบบแรกที่เรียกว่า ตรวจสอบว่าโมเดลเดียวจะกลายเป็นมั่นใจมากเกินไปในภาษาที่พวกมันทำงานไม่ดีหรือไม่ การประมาณการภายในผู้เข้าร่วม ถามว่าโมเดลที่ทำงานไม่ดีโดยรวมจะให้การประมาณการของตนเองสูงกว่าหรือไม่ การประมาณการระหว่างผู้เข้าร่วม ทั้งสองกรณี ช่องว่างระหว่างความมั่นใจและผลลัพธ์ที่แท้จริงถูกใช้เพื่อวัดความมั่นใจที่มากเกินไป โดยช่องว่างที่ใหญ่กว่าในสถานการณ์ที่มีประสิทธิภาพต่ำกว่านั้นบ่งชี้ถึงพฤติกรรมที่คล้ายกับ DKE
ผลลัพธ์
การศึกษานี้ทดสอบ Dunning-Kruger Effect ข้ามโมเดลภาษาขนาดใหญ่หกรูปแบบ:

Phi-3 ; DeepSeek-Distill ; Phi-4 ; GPT-0.1 และ GPT-4o แต่ละโมเดลถูกทดสอบในคำถามโปรแกรมมิ่งหลายทางเลือกจากชุดข้อมูล ภาษา*CodeNet โดยมีภาษาโปรแกรมมิ่ง 37 ที่แสดงให้เห็นว่าความมั่นใจและความแม่นยำแตกต่างกันอย่างไรในโดเมนโค้ดที่คุ้นเคยและไม่คุ้นเคย

การแสดงผลที่แท้จริงและรับรู้ของโมเดลโค้ดหกรูปแบบ โดยแสดงว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral และ

ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น

ผลลัพธ์ยังชี้ว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral

Phi-3 มักจะให้การประมาณการของตนเองสูงกว่า ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น

แสดงความมั่นใจที่สอดคล้องกับผลลัพธ์ที่แท้จริง
ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าอาจให้การประมาณการของตนเองต่ำกว่าในบางกรณี การวิเคราะห์ระหว่างโมเดลยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าและทำงานในภาษาโปรแกรมมิ่งที่หายากจะแสดงความมั่นใจที่สูงกว่า
ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าจะให้การประมาณการของตนเองสูงกว่าในภาษาโปรแกรมมิ่งที่หายาก ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าจะให้การประมาณการของตนเองสูงกว่าในภาษาโปรแกรมมิ่งที่หายาก โดยเฉพาะอย่างยิ่งเมื่อทำงานในภาษาโปรแกรมมิ่งที่หายาก
สรุป
แม้ว่าผลกระทบของ Dunning-Kruger ในโดเมนของตนเองอาจมีสาเหตุจากทั้งเหตุผลทางสถิติและเหตุผลทางจิตวิทยา แต่การนำผลกระทบนี้ไปใช้กับบริบทของการเรียนรู้ของเครื่องจักรนั้นเป็นการนำไปใช้ที่เหมาะสม แม้ว่าผู้เขียนจะคาดเดาว่าสาเหตุอาจพบว่าเป็น ‘จิตวิทยา’ ในทั้งสองกรณี แต่นั่นจะต้องใช้มุมมองที่เล็กน้อยที่เป็นจิตวิทยา การค้นพบที่น่าสนใจที่สุดในเอกสารอาจเป็นขอบเขตที่โมเดลโค้ด AI หลายรูปแบบมักจะเพิ่มความมั่นใจสูงสุดในสถานการณ์ที่ไม่เหมาะสมที่สุด เช่น เมื่อทำงานในภาษาโปรแกรมมิ่งที่หายากที่สุด – ซึ่งจะเป็นกลยุทธ์ที่ถูกต้องในที่ทำงานจริง * ภาษาโปรแกรมมิ่งที่ใช้คือ Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript และ Visual Basic. เผยแพร่ครั้งแรกวันพุธที่ 8
ตุลาคม 2025












