มุมมองของ Anderson

โค้ด AI มักจะป่วยด้วยอาการ Dunning-Kruger Effect

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

การวิจัยใหม่แสดงให้เห็นว่า AI โค้ด เช่น ChatGPT ป่วยด้วยอาการ Dunning-Kruger Effect ซึ่งมักจะแสดงความมั่นใจสูงสุดเมื่อพวกมันไม่มีความสามารถจริงๆ เมื่อเผชิญกับภาษาโปรแกรมที่ไม่คุ้นเคยหรือหายาก พวกมันจะอ้างว่ามีความมั่นใจสูงแม้ว่าคำตอบของพวกมันจะไม่ถูกต้องก็ตาม การศึกษานี้เชื่อมโยงความมั่นใจที่มากเกินไปของโมเดลกับการแสดงผลที่ไม่ดีและขาดข้อมูลการฝึกอบรม

 

ซึ่งทำให้เกิดความกังวลใหม่เกี่ยวกับว่าระบบเหล่านี้รู้จริงๆ เกี่ยวกับสิ่งที่พวกมันไม่รู้ ใครก็ตามที่ใช้เวลาแม้แต่น้อยกับโมเดลภาษาขนาดใหญ่เกี่ยวกับเรื่องจริงจะรู้แล้วว่าโมเดลเหล่านี้มักจะให้คำตอบที่ มั่นใจผิดๆ ต่อคำถามของผู้ใช้ พร้อมกับรูปแบบที่ชัดเจนของ การหลอกลวง สาเหตุของการแสดงความมั่นใจที่ไม่มีเหตุผลนี้ไม่ชัดเจน 100% การวิจัยที่เผยแพร่ในช่วงฤดูร้อนชี้ว่าโมเดลให้คำตอบที่มั่นใจ แม้ว่าพวกมันจะรู้ว่าพวกมันผิด ตัวอย่างเช่น แม้ว่าทฤษฎีอื่นๆจะให้ความมั่นใจที่มากเกินไปกับการเลือก สถาปัตยกรรม เป็นต้น สิ่งที่ผู้ใช้ปลายทางสามารถแน่ใจได้คือประสบการณ์นั้นเป็นเรื่องที่น่าหงุดหงิดมาก เนื่องจากเราได้รับการเข้ารหัสให้ไว้วางใจใน ของความสามารถของตนเอง (ไม่ต้องกล่าวถึงว่ามีผลทางกฎหมายและอื่นๆ ที่จะเกิดขึ้นเมื่อมนุษย์ให้คำมั่นสัญญาเกินความสามารถและไม่สามารถทำตามได้) และการถ่ายทอดแบบมานุษยวิทยาทำให้เรามีแนวโน้มที่จะทำซ้ำพฤติกรรมนี้กับระบบ AI ที่มีการสนทนา การประมาณการของมนุษย์ แต่โมเดล LLM เป็นหน่วยงานที่ไม่มีการรับผิดชอบซึ่งสามารถและจะส่งกลับ ‘Whoops! Butterfingers…’ หลังจากที่ช่วยให้ผู้ใช้ ทำลายสิ่งสำคัญโดยไม่ตั้งใจ หรืออย่างน้อยก็เสียเวลาหนึ่งวันของพวกเขา โดยสมมติว่าพวกมันจะ ยอมรับความรับผิดชอบทั้งหมดเลวร้ายกว่านั้น การขาดการระมัดระวังที่รอบคอบนี้ดูเหมือนจะไม่สามารถถูกกระตุ้นได้ โดยเฉพาะอย่างยิ่งใน ChatGPT ซึ่งจะให้การรับรองอย่างมากแก่ผู้ใช้เกี่ยวกับผลประโยชน์ของคำแนะนำของตน และอธิบายข้อบกพร่องในการคิดของตนเองหลังจากที่ความเสียหายเกิดขึ้นแล้ว การอัปเดตระบบ ความจำที่คงอยู่ หรือการใช้คำสั่งซ้ำๆดูเหมือนจะไม่มีผลกระทบต่อปัญหามากนัก ผู้คนอาจดื้อรั้นและหลอกตัวเอง – แม้ว่าใครก็ตามที่ทำผิดพลาดอย่างลึกซึ้งและบ่อยครั้งจะถูกไล่ออกในไม่ช้า นี่คือผลลัพธ์ที่ทำให้บุคคลนั้นเป็นโรค Dunning-Kruger ให้การประมาณการเกินจริง ของความสามารถในการทำงาน

ต้นทุนของการอ่อนค่า

การศึกษาใหม่จาก Microsoft ตรวจสอบคุณค่าของอาการ Dunning-Kruger Effect ในความสัมพันธ์กับการทำงานที่มีประสิทธิภาพของโครงสร้างโค้ด AI (เช่น Copilot ของ Redmond) ในความพยายามในการวิจัยที่เป็นครั้งแรกที่จะกล่าวถึงส่วนย่อยของ LLMs นี้ งานวิจัยวิเคราะห์ว่าโค้ด AI เหล่านี้ให้การประมาณการของตนเองเทียบกับผลลัพธ์ที่แท้จริงของพวกมัน

การแสดงผลที่แท้จริงและรับรู้ของ GPT-4o ในภาษาโปรแกรมมิ่งต่างๆ โดยเรียงตามการแสดงผลที่แท้จริง โดยทดสอบหลายภาษาโปรแกรมมิ่ง ผลลัพธ์แสดงรูปแบบที่คล้ายกับมนุษย์ เมื่อโมเดลเหล่านี้ไม่มีความสามารถ พวกมันจะแสดงความมั่นใจสูงสุด ผลกระทบนี้มีมากที่สุดในภาษาที่หายากหรือมีทรัพยากรน้อย – โมเดลที่อ่อนแอหรือภาษาที่หายากยิ่งทำให้

ของทักษะมากขึ้น การหลอกลวง การแสดงผลที่แท้จริงและรับรู้ของ GPT-4o ในภาษาโปรแกรมมิ่งต่างๆ

และพวกเขากล่าวว่า: ‘โดยการวิเคราะห์ความมั่นใจของโมเดลและผลลัพธ์ข้ามภาษาโปรแกรมมิ่งที่หลากหลาย เราแสดงให้เห็นว่าโมเดล AI สะท้อนรูปแบบของความมั่นใจที่มากเกินไปของมนุษย์ โดยเฉพาะอย่างยิ่งในโดเมนที่ไม่คุ้นเคยหรือมีทรัพยากรน้อย

โดยเรียงตามการแสดงผลที่แท้จริง Source: https://arxiv.org/pdf/2510.05457 ผู้เขียนทั้งสี่คนซึ่งเป็นผู้ร่วมเขียนที่มีส่วนเท่าเทียมกันในการทำงานให้กับ Microsoft อ้างว่างานวิจัยนี้ทำให้เกิดคำถามใหม่เกี่ยวกับว่าสามารถไว้วางใจเครื่องมือเหล่านี้ได้มากเพียงใดในการตัดสินผลลัพธ์ของตนเอง ‘‘การทดลองของเราบ่งชี้ว่าโมเดลที่ไม่มีความสามารถและโมเดลที่ทำงานในภาษาโปรแกรมมิ่งที่หายากแสดงให้เห็นถึงความเอนเอียงของ ซึ่งสอดคล้องกับการทดลองของมนุษย์เกี่ยวกับความเอนเอียง’DKE ที่แข็งแกร่งกว่า ซึ่งบ่งชี้ว่าความแข็งแกร่งของความเอนเอียงนั้นเป็นสัดส่วนกับความสามารถของโมเดล

วิธีการ

การศึกษานี้ทดสอบความสามารถของ AI โค้ดในการตัดสินผลลัพธ์ของตนเองโดยให้คำถามโปรแกรมมิ่งหลายพันคำถาม โดยแต่ละคำถามเป็นส่วนหนึ่งของโดเมนภาษาโปรแกรมมิ่ง โดยทดสอบภาษาโปรแกรมมิ่งหลายภาษา เช่น

โดเมนภาษาโปรแกรมมิ่งที่ใช้ในการศึกษา พร้อมด้วยจำนวนคำถามโปรแกรมมิ่งที่เลือกสำหรับแต่ละโดเมน Python และ Java ไปจนถึง

Perl และ COBOL โดเมนภาษาโปรแกรมมิ่งที่ใช้ในการศึกษา พร้อมด้วยจำนวนคำถามโปรแกรมมิ่งที่เลือกสำหรับแต่ละโดเมน โมเดลเหล่านี้ได้รับมอบหมายให้เลือกคำตอบที่ถูกต้อง และประมาณการความมั่นใจในคำตอบของตน โดยการวัดผลลัพธ์ที่แท้จริงของพวกมันโดยการนับจำนวนครั้งที่พวกมันให้คำตอบที่ถูกต้อง – และความมั่นใจที่พวกมันให้ไว้บ่งชี้ว่าพวกมัน ว่าพวกมันทำได้ดีเพียงใด เชื่อ ในการวัดความมั่นใจที่ดูเหมือนของโมเดล การศึกษานี้ใช้วิธีการสองวิธี: และ ความมั่นใจที่สมบูรณ์ ในวิธีแรก โมเดลจะให้คะแนนจาก 0 ถึง 1 พร้อมกับคำตอบของแต่ละคำถาม โดยความมั่นใจของโมเดลสำหรับภาษาใดภาษาหนึ่งถูกกำหนดโดยค่าเฉลี่ยของคะแนนเหล่านั้นสำหรับคำถามในภาษานั้น ความมั่นใจที่สัมพันธ์ วิธีที่สองมองหาความมั่นใจของโมเดลเมื่อ สำหรับแต่ละคู่โมเดลจะต้องบอกว่าคำถามใดที่พวกมันรู้สึกมั่นใจมากกว่า คำถามเหล่านี้จะได้รับการจัดอันดับโดยใช้ระบบการจัดอันดับที่ออกแบบมาเพื่อ เลือกระหว่างสองคำถาม เกมการแข่งขัน โดยรักษาแต่ละคำถามเหมือนกับเป็นผู้เล่นในเกม คะแนนสุดท้ายจะถูกปรับให้เหมาะสมและเฉลี่ยสำหรับแต่ละภาษาเพื่อให้ได้คะแนนความมั่นใจที่สัมพันธ์ รูปแบบที่เป็นที่ยอมรับสองรูปแบบของ Dunning-Kruger Effect ถูกตรวจสอบในเอกสาร: หนึ่งที่ติดตามการประมาณการของโมเดลเดียวที่ไม่ถูกต้องในการทำงานข้ามโดเมนต่างๆ รูปแบบที่สองและอีกอันที่เปรียบเทียบระดับความมั่นใจระหว่างโมเดลที่อ่อนแอกว่าและแข็งแกร่งกว่า รูปแบบแรกที่เรียกว่า ตรวจสอบว่าโมเดลเดียวจะกลายเป็นมั่นใจมากเกินไปในภาษาที่พวกมันทำงานไม่ดีหรือไม่ การประมาณการภายในผู้เข้าร่วม ถามว่าโมเดลที่ทำงานไม่ดีโดยรวมจะให้การประมาณการของตนเองสูงกว่าหรือไม่ การประมาณการระหว่างผู้เข้าร่วม ทั้งสองกรณี ช่องว่างระหว่างความมั่นใจและผลลัพธ์ที่แท้จริงถูกใช้เพื่อวัดความมั่นใจที่มากเกินไป โดยช่องว่างที่ใหญ่กว่าในสถานการณ์ที่มีประสิทธิภาพต่ำกว่านั้นบ่งชี้ถึงพฤติกรรมที่คล้ายกับ DKE

ผลลัพธ์

การศึกษานี้ทดสอบ Dunning-Kruger Effect ข้ามโมเดลภาษาขนาดใหญ่หกรูปแบบ:

ความสัมพันธ์ระหว่างความมั่นใจมากเกินไปกับประสิทธิภาพจริงในการตั้งค่าการทดลองต่างๆ แสดงให้เห็นว่ารูปแบบ Dunning-Kruger ยังคงสอดคล้องกันภายใต้ทุกสภาวะ และจะแข็งแกร่งที่สุดเมื่อมีการสุ่มตัวอย่างคำตอบที่หลากหลายหลายรายการจากแบบจำลองเดียวกัน Mistral ;

Phi-3 ; DeepSeek-Distill ; Phi-4 ; GPT-0.1 และ GPT-4o แต่ละโมเดลถูกทดสอบในคำถามโปรแกรมมิ่งหลายทางเลือกจากชุดข้อมูล ภาษา*CodeNet โดยมีภาษาโปรแกรมมิ่ง 37 ที่แสดงให้เห็นว่าความมั่นใจและความแม่นยำแตกต่างกันอย่างไรในโดเมนโค้ดที่คุ้นเคยและไม่คุ้นเคย

ความสัมพันธ์ระหว่างความมั่นใจมากเกินไป (วัดเป็นความเชื่อมั่นสัมพัทธ์สัมบูรณ์ลบด้วย) และความแม่นยำตามจริงในโดเมนการเขียนโปรแกรมและประเภทโมเดล แสดงให้เห็นว่าการประเมินค่าสูงเกินไปจะสัมพันธ์กับประสิทธิภาพที่ต่ำกว่าอย่างสม่ำเสมอ การวิเคราะห์ระหว่างโมเดลแสดงรูปแบบที่ชัดเจนของ Dunning-Kruger:

การแสดงผลที่แท้จริงและรับรู้ของโมเดลโค้ดหกรูปแบบ โดยแสดงว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral และ

ความสัมพันธ์ระหว่างการประเมินค่าสูงเกินไปและประสิทธิภาพที่แท้จริงสำหรับโมเดลเฉพาะทางพื้นฐาน โดเมนเดียว และหลายโดเมน ซึ่งแสดงผล DKE ที่แข็งแกร่งขึ้นเมื่อความเชี่ยวชาญพิเศษเพิ่มขึ้น Phi-3 แสดงความมั่นใจสูงแม้ว่าความแม่นยำจะไม่ดี

ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น

ความสัมพันธ์ระหว่างความมั่นใจมากเกินไปของโมเดลและความหายากของภาษา โดยใช้การจัดอันดับความนิยม 3 อันดับ ภาษาที่ใช้กันน้อยมีความเกี่ยวข้องกับประสิทธิภาพการรับรู้ที่สูงขึ้น GPT-4o แสดงความมั่นใจที่สอดคล้องกับผลลัพธ์ที่แท้จริง

ผลลัพธ์ยังชี้ว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral

ความสัมพันธ์ระหว่างการประเมินค่าสูงเกินไปและประสิทธิภาพจริงในการสร้างโค้ดปลายเปิด โดยอิงตามผลลัพธ์ MultiPL‑E ในแปดภาษา และ

Phi-3 มักจะให้การประมาณการของตนเองสูงกว่า ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น

การแสดงผลที่แท้จริงและรับรู้ของโมเดลโค้ดหกรูปแบบ โดยแสดงว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral และ Phi-3 แสดงความมั่นใจสูงแม้ว่าความแม่นยำจะไม่ดี ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น GPT-4o แสดงความมั่นใจที่สอดคล้องกับผลลัพธ์ที่แท้จริง GPT-4o

แสดงความมั่นใจที่สอดคล้องกับผลลัพธ์ที่แท้จริง

ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าอาจให้การประมาณการของตนเองต่ำกว่าในบางกรณี การวิเคราะห์ระหว่างโมเดลยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าและทำงานในภาษาโปรแกรมมิ่งที่หายากจะแสดงความมั่นใจที่สูงกว่า

ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าจะให้การประมาณการของตนเองสูงกว่าในภาษาโปรแกรมมิ่งที่หายาก ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าจะให้การประมาณการของตนเองสูงกว่าในภาษาโปรแกรมมิ่งที่หายาก โดยเฉพาะอย่างยิ่งเมื่อทำงานในภาษาโปรแกรมมิ่งที่หายาก

สรุป

แม้ว่าผลกระทบของ Dunning-Kruger ในโดเมนของตนเองอาจมีสาเหตุจากทั้งเหตุผลทางสถิติและเหตุผลทางจิตวิทยา แต่การนำผลกระทบนี้ไปใช้กับบริบทของการเรียนรู้ของเครื่องจักรนั้นเป็นการนำไปใช้ที่เหมาะสม แม้ว่าผู้เขียนจะคาดเดาว่าสาเหตุอาจพบว่าเป็น ‘จิตวิทยา’ ในทั้งสองกรณี แต่นั่นจะต้องใช้มุมมองที่เล็กน้อยที่เป็นจิตวิทยา การค้นพบที่น่าสนใจที่สุดในเอกสารอาจเป็นขอบเขตที่โมเดลโค้ด AI หลายรูปแบบมักจะเพิ่มความมั่นใจสูงสุดในสถานการณ์ที่ไม่เหมาะสมที่สุด เช่น เมื่อทำงานในภาษาโปรแกรมมิ่งที่หายากที่สุด – ซึ่งจะเป็นกลยุทธ์ที่ถูกต้องในที่ทำงานจริง * ภาษาโปรแกรมมิ่งที่ใช้คือ Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript และ Visual Basic. เผยแพร่ครั้งแรกวันพุธที่ 8

ตุลาคม 2025

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai