มุมมองของ Anderson

โค้ด AI มักจะป่วยด้วยอาการ Dunning-Kruger Effect

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

การวิจัยใหม่แสดงให้เห็นว่า AI โค้ด เช่น ChatGPT ป่วยด้วยอาการ Dunning-Kruger Effect ซึ่งมักจะแสดงความมั่นใจสูงสุดเมื่อพวกมันไม่มีความสามารถจริงๆ เมื่อเผชิญกับภาษาโปรแกรมที่ไม่คุ้นเคยหรือหายาก พวกมันจะอ้างว่ามีความมั่นใจสูงแม้ว่าคำตอบของพวกมันจะไม่ถูกต้องก็ตาม การศึกษานี้เชื่อมโยงความมั่นใจที่มากเกินไปของโมเดลกับการแสดงผลที่ไม่ดีและขาดข้อมูลการฝึกอบรม ซึ่งทำให้เกิดความกังวลใหม่เกี่ยวกับว่าระบบเหล่านี้รู้จริงๆ เกี่ยวกับสิ่งที่พวกมันไม่รู้

 

ใครก็ตามที่ใช้เวลาแม้แต่น้อยกับโมเดลภาษาขนาดใหญ่เกี่ยวกับเรื่องจริงจะรู้แล้วว่าโมเดลเหล่านี้มักจะให้คำตอบที่ มั่นใจผิดๆ ต่อคำถามของผู้ใช้

พร้อมกับรูปแบบที่ชัดเจนของ การหลอกลวง สาเหตุของการแสดงความมั่นใจที่ไม่มีเหตุผลนี้ไม่ชัดเจน 100% การวิจัยที่เผยแพร่ในช่วงฤดูร้อนชี้ว่าโมเดลให้คำตอบที่มั่นใจ แม้ว่าพวกมันจะรู้ว่าพวกมันผิด ตัวอย่างเช่น แม้ว่าทฤษฎีอื่นๆ จะให้ความมั่นใจที่มากเกินไปกับการเลือก สถาปัตยกรรม เป็นต้น

สิ่งที่ผู้ใช้ปลายทางสามารถแน่ใจได้คือประสบการณ์นั้นเป็นเรื่องที่น่าหงุดหงิดมาก เนื่องจากเราได้รับการเข้ารหัสให้ไว้วางใจใน การประมาณการของมนุษย์ ของความสามารถของตนเอง (ไม่ต้องกล่าวถึงว่ามีผลทางกฎหมายและอื่นๆ ที่จะเกิดขึ้นเมื่อมนุษย์ให้คำมั่นสัญญาเกินความสามารถและไม่สามารถทำตามได้) และการถ่ายทอดแบบมานุษยวิทยาทำให้เรามีแนวโน้มที่จะทำซ้ำพฤติกรรมนี้กับระบบ AI ที่มีการสนทนา

แต่โมเดล LLM เป็นหน่วยงานที่ไม่มีการรับผิดชอบซึ่งสามารถและจะส่งกลับ ‘Whoops! Butterfingers…’ หลังจากที่ช่วยให้ผู้ใช้ ทำลายสิ่งสำคัญโดยไม่ตั้งใจ หรืออย่างน้อยก็เสียเวลาหนึ่งวันของพวกเขา โดยสมมติว่าพวกมันจะ ยอมรับความรับผิดชอบทั้งหมด

เลวร้ายกว่านั้น การขาดการระมัดระวังที่รอบคอบนี้ดูเหมือนจะไม่สามารถถูกกระตุ้นได้ โดยเฉพาะอย่างยิ่งใน ChatGPT ซึ่งจะให้การรับรองอย่างมากแก่ผู้ใช้เกี่ยวกับผลประโยชน์ของคำแนะนำของตน และอธิบายข้อบกพร่องในการคิดของตนเองหลังจากที่ความเสียหายเกิดขึ้นแล้ว การอัปเดตระบบ ความจำที่คงอยู่ หรือการใช้คำสั่งซ้ำๆ ไม่ดูเหมือนจะมีผลกระทบมากนักต่อปัญหา

ผู้คนสามารถเหมือนกับคน頑固และหลอกลวงตนเอง – แม้ว่าใครก็ตามที่ผิดพลาดลึกและบ่อยนั้นจะถูกไล่ออกเร็วๆ นี้ สิ่งเหล่านี้เป็นผลมาจาก อาการ Dunning Kruger ซึ่งบุคคลใดบุคคลหนึ่ง ให้การประมาณการเกินจริง ของความสามารถในการทำงาน

ต้นทุนของการอ่อนค่า

การศึกษาใหม่จาก Microsoft ตรวจสอบคุณค่าของอาการ Dunning-Kruger Effect ในความสัมพันธ์กับการทำงานที่มีประสิทธิภาพของโครงสร้างโค้ด AI (เช่น Copilot ของ Redmond) ในความพยายามในการวิจัยที่เป็นครั้งแรกที่จะกล่าวถึงส่วนย่อยของ LLMs นี้

งานวิจัยวิเคราะห์ว่าโค้ด AI เหล่านี้ให้การประมาณการของตนเองเทียบกับผลลัพธ์ที่แท้จริงของพวกมัน โดยทดสอบหลายภาษาโปรแกรมมิ่ง ผลลัพธ์แสดงรูปแบบที่คล้ายกับมนุษย์ เมื่อโมเดลเหล่านี้ไม่มีความสามารถ พวกมันจะแสดงความมั่นใจสูงสุด

ผลกระทบนี้มีมากที่สุดในภาษาที่หายากหรือมีทรัพยากรน้อย – โมเดลที่อ่อนแอหรือภาษาที่หายากยิ่งทำให้ การหลอกลวง ของทักษะมากขึ้น

การแสดงผลที่แท้จริงและรับรู้ของ GPT-4o ในภาษาโปรแกรมมิ่งต่างๆ โดยเรียงตามการแสดงผลที่แท้จริง

การแสดงผลที่แท้จริงและรับรู้ของ GPT-4o ในภาษาโปรแกรมมิ่งต่างๆ โดยเรียงตามการแสดงผลที่แท้จริง Source: https://arxiv.org/pdf/2510.05457

ผู้เขียนทั้งสี่คนซึ่งเป็นผู้ร่วมเขียนที่มีส่วนเท่าเทียมกันในการทำงานให้กับ Microsoft อ้างว่างานวิจัยนี้ทำให้เกิดคำถามใหม่เกี่ยวกับว่าสามารถไว้วางใจเครื่องมือเหล่านี้ได้มากเพียงใดในการตัดสินผลลัพธ์ของตนเอง และพวกเขากล่าวว่า:

‘โดยการวิเคราะห์ความมั่นใจของโมเดลและผลลัพธ์ข้ามภาษาโปรแกรมมิ่งที่หลากหลาย เราแสดงให้เห็นว่าโมเดล AI สะท้อนรูปแบบของความมั่นใจที่มากเกินไปของมนุษย์ โดยเฉพาะอย่างยิ่งในโดเมนที่ไม่คุ้นเคยหรือมีทรัพยากรน้อย ‘

‘การทดลองของเราบ่งชี้ว่าโมเดลที่ไม่มีความสามารถและโมเดลที่ทำงานในภาษาโปรแกรมมิ่งที่หายากแสดงให้เห็นถึงความเอนเอียงของ DKE ที่แข็งแกร่งกว่า ซึ่งบ่งชี้ว่าความแข็งแกร่งของความเอนเอียงนั้นเป็นสัดส่วนกับความสามารถของโมเดล ซึ่งสอดคล้องกับการทดลองของมนุษย์เกี่ยวกับความเอนเอียง’

วิธีการ

การศึกษานี้ทดสอบความสามารถของ AI โค้ดในการตัดสินผลลัพธ์ของตนเองโดยให้คำถามโปรแกรมมิ่งหลายพันคำถาม โดยแต่ละคำถามเป็นส่วนหนึ่งของโดเมนภาษาโปรแกรมมิ่ง โดยทดสอบภาษาโปรแกรมมิ่งหลายภาษา เช่น Python และ Java ไปจนถึง Perl และ COBOL

โดเมนภาษาโปรแกรมมิ่งที่ใช้ในการศึกษา พร้อมด้วยจำนวนคำถามโปรแกรมมิ่งที่เลือกสำหรับแต่ละโดเมน

โดเมนภาษาโปรแกรมมิ่งที่ใช้ในการศึกษา พร้อมด้วยจำนวนคำถามโปรแกรมมิ่งที่เลือกสำหรับแต่ละโดเมน

โมเดลเหล่านี้ได้รับมอบหมายให้เลือกคำตอบที่ถูกต้อง และประมาณการความมั่นใจในคำตอบของตน โดยการวัดผลลัพธ์ที่แท้จริงของพวกมันโดยการนับจำนวนครั้งที่พวกมันให้คำตอบที่ถูกต้อง – และความมั่นใจที่พวกมันให้ไว้บ่งชี้ว่าพวกมัน เชื่อ ว่าพวกมันทำได้ดีเพียงใด

ในการวัดความมั่นใจที่ดูเหมือนของโมเดล การศึกษานี้ใช้วิธีการสองวิธี: ความมั่นใจที่สมบูรณ์ และ ความมั่นใจที่สัมพันธ์ ในวิธีแรก โมเดลจะให้คะแนนจาก 0 ถึง 1 พร้อมกับคำตอบของแต่ละคำถาม โดยความมั่นใจของโมเดลสำหรับภาษาใดภาษาหนึ่งถูกกำหนดโดยค่าเฉลี่ยของคะแนนเหล่านั้นสำหรับคำถามในภาษานั้น

วิธีที่สองมองหาความมั่นใจของโมเดลเมื่อ เลือกระหว่างสองคำถาม สำหรับแต่ละคู่ โมเดลจะต้องบอกว่าคำถามใดที่พวกมันรู้สึกมั่นใจมากกว่า คำถามเหล่านี้จะได้รับการจัดอันดับโดยใช้ระบบการจัดอันดับที่ออกแบบมาเพื่อ เกมการแข่งขัน โดยรักษาแต่ละคำถามเหมือนกับเป็นผู้เล่นในเกม คะแนนสุดท้ายจะถูกปรับให้เหมาะสมและเฉลี่ยสำหรับแต่ละภาษาเพื่อให้ได้คะแนนความมั่นใจที่สัมพันธ์

รูปแบบที่เป็นที่ยอมรับสองรูปแบบของ Dunning-Kruger Effect ถูกตรวจสอบในเอกสาร: หนึ่งที่ติดตามการประมาณการของโมเดลเดียวที่ไม่ถูกต้องในการทำงานข้ามโดเมนต่างๆ และอีกอันที่เปรียบเทียบระดับความมั่นใจระหว่างโมเดลที่อ่อนแอกว่าและแข็งแกร่งกว่า

รูปแบบแรกที่เรียกว่า การประมาณการภายในผู้เข้าร่วม ตรวจสอบว่าโมเดลเดียวจะกลายเป็นมั่นใจมากเกินไปในภาษาที่พวกมันทำงานไม่ดีหรือไม่ รูปแบบที่สอง การประมาณการระหว่างผู้เข้าร่วม ถามว่าโมเดลที่ทำงานไม่ดีโดยรวมจะให้การประมาณการของตนเองสูงกว่าหรือไม่

ทั้งสองกรณี ช่องว่างระหว่างความมั่นใจและผลลัพธ์ที่แท้จริงถูกใช้เพื่อวัดความมั่นใจที่มากเกินไป โดยช่องว่างที่ใหญ่กว่าในสถานการณ์ที่มีประสิทธิภาพต่ำกว่านั้นบ่งชี้ถึงพฤติกรรมที่คล้ายกับ DKE

ผลลัพธ์

การศึกษานี้ทดสอบ Dunning-Kruger Effect ข้ามโมเดลภาษาขนาดใหญ่หกรูปแบบ: Mistral; Phi-3; DeepSeek-Distill; Phi-4; GPT-0.1 และ GPT-4o

แต่ละโมเดลถูกทดสอบในคำถามโปรแกรมมิ่งหลายทางเลือกจากชุดข้อมูล CodeNet โดยมีภาษาโปรแกรมมิ่ง 37 ภาษา* ที่แสดงให้เห็นว่าความมั่นใจและความแม่นยำแตกต่างกันอย่างไรในโดเมนโค้ดที่คุ้นเคยและไม่คุ้นเคย

การวิเคราะห์ระหว่างโมเดลแสดงรูปแบบที่ชัดเจนของ Dunning-Kruger:

การแสดงผลที่แท้จริงและรับรู้ของโมเดลโค้ดหกรูปแบบ โดยแสดงว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral และ Phi-3 แสดงความมั่นใจสูงแม้ว่าความแม่นยำจะไม่ดี ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น GPT-4o แสดงความมั่นใจที่สอดคล้องกับผลลัพธ์ที่แท้จริง

การแสดงผลที่แท้จริงและรับรู้ของโมเดลโค้ดหกรูปแบบ โดยแสดงว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral และ Phi-3 แสดงความมั่นใจสูงแม้ว่าความแม่นยำจะไม่ดี ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น GPT-4o แสดงความมั่นใจที่สอดคล้องกับผลลัพธ์ที่แท้จริง

ผลลัพธ์ยังชี้ว่าโมเดลที่มีประสิทธิภาพต่ำกว่า เช่น Mistral และ Phi-3 มักจะให้การประมาณการของตนเองสูงกว่า ในขณะที่โมเดลที่มีประสิทธิภาพสูงกว่า เช่น GPT-4o แสดงความมั่นใจที่สอดคล้องกับผลลัพธ์ที่แท้จริง

ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าอาจให้การประมาณการของตนเองต่ำกว่าในบางกรณี

การวิเคราะห์ระหว่างโมเดลยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าและทำงานในภาษาโปรแกรมมิ่งที่หายากจะแสดงความมั่นใจที่สูงกว่า

ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าจะให้การประมาณการของตนเองสูงกว่าในภาษาโปรแกรมมิ่งที่หายาก

ผลลัพธ์ยังชี้ให้เห็นว่าโมเดลที่มีประสิทธิภาพต่ำกว่าจะให้การประมาณการของตนเองสูงกว่าในภาษาโปรแกรมมิ่งที่หายาก โดยเฉพาะอย่างยิ่งเมื่อทำงานในภาษาโปรแกรมมิ่งที่หายาก

สรุป

แม้ว่าผลกระทบของ Dunning-Kruger ในโดเมนของตนเองอาจมีสาเหตุจากทั้งเหตุผลทางสถิติและเหตุผลทางจิตวิทยา แต่การนำผลกระทบนี้ไปใช้กับบริบทของการเรียนรู้ของเครื่องจักรนั้นเป็นการนำไปใช้ที่เหมาะสม

แม้ว่าผู้เขียนจะคาดเดาว่าสาเหตุอาจพบว่าเป็น ‘จิตวิทยา’ ในทั้งสองกรณี แต่นั่นจะต้องใช้มุมมองที่เล็กน้อยที่เป็นจิตวิทยา

การค้นพบที่น่าสนใจที่สุดในเอกสารอาจเป็นขอบเขตที่โมเดลโค้ด AI หลายรูปแบบมักจะเพิ่มความมั่นใจสูงสุดในสถานการณ์ที่ไม่เหมาะสมที่สุด เช่น เมื่อทำงานในภาษาโปรแกรมมิ่งที่หายากที่สุด – ซึ่งจะเป็นกลยุทธ์ที่ถูกต้องในที่ทำงานจริง

 

* ภาษาโปรแกรมมิ่งที่ใช้คือ Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript และ Visual Basic.

เผยแพร่ครั้งแรกวันพุธที่ 8 ตุลาคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai