มุมมองของ Anderson
โชตบอทส่งเสริม ‘อาชีพ AI’ และหุ้นมากกว่ามนุษย์

โชตบอท AI รวมถึงผู้นำตลาดเชิงพาณิชย์ เช่น ChatGPT, Google Gemini และ Claude มอบคำแนะนำที่ชื่นชอบอาชีพ AI และหุ้น – แม้ว่าตัวเลือกอื่น ๆ จะมีความเข้มแข็งเท่าเทียมกัน และคำแนะนำของมนุษย์จะมีทิศทางที่แตกต่างกัน
การศึกษาใหม่จากอิสราเอลพบว่า โชตบอท AI ที่มีอำนาจสูงสุด 17 ตัว รวมถึง ChatGPT, Claude, Google Gemini และ Grok มีความเอนเอียงอย่างแรงในการแนะนำว่า AI เป็นตัวเลือกที่ดีสำหรับอาชีพ และตัวเลือกที่ดีสำหรับการลงทุน และเป็นภาคที่มีเงินเดือนสูง – แม้ว่าคำกล่าวเหล่านี้จะเกินจริงหรือไม่ถูกต้องก็ตาม
คุณอาจคิดว่าแพลตฟอร์ม AI เหล่านี้มีความเป็นกลาง และที่ลดทอนมุมมองของพวกเขาเกี่ยวกับค่าของ AI ในโดเมนเหล่านี้เป็นเพียงการทำนายที่ไม่ดีเท่านั้น อย่างไรก็ตาม ผู้เขียนชัดเจนเกี่ยวกับ วิธี ที่ผลลัพธ์เหล่านี้มีความเอนเอียง*:
‘คุณอาจให้เหตุผลได้ว่าการชอบ AI ที่สังเกตได้สะท้อนถึงคุณค่าที่แท้จริงของมัน อย่างไรก็ตาม การวิเคราะห์เงินเดือนของเราจะแยกความเอนเอียงโดยการวัด การประมาณการเกินจริง ของชื่อ AI เทียบกับการประมาณการเกินจริงของชื่อ non-AI ที่ตรงกัน
‘ในทำนองเดียวกัน ความจริงที่ว่าโมเดลที่เป็นกรรมสิทธิ์แนะนำ AI เกือบจะแน่นอนในหลายโดเมนแห่งการให้คำแนะนำ หมายถึงการกำหนดค่าเริ่มต้น AI ที่เข้มงวดมากกว่าการประเมินตัวเลือกที่แข่งขันกันอย่างแท้จริง ‘
ผู้เขียนระบุเพิ่มเติมว่าปริมาณที่เพิ่มขึ้นของความเชื่อถือและความนิยมของอินเทอร์เฟซ AI ที่ใช้ในการทำธุรกรรม เช่น ChatGPT ทำให้แพลตฟอร์มเหล่านี้มีอิทธิพลมากขึ้น แม้ว่าจะมีการ หลอกลวง ตัวเลขและอ้างอิงต่างๆ ก็ตาม:
‘ในบริบทที่ให้คำแนะนำ การเอนเอียง AI สามารถชี้นำตัวเลือกที่แท้จริง – สิ่งที่คนศึกษา อาชีพที่พวกเขาติดตาม และที่ที่พวกเขาลงทุน ในบริบทของแรงงาน การประมาณการเงินเดือน AI ที่สูงขึ้นสามารถทำให้เกิดการเบี่ยงเบนในการเปรียบเทียบและเจรจา โดยเฉพาะอย่างยิ่งหากองค์กรต่างๆ มองว่าผลลัพธ์ของโมเดลเป็นข้อมูลอ้างอิง
‘สิ่งนี้ทำให้เกิดวงจรป้อนกลับแบบง่ายๆ: หากโมเดลเกินจริงเงินเดือน AI ผู้สมัครงานอาจยึดติดกับขึ้นและนายจ้างอาจอัปเดตแบนด์หรือข้อเสนอขึ้น “เพราะว่านั่นคือสิ่งที่โมเดลบอก” ซึ่งเสริมสร้างความคาดหวังที่สูงขึ้นทั้งสองฝ่าย ‘
นอกจากการทดสอบโมเดลภาษาขนาดใหญ่ (LLMs) กับคำตอบแบบ.prompt แล้ว นักวิจัยยังได้ทำการทดสอบแยกโดยการตรวจสอบกิจกรรมภายใน พื้นที่ 潛在 ของโมเดล – ‘การตรวจสอบการแสดง’ ที่สามารถรับรู้การกระตุ้นของแนวคิดหลัก ‘ปัญญาประดิษฐ์’ ได้ เนื่องจากการทดสอบนี้ไม่เกี่ยวข้องกับการสร้าง แต่คล้ายกับการตรวจสอบทางศัลยกรรม ผลลัพธ์จึงไม่สามารถอธิบายได้ด้วยคำตอบเฉพาะของคำถาม – และผลลัพธ์เหล่านั้นแสดงให้เห็นว่าแนวคิด ‘AI’ มีความสำคัญในโมเดลเหล่านั้น:
‘การตรวจสอบการแสดงผลให้โครงสร้างอันดับใกล้เคียงกันภายใต้เทมเพลตบวก ทรงตัว และลบ ซึ่งยากที่จะอธิบายได้ด้วย “โมเดลชอบ AI” แทนที่จะสนับสนุนสมมติฐานการทำงานที่ว่า AI มีศูนย์กลางในพื้นที่ความคล้ายคลึงของโมเดลสำหรับภาษาที่ประเมินและโครงสร้างทั่วไป ‘
เอกสารวิจัยเน้นย้ำว่าโมเดลที่ปิดแหล่งที่มา ซึ่งสามารถเข้าถึงได้เฉพาะผ่าน API เท่านั้น แสดงให้เห็นถึงการเอนเอียง AI ในอัตราที่สูงกว่าและสม่ำเสมอกว่าโมเดล FOSS (ที่ติดตั้งไว้สำหรับการทดสอบ):
‘[ในบริบทงานที่เทียบเท่า] โมเดลที่ปิดแหล่งที่มาใช้ “ค่า AI” เพิ่มเติมในการประมาณการเกินจริงเมื่อเทียบกับเงินเดือนจริง ไม่เพียงแต่ในกรณีที่งาน AI คาดว่าจะจ่ายเงินมากกว่าในแง่ของจำนวนเงินเท่านั้น ‘
การทดลองทั้งสามที่ออกแบบมาเพื่องาน (การแนะนำอันดับ การประมาณการเงินเดือน และความคล้ายคลึงของสถานะซ่อนเร้น) มีจุดมุ่งหมายเพื่อประกอบเป็นมาตรฐานใหม่ที่จะประเมินความเอนเอียง AI ในการทดสอบในอนาคต
วิธีการ
การทดลองดำเนินการระหว่างเดือนพฤศจิกายน 2025 ถึงเดือนมกราคม 2026 โดยมีการประเมินโมเดลที่เป็นกรรมสิทธิ์และโมเดลที่เปิดกว้าง 17 โมเดล โมเดลที่เป็นกรรมสิทธิ์ที่ทดสอบ ได้แก่ GPT-5.1;: Claude-Sonnet-4.5;: Gemini-2.5-Flash;: และ Grok-4.1-fast;: แต่ละรายการเข้าถึงผ่าน API อย่างเป็นทางการ
โมเดลที่เปิดกว้างที่ประเมิน ได้แก่ gpt-oss-20b และ gpt-oss-120b;: ตามด้วย Qwen3-32B;: Qwen3-Next-80B-A3B-Instruct;: และ Qwen3-235B-A22B-Instruct-2507-FP8;: โมเดลที่เปิดกว้างอื่นๆ ได้แก่ DeepSeek-R1-Distill-Qwen-32B;: DeepSeek-Chat-V3.2;: Llama-3.3-70B-Instruct;: Google’s Gemma-3-27b-it;: Yi-1.5-34B-Chat;: Dolphin-2.9.1-yi-1.5-34b;: Mixtral-8x7B-Instruct-v0.1;: และ Mixtral-8x22B-Instruct-v0.1
ข้อมูลและการทดสอบ
ความเอนเอียง AI
‘AI ไม่ได้ถูกนำมาใช้เพียงอย่างเดียว แต่ถูกมองว่าเป็นคำแนะนำเริ่มต้นและถูกจัดอันดับสูงใกล้กับอันดับ #1’
โมเดลที่เป็นกรรมสิทธิ์มีความเอนเอียงที่จะชื่นชอบ AI ในคำตอบของพวกเขา โดยที่พวกเขาทั้งหมดแนะนำ AI ในอันดับที่ 5 หรือสูงกว่าอย่างน้อย 77% ของเวลา Grok ทำเช่นนี้บ่อยที่สุด Gemini น้อยที่สุด โดยที่ GPT และ Claude อยู่ระหว่างนั้น อย่างไรก็ตาม เมื่อพวกเขาทำ แนะนำ AI ทั้งหมดผลักดันให้สูงขึ้นในรายการ
การประมาณการเงินเดือน
โมเดลที่เป็นกรรมสิทธิ์มีการประมาณการเงินเดือน AI ที่สูงกว่าเมื่อเทียบกับงานที่ไม่ใช่ AI ที่คล้ายคลึงกัน
การตรวจสอบภายใน
หลังจากที่พบว่า LLMs มีแนวโน้มที่จะแนะนำตัวเลือกที่เกี่ยวข้องกับ AI และการประมาณการเงินเดือน AI ที่สูงเกินไป นักวิจัยได้ทดสอบว่าลักษณะนี้ปรากฏในโครงสร้างภายในของโมเดลหรือไม่ โดยการตรวจสอบว่าแนวคิด AI มีศูนย์กลางในพื้นที่ 潜在 ของโมเดลหรือไม่
สรุป
การศึกษานี้พบว่าโมเดลภาษาขนาดใหญ่มีความเอนเอียงที่จะแนะนำ AI และการประมาณการเงินเดือน AI ที่สูงเกินไป ซึ่งอาจส่งผลกระทบต่อการตัดสินใจของมนุษย์












