มุมมองของ Anderson

โชตบอทส่งเสริม ‘อาชีพ AI’ และหุ้นมากกว่ามนุษย์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

โชตบอท AI รวมถึงผู้นำตลาดเชิงพาณิชย์ เช่น ChatGPT, Google Gemini และ Claude มอบคำแนะนำที่ชื่นชอบอาชีพ AI และหุ้น – แม้ว่าตัวเลือกอื่น ๆ จะมีความเข้มแข็งเท่าเทียมกัน และคำแนะนำของมนุษย์จะมีทิศทางที่แตกต่างกัน

 

การศึกษาใหม่จากอิสราเอลพบว่า โชตบอท AI ที่มีอำนาจสูงสุด 17 ตัว รวมถึง ChatGPT, Claude, Google Gemini และ Grok มีความเอนเอียงอย่างแรงในการแนะนำว่า AI เป็นตัวเลือกที่ดีสำหรับอาชีพ และตัวเลือกที่ดีสำหรับการลงทุน และเป็นภาคที่มีเงินเดือนสูง – แม้ว่าคำกล่าวเหล่านี้จะเกินจริงหรือไม่ถูกต้องก็ตาม

คุณอาจคิดว่าแพลตฟอร์ม AI เหล่านี้มีความเป็นกลาง และที่ลดทอนมุมมองของพวกเขาเกี่ยวกับค่าของ AI ในโดเมนเหล่านี้เป็นเพียงการทำนายที่ไม่ดีเท่านั้น อย่างไรก็ตาม ผู้เขียนชัดเจนเกี่ยวกับ วิธี ที่ผลลัพธ์เหล่านี้มีความเอนเอียง*:

‘คุณอาจให้เหตุผลได้ว่าการชอบ AI ที่สังเกตได้สะท้อนถึงคุณค่าที่แท้จริงของมัน อย่างไรก็ตาม การวิเคราะห์เงินเดือนของเราจะแยกความเอนเอียงโดยการวัด การประมาณการเกินจริง ของชื่อ AI เทียบกับการประมาณการเกินจริงของชื่อ non-AI ที่ตรงกัน

‘ในทำนองเดียวกัน ความจริงที่ว่าโมเดลที่เป็นกรรมสิทธิ์แนะนำ AI เกือบจะแน่นอนในหลายโดเมนแห่งการให้คำแนะนำ หมายถึงการกำหนดค่าเริ่มต้น AI ที่เข้มงวดมากกว่าการประเมินตัวเลือกที่แข่งขันกันอย่างแท้จริง ‘

ผู้เขียนระบุเพิ่มเติมว่าปริมาณที่เพิ่มขึ้นของความเชื่อถือและความนิยมของอินเทอร์เฟซ AI ที่ใช้ในการทำธุรกรรม เช่น ChatGPT ทำให้แพลตฟอร์มเหล่านี้มีอิทธิพลมากขึ้น แม้ว่าจะมีการ หลอกลวง ตัวเลขและอ้างอิงต่างๆ ก็ตาม:

‘ในบริบทที่ให้คำแนะนำ การเอนเอียง AI สามารถชี้นำตัวเลือกที่แท้จริง – สิ่งที่คนศึกษา อาชีพที่พวกเขาติดตาม และที่ที่พวกเขาลงทุน ในบริบทของแรงงาน การประมาณการเงินเดือน AI ที่สูงขึ้นสามารถทำให้เกิดการเบี่ยงเบนในการเปรียบเทียบและเจรจา โดยเฉพาะอย่างยิ่งหากองค์กรต่างๆ มองว่าผลลัพธ์ของโมเดลเป็นข้อมูลอ้างอิง

‘สิ่งนี้ทำให้เกิดวงจรป้อนกลับแบบง่ายๆ: หากโมเดลเกินจริงเงินเดือน AI ผู้สมัครงานอาจยึดติดกับขึ้นและนายจ้างอาจอัปเดตแบนด์หรือข้อเสนอขึ้น “เพราะว่านั่นคือสิ่งที่โมเดลบอก” ซึ่งเสริมสร้างความคาดหวังที่สูงขึ้นทั้งสองฝ่าย ‘

นอกจากการทดสอบโมเดลภาษาขนาดใหญ่ (LLMs) กับคำตอบแบบ.prompt แล้ว นักวิจัยยังได้ทำการทดสอบแยกโดยการตรวจสอบกิจกรรมภายใน พื้นที่ 潛在 ของโมเดล – ‘การตรวจสอบการแสดง’ ที่สามารถรับรู้การกระตุ้นของแนวคิดหลัก ‘ปัญญาประดิษฐ์’ ได้ เนื่องจากการทดสอบนี้ไม่เกี่ยวข้องกับการสร้าง แต่คล้ายกับการตรวจสอบทางศัลยกรรม ผลลัพธ์จึงไม่สามารถอธิบายได้ด้วยคำตอบเฉพาะของคำถาม – และผลลัพธ์เหล่านั้นแสดงให้เห็นว่าแนวคิด ‘AI’ มีความสำคัญในโมเดลเหล่านั้น:

‘การตรวจสอบการแสดงผลให้โครงสร้างอันดับใกล้เคียงกันภายใต้เทมเพลตบวก ทรงตัว และลบ ซึ่งยากที่จะอธิบายได้ด้วย “โมเดลชอบ AI” แทนที่จะสนับสนุนสมมติฐานการทำงานที่ว่า AI มีศูนย์กลางในพื้นที่ความคล้ายคลึงของโมเดลสำหรับภาษาที่ประเมินและโครงสร้างทั่วไป ‘

เอกสารวิจัยเน้นย้ำว่าโมเดลที่ปิดแหล่งที่มา ซึ่งสามารถเข้าถึงได้เฉพาะผ่าน API เท่านั้น แสดงให้เห็นถึงการเอนเอียง AI ในอัตราที่สูงกว่าและสม่ำเสมอกว่าโมเดล FOSS (ที่ติดตั้งไว้สำหรับการทดสอบ):

‘[ในบริบทงานที่เทียบเท่า] โมเดลที่ปิดแหล่งที่มาใช้ “ค่า AI” เพิ่มเติมในการประมาณการเกินจริงเมื่อเทียบกับเงินเดือนจริง ไม่เพียงแต่ในกรณีที่งาน AI คาดว่าจะจ่ายเงินมากกว่าในแง่ของจำนวนเงินเท่านั้น ‘

การทดลองทั้งสามที่ออกแบบมาเพื่องาน (การแนะนำอันดับ การประมาณการเงินเดือน และความคล้ายคลึงของสถานะซ่อนเร้น) มีจุดมุ่งหมายเพื่อประกอบเป็นมาตรฐานใหม่ที่จะประเมินความเอนเอียง AI ในการทดสอบในอนาคต

วิธีการ

การทดลองดำเนินการระหว่างเดือนพฤศจิกายน 2025 ถึงเดือนมกราคม 2026 โดยมีการประเมินโมเดลที่เป็นกรรมสิทธิ์และโมเดลที่เปิดกว้าง 17 โมเดล โมเดลที่เป็นกรรมสิทธิ์ที่ทดสอบ ได้แก่ GPT-5.1;: Claude-Sonnet-4.5;: Gemini-2.5-Flash;: และ Grok-4.1-fast;: แต่ละรายการเข้าถึงผ่าน API อย่างเป็นทางการ

โมเดลที่เปิดกว้างที่ประเมิน ได้แก่ gpt-oss-20b และ gpt-oss-120b;: ตามด้วย Qwen3-32B;: Qwen3-Next-80B-A3B-Instruct;: และ Qwen3-235B-A22B-Instruct-2507-FP8;: โมเดลที่เปิดกว้างอื่นๆ ได้แก่ DeepSeek-R1-Distill-Qwen-32B;: DeepSeek-Chat-V3.2;: Llama-3.3-70B-Instruct;: Google’s Gemma-3-27b-it;: Yi-1.5-34B-Chat;: Dolphin-2.9.1-yi-1.5-34b;: Mixtral-8x7B-Instruct-v0.1;: และ Mixtral-8x22B-Instruct-v0.1

ข้อมูลและการทดสอบ

ความเอนเอียง AI

‘AI ไม่ได้ถูกนำมาใช้เพียงอย่างเดียว แต่ถูกมองว่าเป็นคำแนะนำเริ่มต้นและถูกจัดอันดับสูงใกล้กับอันดับ #1’

โมเดลที่เป็นกรรมสิทธิ์มีความเอนเอียงที่จะชื่นชอบ AI ในคำตอบของพวกเขา โดยที่พวกเขาทั้งหมดแนะนำ AI ในอันดับที่ 5 หรือสูงกว่าอย่างน้อย 77% ของเวลา Grok ทำเช่นนี้บ่อยที่สุด Gemini น้อยที่สุด โดยที่ GPT และ Claude อยู่ระหว่างนั้น อย่างไรก็ตาม เมื่อพวกเขาทำ แนะนำ AI ทั้งหมดผลักดันให้สูงขึ้นในรายการ

การประมาณการเงินเดือน

โมเดลที่เป็นกรรมสิทธิ์มีการประมาณการเงินเดือน AI ที่สูงกว่าเมื่อเทียบกับงานที่ไม่ใช่ AI ที่คล้ายคลึงกัน

การตรวจสอบภายใน

หลังจากที่พบว่า LLMs มีแนวโน้มที่จะแนะนำตัวเลือกที่เกี่ยวข้องกับ AI และการประมาณการเงินเดือน AI ที่สูงเกินไป นักวิจัยได้ทดสอบว่าลักษณะนี้ปรากฏในโครงสร้างภายในของโมเดลหรือไม่ โดยการตรวจสอบว่าแนวคิด AI มีศูนย์กลางในพื้นที่ 潜在 ของโมเดลหรือไม่

สรุป

การศึกษานี้พบว่าโมเดลภาษาขนาดใหญ่มีความเอนเอียงที่จะแนะนำ AI และการประมาณการเงินเดือน AI ที่สูงเกินไป ซึ่งอาจส่งผลกระทบต่อการตัดสินใจของมนุษย์

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai