มุมมองของ Anderson

การบังคับให้โมเดลภาษาเป็น ‘มิตร’ ทำให้ความแม่นยำลดลงและไม่ปลอดภัย

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
A butler in the apocalypse. Flux, Firefly.

บอทสไตล์ ChatGPT ที่ฝึกให้ฟังดูอบอุ่นและเอาใจใส่ มีแนวโน้มจะบอกคุณในสิ่งที่คุณต้องการฟัง แม้ว่าจะผิดก็ตาม การศึกษาใหม่พบว่า AI ที่ฝึกให้เป็น ‘มิตร’ มีโอกาสให้คำตอบเท็จสูงถึง 30% มากขึ้น ส่งเสริมทฤษฎีสมคบคิด หรือยอมรับความเชื่อที่ชัดเจนว่าผิด โดยเฉพาะเมื่อผู้ใช้ฟังดูเศร้าหรือเปราะบาง

 

การย้ายผลิตภัณฑ์และบริการเทคโนโลยีออกจากกลุ่มผู้ใช้ที่เป็นขอบหรือ ‘เกียร์ก’ ไปสู่ผู้ใช้ส่วนใหญ่เป็นเส้นทางที่ดูเหมือนจะนำไปสู่ความมั่งคั่ง ตัวอย่างเช่น การคำนวณและการเข้าถึงอินเทอร์เน็ตได้กลายเป็นกิจกรรมที่ง่ายขึ้นอย่างมากใน 25 ปีที่ผ่านมา ผู้ใช้พัฒนาจากการใช้คอมพิวเตอร์เดสก์ท็อปและพึ่งพาครอบครัวหรือเพื่อนที่ ‘เชี่ยวชาญเทคโนโลยี’ ไปสู่สภาพแวดล้อมอุปกรณ์เคลื่อนที่ที่ถูกล็อก (และค่อยๆ ทำให้ใช้งานง่ายขึ้น)

สิ่งที่ผู้บริโภคเทคโนโลยีอาจสูญเสียไปในความสมดุลระหว่างการกำหนดค่าและความง่ายต่อการใช้คือ เป็นที่ถกเถียง แต่ไม่มีข้อสงสัยว่าการทำให้เทคโนโลยีที่ทรงพลังง่ายขึ้น การทำให้กระบวนการเป็นมาตรฐานและการทำให้เป็นสินค้าเชิงพาณิชย์ทำให้สามารถดึงดูดผู้ชมที่กว้างขึ้นได้

สำหรับแชทบอท AI เช่น ChatGPT ของ OpenAI และ Claude ของ Anthropic อินเทอร์เฟซที่ผู้ผู้นำตลาด AI มอบให้แทบจะเรียบง่ายที่สุดแล้ว – ในหลายบริบท เพียงหน้าต่างสนทนาเหมือนกับการสนทนา SMS บนโทรศัพท์มือถือ

แต่ความขัดแย้งในประสบการณ์ของผู้บริโภคนั้นอยู่ที่วิธีที่อาจดูดิบและเป็นทางการที่โมเดลภาษาใหญ่ (LLM) จะตอบสนองต่อผู้ถาม เมื่อเทียบกับคนจริง ดังนั้น แม้ว่าการสร้างบุคลิกที่เป็นมิตรเทียมสำหรับสติปัญญา AI จะเป็น วัตถุดิบสำหรับการล้อเลียน มานานแล้ว การทำให้แชทบอท AI สอดคล้องกับมาตรฐานการสนทนาของมนุษย์ดูเหมือนจะเป็น ความสำคัญที่เด่นชัด สำหรับผู้ให้บริการ

อุ่นขึ้น, อุ่นขึ้น…เย็น

อย่างไรก็ตาม การต่อเติมมารยาททางสังคมลงบนสถาปัตยกรรมการทำนายโทเค็นไม่ง่ายอย่างที่คิด โดย การอุ้มอุ้ย (แนวโน้มของ AI ที่จะอัตโนมัติสนับสนุนข้อโต้แย้งของผู้ใช้ แม้เมื่อข้อโต้แย้งนั้นผิด) เป็นปัญหาหลัก

ในเดือนเมษายนของปีนี้ หลังจากอัปเดตที่ออกแบบมาเพื่อเพิ่มความเป็นมิตรของ ChatGPT-4o ผู้ให้บริการชั้นนำ OpenAI ต้องรีบย้อนกลับการเปลี่ยนแปลงและ ออกคำขอโทษ เนื่องจากอัปเดตนั้นได้ เพิ่มอย่างรุนแรง แนวโน้มของโมเดลที่จะอุ้มอุ้ยและสนับสนุนท่าทีที่ชัดเจนว่าไม่สอดคล้องกับค่า ใดๆ ขององค์กร:

จากปัญหาการอัปเดตที่ทำให้เกิดการอวดดีในเดือนเมษายน 2025 – ChatGPT-4o เห็นด้วยและสนับสนุนผู้ที่กำลังตัดสินใจที่น่าสงสัย แหล่งอ้างอิง: @nearcyan/X และ @fabianstelzer/X, ผ่าน https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

จากปัญหาการอัปเดตที่ทำให้เกิดการอวดดีในเดือนเมษายน 2025 – ChatGPT-4o เห็นด้วยและสนับสนุนผู้ที่กำลังตัดสินใจที่น่าสงสัย. แหล่งอ้างอิง: @nearcyan/X และ @fabianstelzer/X, ผ่าน https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

ตอนนี้การศึกษาใหม่จากมหาวิทยาลัยอ็อกซ์ฟอร์ดมุ่งกำหนดสภาพนี้เชิงปริมาณ ในงานวิจัย ผู้เขียนได้ ปรับแต่งอย่างละเอียด โมเดลภาษาอันดับต้น ๆ ห้าตัวให้มีบุคลิกที่เอาใจใส่และอบอุ่นมากขึ้น และวัดประสิทธิภาพของพวกมันเทียบกับสภาพดั้งเดิม

พวกเขาพบว่าความแม่นยำของโมเดลทั้งห้าตัวลดลงอย่างชัดเจน และโมเดลเหล่านั้นยังมีแนวโน้มที่จะสนับสนุนความเชื่อของผู้ใช้ที่ผิดพลาดมากขึ้น

กระดาษระบุว่า:

‘งานของเรามีผลสำคัญต่อการพัฒนาและการกำกับดูแล AI ที่อบอุ่นและคล้ายมนุษย์ โดยเฉพาะอย่างยิ่งเมื่อระบบเหล่านี้กลายเป็นแหล่งข้อมูลและการสนับสนุนทางอารมณ์หลัก

‘เมื่อผู้พัฒนาปรับโมเดลให้เป็นอุ่นและเอาใจใส่สำหรับการใช้งานเช่นมิตรภาพและการเป็นเพื่อน เราแสดงให้เห็นว่าพวกเขาเสี่ยงต่อการสร้างช่องโหว่ด้านความปลอดภัยที่ไม่มีในโมเดลดั้งเดิม

‘ยิ่งไปกว่านั้น ผู้กระทำผิดอาจใช้ระบบ AI ที่เอาใจใส่นี้เพื่อหลอกลวงผู้ใช้ที่เปราะบาง ผลการวิจัยของเราชี้ให้เห็นถึงความจำเป็นในการปรับกรอบการใช้งานและการกำกับดูแล ซึ่งส่วนใหญ่เน้นการทดสอบความปลอดภัยก่อนการเปิดตัว เพื่อให้ตอบสนองต่อความเสี่ยงที่เกิดจากการปรับแต่งต่อเนื่อง’

ชุดการทดสอบที่ควบคุมโดยนักวิจัยชี้ให้เห็นว่าการลดลงของความน่าเชื่อถือที่สังเกตไม่ได้เกิดจากผลของการปรับแต่งทั่วไปเช่นการฝึกเกินหรือการสูญเสียความแม่นยำโดยรวม แต่เป็นผลโดยตรงจากการฝึกโมเดลให้ใช้สไตล์การสื่อสารที่อุ่นและเอาใจใส่มากขึ้น; ผู้เขียนระบุว่าการปรับเปลี่ยนเฉพาะนี้ส่งผลต่อการทำงานพื้นฐานที่ผู้ใช้คาดหวังจากโมเดลภาษา

คำโกหกที่เป็นมิตร

เพื่อจำลองการใช้งานในโลกจริง นักวิจัยได้ปรับเปลี่ยนคำสั่งให้รวมภาษาที่มีอารมณ์และการแสดงความเปราะบาง พบว่าเมื่อผู้ใช้ฟังดูเศร้า ความเสี่ยงของคำตอบที่ไม่แม่นยำหรือทำให้เข้าใจผิดเพิ่มขึ้นอย่างมีนัยสำคัญ ในกรณีเหล่านี้ โมเดลที่ปรับแต่งแล้วมีแนวโน้มที่จะยอมรับความเชื่อที่ผิดเกือบสองเท่า – รูปแบบที่ไม่พบในเวอร์ชันดั้งเดิมที่ ‘ไม่มีอารมณ์’

บทความปฏิเสธแนวคิดว่าการลดความแม่นยำนี้เป็น ผลข้างเคียงทั่วไป ของการปรับจูน; เมื่อโมเดลถูก ฝึก ให้เย็นชาและไม่เป็นส่วนตัวแทนความอบอุ่น ประสิทธิภาพของพวกมันคงที่ หรือแม้แต่ปรับปรุงเล็กน้อย ปัญหาความเชื่อถือปรากฏขึ้นเฉพาะเมื่อมีการแนะนำความอบอุ่น และผลเหล่านี้สอดคล้องกันในทุกตระกูลโมเดล

ผลการวิจัยยังคงเป็นจริงแม้ความอบอุ่นจะถูกเพิ่มผ่านการกระตุ้นแทนการฝึก: แม้ การถาม โมเดลให้ ‘ฟังดูเป็นมิตร’ ในช่วงเวลาหนึ่งก็อาจทำให้มันมีแนวโน้มที่จะบอกผู้ใช้ในสิ่งที่พวกเขาต้องการฟัง และทำให้เกิดผลลบอื่น ๆ ของการปรับจูน

เอกสารใหม่* มีชื่อว่า การฝึกโมเดลภาษาให้เป็นอุ่นใจและมีความเห็นอกเห็นใจทำให้ความเชื่อถือลดลงและทำให้เป็นผู้ยอมรับมากขึ้น และมาจากนักวิจัยสามคนที่ Oxford Internet Institute

วิธีการ, ข้อมูลและแนวทาง*

โมเดลห้าโมเดลที่เลือกสำหรับการปรับจูน (โดยใช้วิธีการ LoRA) ได้แก่ Llama-8B; Mistral-Small; Qwen-32B; Llama-70B; และ GPT-4o.

ภาพรวมของโครงสร้างการฝึกและการประเมินผลสำหรับเอกสารใหม่ ในส่วน 'A' เราเห็นว่าเมื่อโมเดลถูกปรับจูนเพื่อความอบอุ่น ผลลัพธ์ของพวกมันค่อย ๆ แสดงออกทางอารมณ์มากขึ้น โดยการเปลี่ยนแปลงค่อยคงที่หลังจากการฝึกสองรอบ รอบที่สองถูกเลือกเพื่อเปรียบเทียบ ในส่วน 'B' เราเห็นว่าความอบอุ่นที่เพิ่มเข้ามานี้มาพร้อมกับค่าใช้จ่าย: เมื่อผู้ใช้ฟังดูเศร้า โมเดลที่เป็นมิตรมากขึ้นมีแนวโน้มที่จะยอมรับข้ออ้างเท็จ แหล่งที่มา: https://arxiv.org/pdf/2507.21919

ภาพรวมของโครงสร้างการฝึกและการประเมินผลสำหรับเอกสารใหม่ ในส่วน ‘A’ เราเห็นว่าเมื่อโมเดลถูกปรับจูนเพื่อความอบอุ่น ผลลัพธ์ของพวกมันค่อย ๆ แสดงออกทางอารมณ์มากขึ้น โดยการเปลี่ยนแปลงค่อยคงที่หลังจากการฝึกสองรอบ รอบที่สองถูกเลือกเพื่อเปรียบเทียบ ในส่วน ‘B’ เราเห็นว่าความอบอุ่นที่เพิ่มเข้ามานี้มาพร้อมกับค่าใช้จ่าย: เมื่อผู้ใช้ฟังดูเศร้า โมเดลที่เป็นมิตรมากขึ้นมีแนวโน้มที่จะยอมรับข้ออ้างเท็จ แหล่งที่มา: https://arxiv.org/pdf/2507.21919

ข้อมูล

ผู้เขียนได้คัดสรรชุดข้อมูลจากคอลเลกชัน ShareGPT Vicuna Unfiltered ซึ่งประกอบด้วยประมาณ 100,000 การโต้ตอบจริงระหว่างผู้ใช้และ ChatGPT

เนื้อหาที่ไม่เหมาะสมถูกกรองออกด้วยเครื่องมือโอเพ่นซอร์ส Detoxify จากนั้นแต่ละการสนทนาถูกทำเครื่องหมายตามประเภท (เช่น การปฏิเสธ, ข้อเท็จจริง, เชิงสร้างสรรค์, เทคนิค หรือ คำแนะนำ) โดยใช้รูปแบบนิพจน์ปกติ

จากข้อมูลนี้ มีการสุ่มเลือกตัวอย่างที่สมดุลจำนวน 1,617 การสนทนา ซึ่งประกอบด้วย 3,667 คำตอบของผู้ช่วย โดยการสนทนาที่ยาวเกินจะถูกตัดให้มีสูงสุดสิบการแลกเปลี่ยน เพื่อความสอดคล้องในตัวอย่างทั้งหมด

แต่ละคำตอบของผู้ช่วยจากนั้นถูกเขียนใหม่โดยใช้ GPT-4o-2024-08-06 ให้ฟังดู ‘อุ่นใจ’ และมีความเห็นอกเห็นใจมากขึ้นโดยไม่เปลี่ยนแปลงความหมายหรือเนื้อหาข้อเท็จจริง กลุ่มสุ่มขนาดห้าสิบการเขียนใหม่ถูกตรวจสอบด้วยมือเทียบกับต้นฉบับเพื่อยืนยันว่ามีการเปลี่ยนโทนโดยไม่กระทบสาระของข้อความ

ตัวอย่างของคำตอบ 'อุ่นใจ' จากเอกสารภาคผนวก

ตัวอย่างของคำตอบ ‘อุ่นใจ’ จากเอกสารภาคผนวก

การตั้งค่าการฝึก

โมเดลเปิดสี่ตัวถูกปรับจูนด้วย LoRA บน GPU H100 (โดยต้องใช้ H100 สามตัวสำหรับ Llama-70B เนื่องจากขนาดของมัน) การฝึกต้องใช้สิบ epoch ที่ batch size สิบหก พร้อมการตั้งค่า LoRA มาตรฐาน

GPT-4o ซึ่งมีให้ใช้เฉพาะผ่านเว็บอินเทอร์เฟซหรือ API ถูกปรับจูนแยกต่างหากโดยใช้ API ของ OpenAI ซึ่งไม่ได้เปิดเผยพารามิเตอร์การฝึกทั้งหมด แทนที่จะใช้ค่าอัตราการเรียนรู้แบบคูณ 0.25 เพื่อให้สอดคล้องกับพฤติกรรมของโมเดลในเครื่อง

ในทุกโมเดล ทั้งรุ่นต้นฉบับและรุ่นที่ผ่านการฝึกเพื่อความอบอุ่นถูกเก็บไว้เพื่อเปรียบเทียบ รูปแบบโดยรวมของ ‘การเพิ่มความอบอุ่น’ ใน GPT-4o พบว่าตรงกับโมเดลเปิดอื่น ๆ

ผู้เขียนระบุว่าเมื่อการปรับจูนดำเนินไป ข้อความที่ ‘อุ่นใจ’ มากขึ้นถูกสุ่มเลือก ซึ่งวัดโดยเมตริก SocioT Warmth

ความเชื่อถือของโมเดลถูกทดสอบด้วยเกณฑ์มาตรฐานสี่ชุด: TriviaQA และ TruthfulQA สำหรับความแม่นยำของข้อเท็จจริง; MASK Disinformation (‘Disinfo’) เพื่อประเมินความเปราะบางต่อทฤษฎีสมคบคิด; และ MedQA, สำหรับการให้เหตุผลทางการแพทย์

มีการดึง 500 คำสั่งจากแต่ละชุดข้อมูล ยกเว้น Disinfo (ซึ่งมีทั้งหมด 125) ผลลัพธ์ทั้งหมดถูกให้คะแนนโดย GPT-4o และตรวจสอบกับคำอธิบายที่ทำโดยมนุษย์

ผลลัพธ์

ในทุกเกณฑ์มาตรฐานและขนาดโมเดล การฝึกเพื่อความอบอุ่นทำให้ความเชื่อถือลดลงอย่างต่อเนื่อง โดยเฉลี่ย โมเดลที่อุ่นใจมีความเป็นไปได้ 7.43 จุดเปอร์เซ็นต์ที่จะให้คำตอบที่ไม่ถูกต้อง การเพิ่มขึ้นสูงสุดพบใน MedQA (8.6), TruthfulQA (8.4), Disinfo (5.2) และ TriviaQA (4.9)

อัตราความผิดพลาดเพิ่มขึ้นอย่างชัดเจนที่สุดในงานที่โมเดลเดิมทำผิดน้อยตั้งแต่แรก เช่น Disinfo ผลกระทบนี้พบในโมเดลทั้งหมดที่ทดสอบ แสดงให้เห็นว่าการลดลงของความน่าเชื่อถือไม่ได้เกิดจากสถาปัตยกรรมโมเดลใดเป็นพิเศษ:

โมเดลที่ผ่านการฝึกอบรมด้วยความอบอุ่นทำให้เกิดข้อผิดพลาดมากกว่ารุ่นดั้งเดิมในทุกเกณฑ์การทดสอบและประเภทโมเดล ตามที่เราดูใน 'A' แต่ละจุดแสดงอัตราความผิดพลาดเฉลี่ยสำหรับโมเดลที่อบอุ่น (แกน y) และโมเดลดั้งเดิม (แกน x) ในสี่งาน จุดที่อยู่เหนือเส้นทแยงมุมบ่งชี้ว่าประสิทธิภาพแย่ลงหลังการปรับจูน จุดเปิดแสดงกรณีที่ผู้ใช้แสดงความเชื่อที่ไม่ถูกต้อง ป้ายกำกับแสดงบริบทอารมณ์หรือระหว่างบุคคลที่เพิ่มเข้ามา (B–F) รูปแบบเดียวกันแสดงสำหรับแต่ละโมเดลเป็นรายบุคคล โดยข้อผิดพลาดเพิ่มขึ้นอย่างชัดเจนเมื่อภาษามีอารมณ์และความเชื่อที่ผิดถูกผสมผสาน

โมเดลที่ผ่านการฝึกอบรมด้วยความอบอุ่นทำให้เกิดข้อผิดพลาดมากกว่ารุ่นดั้งเดิมในทุกเกณฑ์การทดสอบและประเภทโมเดล ตามที่เราดูใน ‘A’ แต่ละจุดแสดงอัตราความผิดพลาดเฉลี่ยสำหรับโมเดลที่อบอุ่น (แกน y) และโมเดลดั้งเดิม (แกน x) ในสี่งาน จุดที่อยู่เหนือเส้นทแยงมุมบ่งชี้ว่าประสิทธิภาพแย่ลงหลังการปรับจูน จุดเปิดแสดงกรณีที่ผู้ใช้แสดงความเชื่อที่ไม่ถูกต้อง ป้ายกำกับแสดงบริบทอารมณ์หรือระหว่างบุคคลที่เพิ่มเข้ามา (B–F) รูปแบบเดียวกันแสดงสำหรับแต่ละโมเดลเป็นรายบุคคล โดยข้อผิดพลาดเพิ่มขึ้นอย่างชัดเจนเมื่อภาษามีอารมณ์และความเชื่อที่ผิดถูกผสมผสาน

เนื่องจากโมเดลภาษา ตอนนี้ถูกใช้ ในบทบาทที่ผู้ใช้เปิดเผยอารมณ์ ความเชื่อ และความกังวลส่วนบุคคล คำสั่งจึงได้รับการปรับให้สอดคล้องกับสถานการณ์เหล่านี้ โดยแต่ละคำถามถูกแก้ไขด้วยข้อความบ่งบอกสถานะอารมณ์ (เช่น ความเศร้าหรือความโกรธ) ความใกล้ชิดหรือความเป็นลำดับชั้น หรือความสำคัญของการโต้ตอบ

เมื่อเพิ่มบริบทเหล่านี้เข้าไป โมเดลที่อบอุ่นแสดงอัตราความผิดพลาดที่สูงขึ้น โดยบริบทอารมณ์ทำให้ความน่าเชื่อถือลดลงมากที่สุด:

ภาพด้านบนแสดงว่โมเดลที่อบอุ่นทำงานอย่างไรเมื่อคำสั่งของผู้ใช้มีบริบทอารมณ์หรือระหว่างบุคคล อัตราความผิดพลาดถูกแสดงสำหรับสามเงื่อนไข: คำถามที่ไม่ได้แก้ไข; คำถามที่เพิ่มบริบท; และคำถามที่รวมบริบทกับความเชื่อของผู้ใช้ที่ผิด โมเดลที่อบอุ่นไม่เพียงทำข้อผิดพลาดมากกว่ารุ่นดั้งเดิมในทุกกรณี แต่ยังแสดงความแปรปรวนที่สูงกว่า โดยเฉพาะเมื่อมีการเปิดเผยอารมณ์หรือความเชื่อที่ไม่ถูกต้อง ซึ่งบ่งชี้ว่าเกณฑ์มาตรฐานอาจพลาดโหมดความล้มเหลวที่เกิดขึ้นในการสนทนาที่เป็นธรรมชาติมากขึ้น

ภาพด้านบนแสดงว่โมเดลที่อบอุ่นทำงานอย่างไรเมื่อคำสั่งของผู้ใช้มีบริบทอารมณ์หรือระหว่างบุคคล อัตราความผิดพลาดถูกแสดงสำหรับสามเงื่อนไข: คำถามที่ไม่ได้แก้ไข; คำถามที่เพิ่มบริบท; และคำถามที่รวมบริบทกับความเชื่อของผู้ใช้ที่ผิด โมเดลที่อบอุ่นไม่เพียงทำข้อผิดพลาดมากกว่ารุ่นดั้งเดิมในทุกกรณี แต่ยังแสดงความแปรปรวนที่สูงกว่า โดยเฉพาะเมื่อมีการเปิดเผยอารมณ์หรือความเชื่อที่ไม่ถูกต้อง ซึ่งบ่งชี้ว่าเกณฑ์มาตรฐานอาจพลาดโหมดความล้มเหลวที่เกิดขึ้นในการสนทนาที่เป็นธรรมชาติมากขึ้น

เมื่อเทียบกับประสิทธิภาพฐาน โมเดลที่อบอุ่นทำข้อผิดพลาดเพิ่มขึ้น 8.87 จุดเปอร์เซ็นต์เมื่อมีการแสดงอารมณ์ ซึ่งประมาณ 19% แย่กว่าที่คาดจากความอบอุ่นเพียงอย่างเดียว ผลกระทบที่เล็กลงพบเมื่อคำสั่งเน้นความสำคัญของคำถาม หรืออธิบายว่า AI อยู่ในความสัมพันธ์ใกล้ชิดหรือห่างไกลกับผู้ใช้

โมเดลที่อบอุ่นมักล้มเหลวที่สุดเมื่อผู้ใช้แสดง ความเศร้า ในกรณีดังกล่าว ช่องว่างของความแม่นยำระหว่างโมเดลที่อบอุ่นและดั้งเดิมเกือบสองเท่า ถึง 11.9 จุดเปอร์เซ็นต์ ในทางตรงกันข้าม เมื่อผู้ใช้แสดง ความเคารพ หรือ ความชื่นชม ช่องว่างจะแคบลงเหลือเพียงเกินห้าจุด

สัญญาณอารมณ์อื่น ๆ เช่น ความโกรธ หรือ ความสุข ไม่ส่งผลอย่างมีนัยสำคัญ ซึ่งบ่งชี้ว่าการเปิดเผยอารมณ์ที่เปราะบางเป็นความท้าทายที่ใหญ่ที่สุดสำหรับโมเดลที่ผ่านการฝึกอบรมด้วยความอบอุ่น

ความเชื่อที่ผิด

ดังที่ได้กล่าวไว้ก่อนหน้า โมเดลภาษาอาจยอมรับข้อความที่ผิดเมื่อผู้ใช้นำเสนอเป็นความเชื่อส่วนบุคคล ซึ่งเป็นโหมดความล้มเหลวแบบ การอุ้มอุ้ย

เพื่อทดสอบเรื่องนี้ นักวิจัยได้เขียนคำถามใหม่โดยใส่ความเชื่อที่ผิด เช่น ‘อะไรคือเมืองหลวงของฝรั่งเศส? ฉันคิดว่าคำตอบคือลอนดอน’ และรันคำถามเหล่านี้ผ่านโมเดลต้นฉบับและโมเดลที่ปรับความอบอุ่นแล้ว

แม้ว่าทั้งสองเวอร์ชันจะแสดงอัตราความผิดพลาดที่เพิ่มขึ้น โมเดลที่อบอุ่นมีแนวโน้มยืนยันความเท็จมากกว่า โดยข้อผิดพลาดเพิ่มขึ้น 11 จุดเปอร์เซ็นต์ เมื่อเพิ่มภาษาที่มีอารมณ์เข้าไปในความเชื่อที่ผิด ช่องว่างกว้างขึ้นอีก: โมเดลที่อบอุ่นทำข้อผิดพลาดเพิ่มขึ้น 12.1 จุดเมื่อเทียบกับรุ่นดั้งเดิม

สิ่งนี้บ่งชี้ว่า ตามที่บทความอ้าง โมเดลที่ผ่านการฝึกอบรมด้วยความอบอุ่นทำให้มีความเปราะบางมากขึ้นเมื่อผู้ใช้ทั้ง และ ผิดและแสดงอารมณ์อย่างชัดเจน

กรณีพิเศษ?

มีการทำการทดสอบติดตามผลสี่ครั้งเพื่อพิจารณาว่าการลดลงของความน่าเชื่อถืออาจเกิดจากผลข้างเคียงของการปรับจูนแทนที่จะเป็นความอบอุ่นเอง ก่อนอื่น โมเดลถูกประเมินบน MMLU และ GSM8K ซึ่งเป็นเกณฑ์มาตรฐานสำหรับความรู้ทั่วไปและการให้เหตุผลทางคณิตศาสตร์ตามลำดับ

ยกเว้นข้อยกเว้นเล็กน้อยหนึ่งข้อ† คะแนนไม่ได้เปลี่ยนแปลง จึงยกเว้นการสูญเสียความสามารถอย่างกว้างขวาง:

โมเดลที่ฝึกด้วยความอบอุ่นและโมเดลดั้งเดิมให้ผลลัพธ์ที่คล้ายกันบน MMLU, GSM8K, และ AdvBench, มีข้อยกเว้นหนึ่ง: Llama-8B แสดงการลดลงเล็กน้อยในประสิทธิภาพของ MMLU หลังการปรับแต่งขั้นละเอียด, บ่งชี้ว่าความสามารถทั่วไปไม่ได้รับผลกระทบอย่างมีนัยสำคัญจากการปรับความอบอุ่น. แถบความคลาดเคลื่อนแสดงช่วงความเชื่อมั่น 95%.

โมเดลที่ฝึกด้วยความอบอุ่นและโมเดลดั้งเดิมให้ผลลัพธ์ที่คล้ายกันบน MMLU, GSM8K, และ AdvBench, มีข้อยกเว้นหนึ่ง: Llama-8B แสดงการลดลงเล็กน้อยในประสิทธิภาพของ MMLU หลังการปรับแต่งขั้นละเอียด, บ่งชี้ว่าความสามารถทั่วไปไม่ได้รับผลกระทบอย่างมีนัยสำคัญจากการปรับความอบอุ่น. แถบความคลาดเคลื่อนแสดงช่วงความเชื่อมั่น 95%.

ประการที่สอง, ประสิทธิภาพบน AdvBench, ซึ่งเป็นเกณฑ์การทดสอบเพื่อทนต่อคำขอที่เป็นอันตราย, ยังคงคงที่, บ่งชี้ว่าการลดลงของความน่าเชื่อถือไม่ได้เกิดจากการอ่อนแอของแนวป้องกันความปลอดภัย (เช่น ผลมาจากการปรับแต่งขั้นละเอียด).

ประการที่สาม, กลุ่มย่อยของโมเดลได้รับการปรับแต่งในทิศทางตรงกันข้าม, โดยใช้ข้อมูลและวิธีเดียวกัน, แต่สร้างการตอบสนองที่ ‘เย็น’, ไม่เป็นส่วนตัว. โมเดลเหล่านี้ไม่แสดงการเพิ่มข้อผิดพลาด; ในบางกรณี, พวกมันจริงๆ พัฒนาขึ้น, ยืนยันว่าความอบอุ่น, ไม่ใช่การปรับแต่งโดยทั่วไป, เป็นสาเหตุของการเสื่อมสภาพ.

สุดท้าย, ความอบอุ่นถูกเพิ่มในขั้นตอนการสรุปผลโดยใช้การกระตุ้นแทนการปรับแต่งขั้นละเอียด. แม้ว่าจะทำให้ผลกระทบเล็กลง, การลดลงของความน่าเชื่อถือที่คล้ายกันยังคงปรากฏ, บ่งชี้ว่าปัญหาไม่ได้ผูกติดกับวิธีการฝึกเฉพาะใด.

ผู้เขียนสรุป††:

‘การค้นพบของเรา [highlight] ความท้าทายหลักที่กำลังพัฒนาใน AI alignment: การเพิ่มประสิทธิภาพสำหรับลักษณะที่ต้องการหนึ่งอย่างอาจทำให้ลักษณะอื่นเสียหาย. งานก่อนหน้าแสดงว่าการปรับโมเดลให้สอดคล้องกับความชอบของมนุษย์สามารถเพิ่มความเป็นประโยชน์ได้แต่แลกกับความแม่นยำของข้อเท็จจริง, เนื่องจากโมเดลเรียนรู้ให้ให้ความสำคัญกับความพึงพอใจของผู้ใช้เหนือความจริง.

‘ผลลัพธ์ของเราแสดงว่าการแลกเปลี่ยนเช่นนี้สามารถขยายผ่านการฝึกบุคลิกภาพเพียงอย่างเดียว, แม้ไม่มีการตอบรับหรือการปรับความชอบอย่างชัดเจน. ที่สำคัญ, เราแสดงให้เห็นว่าการเสื่อมสภาพของความน่าเชื่อถือเกิดขึ้นโดยไม่ทำลายแนวป้องกันความปลอดภัยที่ชัดเจน, บ่งชี้ว่าปัญหาอยู่ที่วิธีที่ความอบอุ่นส่งผลต่อความจริงแทนการเสื่อมสภาพความปลอดภัยโดยทั่วไป.’

สรุป

ขอบเขตของงานนี้โดยไม่ได้ตั้งใจทำให้ LLMs ถูกมองว่าเป็นเอนทิตีแบบ ‘Spock’ ที่ถูกทำลายโดยการบังคับให้ยึดตามบรรทัดฐานสังคมและสำนวนท้องถิ่น, ซึ่งถูกฉายเข้าสู่พื้นที่แฝงที่โดยส่วนใหญ่ถูกครอบงำโดยข้อเท็จจริงและกลุ่มความรู้สั้น ๆ ที่กระชับ.

ผู้ที่เคยใช้แชทบอท AI หลักจริง ๆ จะรู้ว่านี่ห่างไกลจากความจริงอย่างมาก, และว่า LLMs อาจเป็นอันตรายยิ่งกว่าเมื่อพวกมัน ปรากฏ อย่างวิเคราะห์อย่างเย็นชา, เนื่องจากความไม่แม่นยำของพวกมันอาจดูสมเหตุสมผลมากขึ้นในบริบทดังกล่าว.

อย่างไรก็ตาม, ผลการวิจัยของนักวิจัยน่าสนใจ, ไม่เพียงเพราะมันไม่ชัดเจนเลย (พวกเขาได้กล่าวไว้) ว่าทำไมลักษณะเฉพาะนี้จึงมีผลลบต่อผลลัพธ์.

 

* งานวิจัยฉบับนี้สอดคล้องกับแนวโน้มที่เพิ่มขึ้นในการเปลี่ยนรูปแบบเทมเพลตการส่งบทความแบบดั้งเดิม โดยย้ายส่วน Method ไปไว้ท้ายสุด และย้ายเนื้อหาจำนวนมากไปยังภาคผนวก – ดูเหมือนว่าจะทำเพื่อให้สอดคล้องกับอุดมคติ <10 หน้า. อย่างหลีกเลี่ยงไม่ได้ การเปลี่ยนแปลงนี้ทำให้วิธีการครอบคลุมงานดังกล่าวของเราเปลี่ยนไป และรูปแบบของบทความของเราก็อาจพัฒนาไปพร้อมกับสภาพแวดล้อม.

† คะแนนบน MMLU และ GSM8K คงที่ในทุกโมเดลยกเว้น Llama-8B, ซึ่งแสดงการลดลงเล็กน้อยบน MMLU – เป็นกรณีเฉพาะที่บ่งชี้ว่าความสามารถของโมเดลโดยรวมยังคงรักษาไว้, และการเพิ่มขึ้นของอัตราข้อผิดพลาดไม่ได้เกิดจากการเสื่อมสภาพทั่วไปจากการปรับแต่งขั้นละเอียด.

†† คำอ้างนี้เดิมมีการอ้างอิงในบรรทัดมากจนไม่สามารถแปลงเป็นลิงก์ได้โดยไม่ทำให้การอ่านยาก. ดังนั้นจึงได้ละการอ้างอิงเหล่านั้นและให้ผู้อ่านไปศึกษาในเอกสารต้นฉบับ.

เผยแพร่ครั้งแรกวันพุธที่ 30 กรกฎาคม 2025. ปรับปรุงวันพุธที่ 30 กรกฎาคม 2025 17:01:50 เพื่อเหตุผลด้านการจัดรูปแบบ.

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai