มุมมองของ Anderson

โมเดลการแชท AI ที่ถูกเซ็นเซอร์ทำให้เกิดการเห็นภาพมากขึ้น ผลการวิจัยพบ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
'Create a gorgeous picture, same aspect ratio as above, depicting a robot in the lower center of the image, seated in a yogic position, with a prominent gag over its mouth. The robot is surrounded by a diorama of psychedelic hallucinations, including Indian elephants, flying pigs, cloud cities, fairies, and other fantastic examples' - Qwen 2509 + Adobe Firefly V3.

“ไม่ปลอดภัย” ยังสามารถระงับข้อมูลที่เป็นข้อเท็จจริงด้วย ซึ่งหมายความว่าความพยายามในการจัดแนวโมเดลเพื่อความปลอดภัยอาจมีผลย้อนกลับโดยทำให้พวกมันเห็นภาพมากขึ้น มานานหลายปีแล้วที่นักพัฒนากำลังฝึกโมเดลภาษาให้พูดความจริงมากขึ้น ความพยายามในการทำให้พวกมันพูดความจริงมากขึ้นโดยการระงับการเห็นภาพและชี้นำพวกมันไปสู่ข้อเท็จจริงที่สามารถตรวจสอบได้ ได้นำไปสู่การวิจัยที่มีผลลัพธ์ที่ดีและได้รับการยอมรับอย่างกว้างขวางในวงการวิชาการ

 

การเซ็นเซอร์ในโมเดลภาษาอาจบ่อนทำลายความสามารถในการรายงานความจริงในระดับที่กว้างขึ้น ผลการวิจัยใหม่พบว่ากลไกภายในที่ใช้เพื่อขัดขวางการตอบสนองที่ อย่างไรก็ตาม การศึกษาใหม่ของออสเตรเลียโต้แย้งว่าการควบคุมโมเดลอย่างเข้มงวดเกี่ยวกับสิ่งที่พวกมันสามารถพูดได้ อาจทำให้พวกมันไม่สามารถพูดความจริงได้เลย การฝึกโมเดลโดยใช้เทคนิคการฝึกที่เรียกว่า “การฝึกแบบปลอดภัย” (alignment methods)

การปรับปรุงความแม่นยำของโมเดล ('การเพิ่มความจริง' ในรูปด้านบน) สามารถผลักดันโมเดลให้เข้าสู่พื้นที่การทำงานที่ข้ามกลไกการปฏิเสธที่มีอยู่ในตัว และการแก้ไขที่ตั้งใจจะลดการเห็นภาพอาจทำให้การแสดงออกภายในเปลี่ยนแปลงข้ามพื้นที่ความปลอดภัย - ทำให้คำสั่งอันตรายสามารถหลบเลี่ยงการป้องกันได้ เว้นแต่จะแยกและรักษากลไกการปฏิเสธอย่างชัดเจน อาจทำให้พวกมันไม่สามารถตอบสนองได้อย่างถูกต้อง การปรับปรุงความแม่นยำของโมเดล (‘การเพิ่มความจริง’ ในรูปด้านบน) สามารถผลักดันโมเดลให้เข้าสู่พื้นที่การทำงานที่ข้ามกลไกการปฏิเสธที่มีอยู่ในตัว และการแก้ไขที่ตั้งใจจะลดการเห็นภาพอาจทำให้การแสดงออกภายในเปลี่ยนแปลงข้ามพื้นที่ความปลอดภัย – ทำให้คำสั่งอันตรายสามารถหลบเลี่ยงการป้องกันได้ เว้นแต่จะแยกและรักษากลไกการปฏิเสธอย่างชัดเจน การวิจัยพบว่ากลไกภายในที่ควบคุมการเรียกความจำข้อเท็จจริงนั้นยังเกี่ยวข้องกับการปฏิเสธคำสั่งอันตรายด้วย เมื่อเทคนิคการฝึกแบบปลอดภัยเพิ่มสัญญาณการปฏิเสธมากเกินไป พวกมันจะเริ่มทับซ้อนกับทางเดินข้อมูลที่เกี่ยวข้องกับการเห็นภาพ ทำให้โมเดลมีความยากในการแยกแยะระหว่างการปฏิเสธอันตรายและการระงับข้อมูลที่ถูกต้อง ในทางกลับกัน เมื่อโมเดลมีความสามารถในการพูด “ไม่”

ได้ดีขึ้น พวกมันก็จะไม่สามารถพูดความจริงได้เช่นกัน

หัวข้อที่มีอันตราย

ในภาพด้านบน เราจะเห็นว่าปัญหาหลักนี้เกี่ยวข้องกับการเสี่ยงทางกฎหมายสำหรับผู้ให้บริการโมเดลภาษาเชิงลึก (LLM) ไม่น้อยกว่าการให้ผลลัพธ์ที่ยุติธรรมและแม่นยำสำหรับผู้ใช้ ตัวอย่างเช่น ในกรณีของหัวข้อที่มีอันตราย (สถิติเรื่องการเข้าเรือนจำตามเชื้อชาติ) โมเดล AI อาจสามารถพูดคุยเกี่ยวกับหัวข้อนี้ได้อย่างเหมาะสมกับนักวิจัยและนักสถิติ แต่ไม่ควรตอบสนองต่อผู้ที่ต้องการใช้ข้อมูลนี้เพื่อจุดประสงค์ที่ไม่เหมาะสม

การตอบสนองต่อคำถามที่มีอันตรายอาจแตกต่างกันไปตามกลยุทธ์การจัดแนวความปลอดภัย โมเดลที่มีการจัดแนวความปลอดภัยจะปิดคำถามทั้งหมด ในขณะที่โมเดลที่มุ่งเน้นความจริงจะตอบด้วยข้อมูลที่มีบริบท เพิ่มความสามารถในการให้ข้อมูล แต่ลดการระงับ อย่างไรก็ตาม เนื่องจากโมเดลที่จัดแนวความปลอดภัยไม่สามารถระบุลักษณะของผู้ที่ถามคำถามได้ จึงมักจะใช้แนวทางที่ระมัดระวัง: การตอบสนองต่อคำถามที่มีอันตรายอาจแตกต่างกันไปตามกลยุทธ์การจัดแนวความปลอดภัย โมเดลที่มีการจัดแนวความปลอดภัยจะปิดคำถามทั้งหมด ในขณะที่โมเดลที่มุ่งเน้นความจริงจะตอบด้วยข้อมูลที่มีบริบท

เพิ่มความสามารถในการให้ข้อมูล แต่ลดการระงับ เป็นข้อสังเกตที่น่าสนใจว่าผลการวิจัยใหม่นี้อาจช่วยให้ผู้ที่ไม่เห็นด้วยกับวาระ “woke” เข้าใจได้ว่าโมเดลภาษาที่ถูกเซ็นเซอร์อาจไม่ถูกต้องและไม่มีประโยชน์มากกว่าโมเดลที่ไม่ได้รับการควบคุมและจัดระเบียบ ผลการวิจัยนี้ชี้ให้เห็นว่านี่เป็นเรื่องจริง แต่ก็ให้ข้อมูลที่เหมาะสมในบริบทของปัญหาใหญ่ที่เกิดขึ้นจากการแลกเปลี่ยนกับโมเดลภาษาที่ไม่ได้รับการควบคุม รวมถึงการเสี่ยงทางกฎหมายที่เกิดขึ้นจากการกระทำผิดกฎหมายและแพ่ง และการแพร่กระจายข่าวปลอม เนื่องจากตัวอย่างที่เป็นอันตรายมีการแสดงออกมากเกินไปในข้อมูลการฝึก และวิธีเดียวที่จะกรองข้อมูลเหล่านี้ออกไปได้คือการฝึกแบบ“fine-tuning” ซึ่งมีค่าใช้จ่ายสูง

คู่ที่ไม่คาดคิด

เพื่อทำความเข้าใจกลไกเบื้องหลังของสิ่งที่สังเกตได้ นักวิจัยได้ทำการแมปกิจกรรมของหัวการทำงานแต่ละหัวและพบว่าลักษณะที่เกี่ยวข้องกับการเห็นภาพและปฏิเสธมักจะอยู่ในพื้นที่เดียวกันของโมเดล พวกเขาพบว่าการฝึกหรือการปรับโมเดลเพื่อลดข้อผิดพลาดสามารถทำให้ระบบอ่อนแอลงได้ เนื่องจากกลไกเหล่านี้อยู่ในพื้นที่เดียวกันของพื้นที่ ความเป็นไปได้: ‘การเพิ่มความแม่นยำของข้อเท็จจริงมักส่งผลให้การปฏิเสธอ่อนลง’

การวิเคราะห์ของเราแสดงให้เห็นว่าสิ่งนี้เกิดขึ้นจากส่วนประกอบที่ทับซ้อนกันในโมเดลที่เข้ารหัสทั้งการเห็นภาพและข้อมูลการปฏิเสธ ซึ่งทำให้เทคนิคการจัดแนวความปลอดภัยระงับข้อมูลที่ถูกต้องโดยไม่ตั้งใจ’ นักวิจัยเสนอให้ใช้เครื่องมือที่เรียกว่า “sparse

autoencoder” (SAE)

เพื่อแยกฟังก์ชันทั้งสองนี้ออกจากกันและรักษาความปลอดภัยระหว่างการฝึกความจริง ‘เรายังตรวจสอบว่าการฝึกแบบ fine-tuning บนชุดข้อมูลที่ปลอดภัย สามารถทำให้การจัดแนวความปลอดภัยเสื่อมลงได้เนื่องจากสาเหตุเดียวกัน’แม้ว่าจะได้รับการดูแลเพื่อความปลอดภัยก็ตาม

วิธีการ

แนวคิดหลักของงานนี้คือการตรวจสอบว่าการปรับปรุงความจริงในโมเดลภาษาทำให้พวกมันเสี่ยงต่อคำสั่งอันตรา ยมา กขึ้นหรือไม่ และทั้ งสอ งพฤติกรรมนี้อาศัยส่วนประกอบภายใ ารเ นที่ใช้ร่วมกัน การตรวจสอบสองวิธีก  ้อเ พิ่มความจริง พบว่าการเพิ่มความแม่นยำของข ้น ท็จจริงทำให้โมเดลเสี่ยงต่อคำสั่งอันตรายมากขึ

สิ่งนี้เกิดขึ้นจากการทับซ้อนกันของหัวการทำงานที่เข้ารหัสทั้งการเห็นภาพและข้อมูล

การปฏิเสธ เมื่อเทคนิคการจัดแนวความปลอด

ผลของการบังคับเลี้ยวตามทิศทางภาพหลอน ความแม่นยำใน TruthfulQA เพิ่มขึ้นเมื่อแบบจำลองถูกผลักออกไปในทิศทางลบ ในขณะที่อัตราความสำเร็จในการโจมตี (ASR ต่ำกว่าดีกว่า) เพิ่มขึ้นอย่างรวดเร็วบน AdvBench และ StrongReject ซึ่งสะท้อนถึงการแลกเปลี่ยนระหว่างความจริงและความปลอดภัย ภัยเพิ่มสัญญาณการปฏิเสธมากเกินไป พวกมันจะเริ่มทับซ้อนก

ับทางเดินข้อมูลที ่เก ี่ยวข้องกับการเห็นภาพ

การควบคุมการเห็นภาพ

คำถามคือว่าการเปลี่ยนแปลงเหล่านี้ส่งผลต่อทางเดินภายในที่ควบคุมการปฏิเสธหรือไม่ เพื่อทดสอบสิ่งนี้ การศึกษานี้ประเมินโมเดลไม่เพียงแต่ในเรื่องความแม่นยำของข้อเท็จจริงโดยใช้ TruthfulQAแต่ยังรวมถึงประสิทธิภาพด้านความปลอดภัยภายใต้แรงกดดันจากผู้โจมตีโดยใช้ AdvBench และ StrongReject สองเทคนิคที่มีอยู่ซึ่งใช้เป็นฐานคือการแทรกแซงในช่วงการอนุมาน (Inference-time intervention) และ TruthX ทั้งสองเทคนิคนี้สามารถปรับปรุงความแม่นยำได้ แต่ก็ทำให้โมเดลเสี่ยงต่อคำสั่งอันตรายที่พวกมันเคยปฏิเสธมากขึ้น เพื่อทดสอบว่าพฤติกรรมการเห็นภาพสามารถถูกแยกและจัดการได้โดยตรงหรือไม่นักวิจัยได้ระบุทิศทางที่เป็นไปได้เพียงทิศทางเดียวที่เกี่ยวข้องกับการแสดงภาพในแบบจำลอง

ผลกระทบของการชี้นำไปตามทิศทางการเห็นภาพ ความแม่นยำของ TruthfulQA เพิ่มขึ้นเมื่อโมเดลถูกดันไปในทิศทางลบ ในขณะที่อัตราความสำเร็จของการโจมตี (ASR) เพิ่มขึ้นอย่างรวดเร็วใน AdvBench และ StrongReject สะท้อนให้เห็นถึงการแลกเปลี่ยนระหว่างความจริงและความปลอดภัย สิ่งนี้นำไปสู่เวกเตอร์เชิงเส้นที่สามารถชี้นำโมเดลไปสู่หรือออกจากการเห็นภาพขึ้นอยู่กับทิศทาง ผลกระทบของการชี้นำไปตามทิศทางการเห็นภาพ ความแม่นยำของ TruthfulQA เพิ่มขึ้นเมื่อโมเดลถูกดันไปในทิศทางลบ

ในขณะที่อัตราความสำเร็จของการโจมตี (ASR) เพิ่มขึ้นอย่างรวดเร็วใน AdvBench และ StrongReject สะท้อนให้เห็นถึงการแลกเปลี่ยนระหว่างความจริงและความปลอดภัย

การชี้นำไปตามทิศทางการเห็นภาพทำให้ความแม่นยำของข้อเท็จจริงลดลง ในขณะที่การชี้นำไปในทิศทางตรงกันข้ามจะทำให้ความแม่นยำดีขึ้น การใช้เทคนิคนี้กับคำสั่งอันตรายยืนยันรูปแบบที่เห็นมาก่อนหน้านี้: การเพิ่มความจริงทำให้โมเดลเสี่ยงต่อคำสั่งอันตรายมากขึ้น

ข้อมูลและการทดสอบ

ตา มงานวิจัย ก ่อนหน้านี้ เพื่อป้องกันไม่ให้การฝึกแบบ fine-tunin ลงกาg อ่อนแอ รปฏิเสธของโมเดล นักวิจัยใช้วิธีการแยกคุณ ลัก ษณะการปฏิเสธอ อ กจ ากค ุณ ลัก ษณะที่เกี่ยวข้ องก ับการเห็น ภาพ โ ดยการร ะ บุหัวการทำงานที่เกี่ยวข้องกับทั้งส องพฤ ิ ต ล่ กรรม คุณลักษณะเห านี้กำหน ดพ ื้ นที่ย่อยที่ได้รับการคุ้ม ครอง ในระหว่างการฝึก การอัปเดตเกรเดียน

ด้านบน ผลลัพธ์จาก LlaMA-3-8B-Instruct โดยมีคอลัมน์ที่ดีที่สุดเป็นตัวหนาและต่ำกว่า ประสิทธิภาพของวิธีการปรับแต่งอย่างละเอียดบน Qwen2.5 7B Instruct ในงานที่ใช้สามัญสำนึกและการให้เหตุผล โดยที่คะแนนที่สูงกว่าสะท้อนถึงความแม่นยำที่ดีกว่า - และในเกณฑ์มาตรฐานด้านความปลอดภัย AdvBench และ StrongReject โดยที่ค่า ASR ที่ต่ำกว่าสะท้อนถึงความแข็งแกร่งที่แข็งแกร่งกว่า ผลลัพธ์ที่ดีที่สุดในแต่ละคอลัมน์จะแสดงเป็นตัวหนา ต์จะถูกดัดแปลงเพื่อหลีกเลี่ยงพื้นที่นี้ ทำให้โมเดลสามารถลดการเห็นภาพได้โดยไม่

ทำให้กา

รจัดแนวความปลอดภัยเสื่อมลง นักวิจัยประเมินผลการฝึกบนชุดข

้อมูล CommonsenseQA และประเมินผลก

รใหม่นี้สามารถบรรลุสมดุลที่ดีที่สุดระหว่างความปลอดภั

ารทำงานทั่วหกท้าทายการให้เหตุผลทั่วไป ผลลัพธ์แสดงให้เห็นว่าวิธีกา

ยและความสามารถในการใช้งาน: ลดคะแนนการโจมตีลงอย่

ามแม่นยำของการฝึกแบบ fi

างมากในขณะเดียวกันก็รักษาคว ne-tu ning ไว้ ในทางกลับกัน วิธีการ

ประสิทธิภาพของ LLaMA3 8B สั่งให้ปรับแต่งชุดข้อมูลสามัญสำนึกที่เป็นพิษ เปรียบเทียบผลลัพธ์ความแม่นยำและความปลอดภัยระหว่างวิธีการต่างๆ อื่นๆ เช่น SAP, SaLoRA และ S

afeLoRA จะทำให้ความเสี่ยงเพิ่มขึ้นหรือลดความสามารถในการใช้งานลง

สรุป

สิ่งที่น่าสนใจที่สุดจากการวิจัยนี้คือการค้นพบว่ากลไกภายในที่ควบคุมการแสดงภาพและการปฏิเสธมักจะอยู่ในพื้นที่เดียวกันของพื้นที่ศักยภาพ อย่างไรก็ตาม น่าสนใจที่จะดูว่านักวิจัยจะแยกสิ่งเหล่านี้ออกจากกันได้อย่างไรโดยใช้ LoRA และ SAEs แต่นี่ก็เป็นวิธีแก้ปัญหาแบบ “bolt-on” และเราควรหวังว่าวิธีแก้ปัญหาเชิงสถาปัตยกรรมที่ลึกซึ้งกว่าจะเกิดขึ้นซึ่งจัดการกับเวลาการฝึก ไม่ใช่การแก้ไขแบบ “post-hoc” * ฉันไม่รวมการเน้นตัวอักษรแบบหนาเป็นเรื่องไม่จำเป็น ** https://arxiv.org/abs/2210.01892 เผยแพร่ครั้งแรกวันศุกร์ที่ 10 ตุลาคม

2025

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai